메인 콘텐츠로 건너뛰기
OpenAI

2026년 8월 25일

엔지니어링회사

Jalapeño의 첫 번째 결과에서 AI 추론 분야를 선도하는 속도와 효율성을 확인했습니다

로딩 중...
청록색 회로 기판에 장착된 Jalapeño 추론 칩의 클로즈업.

OpenAI의 첫 자체 설계 추론 칩인 Jalapeño를 발표한 이후, OpenAI는 이 칩과 이를 기반으로 구축한 시스템을 테스트해 왔습니다. 테스트 결과 상당한 성능 향상을 확인했습니다. Jalapeño는 단위 전력당 더 많은 AI 작업을 처리하면서도 더 빠르게 응답할 수 있습니다. 기존 하드웨어 시스템에서는 처리량과 지연 시간 사이에서 절충해야 하는 경우가 많지만, Jalapeño는 하나의 아키텍처에서 더 높은 처리량과 더 낮은 지연 시간을 모두 제공합니다.

고객은 수요가 증가하더라도 더 빠른 응답과 더 민첩하게 반응하는 에이전트, 더욱 안정적인 액세스를 기대할 수 있습니다. OpenAI의 사명은 인류 전체가 범용 인공지능의 이점을 누리게 하는 것입니다. 이러한 성능 향상은 갈수록 더 뛰어난 역량을 갖춘 AI를 더 저렴한 비용으로 더 많은 사람이 이용할 수 있도록 하는 데 도움이 될 것입니다.

OpenAI 모델은 Jalapeño의 개발 속도를 높이는 데도 기여했습니다. 이전 세대 모델은 팀이 칩을 설계하고 초기 구동하는 데 도움을 주었으며, 최신 모델은 칩을 최적화하고 프로그래밍하는 작업을 더욱 빠르게 진행할 수 있도록 지원하고 있습니다. Jalapeño는 GPT‑OSS 120B, DeepSeek R1, Kimi K2.5 1T 모두에서 뛰어난 성능을 보여주며, 이 아키텍처가 OpenAI 내부와 외부에서 개발된 다양한 모델에 적용될 수 있음을 보여줍니다. 세 모델 모두에서 Jalapeño는 비교 시스템보다 최대 처리량 기준 와트당 1.5~1.9배 더 많은 AI 작업을 처리했으며, 엔드투엔드 지연 시간은 1.7~3.6배 더 낮았습니다. 상호작용이 매우 많은 워크로드에서는 2.1~4.1배 더 높은 성능을 제공했습니다.

Jalapeño는 OpenAI가 보유한 더 광범위한 풀스택 역량의 이점도 보여줍니다. OpenAI는 실제 워크로드에서 얻은 경험을 바탕으로 스택의 모든 계층을 개선하면서 모델, 제품, 서빙 소프트웨어, 칩, 메모리, 네트워킹, 시스템을 통합적으로 설계할 수 있습니다. Jalapeño는 실제로 작동하며 실측 성능이 확인된 OpenAI 자체 실리콘으로, 여러 세대에 걸쳐 발전할 플랫폼의 시작입니다. 앞으로 몇 달에 걸쳐 Jalapeño의 배포 규모를 확대하여 고객에게 더 빠르고 뛰어난 역량과 효율성을 갖춘 제품을 제공할 예정입니다.

Jalapeño의 성능 측정 방법

OpenAI는 동일한 사용자 경험 조건에서 성능을 평가합니다. 고객과 상호작용형 에이전트가 요구하는 지연 시간 기준을 충족하면서 각 시스템이 단위 전력당 얼마나 많은 유용한 AI 작업을 처리할 수 있는지 측정합니다. 이는 특히 에이전트에서 중요합니다. 에이전트는 여러 단계를 순차적으로 수행해야 하므로 각 단계의 지연이 전체 작업에 걸쳐 누적될 수 있기 때문입니다.

Jalapeño의 실제 성능을 파악하기 위해 AI 요청을 처리하는 전체 과정을 측정하는 SemiAnalysis의 공개 벤치마크 InferenceX에서 테스트했습니다. 높은 처리량이 필요한 서빙부터 높은 상호작용성과 낮은 지연 시간이 요구되는 환경까지, 테스트한 전체 운영 범위에 걸쳐 Jalapeño를 시판 중인 주요 AI 시스템과 비교했습니다. Jalapeño는 처리량, 전력 효율성, 지연 시간 측면에서 더 우수한 균형을 보여주었습니다. 성능을 칩당 수치로 나타내는 경우도 있지만, OpenAI는 단위 전력당 성능이 더 유용한 기준이라고 봅니다.

Jalapeño, 기존 최고 TBT에서 격차 확대

Jalapeño, 사용자당 더 많은 토큰 제공

Jalapeño, kW당 더 높은 처리량 제공

세 가지 공개 모델 모두에서 Jalapeño는 테스트한 동작 범위 전반에 걸쳐 와트당 성능과 지연 시간 측면에서 더 우수한 균형을 보여주며 파레토 프런티어에 위치했습니다. 각 시스템을 동일한 기준으로 비교하기 위해 각 가속기에 공개된 칩 정격 전력을 사용해 결과를 정규화했습니다. Jalapeño의 정격 전력은 700와트이지만, 테스트한 워크로드에서 측정된 지속 전력은 550와트 이하로 유지되었습니다.

Jalapeño는 GPT‑OSS 120B, DeepSeek R1 670B, Kimi K2.5 1T 모두에서 뛰어난 성능을 보였습니다. 테스트한 공개 모델 중 가장 큰 Kimi에서는 비교 시스템보다 와트당 최대 성능이 약 1.5배 높았고 엔드투엔드 지연 시간은 3.4배 낮았습니다. OpenAI의 내부 테스트에서는 프런티어 OpenAI 모델에서 Jalapeño의 성능 우위가 더욱 커졌으며, 이는 워크로드의 규모와 요구 수준이 높아질수록 이 아키텍처의 가치가 더욱 커진다는 점을 시사합니다.

단일 칩에서 속도와 효율성을 모두 높이는 아키텍처 설계

Jalapeño의 설계는 처음부터 다음과 같은 질문에서 출발했습니다. 현대 및 미래의 언어 모델, 특히 대화형 에이전트를 지원하는 것이 주된 역할이라면 어떤 하드웨어를 만들어야 할까? Jalapeño의 성능 향상은 실제 언어 모델 워크로드를 중심으로 칩, 메모리, 네트워크, 소프트웨어, 랙 규모 시스템을 하나의 시스템으로 함께 설계한 데서 비롯됩니다. 언어 모델 추론은 각각 병목 지점이 다른 여러 단계를 거칩니다. 시스템이 프롬프트를 처리하는 프리필은 연산 집약적인 반면, 응답을 토큰 단위로 생성하는 디코드는 메모리 대역폭의 제약을 더 많이 받습니다. 데이터를 코어와 칩 사이에서 이동해야 할 때는 통신으로 인해 지연 시간이 늘어나고, 일부 처리 장치는 데이터를 기다리는 동안 유휴 상태가 될 수도 있습니다. 한 단계에서 뛰어난 성능을 발휘하는 시스템도 데이터를 기다리거나 서로 다른 리소스 간에 모델 상태를 이동하는 동안에는 그 이점을 잃을 수 있습니다.

OpenAI는 데이터 이동과 통신 지연을 최소화하도록 Jalapeño를 설계했습니다. 이를 통해 응답 생성에 사용되는 KV 캐시를 비롯한 모델 상태를 명시적으로 배치해 로컬에 유지하면서, 각 추론 단계에 맞는 컴퓨팅, 메모리, 네트워킹 조합을 시스템에서 활성화할 수 있습니다. 네트워크는 이 아키텍처의 핵심 요소입니다. 네트워크의 넓은 도메인 덕분에 전체 워크로드를 하나로 연결된 시스템 내에서 처리할 수 있어 데이터 이동을 최소화하고, 전체 요청을 처음부터 끝까지 빠르고 효율적으로 처리할 수 있습니다. 그 결과, 변화하는 모델 아키텍처를 지원하고 프리필과 디코드 모두에서 뛰어난 성능을 발휘하며, 에이전트형 워크로드의 특징인 프리필과 디코드 간의 비중 변화에도 유연하게 대응할 수 있는 균형 잡힌 범용 가속기가 탄생했습니다.

AI를 활용해 칩을 설계하고, AI가 프로그래밍할 수 있도록 칩을 설계했습니다

AI는 Jalapeño 개발에 직접 활용되었습니다. 다양한 구현 방식을 탐색하고, 설계, 측정, 검증 주기를 단축하며, 모델 워크로드를 지속적으로 반복 개선함으로써 초기 설계부터 테이프아웃까지 걸리는 기간을 9개월로 단축할 수 있었습니다. AI는 칩의 산술 회로를 최적화하는 데도 활용되어, 팀이 일정에 맞춰 칩에 더 높은 연산 성능을 구현할 수 있도록 했습니다.

Jalapeño는 사람과 AI 모두가 명확하고 예측 가능한 방식으로 프로그래밍할 수 있도록 설계되었습니다. 엔지니어는 로컬 텐서, 명시적 통신, 예측 가능한 동기화를 통해 수행할 작업을 정의할 수 있습니다. 그러면 AI는 해당 작업을 시스템 전반에 매핑하고 배치하며, 실행 일정을 정하고 조율하는 방식을 최적화할 수 있습니다. 이처럼 명확하고 예측 가능한 구조 덕분에 AI는 전통적으로 해결하기 어려웠던 병렬 프로그래밍 문제를 보다 효과적으로 다룰 수 있습니다.

새로운 모델 제품군을 지원하려면 여전히 새로운 커널과 모델별 최적화가 필요합니다. 팀은 Codex와 GPT‑Astra를 사용해 Jalapeño의 기존 프로덕션 계획에 포함되지 않았던 세 가지 오픈 웨이트 모델을 두 달 만에 높은 성능 수준으로 끌어올렸습니다. 이는 아키텍처의 유연성뿐만 아니라 AI의 도움을 받아 얼마나 빠르게 이를 프로그래밍할 수 있는지도 보여주었습니다. 일부 GPT‑OSS 어텐션 및 전문가 혼합 블록에서는 AI가 생성한 구현이 기존에 인간 전문가가 작성한 구현보다 1.5~1.8배 빠르게 실행되었습니다. 이 수치는 전체 모델이 아닌 일부 블록에만 해당하지만, 강력한 새로운 개발 주기의 가능성을 보여줍니다.

효율적인 초고속 추론을 향한 길

AI 인프라의 가치는 현실에서 유용한 작업을 가능하게 한다는 데 있습니다. Jalapeño는 동일한 전력과 하드웨어로 더 많은 유용한 작업을 처리함으로써 더 많은 수요에 대응하고 성공적인 결과를 제공하는 데 드는 비용을 낮추는 데 도움이 될 수 있습니다. OpenAI의 경우 이를 통해 유용한 작업량과 매출이 서비스 제공 비용보다 더 빠르게 증가할 수 있어 영업 레버리지를 개선할 수 있습니다. 또한 AI의 도입을 더욱 확대하고 더 나은 모델, 제품, 인프라에 지속적으로 투자하는 데 도움이 될 수 있습니다. 더 빠른 추론은 더 빠른 반복 개선과 새로운 사용 사례를 가능하게 할 수 있습니다.

Jalapeño는 효율적인 저지연 추론의 가능성을 더욱 확장합니다.

  • 이전에는 패스트 모드에서만 가능했던 효율성을 제공하는 울트라 패스트 모드 추론
  • 이전에는 배치 모드에서만 가능했던 효율성을 제공하는 패스트 모드 추론
  • 배치 모드 추론의 효율성 향상

올해 말까지 OpenAI의 컴퓨팅 인프라에 Jalapeño를 배포하기 시작할 계획입니다. Jalapeño는 여러 세대에 걸친 로드맵의 첫 번째 세대입니다. 2세대는 개발이 한창 진행 중이며 3세대도 구체화되고 있습니다. 각 세대는 이전 세대에서 얻은 교훈을 바탕으로 효율성과 속도를 더욱 향상할 것입니다.

증가하는 AI 수요를 충족하려면 활용 가능한 모든 소스에서 더 많은 컴퓨팅 자원을 확보해야 합니다. OpenAI는 앞으로도 학습 및 추론 워크로드 모두에 NVIDIA 및 기타 파트너의 가속기를 광범위하게 배포할 것입니다. OpenAI의 사명 인류 전체가 범용 인공지능의 이점을 누리게 하는 것입니다.

배포를 준비하는 과정에서 프로덕션 적격성 검증을 계속 진행하고, 소프트웨어를 고도화하고, Jalapeño를 대규모로 운영할 준비를 하는 한편, 더 많은 모델에서 성능을 검증하고 있습니다. 지금까지의 결과는 전체 시스템을 통합적으로 설계할 때 무엇이 가능한지를 보여줍니다. 더 뛰어난 응답성과 역량을 갖춘 에이전트형 AI를 더 많은 사람에게 더욱 효율적으로 제공할 수 있습니다.

부록

Jalapeño는 GPT‑OSS 120B에서 파레토 프런티어에 위치합니다

kW당 처리량 프런티어

InferenceX · GPT‑OSS‑120B · 명목 8,000/1,000 · STP · 패키지 TDP: Jalapeño 700W, GB200 1,200W

Jalapeño는 GPT‑OSS의 모든 동작 지점에서 앞섭니다

최대 및 동일 속도 기준 처리량

InferenceX · GPT‑OSS‑120B · 명목 8,000/1,000 · STP · 패키지 TDP: Jalapeño 700W, GB200 1,200W

더 높은 최대 혼합 TPS/kW

약 1.9배

혼합 토큰/kW 85,448 대 44,960

더 낮은 엔드투엔드 지연 시간

약 1.7배

1.03초 대 1.80초

더 낮은 최소 TBT

약 2.7배

0.69ms 대 1.87ms (1,459 대 535토큰/초/사용자)

기존 TBT에서 더 높은 처리량

약 53.7배

혼합 토큰/kW 22,935 대 427 (535.28토큰/초/사용자 기준)

Jalapeño는 DeepSeek R1 670B에서 파레토 프런티어에 위치합니다

kW당 처리량 프런티어

InferenceX · DeepSeek R1 MXFP4 · 명목 8,000/1,000 · STP · 패키지 TDP: Jalapeño 700W, GB300 1,400W

Jalapeño는 DeepSeek R1의 모든 동작 지점에서 앞섭니다

최대 및 동일 속도 기준 처리량

InferenceX · DeepSeek R1 MXFP4 · 명목 8,000/1,000 · STP · 패키지 TDP: Jalapeño 700W, GB300 1,400W

더 높은 최대 혼합 TPS/kW

약 1.7배

혼합 토큰/kW 19,641 대 11,781

더 낮은 엔드투엔드 지연 시간

약 3.6배

1.65초 대 5.99초

더 낮은 최소 TBT

약 4.1배

1.43ms 대 5.90ms (700 대 169토큰/초/사용자)

기존 TBT에서 더 높은 처리량

약 104.3배

혼합 토큰/kW 12,258 대 118 (169.41토큰/초/사용자 기준)

Jalapeño는 Kimi K2.5 1T에서 파레토 프런티어에 위치합니다

kW당 처리량 프런티어

InferenceX · Kimi K2.5 MXFP4 · 명목 8,000/1,000 · STP · 패키지 TDP: Jalapeño 700W, GB300 1,400W

Jalapeño는 Kimi K2.5의 모든 동작 지점에서 앞섭니다

최대 및 동일 속도 기준 처리량

InferenceX · Kimi K2.5 MXFP4 · 명목 8,000/1,000 · STP · 패키지 TDP: Jalapeño 700W, GB300 1,400W

더 높은 최대 혼합 TPS/kW

약 1.5배

혼합 토큰/kW 18,195 대 11,862

더 낮은 엔드투엔드 지연 시간

약 3.4배

1.56초 대 5.31초

더 낮은 최소 TBT

약 3.8배

1.44ms 대 5.48ms (694 대 182토큰/초/사용자)

기존 TBT에서 더 높은 처리량

약 56.1배

혼합 토큰/kW 6,744 대 120 (182.46토큰/초/사용자 기준)

작성자

OpenAI