Lumaktaw sa pangunahing content
OpenAI

Agosto 25, 2026

EngineeringKumpanya

Ipinapakita ng mga unang resulta ng Jalapeño ang nangungunang bilis at kahusayan sa AI inference

Naglo-load…
Malapitang kuha ng Jalapeño inference chip na nakakabit sa isang teal na circuit board.

Mula nang ianunsyo ang Jalapeño, ang unang custom inference chip ng OpenAI, sinusubukan namin ang chip at ang binuong system na nakapalibot dito. Ipinapakita ng mga resulta ang malaking pagbuti sa pagganap: kayang magproseso ng Jalapeño ng mas maraming gawaing AI sa bawat yunit ng paggamit ng kuryente habang mas mabilis ding tumutugon. Nagbibigay ang Jalapeño ng parehong mas mataas na throughput at mas mababang latency gamit ang iisang arkitektura, samantalang ang mga umiiral na mga hardware system ay kadalasang kailangang magkompromiso sa pagitan ng dalawa.

Para sa mga customer, maaari itong mangahulugan ng mas mabilis na mga tugon, mas maagap na mga agent, at mas maaasahang access habang tumataas ang demand. Ang aming misyon ay tiyakin na ang artificial general intelligence ay magdudulot ng benepisyo sa buong sangkatauhan. Makakatulong ang mga pag-unlad na ito na gawing mas abot-kaya at mas malawak na magagamit ang lalong may kakayahang AI.

Pinabilis din ng mga modelo ng OpenAI ang pagbuo ng Jalapeño. Nakatulong ang mga naunang henerasyon sa team na idisenyo at paandarin ang chip, habang pinapabilis ng aming mga pinakabagong modelo ang paraan ng pag-optimize at pag-program namin dito. Umaabot ang pagganap ng Jalapeño sa GPT‑OSS 120B, DeepSeek R1, at Kimi K2.5 1T, na nagpapakita na gumagana ang arkitektura sa mga modelo na binuo sa loob at labas ng OpenAI. Sa lahat ng tatlo, naghatid ang Jalapeño ng 1.5 hanggang 1.9 na beses na mas maraming gawa ng AI bawat watt sa pinakamataas na throughput at 1.7 hanggang 3.6 na beses na mas mababang end-to-end latency kaysa sa mga system na pinagkumparahan. Para sa mga lubos na interactive na workload, naghatid ito ng 2.1 hanggang 4.1 beses na mas mataas na pagganap.

Ang Jalapeño ay patunay rin ng mas malawak na full-stack na bentahe. Maaaring idisenyo ng OpenAI nang magkakasama ang mga modelo, produkto, serving software, chips, memory, networking, at system, gamit ang mga natututuhan namin mula sa mga aktuwal na workload upang pahusayin ang bawat layer ng stack. Ang Jalapeño ay gumaganang first-party silicon na may nasukat na mga resulta, at ito ang simula ng isang multigenerational platform. Sa mga darating na buwan, paiigtingin namin ang Jalapeño upang makapaghatid ng mas mabilis, mas may kakayahan, at mas episyenteng mga produkto para sa aming mga customer.

Paano namin sinukat ang pagganap ng Jalapeño

Sinusuri namin ang pagganap sa katumbas na karanasan ng user, sinusukat kung gaano karaming kapaki-pakinabang na gawaing AI ang kayang tapusin ng bawat system sa bawat yunit ng kuryente habang natutugunan ang latency na kinakailangan ng mga customer at mga interaktibong agent. Mahalaga ito lalo na para sa mga agent, na kailangang matapos ang maraming hakbang nang sunod-sunod, kaya maaaring maipon ang mga pagkaantala sa buong gawain.

Upang maunawaan kung paano gumagana ang Jalapeño sa aktuwal na paggamit, sinubukan namin ito sa InferenceX, isang pampublikong benchmark mula sa SemiAnalysis na sumusukat sa buong proseso ng pagseserbisyo sa isang kahilingan sa AI. Inihambing namin ang Jalapeño sa mga nangungunang AI system na makukuha sa komersyo sa kabuuan ng nasubok na saklaw ng pagpapatakbo, mula sa serving, na may mataas na throughput, hangang sa lubhang interactive na paggamit na may mababang latency. Naghatid ang Jalapeño ng mas mahusay na kombinasyon ng throughput, kahusayan sa pagkonsumo ng kuryente, at latency. Bagama’t minsan iniuulat ang pagganap kada chip, naniniwala kaming mas kapaki-pakinabang na pamantayan ang pagganap kada yunit ng kuryente.

Pinalaki ng Jalapeño ang kalamangan sa dating pinakamahusay na TBT

Naghahatid ang Jalapeño ng mas maraming token kada user

Naghahatid ang Jalapeño ng mas maraming throughput kada kilowatt

Sa lahat ng tatlong pampublikong modelo, naghatid ang Jalapeño ng mas mahusay na kumbinasyon ng pagganap kada watt at latency sa buong sinubok na saklaw ng operasyon, kaya napuwesto ito sa Pareto frontier. Upang maihambing nang pare-pareho ang mga system, ginawan namin ng normalissasyon ang mga resulta gamit ang inilathalang rating ng chip power ng bawat accelerator. May rating na 700 watts ang Jalapeño, bagama’t nanatili sa 550 watts o mas mababa ang nasukat nitong tuloy-tuloy na power sa mga gawain na sinubukan.

Nagpakita ng malakas na pagganap ang Jalapeño sa GPT‑OSS 120B, DeepSeek R1 670B, at Kimi K2.5 1T. Sa Kimi, ang pinakamalaking pampublikong modelo na sinubukan namin, naghatid ito ng humigit-kumulang 1.5 beses na mas mataas na pinakamataas na pagganap kada watt at 3.4 beses na mas mababang end-to-end latency kaysa sa system na pinaghambingan. Sa aming panloob na pagsubok, mas lumawak pa ang bentaha ng Jalapeño sa mga frontier na modelo ng OpenAI, na nagpapahiwatig na mas nagiging mahalaga ang arkitektura habang lumalaki at mas nagiging masalimuot ang mga gawain.

Pagdidisenyo ng arkitektura para sa bilis at kahusayan sa loob ng iisang chip

Dinisenyo ang Jalapeño mula sa simula sa pamamagitan ng pagtatanong: anong hardware ang bubuuin natin kung ang pangunahing trabaho nito ay magsilbi ng mga moderno at panghinaharap na language model, lalo na ang mga interactive agent? Nagmumula ang mga pakinabang ng Jalapeño sa magkakasamang pagdidisenyo ng chip, memory, network, software, at rack-scale system batay sa aktuwal na mga workload ng mga language model. Dumadaan ang inference ng language model sa ilang magkakaibang yugto na may iba't ibang bottleneck. Ang prefill, kapag pinoproseso ng system ang isang prompt, ay nangangailangan ng matinding pag-compute, samantalang ang decode, kapag binubuo ng system ang tugon nang paisa-isang token, ay mas nalilimitahan ng memory bandwidth. Maaari ring makadagdag ng latency ang komunikasyon kapag kailangang ilipat ang data sa pagitan ng mga core at chip, kaya hindi nagagamit ang ilang yunit sa pagpoproseso habang naghihintay ang mga ito. Maaaring mawala sa isang system na mahusay sa isang yugto ang bentaheng iyon habang naghihintay ng data o inililipat ang estado ng modelo sa pagitan ng iba't ibang mapagkukunan.

Dinisenyo namin ang Jalapeño upang mabawaan ang paggalaw ng data at mga pagkaantala sa komunikasyon. Ibig sabihin nito, ang estado ng modelo, kabilang ang KV cache na ginagamit habang bumubuo ng tugon, ay maaaring tahasang ilagay at panatilihing lokal habang inaaktiba ng system ang angkop na kombinasyon ng compute, memory, at networking para sa bawat yugto ng inference. Ang network ay mahalagang bahagi ng arkitektura. Dahil sa malawak na saklaw nito, nananatili ang buong gawain sa loob ng isang nakakonektang system, na binabawasan ang paggalaw ng data at tumutulong na manatiling mabilis at episyente ang buong kahilingan mula simula hanggang katapusan. Ang resulta ay isang balanse at madaling mabagong accelerator na kayang suportahan ang nagbabagong mga arkitektura ng modelo, mahusay sa parehong prefill at decode, at umangkop habang nagbabago ang balanse sa pagitan ng mga ito, isang pangunahing katangian ng mga agentic workload.

Gumamit kami ng AI para idisenyo ang chip, at idinisenyo namin ang chip para ma-program ito ng AI

May direktang papel ang AI sa pagbuo ng Jalapeño, na nagbigay-daan sa team na lumipat mula sa paunang disenyo tungo sa tapeout sa loob ng siyam na buwan sa pamamagitan ng pagsusuri ng mga implementasyon, pagpapaikli ng mga siklo ng disenyo, pagsukat, at beripikasyon, at patuloy na pag-ulit sa mga gawain ng modelo. Nakatulong din ang AI na i-optimize ang mga arithmetic circuit ng chip, kaya nagawa ng team na maisama ang mas mataas na compute performance sa chip ayon sa iskedyul.

Idinisenyo ang Jalapeño bilang isang malinaw at madaling mahulaan na target sa pagpo-program para sa parehong tao at AI. Maaaring ilarawan ng mga engineer ang gawain sa pamamagitan ng mga lokal na tensor, tahasang komunikasyon, at mahuhulaang sinkronisasyon. Pagkatapos, maaaring i-optimize ng AI kung paano imapa, ilagay, iiskedyul, at iugnay ang gawaing iyon sa buong system. Ang malinaw at naaasahang estruktura ay nagbibigay sa AI ng madaling pamamahalaang paraan upang harapin ang matagal nang mahirap na problema ng parallel programming.

Ang pagsuporta sa bawat bagong pamilya ng modelo ay nangangailangan pa rin ng mga bagong kernel at mga optimisasyong partikular para sa modelo. Sa paggamit ng Codex kasama ang GPT‑Astra, naabot ng team ang mataas na antas ng pagganap sa loob ng dalawang buwan para sa tatlong mga open weight na modelo na hindi bahagi ng orihinal na plano ng produksyon ng Jalapeño. Ipinakita nito kapwa ang kakayahang umangkop ng arkitektura at ang bilis kung saan matutulungan tayo ng AI na i-program ito. Para sa mga piling GPT‑OSS attention at mixture-of-experts blocks, tumakbo nang 1.5 hanggang 1.8 beses na mas mabilis ang mga implementasyong binuo ng AI kaysa sa mga umiiral na implementasyong isinulat ng mga ekspertong tao. Ang mga bilang na iyon ay nalalapat sa mga napiling blocks, hindi sa buong modelo, ngunit nagpapahiwatig ang mga ito ng isang makapangyarihang bagong development loop.

Ang daan sa hinaharap para sa mahusay at Ultra-fast na inference

Mahalaga ang imprastraktura ng AI dahil nagbibigay-daan ito sa kapaki-pakinabang na gawain sa totoong mundo. Sa pamamagitan ng paggawa ng mas kapaki-pakinabang na gawain, gamit ang parehong lakas at hardware, matutulungan tayo ng Jalapeño na matugunan ang mas maraming demand at mapababa ang gastos sa paghahatid ng matagumpay na resulta. Para sa OpenAI, maaari nitong pahusayin ang operating leverage sa pamamagitan ng pagpapahintulot na lumago nang mas mabilis ang kapaki-pakinabang na gawain at kita kaysa sa gastos sa paglilingkod. Maaari rin nitong suportahan ang mas malawak na paggamit at patuloy na pamumuhunan sa mas mahuhusay na modelo, produkto, at imprastraktura. Maaaring magbigay-daan ang mas mabilis na inference sa mas mabilis na iteration at mga bagong use case.

Pinapalawak ng Jalapeño ang mga posibilidad para sa mahusay, mababang-latency na inference:

  • Inference sa Ultra-fast-mode na may mga kahusayan na makukuha lang dati sa Fast mode
  • Inference sa Fast mode na may mga kahusayang makukuha lang dati sa batched mode
  • Mas mataas na kahusayan para sa inference sa batched mode

Plano naming simulan ang pag-deploy ng Jalapeño sa loob ng compute infrastructure ng OpenAI bago matapos ang taon. Ito ang unang henerasyon ng isang roadmap na sumasaklaw sa maraming henerasyon: nasa yugto ng masinsinang pagbuo ang Gen 2, at nagsisimula nang mabuo ang Gen 3. Ang bawat henerasyon ay ibabatay sa mga natututuhan natin at lalo pang pasusulungin ang kahusayan at bilis.

Upang matugunan ang lumalaking pangangailangan para sa AI, kakailanganin ang mas malaking kapasidad sa pag-compute mula sa bawat magagamit na mapagkukunan. Patuloy kami na malawakang magde-deploy ng mga accelerator mula sa NVIDIA, at iba pang mga kasosyo para sa parehong mga workload sa pagsasanay at inference. Ang aming misyon ay tiyaking ang artificial general intelligence ay magdudulot ng benepisyo para sa buong sangkatauhan.

Habang naghahanda kami para sa pag-deploy, ipinagpapatuloy namin ang kwalipikasyon para sa produksyon, pagpapahusay ng software, paghahanda upang patakbuhin ang Jalapeño sa malakihang antas, at pagpapatunay ng pagganap sa mas maraming modelo. Ipinapakita ng mga resulta sa ngayon kung ano ang posible kapag sama-sama naming dinisenyo ang buong system: mas mabilis tumugon, may kakayahan, at agentic AI na naihahatid nang mas episyente sa mas maraming tao.

Apendise

Ang Jalapeño ay pareto frontier sa GPT‑OSS 120B

THROUGHPUT-per-kW FRONTIER

InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · package TDP: Jalapeño 700 W; GB200 1,200 W

Nangunguna ang Jalapeño sa iba't ibang operating points ng GPT‑OSS

PINAKAMATAAS AT KATUGMANG THROUGHPUT

InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · package TDP: Jalapeño 700 W; GB200 1,200 W

Mas mataas na peak mixed TPS/kW

≈1.9×

85,448 kumpara sa 44,960 mixed / kW

Mas mababang end-to-end latency

≈1.7×

1.03 s kumpara sa 1.80 s

Mas mababang min TBT

≈2.7×

0.69 kumpara sa 1.87 ms (1,459 kumpara sa 535 tok/s/user)

Mas maraming throughput sa nakaraang TBT

≈53.7×

22,935 kumpara sa 427 mixed/kW (sa 535.28 tok/s/user)

Ang Jalapeño ay pareto frontier sa DeepSeek R1 670B

THROUGHPUT-per-kW FRONTIER

InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · package TDP: Jalapeño 700 W; GB300 1,400 W

Nangunguna ang Jalapeño sa iba't ibang operating points ng DeepSeek R1

PINAKAMATAAS AT KATUGMANG THROUGHPUT

InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · package TDP: Jalapeño 700 W; GB300 1,400 W

Mas mataas na peak mixed TPS/kW

≈1.7×

19,641 kumpara sa 11,781 mixed/kW

Mas mababang end-to-end latency

≈3.6×

1.65 s kumpara sa 5.99 s

Mas mababang min TBT

≈4.1×

1.43 kumpara sa 5.90 ms (700 kumpara sa 169 tok/s/user)

Mas maraming throughput sa nakaraang TBT

≈104.3×

12,258 kumpara sa 118 mixed/kW (sa 169.41 tok/s/user)

Ang Jalapeño ay pareto frontier sa Kimi K2.5 1T

THROUGHPUT-per-kW FRONTIER

InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · package TDP: Jalapeño 700 W; GB300 1,400 W

Nangunguna ang Jalapeño sa iba't ibang operating points ng Kimi K2.5

PINAKAMATAAS AT KATUGMANG THROUGHPUT

InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · package TDP: Jalapeño 700 W; GB300 1,400 W

Mas mataas na peak mixed TPS/kW

≈1.5×

18,195 kumpara sa 11,862 mixed/kW

Mas mababang end-to-end latency

≈3.4×

1.56 s kumapara sa 5.31 s

Mas mababang min TBT

≈3.8×

1.44 kumpara sa 5.48 ms (694 kumpara sa 182 tok/s/user)

Mas maraming throughput sa nakaraang TBT

≈56.1×

6,744 kumpara sa 120 mixed/kW (sa 182.46 tok/s/user)

May-akda

OpenAI