Jalapeños første resultater viser bransjeledende hastighet og effektivitet innen KI-inferens

Siden vi annonserte Jalapeño, OpenAI, første tilpassede inferensbrikke, har vi testet brikken og systemet som er bygget rundt den. Resultatene viser en betydelig ytelsesforbedring: Jalapeño kan håndtere mer AI-arbeid per enhet effekt, samtidig som den leverer svar raskere. Jalapeño gir både høyere gjennomstrømming og lavere latens med én arkitektur, mens eksisterende maskinvaresystemer ofte må gjøre en avveining mellom de to.
For kundene kan det bety raskere svar, mer responsdyktige agenter og mer pålitelig tilgang etter hvert som etterspørselen øker. Oppgaven vår er å sikre at generell kunstig intelligens kommer hele menneskeheten til gode. Disse gevinstene vil bidra til å gjøre stadig mer kapabel KI rimeligere og mer tilgjengelig for flere.
OpenAI-modeller fremskyndet også utviklingen av Jalapeño. Tidligere generasjoner hjalp teamet med å utforme og få brikken i drift, mens våre nyeste modeller fremskynder hvordan vi optimaliserer og programmerer den. Jalapeños ytelse gjelder på tvers av GPT‑OSS 120B, DeepSeek R1 og Kimi K2.5 1T, noe som viser at arkitekturen fungerer på tvers av modeller utviklet både i og utenfor OpenAI. På tvers av alle tre leverte Jalapeño 1,5 til 1,9 ganger mer AI-arbeid per watt ved maksimal gjennomstrømming og 1,7 til 3,6 ganger lavere ende-til-ende-latens enn sammenligningssystemene. For svært interaktive arbeidsbelastninger leverte den 2,1 til 4,1 ganger høyere ytelse.
Jalapeño er også et bevis på en bredere full stack-fordel. OpenAI kan utforme modeller, produkter, tjenesteleveringsprogramvare, brikker, minne, nettverk og systemer sammen, og bruke det vi lærer fra reelle arbeidslaster til å forbedre hvert lag i stakken. Jalapeño er egenutviklet silisium med målte resultater, og det er begynnelsen på en plattform over flere generasjoner. I månedene fremover vil vi trappe opp Jalapeño for å levere raskere, mer funksjonsrike og mer effektive produkter til kundene våre.
Vi evaluerer ytelse ved en sammenlignbar brukeropplevelse, ved å måle hvor mye nyttig AI-arbeid hvert system kan fullføre per effektenhet, samtidig som det oppfyller kravene til latens som kunder og interaktive agenter stiller. Dette er spesielt viktig for agenter, som må fullføre mange trinn i rekkefølge, slik at forsinkelser kan hope seg opp gjennom en hel oppgave.
For å forstå hvordan Jalapeño yter i praksis, testet vi den på InferenceX, en offentlig referansemåling fra SemiAnalysis som måler hele prosessen med å behandle en AI-forespørsel. Vi sammenlignet Jalapeño med ledende kommersielt tilgjengelige AI-systemer på tvers av det testede driftsområdet, fra betjening med høy gjennomstrømming til svært interaktiv bruk med lav latens. Jalapeño ga en bedre kombinasjon av gjennomstrømming, energieffektivitet og latens. Selv om ytelse noen ganger oppgis per brikke, mener vi at den mer nyttige målestokken er ytelse per effektenhet.
Blant alle de tre offentlige modellene leverte Jalapeño en bedre kombinasjon av ytelse per watt og latens i hele det testede driftsområdet, noe som plasserte det på banebrytende pareto. For å sammenligne systemene på en konsekvent måte normaliserte vi resultatene ved hjelp av hver akselerators publiserte effektangivelse for brikken. Jalapeño er klassifisert til 700 watt, selv om den målte vedvarende effekten holdt seg på eller under 550 watt på de testede arbeidsbelastningene.
Jalapeño presterte sterkt på tvers av GPT‑OSS 120B, DeepSeek R1 670B og Kimi K2.5 1T. På Kimi, den største offentlige modellen vi testet, leverte det omtrent 1,5 ganger høyere toppytelse per watt og 3,4 ganger lavere ende-til-ende-latens enn sammenligningssystemet. I våre interne tester økte Jalapeños fordel ytterligere på banebrytende OpenAI-modeller, noe som tyder på at arkitekturen blir mer verdifull etter hvert som arbeidsbelastningene blir større og mer krevende.
Jalapeño ble fra starten av utformet med spørsmålet: hvilken maskinvare ville vi bygget dersom hovedoppgaven var å betjene moderne og fremtidige språkmodeller, særlig interaktive agenter? Jalapeños ytelsesgevinster skyldes at brikken, minnet, nettverket, programvaren og systemet på racknivå utformes samlet rundt reelle arbeidslaster for språkmodeller. Språkmodellinferens går gjennom flere ulike faser med forskjellige flaskehalser. Prefill, når systemet behandler en prompt, er regneintensiv, mens decode, når systemet genererer svaret token for token, i større grad begrenses av minnebåndbredden. Kommunikasjon kan også føre til økt latens når data må flyttes mellom kjerner og brikker, slik at noen prosesseringsenheter blir stående uvirksomme mens de venter. Et system som utmerker seg i én fase, kan miste denne fordelen mens det venter på data eller flytter modelltilstand mellom ulike ressurser.
Vi utformet Jalapeño for å minimere dataflytting og kommunikasjonsforsinkelser. Dette betyr at modelltilstand, inkludert KV-hurtigbufferen som brukes mens et svar genereres, kan plasseres eksplisitt og holdes lokalt mens systemet aktiverer den riktige kombinasjonen av datakraft, minne og nettverk for hver inferensfase. Nettverket er en integrert del av arkitekturen. Det store domenet gjør at hele arbeidsbelastningen kan forbli innenfor ett sammenkoblet system, noe som minimerer dataflytting og bidrar til at hele forespørselen forblir rask og effektiv fra begynnelse til slutt. Resultatet er en balansert og fleksibel akselerator som kan støtte skiftende modellarkitekturer, utmerke seg både ved prefill og decode og tilpasse seg etter hvert som balansen mellom dem endrer seg – et kjennetegn ved agentiske arbeidsbelastninger.
AI spilte en direkte rolle i utviklingen av Jalapeño og gjorde det mulig for teamet å gå fra innledende design til tapeout på ni måneder ved å utforske implementasjoner, forkorte syklusene for design, måling og verifisering og kontinuerlig iterere på modellarbeidslaster. KI bidro også til å optimalisere brikkens aritmetiske kretser, noe som gjorde at teamet kunne få plass til mer beregningsytelse i brikken etter planen.
Jalapeño ble utformet som et tydelig og forutsigbart programmeringsmål for både mennesker og KI. Ingeniører kan beskrive arbeid gjennom lokale tensorer, eksplisitt kommunikasjon og forutsigbar synkronisering. KI kan deretter optimalisere hvordan dette arbeidet kartlegges, plasseres, planlegges og koordineres på tvers av systemet. Den klare, forutsigbare strukturen gir KI en håndterbar måte å angripe det tradisjonelt vanskelige problemet med parallellprogrammering på.
Støtte for hver ny modellfamilie krever fortsatt nye kjerner og modellspesifikke optimaliseringer. Ved å bruke Codex med GPT‑Astra fikk teamet tre modeller med åpen vekt, som ikke var en del av Jalapeños opprinnelige produksjonsplan, til høy ytelse i løpet av to måneder. Dette demonstrerte både fleksibiliteten i arkitekturen og hvor raskt KI kan hjelpe oss med å programmere den. For utvalgte GPT‑OSS‑blokker for oppmerksomhet og blanding av eksperter kjørte AI-genererte implementeringer 1,5 til 1,8 ganger raskere enn de eksisterende implementeringene skrevet av menneskelige eksperter. Disse tallene gjelder de valgte blokkene, ikke hele modellen, men de peker mot en kraftig ny utviklingssløyfe.
KI-infrastruktur er verdifull fordi den muliggjør nyttig arbeid i den virkelige verden. Ved å produsere mer nyttig arbeid med samme strømforbruk og maskinvare kan Jalapeño hjelpe oss med å håndtere større etterspørsel og redusere kostnaden ved å levere et vellykket resultat. For OpenAI kan det forbedre driftsgearingen ved å la nyttig arbeid og inntekter vokse raskere enn kostnaden ved å betjene systemet. Det kan også støtte bredere bruk og fortsatt investering i bedre modeller, produkter og infrastruktur. Raskere inferens kan muliggjøre raskere iterasjon og nye bruksområder.
Jalapeño utvider hva som er mulig for effektiv inferens med lav latens:
- Inferens i ultra-hurtigmodus med en effektivitet som tidligere bare var tilgjengelig i hurtigmodus
- Inferens i hurtigmodus med effektivitet som tidligere bare var tilgjengelig i batchmodus
- Høyere effektivitet for inferens i batchvis modus
Vi planlegger å begynne å rulle ut Jalapeño i OpenAIs databehandlingsinfrastruktur innen utgangen av året. Dette er første generasjon i et veikart for flere generasjoner: Gen 2 er langt inne i utviklingsløpet, og Gen 3 begynner å ta form. Hver generasjon vil bygge videre på det vi lærer, og ytterligere forbedre både effektivitet og hastighet.
Å møte den økende etterspørselen etter KI vil kreve mer regnekraft fra alle tilgjengelige kilder. Vi vil fortsette å rulle ut akseleratorer fra NVIDIA og andre partnere i stor utstrekning for både trenings- og inferensoppgaver. Oppgaven vår er å sikre at generell kunstig intelligens kommer hele menneskeheten til gode.
Mens vi forbereder utrulling, fortsetter vi med produksjonskvalifisering, videreutvikler programvaren, forbereder driften av Jalapeño i stor skala og validerer ytelsen på tvers av flere modeller. Resultatene så langt viser hva som er mulig når vi utformer hele systemet sammen: mer responsiv, kapabel og agentisk AI levert mer effektivt til flere mennesker.
GJENNOMSTRØMMING-PER-KW BANEBRYTENDE
InferenceX · GPT‑OSS‑120B · nominell 8k/1k · STP · pakke TDP: Jalapeño 700 W; GB200 1 200 W
TOPP- OG TILPASSET GJENNOMSTRØMMING
InferenceX · GPT‑OSS‑120B · nominell 8k/1k · STP · pakke TDP: Jalapeño 700 W; GB200 1 200 W
Høyere toppverdi for blandet TPS/kW
≈1,9×
85 448 mot 44 960 blandet/kW
Lavere ende-til-ende latens
≈1,7×
1,03 s vs. 1,80 s
Lavere min. TBT
≈2,7×
0,69 vs. 1,87 ms (1 459 vs. 535 tok/s/bruker)
Mer gjennomstrømming ved tidligere TBT
≈53,7×
22 935 vs. 427 blandet / kW (ved 535,28 tok/sek/bruker)
GJENNOMSTRØMMING-PER-KW BANEBRYTENDE
InferenceX · DeepSeek R1 MXFP4 · nominell 8k/1k · STP · pakke TDP: Jalapeño 700 W; GB300 1 400 W
TOPP- OG TILPASSET GJENNOMSTRØMMING
InferenceX · DeepSeek R1 MXFP4 · nominell 8k/1k · STP · pakke TDP: Jalapeño 700 W; GB300 1 400 W
Høyere toppverdi for blandet TPS/kW
≈1,7×
19 641 mot 11 781 blandet/kW
Lavere ende-til-ende latens
≈3,6×
1,65 s vs. 5,99 s
Lavere min. TBT
≈4,1×
1,43 vs. 5,90 ms (700 vs. 169 tok/s/user)
Mer gjennomstrømming ved tidligere TBT
≈104,3×
12 258 vs. 118 blandet / kW (ved 169,41 tok/s/bruker)
GJENNOMSTRØMMING-PER-KW BANEBRYTENDE
InferenceX · Kimi K2.5 MXFP4 · nominelt 8k/1k · STP · pakke TDP: Jalapeño 700 W; GB300 1 400 W
TOPP- OG TILPASSET GJENNOMSTRØMMING
InferenceX · Kimi K2.5 MXFP4 · nominelt 8k/1k · STP · pakke TDP: Jalapeño 700 W; GB300 1 400 W
Høyere toppverdi for blandet TPS/kW
≈1,5×
18 195 mot 11 862 blandet/kW
Lavere ende-til-ende latens
≈ 3,4 ×
1,56 s vs. 5,31 s
Lavere min. TBT
≈3,8×
1,44 vs. 5,48 ms (694 vs. 182 tok/s/bruker)
Mer gjennomstrømming ved tidligere TBT
≈56,1×
6 744 vs. 120 blandet/kW (ved 182,46 tok/sek/bruker)


