Gå til hovedindhold
OpenAI

Jalapeños første resultater viser brancheførende hastighed og effektivitet inden for AI-inferens

Indlæser ...
Nærbillede af Jalapeño-inferenschippen monteret på et blågrønt printkort.

Siden vi annoncerede Jalapeño, OpenAI's første specialdesignede inferenschip, har vi testet chippen og systemet, der er bygget omkring den. Resultaterne viser en markant forbedring af ydeevnen: Jalapeño kan håndtere mere AI-arbejde pr. watt og samtidig levere svar hurtigere. Jalapeño leverer både højere gennemløb og lavere latenstid med én arkitektur, hvor eksisterende hardwaresystemer ofte må foretage en afvejning mellem de to.

For kunderne kan det betyde hurtigere svar, mere lydhøre agenter og mere pålidelig adgang, efterhånden som efterspørgslen stiger. Vores mission er at sikre, at kunstig generel intelligens kommer hele menneskeheden til gode. Disse gevinster vil bidrage til at gøre stadig mere avanceret AI mere økonomisk overkommelig og mere bredt tilgængelig.

OpenAI-modeller fremskyndede også udviklingen af Jalapeño. Tidligere generationer hjalp teamet med at designe og idriftsætte chippen, mens vores nyeste modeller fremskynder, hvordan vi optimerer og programmerer den. Jalapeños ydeevne gælder på tværs af GPT‑OSS 120B, DeepSeek R1 og Kimi K2.5 1T, hvilket viser, at arkitekturen fungerer på tværs af modeller, der er udviklet både i og uden for OpenAI. På tværs af alle tre leverede Jalapeño 1,5 til 1,9 gange mere AI-arbejde pr. watt ved maksimalt gennemløb og 1,7 til 3,6 gange lavere end-to-end latenstid end sammenlignelige systemer. For højt interaktive arbejdsbelastninger leverede den 2,1 til 4,1 gange højere ydeevne.

Jalapeño er også et tegn på en bredere fuldstack-fordel. OpenAI kan designe modeller, produkter, serverstyringssoftware, chips, hukommelse, netværk og systemer sammen og bruge det, vi lærer af reelle arbejdsbelastninger, til at forbedre hvert lag i stakken. Jalapeño kombinerer førstepartssilicium med målte resultater, og det er begyndelsen på en platform, der strækker sig over flere generationer. I de kommende måneder vil vi opskalere Jalapeño for at levere hurtigere, mere avancerede og mere effektive produkter til vores kunder.

Sådan målte vi Jalapeños ydeevne

Vi evaluerer ydeevne ved en matchet brugeroplevelse og måler, hvor meget nyttigt AI-arbejde hvert system kan fuldføre pr. watt, samtidig med at det lever op til den latenstid, som kunder og interaktive agenter kræver. Dette er især vigtigt for agenter, som skal gennemføre mange trin i rækkefølge, så forsinkelser kan hobe sig op gennem en hel opgave.

For at forstå, hvordan Jalapeño præsterer i praksis, testede vi det på InferenceX, et offentligt benchmark fra SemiAnalysis, der måler hele processen med at hoste en AI-anmodning. Vi sammenlignede Jalapeño med førende kommercielt tilgængelige AI-systemer på tværs af det testede driftsområde, fra hosting med højt gennemløb til højinteraktiv brug med lav latenstid. Jalapeño leverede en bedre kombination af gennemløb, energieffektivitet og latenstid. Selvom ydeevne nogle gange rapporteres pr. chip, mener vi, at den mere nyttige målestok er ydeevne pr. watt.

Jalapeño øger forspringet ved den tidligere bedste TBT

Jalapeño leverer flere tokens pr. bruger

Jalapeño leverer mere gennemløb pr. kilowatt

På tværs af alle tre offentlige modeller leverede Jalapeño en bedre kombination af ydeevne pr. watt og latenstid på tværs af det testede driftsområde, hvilket placerer det på Pareto-fronten. For at sammenligne systemerne på en ensartet måde normaliserede vi resultaterne ud fra den offentliggjorte nominelle chipeffekt for hver accelerator. Jalapeño er klassificeret til 700 watt, selvom dens målte vedvarende effekt forblev på eller under 550 watt ved de testede arbejdsbelastninger.

Jalapeño klarede sig stærkt på tværs af GPT‑OSS 120B, DeepSeek R1 670B og Kimi K2.5 1T. På Kimi, den største offentligt tilgængelige model, vi testede, leverede den cirka 1,5 gange højere maksimal ydeevne pr. watt og 3,4 gange lavere end-to-end latenstid end sammenligningssystemet. I vores interne test blev Jalapeños fordel endnu større på banebrydende OpenAI-modeller, hvilket tyder på, at arkitekturen bliver mere værdifuld, efterhånden som arbejdsbelastningerne bliver større og mere krævende.

Arkitektur til hastighed og effektivitet i én enkelt chip

Jalapeño blev fra starten designet ud fra spørgsmålet: Hvilken hardware ville vi bygge, hvis dens primære opgave var at betjene moderne og fremtidige sprogmodeller, især interaktive agenter? Jalapeños gevinster kommer fra at designe chippen, hukommelsen, netværket, softwaren og rackskala-systemet sammen omkring reelle arbejdsbelastninger for sprogmodeller. Inferens for sprogmodeller bevæger sig gennem flere forskellige faser med forskellige flaskehalse. Forudfyldning, hvor systemet behandler en prompt, er beregningstung, mens afkodning, hvor systemet genererer svar-token efter token, i højere grad er begrænset af hukommelsesbåndbredde. Kommunikation kan også tilføje latenstid, når data skal flyttes mellem kerner og chips, så nogle behandlingsenheder står ubenyttede, mens de venter. Et system, der udmærker sig i én fase, kan miste denne fordel, mens det venter på data eller flytter modeltilstand mellem forskellige ressourcer.

Vi designede Jalapeño til at minimere dataflytning og kommunikationsforsinkelser. Det betyder, at modeltilstand, herunder den KV-cache, der bruges under genereringen af et svar, udtrykkeligt kan placeres og holdes lokal, mens systemet aktiverer den rette kombination af beregningskraft, hukommelse og netværk for hver inferensfase. Netværket er en integreret del af arkitekturen. Dets store domæne gør det muligt for hele arbejdsbelastningen at forblive inden for ét sammenkoblet system, hvilket minimerer dataflytning og hjælper hele anmodningen med at forblive hurtig og effektiv fra start til slut. Resultatet er en afbalanceret og fungibel accelerator, der kan understøtte skiftende modelarkitekturer, udmærke sig ved både forudfyldning og afkodning og tilpasse sig, efterhånden som balancen mellem dem ændrer sig–et definerende kendetegn ved agentiske arbejdsbelastninger.

Vi brugte AI til at designe chippen og designede chippen, så AI kunne programmere den

AI spillede en direkte rolle i udviklingen af Jalapeño og gjorde det muligt for teamet at gå fra det indledende design til tapeout på ni måneder ved at udforske implementeringer, forkorte design-, måle- og verifikationssløjfer samt løbende iterere på modelarbejdsbelastninger. AI hjalp også med at optimere chippens aritmetiske kredsløb, så teamet kunne få mere beregningskraft ind i chippen til tiden.

Jalapeño blev designet som et klart og forudsigeligt programmeringsmål for både mennesker og AI. Ingeniører kan beskrive arbejde ved hjælp af lokale tensorer, udtrykkelig kommunikation og forudsigelig synkronisering. AI kan derefter optimere, hvordan arbejdet kortlægges, placeres, planlægges og koordineres på tværs af systemet. Denne klare, forudsigelige struktur giver AI en håndterbar tilgang til at gribe det traditionelt vanskelige problem med parallelprogrammering an.

Det kræver stadig nye kerner og modelspecifikke optimeringer at understøtte hver ny modelfamilie. Ved at bruge Codex med GPT‑Astra opnåede teamet inden for to måneder høj ydeevne med tre åbne vægtmodeller, som ikke indgik i Jalapeños oprindelige produktionsplan. Dette demonstrerede både arkitekturens fleksibilitet og den hastighed, hvormed AI kan hjælpe os med at programmere den. For udvalgte GPT‑OSS‑opmærksomheds‑ og mixture-of-experts-blokke kørte AI-genererede implementeringer 1,5 til 1,8 gange hurtigere end de eksisterende implementeringer skrevet af menneskelige eksperter. Disse tal gælder for de valgte blokke, ikke hele modellen, men de antyder en effektiv ny udviklingscyklus.

Vejen frem mod effektiv, ultra-hurtig inferens

AI-infrastruktur er værdifuld, fordi den muliggør nyttigt arbejde i den virkelige verden. Ved at producere mere nyttigt arbejde med samme strøm og hardware kan Jalapeño hjælpe os med at imødekomme større efterspørgsel og sænke omkostningerne ved at levere et vellykket resultat. For OpenAI kan det forbedre de driftsmæssige muligheder ved at gøre det muligt for nyttigt arbejde og omsætning at vokse hurtigere end omkostningerne ved at levere tjenesten. Det kan også understøtte bredere ibrugtagning og fortsatte investeringer i bedre modeller, produkter og infrastruktur. Hurtigere inferens kan muliggøre hurtigere iteration og nye brugstilfælde.

Jalapeño udvider mulighederne for effektiv inferens med lav latenstid:

  • Inferens i ultra-hurtig tilstand med en effektivitet, der tidligere kun var tilgængelig i hurtig tilstand
  • Inferens i hurtig tilstand med en effektivitet, der tidligere kun var mulig i batch-tilstand
  • Højere effektivitet for inferens i batch-tilstand

Vi planlægger at begynde at udrulle Jalapeño i OpenAI's beregningsinfrastruktur inden årets udgang. Det er den første generation i en køreplan over flere generationer: Gen 2 er langt fremme i udviklingen, og Gen 3 er ved at tage form. Hver generation vil bygge videre på det, vi lærer, og yderligere forbedre både effektivitet og hastighed.

At imødekomme den voksende efterspørgsel efter AI kræver mere beregningskraft fra alle tilgængelige kilder. Vi vil fortsætte med bred udrulning af acceleratorer fra NVIDIA og andre partnere til både trænings- og inferensopgaver. Vores mission er at sikre, at kunstig generel intelligens kommer hele menneskeheden til gode.

Mens vi forbereder udrulningen, fortsætter vi produktionsgodkendelse, modner softwaren, forbereder driften af Jalapeño i stor skala og validerer ydeevne på tværs af flere modeller. Resultaterne indtil videre viser, hvad der er muligt, når vi designer hele systemet samlet: mere lydhør, kompetent og agentisk AI leveret mere effektivt til flere mennesker.

Appendiks

Jalapeño er på pareto-fronten ved GPT‑OSS 120B

BANEBRYDENDE GENNEMLØB-per-kW

InferenceX · GPT‑OSS‑120B · nominelt 8k/1k · STP · pakke TDP: Jalapeño 700 W, GB200 1.200 W

Jalapeño fører på tværs af GPT‑OSS‑driftspunkter

MAKSIMALT OG MATCHET GENNEMLØB

InferenceX · GPT‑OSS‑120B · nominelt 8k/1k · STP · pakke-TDP: Jalapeño 700 W; GB200 1.200 W

Højere maksimal blandet TPS/kW

≈1,9×

85.448 sammenlignet med 44.960 blandet/kW

Lavere end-to-end latenstid

≈1,7×

1,03 s sammenlignet med 1,80 s

Lavere min TBT

≈2,7×

0.69 sammenlignet med 1.87 ms (1,459 vs. 535 tok/s/bruger)

Mere gennemløb ved tidligere TBT

≈53,7×

22.935 sammenlignet med 427 blandet/kW (ved 535,28 tok/s/bruger)

Jalapeño er på pareto-fronten ved DeepSeek R1 670B

BANEBRYDENDE GENNEMLØB-per-kW

InferenceX · DeepSeek R1 MXFP4 · nominelt 8k/1k · STP · pakke TDP: Jalapeño 700 W; GB300 1.400 W

Jalapeño fører på tværs af DeepSeek R1-driftspunkter

MAKSIMALT OG MATCHET GENNEMLØB

InferenceX · DeepSeek R1 MXFP4 · nominelt 8k/1k · STP · pakke-TDP: Jalapeño 700 W; GB300 1.400 W

Højere maksimal blandet TPS/kW

≈1,7×

19.641 sammenlignet med 11.781 blandet / kW

Lavere end-to-end-latenstid

≈3,6×

1,65 s sammenlignet med 5,99 s

Lavere min TBT

≈4.1×

1,43 sammenlignet med 5,90 ms (700 sammenlignet med 169 tok/s/bruger)

Mere gennemløb ved tidligere TBT

≈104,3×

12.258 sammenlignet med 118 blandet / kW (ved 169,41 tok/s/bruger)

Jalapeño er på pareto-fronten ved Kimi K2.5 1T

BANEBRYDENDE GENNEMLØB-per-kW

InferenceX · Kimi K2.5 MXFP4 · nominelt 8k/1k · STP · package TDP: Jalapeño 700 W, GB300 1.400 W

Jalapeño fører på tværs af Kimi K2.5-driftspunkter

MAKSIMALT OG MATCHET GENNEMLØB

InferenceX · Kimi K2,5 MXFP4 · nominelt 8.000/1.000 · STP · pakke TDP: Jalapeño 700 W; GB300 1.400 W

Højere maksimal blandet TPS/kW

≈1,5×

18.195 sammenlignet med 11.862 blandet/kW

Lavere end-to-end-latenstid

≈3.4×

1,56 s sammenlignet med 5,31 s

Lavere min TBT

≈3,8×

1,44 sammenlignet med 5,48 ms (694 sammenlignet med 182 tok/s/bruger)

Mere gennemløb ved tidligere TBT

≈56.1×

6.744 sammenlignet med 120 blandet/kW (ved 182,46 tok/s/bruger)

Skrevet af

OpenAI