Gå direkt till huvudinnehåll
OpenAI

25 augusti 2026

TeknikFöretag

Jalapeños första resultat visar branschledande hastighet och effektivitet inom AI-inferens

Laddar …
Närbild av Jalapeño-inferenschipset monterat på ett turkost kretskort.

Sedan vi tillkännagav Jalapeño, OpenAI:s första specialanpassade inferenschip, har vi testat chipet och det system som byggts upp kring det. Resultaten visar en betydande prestandaförbättring: Jalapeño kan hantera fler AI-uppgifter per energienhet och samtidigt leverera svar snabbare. Jalapeño erbjuder både högre genomströmning och lägre latens med en och samma arkitektur, medan befintliga hårdvarusystem ofta måste göra en avvägning mellan dessa två faktorer.

För kunder kan det innebära snabbare svar, mer lyhörda agenter och mer tillförlitlig åtkomst när efterfrågan ökar. Vårt uppdrag är att säkerställa att artificiell generell intelligens kommer hela mänskligheten till nytta. Dessa framsteg kommer att bidra till att göra alltmer kapabel AI mer prisvärd och mer allmänt tillgänglig.

OpenAI-modeller påskyndade också utvecklingen av Jalapeño. Tidigare generationer har hjälpt teamet att utforma och ta fram chipet, medan våra senaste modeller påskyndar arbetet med att optimera och programmera det. Jalapeños prestanda sträcker sig över GPT‑OSS 120B, DeepSeek R1 och Kimi K2.5 1T, vilket visar att arkitekturen fungerar med modeller som utvecklats både inom och utanför OpenAI. I alla tre fallen levererade Jalapeño 1,5 till 1,9 gånger mer AI-bearbetning per watt vid maximal genomströmning och 1,7 till 3,6 gånger lägre total fördröjning jämfört med jämförelsesystemen. För mycket interaktiva arbetsbelastningar levererade Jalapeño 2,1 till 4,1 gånger högre prestanda.

Jalapeño är också ett bevis på en bredare fördel med fullstack. OpenAI kan utforma modeller, produkter, driftsprogramvara, chips, minne, nätverksteknik och system i samverkan, och använda de lärdomar vi drar från verkliga arbetsbelastningar för att förbättra varje lager i arkitekturen. Jalapeño arbetar med egenutvecklad hårdvara och har uppnått mätbara resultat, vilket markerar början på en plattform som sträcker sig över flera generationer. Under de kommande månaderna kommer vi att trappa upp Jalapeño för att leverera snabbare, mer kraftfulla och effektivare produkter till våra kunder.

Så mätte vi Jalapeños prestanda

Vi utvärderar prestandan utifrån en jämförbar användarupplevelse genom att mäta hur mycket meningsfullt AI-arbete varje system kan utföra per energienhet, samtidigt som det uppfyller de krav på svarstid som kunder och interaktiva agenter ställer. Detta är särskilt viktigt för agenter, som behöver slutföra många steg i följd, så fördröjningar kan ackumuleras över en hel uppgift.

Vi testade Jalapeño på InferenceX, ett offentligt benchmarktest från SemiAnalysis som mäter hela processen för att hantera en AI-förfrågan, för att se hur det presterar i praktiken. Vi jämförde Jalapeño med ledande kommersiellt tillgängliga AI-system inom hela det testade driftområdet, från hantering med hög kapacitet till mycket interaktiv användning med låg latens. Jalapeño gav en bättre kombination av Kapacitet, energieffektivitet och latens. Även om prestanda ibland rapporteras per chip anser vi att det mer användbara måttet är prestanda per effektenhet.

Jalapeño ökar försprånget vid tidigare bästa TBT

Jalapeño levererar fler Token per användare

Jalapeño ger högre kapacitet per kilowatt

I alla tre offentliga modellerna uppvisade Jalapeño en bättre kombination av prestanda per watt och latens över hela det testade driftsområdet, vilket placerade den på Pareto-gränsen. För en konsekvent jämförelse av systemen normaliserade vi resultaten utifrån den publicerade märkeffekten för respektive acceleratorkrets. Jalapeño är märkt för 700 watt, även om dess uppmätta kontinuerliga effekt höll sig på eller under 550 watt vid de testade arbetsbelastningarna.

Jalapeño presterade starkt i GPT‑OSS 120B, DeepSeek R1 670B och Kimi K2.5 1T. På Kimi, den största offentliga modellen som vi testade, uppvisade den ungefär 1,5 gånger högre toppprestanda per watt och 3,4 gånger lägre total fördröjning jämfört med jämförelsesystemet. I våra interna tester ökade Jalapeños försprång ytterligare när det gäller de senaste OpenAI-modellerna, vilket tyder på att arkitekturen blir mer värdefull ju större och mer krävande arbetsbelastningarna blir.

Utformning för snabbhet och effektivitet i en enda krets

Jalapeño utformades redan från början utifrån frågan: vilken hårdvara skulle vi bygga om dess främsta uppgift var att betjäna moderna och framtida språkmodeller, särskilt interaktiva agenter? Jalapeños framgångar beror på att man har utformat chip, minne, nätverk, programvara och system i rackskala gemensamt utifrån verkliga arbetsbelastningar för språkmodeller. Inferensen i språkmodellen genomgår flera olika faser med olika flaskhalsar. Förifyllningen, som sker när systemet bearbetar en inmatning, är beräkningsintensiv, medan avkodningen – då systemet genererar svaret token för token – i högre grad begränsas av minnesbandbredden. Kommunikation kan också orsaka fördröjning när data måste överföras mellan kärnor och kretsar, vilket gör att vissa processorenheter står stilla medan de väntar. Ett system som presterar särskilt bra i en viss fas kan förlora den fördelen medan det väntar på data eller överför modellens tillstånd mellan olika resurser.

Vi utformade Jalapeño för att minimera dataförflyttning och kommunikationsfördröjningar. Detta innebär att modellens tillstånd, inklusive den KV-cache som används vid genereringen av ett svar, explicit kan placeras och hållas lokalt medan systemet aktiverar rätt kombination av beräkningskapacitet, minne och nätverksresurser för varje inferensfas. Nätverket är en integrerad del av arkitekturen. Tack vare dess stora domän kan hela arbetsbelastningen hanteras inom ett enda sammanhängande system, vilket minimerar dataöverföringen och bidrar till att hela begäran hanteras snabbt och effektivt från början till slut. Resultatet är en balanserad och utbytbar accelerator som kan hantera föränderliga modellarkitekturer, prestera utmärkt både vid förifyllning och avkodning samt anpassa sig när balansen mellan dessa förändras – vilket är ett utmärkande drag för agentbaserade arbetsbelastningar.

Vi använde AI för att designa chipet och designade chipet så att AI kunde programmera det

AI spelade en direkt roll i utvecklingen av Jalapeño och gjorde det möjligt för teamet att gå från den inledande designfasen till tapeout på nio månader genom att utforska olika implementeringar, förkorta design-, mät- och verifieringscyklerna samt kontinuerligt iterera över modellbelastningar. AI bidrog också till att optimera chipets aritmetiska kretsar, vilket gjorde det möjligt för teamet att få in mer beräkningskapacitet i chipet enligt tidsplanen.

Jalapeño utformades som ett tydligt och förutsägbart programmeringsmål för både människor och AI. Ingenjörer kan beskriva arbete med hjälp av lokala tensorer, explicit kommunikation och förutsägbar synkronisering. AI kan sedan optimera hur det arbetet mappas, placeras, schemaläggs och samordnas i hela systemet. Den tydliga, förutsägbara strukturen ger AI ett hanterbart sätt att ta sig an det traditionellt svåra problemet med parallellprogrammering.

Det krävs fortfarande nya kärnor och modellspecifika optimeringar för att stödja varje ny modellserie. Genom att använda Codex tillsammans med GPT‑Astra lyckades teamet inom två månader få tre modeller med obegränsad storlek – som inte ingick i Jalapeños ursprungliga produktionsplan – att uppnå hög prestanda. Detta visade både arkitekturens flexibilitet och hur snabbt AI kan hjälpa oss att programmera den. För utvalda GPT‑OSS‑block av typen ”attention” och ”mixture-of-experts” kördes de AI-genererade implementationerna 1,5 till 1,8 gånger snabbare än de befintliga implementationerna som skrivits av mänskliga experter. Dessa siffror gäller de valda blocken, inte hela modellen, men de pekar mot en kraftfull ny utvecklingscykel.

Vägen framåt för effektiv, Ultra-snabb inferens

AI-infrastruktur är värdefull eftersom den möjliggör nyttigt arbete i verkliga världen. Genom att åstadkomma mer användbart arbete med samma prestanda och hårdvara kan Jalapeño hjälpa oss att möta en större efterfrågan och sänka kostnaderna för att uppnå ett framgångsrikt resultat. För OpenAI kan detta förbättra den operativa hävstångseffekten genom att användbart arbete och intäkter kan växa snabbare än kostnaderna för att tillhandahålla tjänsterna. Det kan också bidra till en bredare användning och fortsatta investeringar i bättre modeller, produkter och infrastruktur. Snabbare inferens kan möjliggöra snabbare iteration och nya användningsområden.

Jalapeño utökar möjligheterna för effektiv inferens med låg latens:

  • Inferens i ultrasnabbläge med en effektivitet som tidigare endast var möjlig i snabbläge
  • Inferens i snabbläge med effektivitet som tidigare endast var möjlig i batchläge
  • Högre effektivitet för inferens i batchläge

Vi planerar att börja implementera Jalapeño i OpenAI:s databehandlingsinfrastruktur senast i slutet av året. Det är den första generationen i en flergenerationsplan: Gen 2 befinner sig i ett långt framskridet utvecklingsskede, och Gen 3 börjar ta form. Varje generation kommer att bygga vidare på det vi lär oss och ytterligare förbättra både effektiviteten och hastigheten.

Ska vi möta den växande efterfrågan på AI kommer det att krävas mer datorkraft från alla tillgängliga källor. Vi kommer att fortsätta att i stor utsträckning använda acceleratorer från NVIDIA och andra samarbetspartner för både tränings- och inferensarbetsbelastningar. Vårt uppdrag är att säkerställa att artificiell generell intelligens kommer hela mänskligheten till nytta.

Samtidigt som vi förbereder oss för driftsättningen fortsätter vi med produktionskvalificeringen, vidareutvecklar programvaran, förbereder oss för att driva Jalapeño i stor skala och validerar prestandan för fler modeller. Resultaten hittills visar vad som är möjligt när vi utformar hela systemet tillsammans: en mer lyhörd, kapabel och handlingskraftig AI som levereras mer effektivt till fler människor.

Bilaga

Jalapeño ligger på Pareto banbrytande vid GPT‑OSS 120B

GENOMSTRÖMNING per kW – FRONTIER

InferenceX · GPT‑OSS‑120B · nominell 8k/1k · STP · paket TDP: Jalapeño 700 W; GB200 1 200 W

Jalapeño leder över alla GPT‑OSS‑driftpunkter

TOPPVÄRDE OCH ANPASSAD GENOMSTRÖMNING

InferenceX · GPT‑OSS‑120B · nominell 8k/1k · STP · paket TDP: Jalapeño 700 W; GB200 1 200 W

Högre toppvärde blandad TPS/kW

≈1,9×

85 448 jämfört med 44 960 blandat/kW

Lägre totalt fördröjning

≈1,7×

1,03 s jämfört med 1,80 s

Lägre min TBT

≈2,7×

0,69 jämfört med 1,87 ms (1 459 jämfört med 535 tok/s/användare)

Högre kapacitet vid tidigare TBT

≈53,7×

22 935 jämfört med 427 blandat/kW (vid 535,28 tok/s/användare)

Jalapeño ligger på pareto banbrytande vid DeepSeek R1 670B

Kapacitet per kW banbrytande

InferenceX · DeepSeek R1 MXFP4 · nominellt 8k/1k · STP · paket TDP: Jalapeño 700 W; GB300 1,400 W

Jalapeño leder över DeepSeek R1 vid alla driftpunkter

Topp- och matchad kapacitet

InferenceX · DeepSeek R1 MXFP4 · nominellt 8k/1k · STP · paket TDP: Jalapeño 700 W; GB300 1 400 W

Högre toppvärde blandad TPS/kW

≈1,7×

19 641 jämfört med 11 781 blandade / kW

Lägre totalt fördröjning

≈3,6×

1,65 s jämfört med 5,99 s

Lägre min TBT

≈4,1×

1,43 vs. 5,90 ms (700 vs. 169 tok/s/användare)

Högre kapacitet vid tidigare TBT

≈104,3×

12 258 mot 118 blandade/kW (vid 169,41 tok/s/användare)

Jalapeño är banbrytande på Paretofronten hos Kimi K2.5 1T

Kapacitet per kW banbrytande

InferenceX · Kimi K2.5 MXFP4 · nominellt 8k/1k · STP · paket TDP: Jalapeño 700 W; GB300 1 400 W

Jalapeño leder vid Kimi K2.5:s driftpunkter

Topp- och matchad kapacitet

InferenceX · Kimi K2.5 MXFP4 · nominellt 8k/1k · STP · paket TDP: Jalapeño 700 W; GB300 1 400 W

Högre toppvärde för blandad TPS / kW

≈1,5×

18 195 jämfört med 11 862 blandat / kW

Lägre totalt fördröjning

≈3,4×

1,56 s vs. 5,31 s

Lägre min TBT

≈3,8×

1,44 jämfört med 5,48 ms (694 jämfört med 182 tok/s/användare)

Högre kapacitet vid tidigare TBT

≈56,1×

6 744 jämfört med 120 blandade/kW (vid 182,46 tok/s/användare)

Författare

OpenAI