Jalapeño’s eerste resultaten tonen toonaangevende snelheid en efficiëntie in AI-inferentie

Sinds de aankondiging van Jalapeño, de eerste eigen inferentiechip van OpenAI, testen we de chip en het systeem dat eromheen is gebouwd. De resultaten laten een aanzienlijke prestatieverbetering zien: Jalapeño kan meer AI-werk per eenheid vermogen afhandelen en tegelijkertijd sneller antwoorden geven. Jalapeño levert met één architectuur zowel een hogere doorvoer als een lagere latentie, terwijl bestaande hardwaresystemen vaak een afweging tussen beide moeten maken.
Voor klanten kan dat snellere antwoorden, responsievere agents en betrouwbaardere toegang betekenen naarmate de vraag toeneemt. Onze missie is ervoor te zorgen dat kunstmatige algemene intelligentie de hele mensheid ten goede komt. Deze verbeteringen zullen steeds capabelere AI betaalbaarder en breder beschikbaar helpen maken.
OpenAI-modellen versnelden ook de ontwikkeling van Jalapeño. Eerdere generaties hielpen het team bij het ontwerpen en in bedrijf stellen van de chip, terwijl onze nieuwste modellen het optimaliseren en programmeren ervan versnellen. De prestaties van Jalapeño strekken zich uit over GPT‑OSS 120B, DeepSeek R1 en Kimi K2.5 1T, wat laat zien dat de architectuur werkt voor modellen die zowel binnen als buiten OpenAI zijn ontwikkeld. Bij alle drie leverde Jalapeño bij piekdoorvoer 1,5 tot 1,9 keer meer AI-rekenwerk per watt en een 1,7 tot 3,6 keer lagere end-to-endlatentie dan de vergelijkingssystemen. Voor zeer interactieve workloads leverde het 2,1 tot 4,1 keer hogere prestaties.
Jalapeño bewijst ook een breder voordeel van onze fullstackaanpak. OpenAI kan modellen, producten, servingsoftware, chips, geheugen, netwerken en systemen gezamenlijk ontwerpen en daarbij inzichten uit echte workloads gebruiken om elke laag van de stack te verbeteren. Jalapeño is eigen silicium met meetbare resultaten en het vormt het begin van een platform voor meerdere generaties. In de komende maanden zullen we Jalapeño opschalen om snellere, capabelere en efficiëntere producten voor onze klanten te leveren.
Wij evalueren prestaties bij een gelijkwaardige gebruikerservaring, waarbij we meten hoeveel nuttig AI-werk elk systeem per vermogenseenheid kan voltooien terwijl het voldoet aan de latentie-eisen van klanten en interactieve agenten. Dit is vooral belangrijk voor agenten, die veel stappen achter elkaar moeten voltooien, waardoor vertragingen zich gedurende een volledige taak kunnen opstapelen.
Om te begrijpen hoe Jalapeño in de praktijk presteert, hebben we het getest op InferenceX, een openbare benchmark van SemiAnalysis die het volledige proces van het afhandelen van een AI-verzoek meet. We hebben Jalapeño vergeleken met toonaangevende commercieel beschikbare AI-systemen binnen het geteste operationele bereik, van verwerking met hoge doorvoer tot zeer interactief gebruik met lage latentie. Jalapeño bood een betere combinatie van doorvoer, energie-efficiëntie en latentie. Hoewel prestaties soms per chip worden gerapporteerd, zijn wij van mening dat prestaties per eenheid vermogen de nuttigere maatstaf vormen.
Bij alle drie de openbare modellen leverde Jalapeño over het geteste bedrijfsbereik een betere combinatie van prestaties per watt en latentie, waarmee het op het Paretofront komt te liggen. Om de systemen consistent te vergelijken, hebben we de resultaten genormaliseerd op basis van het gepubliceerde nominale chipvermogen van elke accelerator. Jalapeño heeft een nominaal vermogen van 700 watt, hoewel het gemeten aanhoudende vermogen bij de geteste workloads op of onder 550 watt bleef.
Jalapeño presteerde sterk op GPT‑OSS 120B, DeepSeek R1 670B en Kimi K2.5 1T. Op Kimi, het grootste openbare model dat we hebben getest, leverde het ongeveer 1,5 keer hogere piekprestaties per watt en een 3,4 keer lagere end-to-endlatentie dan het vergelijkingssysteem. In onze interne tests werd het voordeel van Jalapeño nog groter op grensverleggende OpenAI-modellen, wat erop wijst dat de architectuur waardevoller wordt naarmate workloads groter en veeleisender worden.
We hebben Jalapeño vanaf het begin ontworpen vanuit de vraag: welke hardware zouden we bouwen als de primaire taak ervan het bedienen van moderne en toekomstige taalmodellen was, met name interactieve agents? De voordelen van Jalapeño komen voort uit het gezamenlijk ontwerpen van de chip, het geheugen, het netwerk, de software en het systeem op rackniveau rond daadwerkelijke workloads voor taalmodellen. Inferentie met taalmodellen verloopt via verschillende afzonderlijke fasen met verschillende knelpunten. Prefill, waarbij het systeem een prompt verwerkt, is rekenintensief, terwijl decode, waarbij het systeem het antwoord token voor token genereert, sterker wordt beperkt door de geheugenbandbreedte. Communicatie kan ook latentie toevoegen wanneer gegevens tussen kernen en chips moeten worden verplaatst, waardoor sommige verwerkingseenheden tijdens het wachten inactief blijven. Een systeem dat in één fase uitblinkt, kan dat voordeel verliezen terwijl het wacht op gegevens of de modelstatus tussen verschillende resources verplaatst.
We hebben Jalapeño ontworpen om dataverplaatsing en communicatievertragingen tot een minimum te beperken. Dit betekent dat de modelstatus, inclusief de KV-cache die tijdens het genereren van een antwoord wordt gebruikt, expliciet kan worden geplaatst en lokaal kan worden gehouden, terwijl het systeem voor elke inferentiefase de juiste combinatie van rekenkracht, geheugen en netwerken activeert. Het netwerk is een integraal onderdeel van de architectuur. Dankzij het grote domein kan de volledige workload binnen één verbonden systeem blijven, waardoor dataverplaatsing wordt geminimaliseerd en het volledige verzoek van begin tot eind snel en efficiënt blijft. Het resultaat is een evenwichtige, flexibel inzetbare accelerator die veranderende modelarchitecturen kan ondersteunen, uitblinkt in zowel prefill als decode en zich kan aanpassen naarmate de balans daartussen verandert: een kenmerkende eigenschap van agentic workloads.
AI speelde een directe rol in de ontwikkeling van Jalapeño en stelde het team in staat om in negen maanden van het eerste ontwerp naar tape-out te gaan door implementaties te verkennen, ontwerp-, meet- en verificatiecycli te verkorten en continu te itereren op modelworkloads. AI hielp ook bij het optimaliseren van de rekenkundige schakelingen van de chip, waardoor het team volgens planning meer rekenkracht in de chip kon onderbrengen.
Jalapeño is ontworpen als een duidelijk, voorspelbaar programmeerdoel voor zowel mensen als AI. Engineers kunnen werk beschrijven met behulp van lokale tensoren, expliciete communicatie en voorspelbare synchronisatie. AI kan vervolgens optimaliseren hoe dat werk in het hele systeem wordt toegewezen, geplaatst, gepland en gecoördineerd. Die duidelijke, voorspelbare structuur biedt AI een hanteerbare manier om het traditioneel lastige probleem van parallel programmeren aan te pakken.
Het ondersteunen van elke nieuwe modelfamilie vereist nog steeds nieuwe kernels en modelspecifieke optimalisaties. Door Codex in combinatie met GPT‑Astra te gebruiken, heeft het team binnen twee maanden drie open-weight-modellen die geen deel uitmaakten van het oorspronkelijke productieplan van Jalapeño naar een hoog prestatieniveau gebracht. Dit toonde zowel de flexibiliteit van de architectuur aan als de snelheid waarmee AI ons kan helpen deze te programmeren. Voor geselecteerde GPT‑OSS‑attention‑ en mixture-of-experts-blokken waren door AI gegenereerde implementaties 1,5 tot 1,8 keer sneller dan de bestaande, door menselijke experts geschreven implementaties. Die cijfers gelden voor de geselecteerde blokken, niet voor het volledige model, maar ze wijzen op een krachtige nieuwe ontwikkelcyclus.
AI-infrastructuur is waardevol vanwege het nuttige werk dat deze in de echte wereld mogelijk maakt. Door met dezelfde hoeveelheid energie en hardware meer nuttig werk te verrichten, kan Jalapeño ons helpen om aan meer vraag te voldoen en de kosten voor het behalen van een succesvol resultaat te verlagen. Voor OpenAI kan dat de operationele hefboomwerking verbeteren doordat nuttig werk en omzet sneller kunnen groeien dan de kosten van onze dienstverlening. Het kan ook bredere adoptie en blijvende investeringen in betere modellen, producten en infrastructuur ondersteunen. Snellere inferentie kan snellere iteratie en nieuwe gebruiksscenario’s mogelijk maken.
Jalapeño verruimt de mogelijkheden voor efficiënte inferentie met lage latentie:
- Inferentie in ultrasnelle modus met efficiëntieniveaus die voorheen alleen beschikbaar waren in fast-modus
- Inferentie in fast-modus met efficiëntieniveaus die voorheen alleen beschikbaar waren in batchmodus
- Verbeterde efficiëntie voor inferentie in batchmodus
We zijn van plan om tegen het einde van het jaar te beginnen met de uitrol van Jalapeño binnen de rekeninfrastructuur van OpenAI. Het is de eerste generatie van een roadmap voor meerdere generaties: Gen 2 is volop in ontwikkeling en Gen 3 krijgt vorm. Elke generatie bouwt voort op wat we leren en verbetert zowel de efficiëntie als de snelheid verder.
Om aan de groeiende vraag naar AI te voldoen, is meer rekenkracht uit elke beschikbare bron nodig. We blijven accelerators van NVIDIA en andere partners op grote schaal inzetten voor workloads voor training en inferentie. Onze missie is ervoor te zorgen dat kunstmatige algemene intelligentie de hele mensheid ten goede komt.
Terwijl we ons voorbereiden op de uitrol, zetten we de productiekwalificatie voort, brengen we de software verder tot rijping, bereiden we ons voor om Jalapeño op grote schaal te laten draaien en valideren we de prestaties over meer modellen. De resultaten tot nu toe laten zien wat er mogelijk is wanneer we het volledige systeem samen ontwerpen: responsievere, capabelere en agentic AI die efficiënter aan meer mensen wordt geleverd.
GRENSVERLEGGENDE DOORVOER PER kW
InferenceX · GPT‑OSS‑120B · nominaal 8k/1k · STP · pakket-TDP: Jalapeño 700 W; GB200 1.200 W
PIEK- EN AFGESTEMDE DOORVOER
InferenceX · GPT‑OSS‑120B · nominaal 8k/1k · STP · pakket-TDP: Jalapeño 700 W; GB200 1.200 W
Hogere piek gemengde TPS / kW
≈1,9×
85.448 vs. 44.960 gemengd / kW
Lagere end-to-endlatentie
≈1,7×
1,03 s vs. 1,80 s
Lagere minimale TBT
≈2,7×
0,69 vs. 1,87 ms (1.459 vs. 535 tok/s/gebruiker)
Meer doorvoer bij vorige TBT
≈53,7×
22.935 vs. 427 gemengd / kW (bij 535,28 tokens/s/gebruiker)
GRENSVERLEGGENDE DOORVOER PER kW
InferenceX · DeepSeek R1 MXFP4 · nominaal 8k/1k · STP · pakket TDP: Jalapeño 700 W; GB300 1.400 W
PIEK- EN AFGESTEMDE DOORVOER
InferenceX · DeepSeek R1 MXFP4 · nominaal 8k/1k · STP · pakket TDP: Jalapeño 700 W; GB300 1.400 W
Hogere piek gemengde TPS / kW
≈1,7×
19.641 t.o.v. 11.781 gemengd / kW
Lagere end-to-endlatentie
≈3,6×
1,65 s vs. 5,99 s
Lagere minimale TBT
≈4,1×
1,43 vs. 5,90 ms (700 vs. 169 tok/s/user)
Meer doorvoer bij vorige TBT
≈104,3×
12.258 vs. 118 gemengd / kW (bij 169,41 tok/s/user)
GRENSVERLEGGENDE DOORVOER PER kW
InferenceX · Kimi K2.5 MXFP4 · nominaal 8k/1k · STP · pakket-TDP: Jalapeño 700 W; GB300 1.400 W
PIEK- EN AFGESTEMDE DOORVOER
InferenceX · Kimi K2.5 MXFP4 · nominaal 8k/1k · STP · pakket-TDP: Jalapeño 700 W; GB300 1.400 W
Hogere piek gemengde TPS / kW
≈1,5×
18.195 vs. 11.862 gemengd / kW
Lagere end-to-endlatentie
≈3,4×
1,56 s vs. 5,31 s
Lagere minimale TBT
≈3,8×
1,44 vs. 5,48 ms (694 vs. 182 tok/s/gebruiker)
Meer doorvoer bij vorige TBT
≈56,1×
6.744 vs. 120 gemengd / kW (bij 182,46 tok/s/gebruiker)


