Prvé výsledky Jalapeño ukazujú špičkovú rýchlosť a efektivitu v odvetví pri vyvodzovaní záverov AI

Od oznámenia Jalapeño, prvého vlastného inferenčného čipu OpenAI, testujeme tento čip aj systém vybudovaný okolo neho. Výsledky ukazujú výrazné zlepšenie výkonu: Jalapeño dokáže spracovať viac úloh AI na jednotku príkonu a zároveň rýchlejšie vracať odpovede. Jalapeño prináša vyššiu priepustnosť aj nižšiu latenciu pomocou jednej architektúry, zatiaľ čo pri existujúcich hardvérových systémoch je často nutné robiť kompromis medzi nimi.
Pre zákazníkov to môže znamenať rýchlejšie odpovede, pohotovejších agentov a spoľahlivejší prístup pri rastúcom dopyte. Naším poslaním je zabezpečiť, aby zo všeobecnej umelej inteligencie čerpalo výhody celé ľudstvo. Tieto zlepšenia pomôžu dosiahnuť, aby bola čoraz schopnejšia umelá inteligencia cenovo dostupnejšia a širšie dostupná.
Modely OpenAI tiež urýchlili vývoj Jalapeño. Staršie generácie pomohli tímu navrhnúť a uviesť čip do prevádzky, zatiaľ čo naše najnovšie modely urýchľujú optimalizáciu a programovanie čipu. Výkon Jalapeño sa prejavuje naprieč modelmi GPT‑OSS 120B, DeepSeek R1 a Kimi K2.5 1T, čo ukazuje, že architektúra funguje naprieč modelmi vyvinutými v OpenAI aj mimo nej. Vo všetkých troch prípadoch poskytlo Jalapeño pri špičkovej priepustnosti 1,5 až 1,9-krát viac práce AI na watt a o 1,7 až 3,6-krát nižšiu end-to-end latenciu než porovnávacie systémy. Pri vysoko interaktívnych pracovných záťažiach poskytol 2,1- až 4,1-krát vyšší výkon.
Jalapeño je tiež dôkazom širšej výhody v celom zásobníku. OpenAI dokáže navrhovať modely, produkty, softvér na obsluhu, čipy, pamäť, siete a systémy spoločne a využívať poznatky zo skutočných pracovných záťaží na zlepšenie každej vrstvy zásobníka. Jalapeño je vlastný kremíkový čip s nameranými výsledkami a predstavuje začiatok viacgeneračnej platformy. V nasledujúcich mesiacoch zvýšime nasadenie Jalapeño, aby sme našim zákazníkom prinášali rýchlejšie, výkonnejšie a efektívnejšie produkty.
Výkon hodnotíme pri rovnakej používateľskej skúsenosti, pričom meriame, koľko užitočnej práce AI dokáže každý systém vykonať na jednotku príkonu a zároveň spĺňať latenciu, ktorú zákazníci a interaktívni agenti vyžadujú. Je to dôležité najmä pre agentov, ktorí musia vykonať mnoho krokov za sebou, takže oneskorenia sa môžu kumulovať počas celej úlohy.
Aby sme pochopili, ako si Jalapeño vedie v praxi, otestovali sme ho na InferenceX, verejnom benchmarku od SemiAnalysis, ktorý meria celý proces obslúženia požiadavky AI. Jalapeño sme porovnali s poprednými komerčne dostupnými AI systémami v celom testovanom prevádzkovom rozsahu, od obsluhy s vysokou priepustnosťou po vysoko interaktívne použitie s nízkou latenciou. Jalapeño poskytlo lepšiu kombináciu priepustnosti, energetickej efektivity a latencie. Hoci sa výkon niekedy uvádza na čip, domnievame sa, že užitočnejším štandardom je výkon na jednotku príkonu.
Spomedzi všetkých troch verejných modelov poskytlo Jalapeño v celom testovanom prevádzkovom rozsahu lepšiu kombináciu výkonu na watt a latencie, čím sa dostalo na prelomovú hranicu. Aby sme mohli systémy konzistentne porovnať, normalizovali sme výsledky podľa zverejneného menovitého príkonu čipu jednotlivých akcelerátorov. Jalapeño má menovitý výkon 700 wattov, hoci jeho nameraný trvalý výkon pri testovaných pracovných záťažiach zostal na úrovni 550 wattov alebo nižšie.
Jalapeño dosahoval vysoký výkon naprieč modelmi GPT‑OSS 120B, DeepSeek R1 670B a Kimi K2.5 1T. Pri modeli Kimi, najväčšom verejnom modeli, ktorý sme testovali, poskytol približne 1,5-krát vyšší špičkový výkon na watt a 3,4-krát nižšiu latenciu od začiatku do konca než porovnávací systém. V našom internom testovaní sa výhoda Jalapeña pri prelomových modeloch OpenAI ešte zväčšila, čo naznačuje, že architektúra je hodnotnejšia, keď sú pracovné záťaže väčšie a náročnejšie.
Jalapeño bolo od začiatku navrhnuté s otázkou: aký hardvér by sme vytvorili, keby jeho hlavnou úlohou bolo podporovať moderné a budúce jazykové modely, najmä interaktívnych agentov? Prínosy Jalapeña vyplývajú z návrhu čipu, pamäte, siete, softvéru a systému na úrovni racku, ktorý je prispôsobený reálnym pracovným záťažiam jazykových modelov. Inferencia jazykových modelov prebieha cez niekoľko odlišných fáz s rôznymi úzkymi miestami. Predvyplnenie, keď systém spracúva príkaz, je výpočtovo náročné, zatiaľ čo dekódovanie, keď systém generuje odpoveď token po tokene, je viac obmedzené priepustnosťou pamäte. Komunikácia môže tiež zvyšovať latenciu, keď sa údaje musia presúvať medzi jadrami a čipmi, pričom niektoré výpočtové jednotky zostanú nečinné, kým čakajú. Systém, ktorý vyniká v jednej fáze, môže stratiť túto výhodu, keď čaká na údaje alebo presúva stav modelu medzi rôznymi zdrojmi.
Jalapeño sme navrhli tak, aby sa minimalizoval presun údajov a oneskorenia v komunikácii. To znamená, že stav modelu vrátane vyrovnávacej pamäte KV používanej pri generovaní odpovede možno explicitne umiestniť a uchovať lokálne, zatiaľ čo systém pre každú fázu inferencie aktivuje správnu kombináciu výpočtových zdrojov, pamäte a sietí. Sieť je neoddeliteľnou súčasťou architektúry. Jej rozsiahla doména umožňuje, aby celá pracovná záťaž zostala v rámci jedného prepojeného systému, čím sa minimalizuje presun údajov a pomáha sa zabezpečiť, aby celá požiadavka zostala rýchla a efektívna od začiatku až do konca. Výsledkom je vyvážený a univerzálne použiteľný akcelerátor, ktorý dokáže podporovať meniace sa architektúry modelov, vynikať pri predfill aj dekódovaní a prispôsobovať sa, keď sa mení rovnováha medzi nimi, čo je určujúcim znakom agentových pracovných záťaží.
AI zohrala priamu úlohu pri vývoji Jalapeño a umožnila tímu prejsť od úvodného návrhu k tapeoutu za deväť mesiacov vďaka skúmaniu implementácií, skracovaniu cyklov návrhu, merania a overovania a neustálemu iterovaniu pracovných záťaží modelov. Umelá inteligencia tiež pomohla optimalizovať aritmetické obvody čipu, vďaka čomu tím dokázal podľa harmonogramu vtesnať do čipu vyšší výpočtový výkon.
Jalapeño bol navrhnutý ako jasný a predvídateľný programovací cieľ pre ľudí aj umelú inteligenciu. Inžinieri môžu opísať prácu pomocou lokálnych tenzorov, explicitnej komunikácie a predvídateľnej synchronizácie. AI potom môže optimalizovať spôsob, akým sa táto práca mapuje, umiestňuje, plánuje a koordinuje v celom systéme. Táto jasná a predvídateľná štruktúra poskytuje umelej inteligencii zvládnuteľný spôsob, ako riešiť tradične náročný problém paralelného programovania.
Podpora každej novej rodiny modelov si stále vyžaduje nové jadrá a optimalizácie špecifické pre daný model. Tím pomocou Codexu s GPT‑Astra do dvoch mesiacov dosiahol vysoký výkon troch open-weight modelov, ktoré neboli súčasťou pôvodného produkčného plánu Jalapeño. To preukázalo flexibilitu architektúry aj rýchlosť, s akou nám AI dokáže pomôcť ju naprogramovať. Pri vybraných blokoch pozornosti a blokoch zložených z expertov modelu GPT‑OSS boli implementácie generované umelou inteligenciou 1,5 až 1,8-krát rýchlejšie než existujúce implementácie napísané ľudskými expertmi. Tieto údaje sa vzťahujú na vybrané bloky, nie na celý model, ale poukazujú na výkonný nový vývojový cyklus.
Infraštruktúra umelej inteligencie má hodnotu vďaka užitočnej práci v reálnom svete, ktorú umožňuje. Tým, že z rovnakého príkonu a hardvéru vyprodukuje viac užitočnej práce, nám Jalapeño môže pomôcť obslúžiť väčší dopyt a znížiť náklady na dosiahnutie úspešného výsledku. Pre OpenAI to môže zlepšiť prevádzkovú páku tým, že užitočná práca a príjmy môžu rásť rýchlejšie než náklady na poskytovanie služieb. Môže tiež podporiť širšie využívanie a pokračujúce investície do lepších modelov, produktov a infraštruktúry. Rýchlejšie vyhodnocovanie môže umožniť rýchlejšie opakovanie a nové prípady použitia.
Jalapeño rozširuje možnosti pre efektívnu inferenciu s nízkou latenciou:
- inferencia v ultrarýchlom režime s efektivitou, ktorá bola predtým dostupná len v rýchlom režime
- Vyhodnocovanie v rýchlom režime s efektivitou, ktorá bola predtým dostupná iba v dávkovom režime
- Vysoká efektivita inferencie v dávkovom režime
Plánujeme začať nasadzovať Jalapeño vo výpočtovej infraštruktúre OpenAI do konca roka. Je to prvá generácia viacgeneračného plánu vývoja: Gen 2 je v pokročilej fáze vývoja a Gen 3 sa formuje. Každá generácia nadviaže na to, čo sa naučíme, a bude ďalej zlepšovať efektivitu aj rýchlosť.
Uspokojenie rastúceho dopytu po AI si bude vyžadovať viac výpočtovej kapacity zo všetkých dostupných zdrojov. Budeme naďalej vo veľkom nasadzovať akcelerátory od spoločnosti NVIDIA a ďalších partnerov pre tréningové a inferenčné pracovné záťaže. Naším poslaním je zabezpečiť, aby zo všeobecnej umelej inteligencie čerpalo výhody celé ľudstvo.
Keď sa pripravujeme na nasadenie, pokračujeme v kvalifikácii pre produkčné nasadenie, zdokonaľovaní softvéru, príprave na prevádzku Jalapeño vo veľkom rozsahu a overovaní výkonu naprieč viacerými modelmi. Dosiaľ dosiahnuté výsledky ukazujú, čo je možné, keď spoločne navrhujeme celý systém: pohotovejšiu, schopnejšiu a agentická AI dodávanú efektívnejšie väčšiemu počtu ľudí.
PRELOMOVÁ PRIEPUSTNOSŤ na kW
InferenceX · GPT‑OSS‑120B · nominálne 8k/1k · STP · TDP balíka: Jalapeño 700 W. GB200 1 200 W
Špičková a zodpovedajúca priepustnosť
InferenceX · GPT‑OSS‑120B · nominálna hodnota 8 000/1 000 · STP · TDP balíka. Jalapeño 700 W. GB200 1 200 W
Vyšší špičkový zmiešaný TPS/kW
≈1,9×
85 448 verzus 44 960 zmiešané/kW
Nižšia latencia end-to-end
≈1,7×
1,03 s verzus 1,80 s
zníž min tbt
≈2,7×
0,69 oproti 1,87 ms (1 459 oproti 535 tok/s/používateľ)
Vyššia priepustnosť pri predchádzajúcom TBT
≈53,7×
22 935 oproti 427 zmiešané / kW (pri 535,28 tok/s/používateľ)
PRIEPUSTNOSŤ na kW PRELOMOVÝ
InferenceX · DeepSeek R1 MXFP4 · nominálne 8k/1k · STP · TDP balíka: Jalapeño 700 W. GB300 1 400 W
Špičková a zodpovedajúca priepustnosť
InferenceX · DeepSeek R1 MXFP4 · nominálne 8k/1k · STP · TDP balíka: Jalapeño 700 W. GB300 1 400 W
vyšší špičkový zmiešaný TPS/kW
≈1,7×
19 641 verzus 11 781 zmiešané/kW
Nižšia latencia koncového spojenia
≈3,6×
1,65 s verzus 5,99 s
zniž min TBT
≈4.1×
1,43 verzus 5,90 ms (700 verzus 169 tok/s/používateľ)
Vyššia priepustnosť pri predchádzajúcom TBT
≈104,3×
12 258 verzus 118 zmiešaných / kW (pri 169,41 tok/s/používateľ)
PRIEPUSTNOSŤ na kW PRELOMOVÝ
InferenceX · Kimi K2.5 MXFP4 · nominálne 8k/1k · STP · TDP puzdra: Jalapeño 700 W. GB300 1 400 W
Špičková a zodpovedajúca priepustnosť
InferenceX · Kimi K2.5 MXFP4 · nominálne 8k/1k · STP · TDP balíka: Jalapeño 700 W. GB300 1 400 W.
Vyšší špičkový zmiešaný TPS/kW
≈1,5×
18 195 oproti 11 862 kombinované/kW
Nižšia latencia end-to-end
≈3,4 ×
1,56 s verzus 5,31 s
Zníž min TBT
≈3,8×
1,44 verzus 5,48 ms (694 verzus 182 tok/s/používateľ)
Vyššia priepustnosť pri predchádzajúcom TBT
≈56,1 ×
6 744 verzus 120 zmiešané/kW (pri 182,46 tok/s/používateľ)


