Prvi rezultati Jalapeña pokazuju vodeću brzinu i učinkovitost u branši u izvođenju AI inferencije

Od kada smo najavili Jalapeño, prvi prilagođeni čip za inferenciju društva OpenAI, testiramo čip i sustav izgrađen oko njega. Rezultati pokazuju značajan napredak u performansama: Jalapeño može obraditi više AI opterećenja po jedinici snage, a istodobno brže vraćati odgovore. Jalapeño pruža veću propusnost i manju latenciju s jednom arhitekturom, dok postojeći hardverski sustavi često moraju napraviti kompromis između njih.
To za korisnike može značiti brže odgovore, responzivnije agente i pouzdaniji pristup s rastom potražnje. Naša je misija osigurati da umjetna inteligencija koristi cijelom čovječanstvu. Ta će poboljšanja pomoći da sve sposobnija umjetna inteligencija postane cjenovno pristupačnija i šire dostupna.
Modeli OpenAI-ja također su ubrzali razvoj Jalapeña. Prethodne generacije pomogle su timu da dizajnira i dovrši čip, dok naši najnoviji modeli ubrzavaju optimizaciju i programiranje čipa. Performanse Jalapeña obuhvaćaju modele GPT‑OSS 120B, DeepSeek R1 i Kimi K2.5 1T, što pokazuje da arhitektura funkcionira s modelima razvijenima unutar i izvan OpenAI-ja. Za sva tri modela Jalapeño je pri vršnoj propusnosti isporučio 1,5 do 1,9 puta više AI rada po vatu i 1,7 do 3,6 puta nižu latenciju s kraja na kraj od usporednih sustava. Za vrlo interaktivna radna opterećenja ostvario je 2,1 do 4,1 puta bolje performanse.
Jalapeño je također dokaz šire prednosti u cijelom tehnološkom sloju. OpenAI može zajedno dizajnirati modele, proizvode, softver za pružanje usluga, čipove, memoriju, mrežu i sustave, koristeći ono što učimo iz stvarnih radnih opterećenja za poboljšanje svakog sloja stoga. Jalapeño je vlastiti silicij s izmjerenim rezultatima i početak višegeneracijske platforme. U mjesecima koji slijede pojačat ćemo rad na Jalapeñu kako bismo našim klijentima isporučili brže, naprednije i učinkovitije proizvode.
Procjenjujemo performanse pri usporedivom korisničkom iskustvu, mjereći koliko korisnog AI rada svaki sustav može obaviti po jedinici snage, uz ispunjavanje zahtjeva za latencijom koje imaju korisnici i interaktivni agenti. To je posebno važno za agente, koji trebaju izvršiti mnogo koraka u nizu, pa se kašnjenja mogu kumulirati tijekom cijelog zadatka.
Kako bismo razumjeli kako se Jalapeño ponaša u praksi, testirali smo ga na InferenceX-u, javnom referentnom testu tvrtke SemiAnalysis koji mjeri cjelokupan proces posluživanja AI zahtjeva. Usporedili smo Jalapeño s vodećim komercijalno dostupnim AI sustavima u cijelom ispitanom radnom rasponu, od posluživanja s visokom propusnošću do vrlo interaktivne upotrebe s niskom latencijom. Jalapeño je pružio bolju kombinaciju propusnosti, energetske učinkovitosti i latencije. Iako se performanse ponekad iskazuju po čipu, smatramo da je korisnije mjerilo performanse po jedinici snage.
Jalapeño je u sva tri javno dostupna modela u cijelom testiranom radnom rasponu ostvario bolju kombinaciju performansi po vatu i latencije, čime se smjestio na Paretovu granicu. Kako bismo dosljedno usporedili sustave, normalizirali smo rezultate s pomoću objavljene nazivne snage čipa svakog akceleratora. Jalapeño ima nazivnu snagu od 700 W, iako njegova izmjerena trajna snaga pri testiranim radnim opterećenjima nije prelazila 550 W.
Jalapeño je ostvario sjajne rezultate u modelima GPT‑OSS 120B, DeepSeek R1 670B i Kimi K2.5 1T. Na modelu Kimi, najvećem javno dostupnom modelu koji smo testirali, postignute su približno 1,5 puta veće vršne performanse po vatu i 3,4 puta niža latencija s kraja na kraj u odnosu na usporedni sustav. U našim internim testiranjima prednost Jalapeña dodatno se povećala na graničnim modelima OpenAI-ja, što upućuje na to da arhitektura postaje vrednija kako radna opterećenja rastu i postaju zahtjevnija.
Jalapeño je od početka dizajniran polazeći od pitanja: kakav bismo hardver izgradili kad bi mu glavna zadaća bila posluživanje suvremenih i budućih jezičnih modela, osobito interaktivnih agenata? Prednosti Jalapeña proizlaze iz zajedničkog projektiranja čipa, memorije, mreže, softvera i sustava na razini nosača za stvarna radna opterećenja jezičnih modela. Inferencija jezičnih modela odvija se u nekoliko različitih faza s različitim uskim grlima. U fazi obrade (engl. prefill), kada sustav obrađuje upit, potrebna je velika računalna snaga, dok u fazi dekodiranja (engl. decode), kada sustav generira odgovor token po token, veće ograničenje predstavlja propusnost memorije. Komunikacija također može povećati latenciju kada se podaci moraju premještati između jezgri i čipova, ostavljajući neke procesorske jedinice neaktivnima dok čekaju. Sustav koji se ističe u jednoj fazi može izgubiti tu prednost dok čeka podatke ili premješta stanje modela između različitih resursa.
Osmislili smo Jalapeño kako bismo minimizirali premještanje podataka i kašnjenja u komunikaciji. To znači da se stanje modela, uključujući KV predmemoriju koja se upotrebljava pri generiranju odgovora, može eksplicitno smjestiti i zadržati lokalno dok sustav aktivira odgovarajuću kombinaciju računalnih resursa, memorije i mrežnog povezivanja za svaku fazu inferencije. Mreža je sastavni dio arhitekture. Njezina velika domena omogućuje da cjelokupno radno opterećenje ostane unutar jednog povezanog sustava, čime se smanjuje potreba za premještanjem podataka i pomaže da cjelokupni zahtjev ostane brz i učinkovit od početka do kraja. Rezultat je uravnotežen i prilagodljiv akcelerator koji može podržati promjenjive arhitekture modela, izvrsno funkcionirati u fazama obrade i dekodiranja te se prilagođavati promjenama ravnoteže između njih, što je ključna značajka agentskih radnih opterećenja.
AI je imao izravnu ulogu u razvoju čipa Jalapeño, omogućivši timu da u devet mjeseci prijeđe od početnog dizajna do slanja u proizvodnju istraživanjem implementacija, skraćivanjem ciklusa dizajna, mjerenja i provjere te kontinuiranim iteriranjem radnih opterećenja modela. Umjetna inteligencija pomogla je i optimizirati aritmetičke sklopove čipa, omogućivši timu da u predviđenom roku u čip uklopi veću računalnu snagu.
Jalapeño je osmišljen kao jasan i predvidljiv programerski cilj za ljude i umjetnu inteligenciju. Inženjeri mogu opisati rad s pomoću lokalnih tenzora, eksplicitne komunikacije i predvidljive sinkronizacije. AI zatim može optimizirati način na koji se taj rad mapira, smješta, raspoređuje i koordinira u cijelom sustavu. Ta jasna, predvidljiva struktura daje umjetnoj inteligenciji izvediv način za rješavanje tradicionalno teškog problema paralelnog programiranja.
Podrška svakoj novoj obitelji modela i dalje zahtijeva nove jezgre i optimizacije specifične za svaki model. Upotrebom Codexa s GPT‑Astrom, tim je u roku od dva mjeseca doveo tri modela s otvorenim težinama, koji nisu bili dio izvornog plana proizvodnje Jalapeña, do visokih performansi. Time su pokazani i fleksibilnost arhitekture i brzina kojom nam umjetna inteligencija može pomoći da je programiramo. Za odabrane blokove pažnje i mješavine stručnjaka modela GPT‑OSS implementacije koje je generirala AI radile su 1,5 do 1,8 puta brže od postojećih implementacija koje su napisali ljudski stručnjaci. Te brojke odnose se na odabrane blokove, a ne na cijeli model, ali upućuju na snažnu novu razvojnu petlju.
AI infrastruktura vrijedna je zbog korisnog stvarnog rada koji omogućuje. Proizvodnjom više korisnog rada uz istu potrošnju energije i isti hardver, Jalapeño nam može pomoći zadovoljiti veću potražnju i smanjiti trošak postizanja uspješnog rezultata. Za OpenAI to može poboljšati operativnu prednost tako što će omogućiti da koristan rad i prihodi rastu brže od troška pružanja usluga. Može podržati i širu primjenu te kontinuirano ulaganje u bolje modele, proizvode i infrastrukturu. Brža inferencija može omogućiti bržu iteraciju i nove slučajeve upotrebe.
Jalapeño proširuje mogućnosti za učinkovitu inferenciju niske latencije:
- Zaključivanje u ultra brzom načinu rada s učinkovitošću koja je prije bila dostupna samo u brzom načinu rada
- Inferencija u brzom načinu rada uz učinkovitost koja je prethodno bila dostupna samo u skupnom načinu rada
- Visoka učinkovitost inferencije u skupnom načinu rada
Planiramo do kraja godine započeti implementaciju Jalapeña u računalnoj infrastrukturi OpenAI-ja. To je prva generacija višegeneracijskog plana razvoja: Gen 2 je u poodmakloj fazi razvoja, a Gen 3 poprima oblik. Svaka će se generacija nadovezivati na ono što naučimo i dodatno unapređivati učinkovitost i brzinu.
Za zadovoljavanje rastuće potražnje za umjetnom inteligencijom bit će potrebno više računalne snage iz svakog dostupnog izvora. Nastavit ćemo široko upotrebljavati akceleratore NVIDIA-e i drugih partnera za obuku i inferenciju radnog opterećenja. Naša je misija osigurati da umjetna inteligencija koristi cijelom čovječanstvu.
Dok se pripremamo za primjenu, nastavljamo s kvalifikacijom za proizvodnju, usavršavamo softver, pripremamo se za rad Jalapeña u velikom opsegu i provjeravamo performanse na većem broju modela. Dosadašnji rezultati pokazuju što je moguće kada zajedno osmislimo cijeli sustav: responzivniji, sposobniji AI s mogućnostima agenata koji se učinkovitije isporučuje većem broju ljudi.
PROPUSNOST po kW GRANIČNI
InferenceX · GPT‑OSS‑120B · nominalni 8k/1k · STP · TDP paket: Jalapeño 700 W; GB200 1200 W
VRŠNA I USKLAĐENA PROPUSNOST
InferenceX · GPT‑OSS‑120B · nominalni 8k/1k · STP · TDP paket: Jalapeño 700 W; GB200 1200 W
Viši vršni mješoviti TPS / kW
≈1,9×
85 448 naspram 44 960 mješovito / kW
Niža latencija s kraja na kraj
≈1,7×
1,03 s naspram 1,80 s
Niži minimalni TBT
≈2,7×
0,69 naspram 1,87 ms (1459 naspram 535 tok/s/korisnik)
Veća propusnost na prethodnom TBT-u
≈53,7×
22 935 naspram 427 mješovito / kW (pri 535,28 tok/s/korisnik)
PROPUSNOST po kW GRANIČNI
InferenceX · DeepSeek R1 MXFP4 · nominalni 8k/1k · STP · TDP paket: Jalapeño 700 W; GB300 1400 W
VRŠNA I USKLAĐENA PROPUSNOST
InferenceX · DeepSeek R1 MXFP4 · nominalni 8k/1k · STP · TDP paket: Jalapeño 700 W; GB300 1400 W
Viši vršni mješoviti TPS / kW
≈1,7×
19 641 naspram 11 781 mješovito / kW
Niža latencija s kraja na kraj
≈3,6×
1,65 s naspram 5,99 s
Niži minimalni TBT
≈4,1×
1,43 naspram 5,90 ms (700 naspram 169 tok/s/korisnik)
Veća propusnost na prethodnom TBT-u
≈104,3×
12 258 naspram 118 mješovito / kW (pri 169,41 tok/s/korisnik)
PROPUSNOST po kW GRANIČNI
InferenceX · Kimi K2.5 MXFP4 · nominalni 8k/1k · STP · TDP paket: Jalapeño 700 W; GB300 1 400 W
VRŠNA I USKLAĐENA PROPUSNOST
InferenceX · Kimi K2.5 MXFP4 · nominalni 8k/1k · STP · TDP paket: Jalapeño 700 W; GB300 1 400 W
Viši vršni mješoviti TPS / kW
≈1,5×
18 195 naspram 11 862 mješovito / kW
Niža latencija s kraja na kraj
≈3,4×
1,56 s naspram 5,31 s
Niži minimalni TBT
≈3,8×
1,44 naspram 5,48 ms (694 naspram 182 tok/s/korisnik)
Veća propusnost na prethodnom TBT-u
≈56,1×
6744 naspram 120 mješovito / kW (pri 182,46 tok/s/korisnik)


