Prvi rezultati Jalapeño pokazuju vodeću brzinu i efikasnost u izvođenju inferencije u UI

Od najave Jalapeña, prvog prilagođenog OpenAI čipa za inferenciju, testirali smo čip i sistem izgrađen oko njega. Rezultati pokazuju značajan napredak u performansama: Jalapeño može obraditi više AI zadataka po jedinici snage, a istovremeno brže vraćati odgovore. Jalapeño pruža i veći protok i nižu latenciju koristeći jednu arhitekturu, dok postojeći hardverski sistemi često moraju praviti kompromis između ta dva.
Za korisnike to može značiti brže odgovore, agente koji brže reaguju i pouzdaniji pristup kako potražnja raste. Naša misija je osigurati da opća umjetna inteligencija koristi cijelom čovječanstvu. Ova poboljšanja pomoći će da sve sposobnija vještačka inteligencija bude pristupačnija i šire dostupna.
OpenAI modeli su također ubrzali razvoj Jalapeño. Ranije generacije pomogle su timu da dizajnira i osposobi čip za rad, dok naši najnoviji modeli ubrzavaju način na koji ga optimiziramo i programiramo. Performanse Jalapeño obuhvataju GPT‑OSS 120B, DeepSeek R1 i Kimi K2.5 1T, što pokazuje da arhitektura radi s modelima razvijenim i unutar i izvan OpenAI-ja. U sva tri slučaja Jalapeño je pri najvećem protoku ostvario 1,5 do 1,9 puta više AI rada po vatu i 1,7 do 3,6 puta manju latenciju od kraja do kraja u odnosu na uporedne sisteme. Za veoma interaktivna radna opterećenja pružio je 2,1 do 4,1 puta bolje performanse.
Jalapeño je također dokaz šire full-stack prednosti. OpenAI može zajedno dizajnirati modele, proizvode, softver za opsluživanje, čipove, memoriju, umrežavanje i sisteme, koristeći ono što učimo iz stvarnih radnih opterećenja kako bismo poboljšali svaki sloj steka. Jalapeño je vlastiti čip s izmjerenim rezultatima i predstavlja početak višegeneracijske platforme. U narednim mjesecima intenzivirat ćemo rad na Jalapeñu kako bismo našim kupcima isporučili brže, sposobnije i efikasnije proizvode.
Procjenjujemo performanse uz usklađeno korisničko iskustvo, mjereći koliko korisnog AI rada svaki sistem može obaviti po jedinici snage, uz ispunjavanje zahtjeva za latencijom koje imaju klijenti i interaktivni agenti. To je posebno važno za agente, koji moraju izvršiti mnogo koraka redom, pa se kašnjenja mogu akumulirati tokom cijelog zadatka.
Da bismo razumjeli kako se Jalapeño ponaša u praksi, testirali smo ga na InferenceX-u, javnom referentnom testu kompanije SemiAnalysis koji mjeri cjelokupan proces posluživanja AI zahtjeva. Uporedili smo Jalapeño s vodećim komercijalno dostupnim AI sistemima u testiranom radnom rasponu, od opsluživanja s visokim protokom do vrlo interaktivne upotrebe s niskom latencijom. Jalapeño je pružio bolju kombinaciju protoka, energetske efikasnosti i latencije. Iako se performanse ponekad prikazuju po čipu, vjerujemo da je korisniji standard performanse po jedinici snage.
U sva tri javna modela, Jalapeño je pružio bolju kombinaciju performansi po vatu i latencije u testiranom radnom rasponu, čime se našao na Pareto granici. Da bismo dosljedno uporedili sisteme, normalizirali smo rezultate koristeći objavljenu nazivnu snagu čipa svakog akceleratora. Jalapeño je deklarisan na 700 vati, iako je njegova izmjerena trajna snaga ostala na ili ispod 550 vati na testiranim radnim opterećenjima.
Jalapeño je ostvario snažne rezultate na modelima GPT‑OSS 120B, DeepSeek R1 670B i Kimi K2.5 1T. Na modelu Kimi, najvećem javno dostupnom modelu koji smo testirali, pružio je približno 1,5 puta visoke vrhunske performanse po vatu i 3,4 puta nižu ukupnu latenciju od sistema za poređenje. U našim internim testiranjima, prednost Jalapeña dodatno se povećala na najnovijim OpenAI modelima, što ukazuje na to da arhitektura postaje vrijednija kako radna opterećenja postaju veća i zahtjevnija.
Jalapeño je od početka dizajniran polazeći od pitanja: kakav bismo hardver izgradili kada bi njegov primarni zadatak bio opsluživanje modernih i budućih jezičkih modela, posebno interaktivnih agenata? Prednosti Jalapeña proizlaze iz zajedničkog dizajniranja čipa, memorije, mreže, softvera i sistema na nivou racka u skladu sa stvarnim radnim opterećenjima jezičkih modela. Inferencija jezičkih modela odvija se kroz nekoliko različitih faza s različitim uskim grlima. Prefill, kada sistem obrađuje upit, zahtijeva intenzivno računanje, dok je decode, kada sistem generira odgovor token po token, više ograničen propusnošću memorije. Komunikacija također može povećati latenciju kada se podaci moraju prenositi između jezgara i čipova, ostavljajući neke procesorske jedinice neaktivnima dok čekaju. Sistem koji se ističe u jednoj fazi može izgubiti tu prednost dok čeka podatke ili premješta stanje modela između različitih resursa.
Dizajnirali smo Jalapeño tako da svede premještanje podataka i kašnjenja u komunikaciji na minimum. To znači da se stanje modela, uključujući KV keš koji se koristi pri generiranju odgovora, može eksplicitno smjestiti i zadržati lokalno, dok sistem aktivira pravu kombinaciju računarskih resursa, memorije i umrežavanja za svaku fazu inferencije. Mreža je sastavni dio arhitekture. Njegova velika domena omogućava da cjelokupno radno opterećenje ostane unutar jednog povezanog sistema, smanjujući premještanje podataka i pomažući da kompletan zahtjev ostane brz i efikasan od početka do kraja. Rezultat je uravnotežen i zamjenjiv akcelerator koji može podržati promjenjive arhitekture modela, isticati se i u fazama prefill i decode te se prilagođavati kako se mijenja ravnoteža između njih, što je ključna karakteristika agentskih radnih opterećenja.
UI je imao direktnu ulogu u razvoju Jalapeño, omogućavajući timu da za devet mjeseci pređe od početnog dizajna do tapeouta istraživanjem implementacija, skraćivanjem ciklusa dizajna, mjerenja i verifikacije te kontinuiranim iteriranjem na radnim opterećenjima modela. AI je također pomogla optimizirati aritmetička kola čipa, omogućivši timu da u čip smjesti više računskih performansi prema planu.
Jalapeño je osmišljen kao jasan i predvidljiv cilj za programiranje, kako za ljude tako i za UI. Inženjeri mogu opisati rad pomoću lokalnih tenzora, eksplicitne komunikacije i predvidljive sinhronizacije. AI zatim može optimizirati način na koji se taj rad mapira, smješta, planira i koordinira u cijelom sistemu. Ta jasna, predvidljiva struktura pruža vještačkoj inteligenciji pristupačan način da se riješi tradicionalno težak problem paralelnog programiranja.
Podrška za svaku novu porodicu modela i dalje zahtijeva nove jezgre i optimizacije specifične za modele. Koristeći Codex s GPT‑Astra, tim je u roku od dva mjeseca doveo tri modela s otvorenim težinama, koji nisu bili dio Jalapeñovog prvobitnog plana proizvodnje, do visokih performansi. Ovo je pokazalo i fleksibilnost arhitekture i brzinu kojom nam vještačka inteligencija može pomoći da je programiramo. Za odabrane GPT‑OSS blokove pažnje i mješavine stručnjaka, implementacije koje je generirao AI radile su 1,5 do 1,8 puta brže od postojećih implementacija koje su napisali ljudski stručnjaci. Te brojke se odnose na odabrane blokove, a ne na cijeli model, ali ukazuju na moćan novi ciklus razvoja.
Infrastruktura vještačke inteligencije je vrijedna jer omogućava koristan rad u stvarnom svijetu. Proizvodeći više korisnog rada uz istu potrošnju energije i isti hardver, Jalapeño nam može pomoći da zadovoljimo veću potražnju i smanjimo troškove isporuke uspješnog rezultata. Za OpenAI to može poboljšati operativnu polugu tako što omogućava da korisni rad i prihod rastu brže od troškova pružanja usluga. Također može podržati širu primjenu i kontinuirana ulaganja u bolje modele, proizvode i infrastrukturu. Brže izvođenje zaključaka može omogućiti brže iteracije i nove primjene.
Jalapeño proširuje granice mogućeg za efikasnu inferenciju s malom latencijom:
- Zaključivanje u ultra brzom modu uz efikasnost koja je ranije bila dostupna samo u brzom modu
- Zaključivanje u Brzi mod uz efikasnost koja je ranije bila dostupna samo u batch modu
- Visoka efikasnost za inference u grupnom načinu rada
Planiramo početi implementirati Jalapeño u okviru OpenAI-jeve računarske infrastrukture do kraja godine. To je prva generacija višegeneracijskog plana razvoja: Gen 2 je u poodmakloj fazi razvoja, a Gen 3 poprima oblik. Svaka generacija će se nadovezivati na ono što naučimo i dodatno unapređivati i efikasnost i brzinu.
Zadovoljavanje rastuće potražnje za umjetnom inteligencijom (AI) zahtijevat će više računarske snage iz svakog dostupnog izvora. Nastavit ćemo široko primjenjivati akceleratore kompanije NVIDIA i drugih partnera za radna opterećenja treniranja i inferencije. Naša misija je osigurati da opća umjetna inteligencija koristi cijelom čovječanstvu.
Dok se pripremamo za implementaciju, nastavljamo sa kvalifikacijom za produkciju, unapređujemo softver, pripremamo se za rad Jalapeño u velikim razmjerama i provjeravamo performanse na više modela. Dosadašnji rezultati pokazuju šta je moguće kada zajedno dizajniramo cijeli sistem: odzivniji, sposobniji i agentički AI koji se efikasnije isporučuje većem broju ljudi.
Protok po kW granične vrijednosti
InferenceX · GPT‑OSS‑120B · nominalno 8k/1k · STP · TDP paketa: Jalapeño 700 W; GB200 1.200 W
Vršni i usklađeni protok
InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP paketa: Jalapeño 700 W; GB200 1.200 W
Viši vršni mješoviti broj transakcija u sekundi (TPS) / kW
≈1,9×
85.448 u odnosu na 44.960 mješovito / kW
Niža latencija od kraja do kraja
≈1,7×
1,03 sa naspram 1,80 s
Niži min TBT
≈2,7×
0,69 vs. 1,87 ms (1.459 vs. 535 tok/s/korisnik)
Veći protok uz prethodni TBT
≈53,7×
22.935 vs. 427 mješovito / kW (pri 535,28 tok/s/korisniku)
PROTOK-po-kW GRANIČNI
InferenceX · DeepSeek R1 MXFP4 · nominalno 8.000/1.000 · STP · TDP paketa: Jalapeño 700 W; GB300 1.400 W
Vršni i usklađeni protok
InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP paketa: Jalapeño 700 W; GB300 1,400 W
Viši vršni mješoviti TPS/kW
≈1,7×
19.641 naspram 11.781 miješano/kW
Niža latencija od kraja do kraja
≈3,6×
1,65 s u odnosu na 5,99 s
Niži min TBT
≈4,1×
1,43 naspram 5,90 ms (700 naspram 169 tok/s/korisnik)
Veći protok uz prethodni TBT
≈104,3×
12.258 naspram 118 mješovito / kW (pri 169,41 tok/s/user)
PROTOK-po-kW GRANIČNI
InferenceX · Kimi K2,5 MXFP4 · nominalni 8.000/1.000 · STP · TDP paketa: Jalapeño 700 W; GB300 1.400 W
Vršni i usklađeni protok
InferenceX · Kimi K2.5 MXFP4 · nominalno 8k/1k · STP · TDP paketa: Jalapeño 700 W; GB300 1,400 W
Visoka vršni mješoviti TPS / kW
≈1,5×
18.195 naspram 11.862 miješano / kW
Niža latencija od kraja do kraja
≈3,4×
1,56 s vs. 5,31 s
Niži min TBT
≈3,8×
1,44 naspram 5,48 ms (694 naspram 182 tok/s/korisniku)
Veći protok uz prethodni TBT
≈56,1×
6.744 u odnosu na 120 miješano / kW (pri 182,46 tok/s/korisnik)


