Prvi rezultati Jalapeño kažejo vodilno hitrost in učinkovitost v panogi pri sklepanju UI

Odkar smo najavili Jalapeño, prvi namenski čip za sklepanje OpenAI, testiramo čip in sistem, zgrajen okoli njega. Rezultati kažejo znatno izboljšanje zmogljivosti: Jalapeño lahko obdela več opravil umetne inteligence na enoto porabljene moči, obenem pa hitreje vrača odgovore. Jalapeño z eno arhitekturo zagotavlja tako visoko prepustnost kot manjšo zakasnitev, medtem ko morajo obstoječi strojni sistemi pogosto sprejeti kompromis med obema.
Za stranke lahko to pomeni hitrejše odzive, odzivnejše agente in zanesljivejši dostop ob naraščanju povpraševanja. Naše poslanstvo je, da bi zagotovili, da bo splošna umetna inteligenca koristila celotnemu človeštvu. Te izboljšave bodo pripomogle k temu, da bo vse zmogljivejša umetna inteligenca ceejša in širše dostopna.
Modeli OpenAI so prav tako pospešili razvoj Jalapeña. Prejšnje generacije so ekipi pomagale zasnovati in zagnati čip, medtem ko naši najnovejši modeli pospešujejo optimizacijo in programiranje čipa. Zmogljivost Jalapeña se izkazuje pri GPT‑OSS 120B, DeepSeek R1 in Kimi K2.5 1T, kar kaže, da arhitektura deluje pri modelih, razvitih tako znotraj kot zunaj OpenAI. Jalapeño je pri vseh treh pri največji prepustnosti zagotovil od 1,5- do 1,9-krat več dela AI na vat ter od 1,7- do 3,6-krat nižjo zakasnitev od začetka do konca kot primerjalni sistemi. Za zelo interaktivne delovne obremenitve je zagotavljal 2,1- do 4,1-krat višjo zmogljivost.
Jalapeño je tudi dokaz širše prednosti celovitega sklada. OpenAI lahko skupaj zasnuje modele, izdelke, programsko opremo za streženje, čipe, pomnilnik, omrežja in sisteme ter na podlagi spoznanj iz dejanskih delovnih obremenitev izboljša vsak sloj sklada. Jalapeño je funkcionalen lastni silicij z izmerjenimi rezultati in predstavlja začetek večgeneracijske platforme. V prihodnjih mesecih bomo pospešili uvajanje Jalapeña, da bomo svojim strankam zagotovili hitrejše, zmogljivejše in učinkovitejše izdelke.
Zmogljivost ocenjujemo pri primerljivi uporabniški izkušnji, pri čemer merimo, koliko koristnega dela umetne inteligence lahko posamezen sistem opravi na enoto moči, hkrati pa izpolnjuje zahteve glede zakasnitve, ki jih imajo stranke in interaktivni agenti. To je še posebej pomembno za agente, ki morajo zaporedoma izvesti veliko korakov, zato se lahko zamude kopičijo skozi celotno opravilo.
Da bi razumeli, kako se Jalapeño obnese v praksi, smo ga preizkusili na InferenceX, javnem primerjalnem preizkusu podjetja SemiAnalysis, ki meri celoten postopek obdelave zahteve za umetno inteligenco. Jalapeño smo primerjali z vodilnimi komercialno dostopnimi sistemi AI v celotnem preizkušenem območju delovanja, od streženja z visoko prepustnostjo do zelo interaktivne uporabe z nizko zakasnitvijo. Jalapeño je zagotovil boljšo kombinacijo prepustnosti, energijske učinkovitosti in zakasnitve. Čeprav se zmogljivost včasih navaja na čip, menimo, da je uporabnejše merilo zmogljivost na enoto moči.
Pri vseh treh javno dostopnih modelih je Jalapeño v celotnem preizkušenem območju delovanja zagotavljal boljšo kombinacijo zmogljivosti na vat in zakasnitve, kar ga uvršča na Paretovo prelomno mejo. Za dosledno primerjavo sistemov smo rezultate normalizirali z uporabo objavljene nazivne moči čipa posameznega pospeševalnika. Jalapeño ima nazivno moč 700 vatov, čeprav je njegova izmerjena trajna moč pri preizkušenih delovnih obremenitvah ostala pri 550 vatih ali manj.
Jalapeño se je dobro izkazal pri modelih GPT‑OSS 120B, DeepSeek R1 670B in Kimi K2.5 1T. Pri Kimi, največjem javno dostopnem modelu, ki smo ga preizkusili, je dosegel približno 1,5-krat višjo največjo zmogljivost na vat in 3,4-krat nižjo zakasnitev od začetka do konca kot primerjalni sistem. V naših notranjih preizkusih se je prednost Jalapeña pri vodilnih modelih OpenAI še povečala, kar nakazuje, da arhitektura postaja dragocenejša, ko delovne obremenitve postajajo večje in zahtevnejše.
Jalapeño je bil od začetka zasnovan na podlagi vprašanja: kakšno strojno opremo bi zgradili, če bi bila njena glavna naloga streženje sodobnih in prihodnjih jezikovnih modelov, zlasti interaktivnih agentov? Prednosti Jalapeña izhajajo iz skupnega načrtovanja čipa, pomnilnika, omrežja, programske opreme in sistema na ravni regalov za dejanske delovne obremenitve jezikovnih modelov. Sklepanje jezikovnih modelov poteka skozi več različnih faz z različnimi ozkimi grli. Predizpolnjevanje, ko sistem obdela poziv, je računsko intenzivno, medtem ko je dekodiranje, ko sistem ustvarja odgovor žeton za žetonom, bolj omejeno s pasovno širino pomnilnika. Komunikacija lahko tudi poveča latenco, kadar se morajo podatki premikati med jedri in čipi, zaradi česar so nekatere procesne enote med čakanjem nedejavne. Sistem, ki se odlično obnese v eni fazi, lahko to prednost izgubi med čakanjem na podatke ali prenosom stanja modela med različnimi viri.
Jalapeño smo zasnovali tako, da čim bolj zmanjša premikanje podatkov in komunikacijske zakasnitve. To pomeni, da je mogoče stanje modela, vključno s predpomnilnikom KV, ki se uporablja pri ustvarjanju odgovora, izrecno umestiti in ohraniti lokalno, medtem ko sistem aktivira ustrezno kombinacijo računskih virov, pomnilnika in omrežja za vsako fazo sklepanja. Omrežje je sestavni del arhitekture. Obsežna domena omogoča, da celotna delovna obremenitev ostane znotraj enega povezanega sistema, kar zmanjšuje premikanje podatkov in zagotavlja, da je celotna zahteva hitra in učinkovita od začetka do konca. Rezultat je uravnotežen in prilagodljiv pospeševalnik, ki podpira spreminjajoče se arhitekture modelov, se odlikuje tako pri predizpolnjevanju kot pri dekodiranju ter se prilagaja spreminjajočemu se ravnovesju med njima, kar je ključna značilnost delovnih obremenitev z agenti.
AI je imel neposredno vlogo pri razvoju čipa Jalapeño, saj je ekipi omogočil, da je z raziskovanjem izvedb, krajšanjem ciklov načrtovanja, merjenja in preverjanja ter nenehnim ponavljanjem delovnih obremenitev modelov od začetne zasnove do predaje proizvodnji prišla v devetih mesecih. AI je pomagal tudi optimizirati aritmetična vezja čipa, kar je ekipi omogočilo, da je v čip vključila več računske zmogljivosti v skladu z načrtovanim časovnim razporedom.
Jalapeño je bil zasnovan kot jasen in predvidljiv programski cilj tako za ljudi kot za umetno inteligenco. Inženirji lahko opišejo delo z lokalnimi tenzorji, jasno komunikacijo in predvidljivo sinhronizacijo. AI lahko nato optimizira, kako je to delo preslikano, umeščeno, razporejeno in usklajeno v celotnem sistemu. Ta jasna, predvidljiva struktura daje umetni inteligenci obvladljiv način za spopadanje s tradicionalno težavnim problemom vzporednega programiranja.
Podpora vsaki novi družini modelov še vedno zahteva nova jedra in posameznim modelom specifične optimizacije. Ekipa je z uporabo Codexa z GPT‑Astra v dveh mesecih zagotovila visoko zmogljivost trem modelom z odprtimi utežmi, ki niso bili del Jalapeñovega prvotnega proizvodnega načrta. To je pokazalo tako prilagodljivost arhitekture kot hitrost, s katero nam lahko umetna inteligenca pomaga pri njenem programiranju. Pri izbranih blokih pozornosti in mešanice strokovnjakov GPT‑OSS so izvedbe, ki jih je ustvarila umetna inteligenca, delovale 1,5 – 1,8-krat hitreje kot obstoječe izvedbe, ki so jih napisali človeški strokovnjaki. Te številke veljajo za izbrane bloke, ne za celoten model, vendar nakazujejo zmogljiv nov razvojni cikel.
Infrastruktura za umetno inteligenco je dragocena, ker omogoča koristno delo v resničnem svetu. S tem ko Jalapeño z enako porabo energije in isto strojno opremo opravi več koristnega dela, nam lahko pomaga zadostiti večjemu povpraševanju in znižati stroške zagotavljanja uspešnega rezultata. Za OpenAI lahko to izboljša operativni vzvod, saj uporabnemu delu in prihodkom omogoča hitrejšo rast od stroškov zagotavljanja storitev. Podpira lahko tudi širšo uporabo in nadaljnje naložbe v boljše modele, izdelke in infrastrukturo. Hitrejša izpeljava lahko omogoči hitrejše ponavljanje in nove primere uporabe.
Jalapeño širi meje mogočega za učinkovito sklepanje z nizko zakasnitvijo:
- Izvedba v ultra-hitrem načinu z učinkovitostjo, ki je bila prej na voljo le v hitrem načinu
- Sklepanje v hitrem načinu z učinkovitostjo, ki je bila prej dosegljiva le v paketnem načinu
- Visoka učinkovitost pri paketnem sklepanju
Do konca leta nameravamo začeti uvajati Jalapeño v računsko infrastrukturo OpenAI. To je prva generacija večgeneracijskega razvojnega načrta: 2. generacija je v napredni fazi razvoja, 3. generacija pa dobiva obliko. Vsaka generacija bo gradila na tem, kar se naučimo, ter še naprej izboljševala učinkovitost in hitrost.
Za zadovoljevanje vse večjega povpraševanja po umetni inteligenci bo potrebnih več računskih zmogljivosti iz vseh razpoložljivih virov. Še naprej bomo v veliki meri uvajali pospeševalnike družbe NVIDIA in drugih partnerjev za obremenitve tako učenja kot sklepanja. Naše poslanstvo je, da bi zagotovili, da bo splošna umetna inteligenca koristila celotnemu človeštvu.
Med pripravo na uvedbo nadaljujemo s kvalifikacijo za produkcijo, izpopolnjujemo programsko opremo, se pripravljamo na upravljanje s Jalapeñom v velikem obsegu in preverjamo zmogljivost na več modelih. Dosedanji rezultati kažejo, kaj je mogoče, ko celoten sistem zasnujemo skupaj: da več ljudem učinkoviteje zagotovimo bolj odzivno, bolj zmogljivo in bolj agentsko umetno inteligenco.
PRELOMNA PREPUSTNOST-na-kW
InferenceX · GPT‑OSS‑120B · nazivno 8k/1k · STP · TDP paketa: Jalapeño 700 W; GB200 1 200 W
NAJVIŠJA IN USKLAJENA PREPUSTNOST
InferenceX · GPT‑OSS‑120B · nazivno 8k/1k · STP · TDP paketa: Jalapeño 700 W; GB200 1.200 W
Visoko mešani TPS / kW na vrhuncu
≈1,9×
85.448 vs. 44.960 mešano / kW
Nižja zakasnitev od konca do konca
≈1,7×
1,03 s v primerjavi z 1,80 s
Nižji min TBT
≈2,7×
0,69 proti 1,87 ms (1 459 proti 535 tok/s/uporabnika)
Večja prepustnost ob enakem TBT
≈53,7×
22 935 v primerjavi s 427 mešano / kW (pri 535,28 tok/s/uporabnika)
Prepustnost na kW prelomno
InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP paketa: Jalapeño 700 W; GB300 1.400 W
NAJVIŠJA IN USKLAJENA PREPUSTNOST
InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP paketa: Jalapeño 700 W; GB300 1.400 W
Visoko mešani TPS / kW na vrhuncu
≈1,7×
19.641 glede na 11.781 mešano / kW
Nižja neprekinjena zakasnitev
≈3,6×
1,65 s v primerjavi s 5,99 s
Nižji min TBT
≈4.1×
1,43 vs. 5,90 ms (700 vs. 169 tok/s/uporabnika)
Večja prepustnost ob enakem TBT
≈104,3×
12.258 proti 118 mešano / kW (pri 169,41 tok/s/uporabnika)
PRELOMNA PREPUSTNOST-na-kW
InferenceX · Kimi K2.5 MXFP4 · nazivno 8k/1k · STP · TDP paketa: Jalapeño 700 W; GB300 1 400 W
NAJVIŠJA IN USKLAJENA PREPUSTNOST
InferenceX · Kimi K2.5 MXFP4 · nazivno 8 000/1 000 · STP · TDP paketa: Jalapeño 700 W; GB300 1 400 W
Visoko mešani TPS / kW na vrhuncu
≈1,5×
18.195 proti 11.862 mešano / kW
Nižja neprekinjena zakasnitev
≈3,4×
1,56 s v primerjavi s 5,31 s
Nižji min TBT
≈3,8×
1,44 v primerjavi s 5,48 ms (694 v primerjavi s 182 tok/s/uporabnika)
Večja prepustnost pri prejšnjem TBT
≈56,1×
6.744 vs. 120 mešano / kW (pri 182,46 tok/s/uporabnika)


