
Frá því að Jalapeño, fyrsti sérsmíðaði ályktunarkubbur OpenAI, var kynntur höfum við prófað kubbinn og kerfið sem byggt hefur verið í kringum hann. Niðurstöðurnar sýna umtalsverðar framfarir í afköstum: Jalapeño getur sinnt meiri gervigreindarvinnu á hverja einingu af afli og jafnframt skilað svörum hraðar. Jalapeño skilar bæði háum afköstum og minni biðtíma með einni arkitektúrlausn, en núverandi vélbúnaðarkerfi þurfa oft að gera málamiðlun á milli þessara tveggja.
Fyrir viðskiptavini getur það þýtt hraðari svör, viðbragðsfljótari gervigreindarfulltrúa og áreiðanlegri aðgang eftir því sem eftirspurn eykst. Markmið okkar er að tryggja að almenn gervigreind komi öllu mannkyninu til góða. Þessar framfarir munu hjálpa til við að gera sífellt öflugri gervigreind ódýrari og aðgengilegri fleirum.
OpenAI-líkön flýttu einnig fyrir þróun Jalapeño. Fyrri kynslóðir hjálpuðu teyminu að hanna og gangsetja örgjörvann, en nýjustu líkönin okkar flýta fyrir því hvernig við fínstillum og forritum hann. Afköst Jalapeño ná yfir GPT‑OSS 120B, DeepSeek R1 og Kimi K2.5 1T, sem sýnir að arkitektúrinn virkar með líkönum sem þróuð eru bæði innan og utan OpenAI. Með öllum þremur skilaði Jalapeño 1,5 til 1,9 sinnum meiri AI-vinnu á hvert watt við hámarksafköst og 1,7 til 3,6 sinnum minni biðtíma frá upphafi til enda en samanburðarkerfin. Fyrir mjög gagnvirkt vinnuálag skilaði það 2,1 til 4,1 sinnum betri frammistöðu.
Jalapeño er einnig til marks um víðtækara forskot yfir allan tæknistaflann. OpenAI getur hannað líkön, vörur, þjónustuhugbúnað, kubba, minni, netbúnað og kerfi saman og nýtt það sem við lærum af raunverulegu vinnuálagi til að bæta hvert lag tæknistaflans. Jalapeño er eigin örflaga OpenAI með mældum niðurstöðum og er upphaf að vettvangi sem mun spanna margar kynslóðir. Á næstu mánuðum munum við efla Jalapeño til að skila hraðari, öflugri og skilvirkari vörum til viðskiptavina okkar.
Við metum afköst við sambærilega notendaupplifun og mælum hversu miklu gagnlegu gervigreindarstarfi hvert kerfi getur lokið á hverja afleiningu, á meðan það uppfyllir þær kröfur um biðtíma sem viðskiptavinir og gagnvirkir fulltrúar gera. Þetta skiptir sérstaklega máli fyrir fulltrúa, sem þurfa að ljúka mörgum skrefum í röð, þannig að tafir geta safnast upp yfir heilt verkefni.
Til að skilja hvernig Jalapeño stendur sig í reynd prófuðum við það á InferenceX, opinberu viðmiðunarprófi frá SemiAnalysis sem mælir allt ferlið við að afgreiða gervigreindarbeiðni. Við bárum Jalapeño saman við leiðandi AI-kerfi sem fást á markaði á öllu prófaða rekstrarsviðinu, allt frá þjónustu með háum afköstum til mjög gagnvirkrar notkunar með lágum biðtíma. Jalapeño skilaði betri samsetningu afkasta, orkunýtni og biðtíma. Þótt afköst séu stundum gefin upp fyrir hvern örgjörvakubb teljum við að gagnlegra viðmið sé afköst á hverja orkueiningu.
Í öllum þremur opinberu líkönunum skilaði Jalapeño betri samsetningu afkasta á hvert vatt og biðtíma á öllu prófaða rekstrarsviðinu, sem setur hann á Pareto-jaðarinn. Til að bera kerfin saman með samræmdum hætti stöðluðum við niðurstöðurnar með því að nota uppgefið afl hvers örgjörvakubbs. Jalapeño er metinn á 700 vött, þótt mælt viðvarandi afl þess hafi haldist við eða undir 550 vöttum í þeim vinnuálögum sem voru prófuð.
Jalapeño stóð sig vel á GPT‑OSS 120B, DeepSeek R1 670B og Kimi K2.5 1T. Á Kimi, stærsta opinbera líkaninu sem við prófuðum, skilaði það um það bil 1,5 sinnum meiri hámarksafköstum á hvert vatt og 3,4 sinnum minni heildarbiðtíma en samanburðarkerfið. Í innri prófunum okkar jókst forskot Jalapeño enn frekar á háþróuðum OpenAI-líkönum, sem bendir til þess að arkitektúrinn verði verðmætari eftir því sem vinnuálag verður meira og meira krefjandi.
Jalapeño var frá upphafi hannaður út frá spurningunni: hvaða vélbúnað myndum við byggja ef meginhlutverk hans væri að þjóna nútíma- og framtíðartungumálalíkönum, einkum gagnvirkum fulltrúum? Ávinningur Jalapeño fæst með því að hanna örflöguna, minni, net, hugbúnað og kerfið á rekkskala saman í kringum raunveruleg vinnuálög tungumálalíkana. Úrvinnsla tungumálalíkana fer í gegnum nokkra ólíka áfanga með mismunandi flöskuhálsum. Forfylling, þegar kerfið vinnur úr kveikju, er reiknifrek, en afkóðun, þegar kerfið býr til svarið tákna fyrir tákna, takmarkast frekar af minnisbandbreidd. Samskipti geta einnig aukið töf þegar gögn þurfa að færast á milli kjarna og örflaga, þannig að sumar vinnslueiningar standa aðgerðalausar á meðan þær bíða. Kerfi sem stendur sig vel í einum áfanga getur misst það forskot á meðan það bíður eftir gögnum eða flytur stöðu líkans milli mismunandi auðlinda.
Við hönnuðum Jalapeño til að lágmarka tilfærslu gagna og samskiptatafir. Þetta þýðir að ástand líkansins, þar á meðal KV-skyndiminnið sem notað er við myndun svars, má staðsetja með skýrum hætti og halda því staðbundnu, á meðan kerfið virkjar rétta samsetningu reikniafls, minnis og netkerfis fyrir hvern ályktunarfasa. Netkerfið er óaðskiljanlegur hluti af arkitektúrnum. Stórt lén þess gerir kleift að halda öllu vinnuálaginu innan eins tengds kerfis, sem lágmarkar gagnaflutning og hjálpar til við að halda beiðninni hraðri og skilvirkri frá upphafi til enda. Niðurstaðan er jafnvægisvænn og sveigjanlegur hraðall sem getur stutt breytilegan arkitektúr líkana, skarað fram úr bæði í forfyllingu og afkóðun og aðlagast eftir því sem jafnvægið þar á milli breytist, sem er einkennandi fyrir vinnuálag gervigreindarfulltrúa.
Gervigreind lék beint hlutverk í þróun Jalapeño og gerði teyminu kleift að fara frá upphaflegri hönnun til lokahönnunar á níu mánuðum með því að kanna útfærslur, stytta hönnunar-, mælinga- og sannprófunarferla og vinna stöðugt í þróunarumferðum með vinnuálag líkana. Gervigreind hjálpaði einnig til við að hagræða reiknirásum örflögunnar, sem gerði teyminu kleift að koma meira reikniafli fyrir í örflögunni samkvæmt áætlun.
Jalapeño var hannað sem skýrt og fyrirsjáanlegt forritunarmarkmið fyrir bæði fólk og gervigreind. Verkfræðingar geta lýst vinnu með staðbundnum tensorum, skýrum samskiptum og fyrirsjáanlegri samstillingu. Gervigreind getur þá fínstillt hvernig þeirri vinnu er varpað, komið fyrir, hún tímasett og samhæfð í kerfinu öllu. Þessi skýra, fyrirsjáanlega uppbygging veitir gervigreindinni viðráðanlega leið til að takast á við hið jafnan erfiða viðfangsefni samhliða forritunar.
Stuðningur við hverja nýja líkanafjölskyldu krefst enn nýrra kjarna og líkansértækra fínstillinga. Með því að nota Codex með GPT‑Astra kom teymið 3 opnum vigtarlíkönum, sem voru ekki hluti af upphaflegri framleiðsluáætlun Jalapeño, upp í há afköst innan tveggja mánaða. Þetta sýndi bæði sveigjanleika arkitektúrsins og hversu hratt gervigreind getur hjálpað okkur að forrita hann. Fyrir valdar athyglisblokkir og blokkir með blöndu sérfræðinga í GPT‑OSS keyrðu útfærslur sem gervigreind bjó til 1,5 til 1,8 sinnum hraðar en núverandi útfærslur skrifaðar af mannlegum sérfræðingum. Þessar tölur eiga við um valdar blokkir, ekki heildarlíkanið, en þær benda til öflugs nýs þróunarferlis.
Innviðir gervigreindar eru verðmætir vegna þeirrar gagnlegu vinnu í raunheimum sem þeir gera mögulega. Með því að vinna meira gagnlegt verk með sömu orku og vélbúnaði getur Jalapeño hjálpað okkur að sinna meiri eftirspurn og lækka kostnaðinn við að skila árangursríkri niðurstöðu. Fyrir OpenAI getur það bætt rekstrarlegan sveigjanleika með því að leyfa nytsamlegri vinnu og tekjum að vaxa hraðar en kostnaðurinn við þjónustu. Það getur einnig stutt víðtækari innleiðingu og áframhaldandi fjárfestingu í betri líkönum, vörum og innviðum. Hraðari ályktun getur gert hraðari þróunarumferðir mögulegar og opnað fyrir nýja notkunarmöguleika.
Jalapeño færir út mörk þess sem er mögulegt fyrir skilvirka, lágseinkunarályktun:
- Ályktun í ultra-hraðstillingu með skilvirkni sem áður var aðeins í boði í hraðstillingu
- Ályktun í hraðstillingu með skilvirkni sem áður var aðeins möguleg í runuham
- Meiri skilvirkni fyrir ályktun í lotuham
Við hyggjumst hefja innleiðingu Jalapeño í reikniinnviðum OpenAI fyrir árslok. Þetta er fyrsta kynslóðin í vegvísi sem spannar margar kynslóðir: þróun Gen 2 er komin langt á veg og Gen 3 er að taka á sig mynd. Hver kynslóð mun byggja á því sem við lærum og auka enn frekar bæði skilvirkni og hraða.
Til að mæta vaxandi eftirspurn eftir gervigreind þarf meiri reiknigetu frá öllum tiltækum uppsprettum. Við munum halda áfram að innleiða víða hraðla frá NVIDIA og öðrum samstarfsaðilum, bæði fyrir þjálfunar- og ályktunarvinnuálag. Markmið okkar er að tryggja að almenn gervigreind komi öllu mannkyninu til góða.
Þegar við undirbúum notkunarsetningu höldum við áfram með framleiðsluvottun, þróum hugbúnaðinn áfram, undirbúum rekstur Jalapeño í stórum stíl og staðfestum afköst í fleiri líkönum. Niðurstöðurnar hingað til sýna hvað er mögulegt þegar við hönnum allt kerfið saman: viðbragðsfljótari, hæfari og fulltrúagervigreind sem er afhent skilvirkar til fleiri.
JAÐAR AFKASTA Á kW
InferenceX · GPT‑OSS‑120B · nafnlegt 8 þús./1 þús. · STP · TDP pakka: Jalapeño 700 W; GB200 1.200 W
HÁMARKS- OG SAMSVARANDI AFKÖST
InferenceX · GPT‑OSS‑120B · nafnlegt 8 þús./1 þús. · STP · TDP pakka: Jalapeño 700 W; GB200 1.200 W
Meira hámarksblandað TPS / kW
≈1,9×
85.448 á móti 44.960 blandað / kW
Minni heildarbiðtími frá upphafi til enda
≈1,7×
1,03 s vs. 1,80 s
Lækka lágmarks TBT
≈2,7×
0,69 á móti 1,87 ms (1.459 á móti 535 tók/s/notanda)
Meiri afköst við fyrra TBT
≈53,7×
22.935 á móti 427 blandað / kW (við 535,28 tók/s/notanda)
JAÐAR AFKASTA Á kW
InferenceX · DeepSeek R1 MXFP4 · nafnlegt 8 þús./1 þús. · STP · TDP pakkning: Jalapeño 700 W; GB300 1.400 W
HÁMARKS- OG SAMSVARANDI AFKÖST
InferenceX · DeepSeek R1 MXFP4 · nafnlegt 8 þús./1 þús. · STP · TDP pakkning: Jalapeño 700 W; GB300 1.400 W
Meira hámarksblandað TPS / kW
≈1,7×
19.641 á móti 11.781 blandað / kW
Minni heildarbiðtími frá upphafi til enda
≈3,6×
1,65 s á móti 5,99 s
Lækka lágmarks TBT
≈4,1×
1,43 á móti 5,90 ms (700 á móti 169 tók/s/notanda)
Meiri afköst við fyrra TBT
≈104,3×
12.258 vs. 118 blandað / kW (við 169,41 tók/s/notanda)
JAÐAR AFKASTA Á kW
InferenceX · Kimi K2,5 MXFP4 · nafnlegt 8 þús./1 þús. · STP · TDP pakkning: Jalapeño 700 W; GB300 1.400 W
HÁMARKS- OG SAMSVARANDI AFKÖST
InferenceX · Kimi K2,5 MXFP4 · nafnlegt 8 þús./1 þús. · STP · TDP pakkning: Jalapeño 700 W; GB300 1.400 W
Meira hámarksblandað TPS / kW
≈1,5×
18.195 á móti 11.862 blandað / kW
Minni heildarbiðtími frá upphafi til enda
≈3,4×
1,56 s á móti 5,31 s
Lækka lágmarks TBT
≈3,8×
1,44 á móti 5,48 ms (694 á móti 182 tók/s/notanda)
Meiri afköst við fyrra TBT
≈56,1×
6.744 á móti 120 blönduðu / kW (við 182,46 tók/s/notanda)


