L-ewwel riżultati ta’ Jalapeño juru veloċità u effiċjenza ewlenin fl-inferenza tal-IA

Minn meta ħabbarna Jalapeño, l-ewwel ċippa personalizzata għall-inferenza ta’ OpenAI, ilna nittestjaw iċ-ċippa u s-sistema mibnija madwarha. Ir-riżultati juru avvanz sinifikanti fil-prestazzjoni: Jalapeño jista’ jwettaq aktar xogħol tal-IA għal kull unità ta’ enerġija filwaqt li jagħti r-risposti aktar malajr. B’arkitettura waħda, Jalapeño jipprovdi kemm throughput ogħla kif ukoll latenza aktar baxxa, filwaqt li s-sistemi tal-hardware eżistenti spiss ikollhom jagħżlu bejn it-tnejn.
Għall-klijenti, dan jista’ jfisser risposti aktar veloċi, aġenti aktar reattivi u aċċess aktar affidabbli hekk kif tikber id-domanda. Il-missjoni tagħna hi li niżguraw li l-intelliġenza artifiċjali ġenerali tkun ta’ benefiċċju għall-umanità kollha. Dan it-titjib se jgħin biex IA dejjem aktar kapaċi ssir orħos u disponibbli b’mod usa’.
Il-mudelli ta’ OpenAI aċċelleraw ukoll l-iżvilupp ta’ Jalapeño. Ġenerazzjonijiet preċedenti għenu lit-tim ifassal u jibda jħaddem iċ-ċippa, filwaqt li l-aħħar mudelli tagħna qed iħaffu l-mod kif nottimizzawha u nipprogrammawha. Il-prestazzjoni ta’ Jalapeño testendi fuq GPT‑OSS 120B, DeepSeek R1 u Kimi K2.5 1T, u turi li l-arkitettura taħdem ma’ mudelli żviluppati kemm ġewwa kif ukoll barra OpenAI. Fit-tlieta kollha, Jalapeño wettaq bejn 1.5 u 1.9 darbiet aktar xogħol tal-IA għal kull watt fl-ogħla throughput u kellu latenza sħiħa bejn 1.7 u 3.6 darbiet aktar baxxa mis-sistemi mqabbla. Għal piżijiet tax-xogħol interattivi ħafna, ipprovda prestazzjoni bejn 2.1 u 4.1 darbiet ogħla.
Jalapeño huwa wkoll prova ta’ vantaġġ usa’ tul l-istack kollu. OpenAI tista’ tfassal flimkien mudelli, prodotti, software għas-servizz, ċipep, memorja, networking u sistemi, billi tuża dak li nitgħallmu minn piżijiet tax-xogħol reali biex ittejjeb kull saff tal-istack. Jalapeño huwa silikon proprjetarju li jaħdem b’riżultati mkejla, u huwa l-bidu ta’ pjattaforma fuq diversi ġenerazzjonijiet. Fix-xhur li ġejjin, se nżidu l-produzzjoni ta’ Jalapeño biex inwasslu lill-klijenti tagħna prodotti aktar veloċi, kapaċi u effiċjenti.
Nevalwaw il-prestazzjoni b’esperjenza tal-utent ekwivalenti, billi nkejlu kemm xogħol utli tal-IA tista’ tlesti kull sistema għal kull unità ta’ enerġija filwaqt li tissodisfa l-latenza meħtieġa mill-klijenti u mill-aġenti interattivi. Dan huwa partikolarment importanti għall-aġenti, li jridu jlestu ħafna passi f’sekwenza, għalhekk id-dewmien jista’ jakkumula tul kompitu sħiħ.
Biex nifhmu kif Jalapeño jaħdem fil-prattika, ittestjajnieh fuq InferenceX, benchmark pubbliku minn SemiAnalysis li jkejjel il-proċess sħiħ tas-servizz ta’ talba tal-IA. Qabbilna Jalapeño ma’ sistemi ewlenin tal-IA disponibbli kummerċjalment tul il-medda operattiva ttestjata, minn servizz bi throughput għoli sa użu interattiv ħafna u b’latenza baxxa. Jalapeño pprovda taħlita aħjar ta’ throughput, effiċjenza fl-enerġija u latenza. Għalkemm il-prestazzjoni xi drabi tiġi rrappurtata għal kull ċippa, nemmnu li l-istandard aktar utli huwa l-prestazzjoni għal kull unità ta’ enerġija.
Fit-tliet mudelli pubbliċi kollha, Jalapeño pprovda taħlita aħjar ta’ prestazzjoni għal kull watt u latenza tul il-medda operattiva ttestjata, u poġġietu fuq il-fruntiera ta’ Pareto. Biex inqabblu s-sistemi b’mod konsistenti, innormalizzajna r-riżultati bl-użu tal-klassifikazzjoni ppubblikata tal-qawwa taċ-ċippa ta’ kull aċċelleratur. Jalapeño huwa kklassifikat għal 700 watt, għalkemm il-qawwa sostnuta mkejla tiegħu baqgħet ta’ 550 watt jew inqas fuq il-piżijiet tax-xogħol ittestjati.
Jalapeño kiseb prestazzjoni b’saħħitha fuq GPT‑OSS 120B, DeepSeek R1 670B u Kimi K2.5 1T. Fuq Kimi, l-akbar mudell pubbliku li ttestjajna, ipprovda prestazzjoni massima għal kull watt madwar 1.5 darbiet ogħla u latenza sħiħa 3.4 darbiet aktar baxxa mis-sistema mqabbla. Fl-ittestjar intern tagħna, il-vantaġġ ta’ Jalapeño kompla jikber fuq il-mudelli avvanzati ta’ OpenAI, u dan jissuġġerixxi li l-arkitettura ssir aktar siewja hekk kif il-piżijiet tax-xogħol jikbru u jsiru aktar impenjattivi.
Jalapeño tfassal mill-bidu billi staqsejna: x’hardware nibnu kieku x-xogħol ewlieni tiegħu kien li jħaddem mudelli tal-lingwa moderni u futuri, speċjalment aġenti interattivi? Il-vantaġġi ta’ Jalapeño ġejjin mit-tfassil konġunt taċ-ċippa, il-memorja, in-network, is-software u s-sistema fuq skala ta’ rack madwar piżijiet tax-xogħol reali ta’ mudelli tal-lingwa. L-inferenza tal-mudelli tal-lingwa tgħaddi minn diversi fażijiet distinti b’konġestjonijiet differenti. Il-prefill, meta s-sistema tipproċessa prompt, jeħtieġ ħafna computing, filwaqt li d-dekodifikazzjoni, meta s-sistema tiġġenera r-risposta token wara token, hija aktar limitata mill-bandwidth tal-memorja. Il-komunikazzjoni tista’ żżid ukoll il-latenza meta d-data jkollha tiċċaqlaq bejn il-qlub u ċ-ċipep, u tħalli xi unitajiet tal-ipproċessar wieqfa waqt li jistennew. Sistema li teċċella f’fażi waħda tista’ titlef dak il-vantaġġ waqt li tistenna d-data jew iċċaqlaq l-istat tal-mudell bejn riżorsi differenti.
Fassalna Jalapeño biex nimminimizzaw iċ-ċaqliq tad-data u d-dewmien fil-komunikazzjoni. Dan ifisser li l-istat tal-mudell, inkluż il-cache KV użat waqt il-ġenerazzjoni ta’ risposta, jista’ jitqiegħed b’mod espliċitu u jinżamm lokalment filwaqt li s-sistema tattiva l-kombinazzjoni xierqa ta’ computing, memorja u networking għal kull fażi tal-inferenza. In-network huwa parti integrali mill-arkitettura. Id-dominju kbir tiegħu jippermetti li l-piż tax-xogħol kollu jibqa’ f’sistema waħda konnessa, u b’hekk inaqqas iċ-ċaqliq tad-data u jgħin biex it-talba sħiħa tibqa’ veloċi u effiċjenti mill-bidu sal-aħħar. Ir-riżultat huwa aċċelleratur ibbilanċjat u flessibbli li jista’ jappoġġa arkitetturi ta’ mudelli li jinbidlu, jeċċella kemm fil-prefill kif ukoll fid-dekodifikazzjoni, u jadatta hekk kif jinbidel il-bilanċ bejniethom—karatteristika ewlenija tal-piżijiet tax-xogħol aġentiċi.
L-IA kellha rwol dirett fl-iżvilupp ta’ Jalapeño, u ppermettiet lit-tim jgħaddi mid-disinn inizjali sat-tapeout f’disa’ xhur billi esplora implimentazzjonijiet, qassar iċ-ċikli tad-disinn, il-kejl u l-verifika, u kompla jtejjeb il-piżijiet tax-xogħol tal-mudelli. L-IA għenet ukoll tottimizza ċ-ċirkwiti aritmetiċi taċ-ċippa, u ppermettiet lit-tim idaħħal aktar prestazzjoni tal-computing fiċ-ċippa skont l-iskeda.
Jalapeño tfassal bħala mira ta’ programmazzjoni ċara u prevedibbli kemm għall-bnedmin kif ukoll għall-IA. L-inġiniera jistgħu jiddeskrivu x-xogħol permezz ta’ tensors lokali, komunikazzjoni espliċita u sinkronizzazzjoni prevedibbli. Imbagħad l-IA tista’ tottimizza kif dak ix-xogħol jiġi mmappjat, imqiegħed, skedat u kkoordinat fis-sistema kollha. Dik l-istruttura ċara u prevedibbli tagħti lill-IA mod prattikabbli biex tindirizza l-problema tradizzjonalment diffiċli tal-ipprogrammar parallel.
L-appoġġ għal kull familja ġdida ta’ mudelli xorta jeħtieġ kernels ġodda u ottimizzazzjonijiet speċifiċi għall-mudell. Bl-użu ta’ Codex ma’ GPT‑Astra, fi żmien xahrejn it-tim wassal għal prestazzjoni għolja tliet mudelli b’piżijiet miftuħa li ma kinux fil-pjan ta’ produzzjoni oriġinali ta’ Jalapeño. Dan wera kemm il-flessibbiltà tal-arkitettura kif ukoll il-ħeffa li biha l-IA tista’ tgħinna nipprogrammawha. Għal blokok magħżula tal-attenzjoni u tal-mixture-of-experts ta’ GPT‑OSS, l-implimentazzjonijiet iġġenerati mill-IA ħadmu bejn 1.5 u 1.8 darbiet aktar malajr mill-implimentazzjonijiet eżistenti miktuba minn esperti umani. Dawk iċ-ċifri japplikaw għall-blokok magħżula, mhux għall-mudell sħiħ, iżda jindikaw ċiklu ġdid u b’saħħtu ta’ żvilupp.
L-infrastruttura tal-IA hija siewja minħabba x-xogħol utli fid-dinja reali li tagħmilha possibbli. Billi jipproduċi aktar xogħol utli bl-istess enerġija u hardware, Jalapeño jista’ jgħinna naqdu aktar domanda u nnaqqsu l-ispiża biex inwasslu riżultat ta’ suċċess. Għal OpenAI, dan jista’ jtejjeb l-ingranaġġ operattiv billi jippermetti lix-xogħol utli u d-dħul jikbru aktar malajr mill-ispiża tas-servizz. Jista’ wkoll jappoġġa adozzjoni usa’ u investiment kontinwu f’mudelli, prodotti u infrastruttura aħjar. Inferenza aktar veloċi tista’ tippermetti iterazzjoni aktar rapida u każijiet ta’ użu ġodda.
Jalapeño jwessa’ dak li hu possibbli għal inferenza effiċjenti b’latenza baxxa:
- Inferenza fil-modalità ultraveloċi b’effiċjenzi li qabel kienu disponibbli biss fil-modalità veloċi
- Inferenza fil-modalità veloċi b’effiċjenzi li qabel kienu disponibbli biss fil-modalità raggruppata
- Effiċjenza ogħla għall-inferenza fil-modalità raggruppata
Qed nippjanaw li nibdew nimplimentaw Jalapeño fl-infrastruttura tal-computing ta’ OpenAI sal-aħħar tas-sena. Hija l-ewwel ġenerazzjoni ta’ pjan direzzjonali fuq diversi ġenerazzjonijiet: Ġen 2 tinsab fi stadju avvanzat ta’ żvilupp, u Ġen 3 qed tieħu sura. Kull ġenerazzjoni se tibni fuq dak li nitgħallmu u tkompli ttejjeb kemm l-effiċjenza kif ukoll il-veloċità.
Biex tintlaħaq id-domanda dejjem tikber għall-IA se jkun meħtieġ aktar computing minn kull sors disponibbli. Se nkomplu nimplimentaw b’mod mifrux aċċelleraturi minn NVIDIA u sħab oħra kemm għat-taħriġ kif ukoll għall-piżijiet tax-xogħol tal-inferenza. Il-missjoni tagħna hi li niżguraw li l-intelliġenza artifiċjali ġenerali tkun ta’ benefiċċju għall-umanità kollha.
Hekk kif nippreparaw għall-implimentazzjoni, qed inkomplu nikkwalifikaw il-produzzjoni, nimmaturaw is-software, nippreparaw biex inħaddmu Jalapeño fuq skala kbira u nivvalidaw il-prestazzjoni fuq aktar mudelli. Ir-riżultati s’issa juru x’inhu possibbli meta niddisinjaw is-sistema sħiħa flimkien: IA aktar reattiva, kapaċi u aġentika, imwassla b’mod aktar effiċjenti lil aktar nies.
FRUNTIERA TAT-THROUGHPUT GĦAL KULL kW
InferenceX · GPT‑OSS‑120B · 8k/1k nominali · STP · TDP tal-pakkett: Jalapeño 700 W; GB200 1,200 W
THROUGHPUT MASSIMU U MQABBEL
InferenceX · GPT‑OSS‑120B · 8k/1k nominali · STP · TDP tal-pakkett: Jalapeño 700 W; GB200 1,200 W
TPS imħallta massimi/kW ogħla
≈1.9×
85,448 kontra 44,960 imħallta/kW
Latenza sħiħa aktar baxxa
≈1.7×
1.03 s kontra 1.80 s
TBT minimu aktar baxx
≈2.7×
0.69 kontra 1.87 ms (1,459 kontra 535 tok/s/utent)
Aktar throughput bit-TBT preċedenti
≈53.7×
22,935 kontra 427 imħallta/kW (b’535.28 tok/s/utent)
FRUNTIERA TAT-THROUGHPUT GĦAL KULL kW
InferenceX · DeepSeek R1 MXFP4 · 8k/1k nominali · STP · TDP tal-pakkett: Jalapeño 700 W; GB300 1,400 W
THROUGHPUT MASSIMU U MQABBEL
InferenceX · DeepSeek R1 MXFP4 · 8k/1k nominali · STP · TDP tal-pakkett: Jalapeño 700 W; GB300 1,400 W
TPS imħallta massimi/kW ogħla
≈1.7×
19,641 kontra 11,781 imħallta/kW
Latenza sħiħa aktar baxxa
≈3.6×
1.65 s kontra 5.99 s
TBT minimu aktar baxx
≈4.1×
1.43 kontra 5.90 ms (700 kontra 169 tok/s/utent)
Aktar throughput bit-TBT preċedenti
≈104.3×
12,258 kontra 118 imħallta/kW (b’169.41 tok/s/utent)
FRUNTIERA TAT-THROUGHPUT GĦAL KULL kW
InferenceX · Kimi K2.5 MXFP4 · 8k/1k nominali · STP · TDP tal-pakkett: Jalapeño 700 W; GB300 1,400 W
THROUGHPUT MASSIMU U MQABbel
InferenceX · Kimi K2.5 MXFP4 · 8k/1k nominali · STP · TDP tal-pakkett: Jalapeño 700 W; GB300 1,400 W
TPS imħallta massimi/kW ogħla
≈1.5×
18,195 kontra 11,862 imħallta/kW
Latenza sħiħa aktar baxxa
≈3.4×
1.56 s kontra 5.31 s
TBT minimu aktar baxx
≈3.8×
1.44 kontra 5.48 ms (694 kontra 182 tok/s/utent)
Aktar throughput bit-TBT preċedenti
≈56.1×
6,744 kontra 120 imħallta/kW (b’182.46 tok/s/utent)


