Pirmieji „Jalapeño“ rezultatai rodo rinkoje pirmaujantį DI modelio vykdymo greitį ir efektyvumą

Paskelbę apie „Jalapeño“, pirmąjį „OpenAI“ specializuotą modelio vykdymo lustą, nuolat jį testavome kartu su visa jam sukurta sistema. Rezultatai rodo didžiulį našumo šuolį: vienam energijos vienetui „Jalapeño“ atlieka daugiau DI darbo ir greičiau pateikia atsakymus. „Jalapeño“ viena architektūra užtikrina ir didesnį pralaidumą, ir mažesnį vėlavimą, nors esamose techninės įrangos sistemose dažnai tenka ieškoti kompromiso tarp šių dviejų rodiklių.
Klientams tai reiškia greitesnius atsakymus, sparčiau reaguojančius agentus ir patikimesnę prieigą net ir augant paklausai. Mūsų misija – užtikrinti, kad bendrasis dirbtinis intelektas būtų naudingas visai žmonijai. Šie pranašumai padės vis pajėgesnį DI padaryti pigesnį ir plačiau prieinamą.
„OpenAI“ modeliai taip pat paspartino „Jalapeño“ kūrimą. Ankstesnių kartų modeliai padėjo komandai suprojektuoti ir paleisti lustą, o naujausi modeliai spartina jo optimizavimą ir programavimą. „Jalapeño“ našumas akivaizdus naudojant GPT‑OSS 120B, „DeepSeek R1“ ir „Kimi K2.5 1T“ modelius – tai rodo, kad architektūra puikiai veikia tiek su „OpenAI“, tiek su kitų kūrėjų modeliais. Su visais trimis modeliais esant maksimaliam pralaidumui „Jalapeño“ atliko nuo 1,5 iki 1,9 karto daugiau DI darbo vienam vatui, o visos užklausos vėlavimas buvo nuo 1,7 iki 3,6 karto mažesnis nei lyginamųjų sistemų. Esant itin interaktyviems darbo krūviams, jo našumas buvo nuo 2,1 iki 4,1 karto didesnis.
„Jalapeño“ taip pat įrodo platesnį visos technologijų grandinės pranašumą. „OpenAI“ gali kompleksiškai kurti modelius, produktus, paslaugų teikimo programinę įrangą, lustus, atmintį, tinklus ir sistemas, o iš realių darbo krūvių įgytą patirtį panaudoti tobulinant kiekvieną sistemos lygmenį. „Jalapeño“ – tai realiai veikiantis, išmatuotus rezultatus rodantis originalus lustas ir daugiakartės platformos pradžia. Artimiausiais mėnesiais plėsime „Jalapeño“ diegimą, kad klientams teiktume greitesnius, pajėgesnius ir efektyvesnius produktus.
Našumą vertiname užtikrindami vienodą naudotojų patirtį – matuojame, kiek naudingo DI darbo kiekviena sistema gali atlikti sunaudodama vieną energijos vienetą ir užtikrindama klientams bei interaktyviems agentams reikiamą vėlavimą. Tai ypač svarbu agentams, kuriems reikia atlikti daug nuoseklių veiksmų, todėl kiekvienas vėlavimas vykdant visą užduotį gali sumuotis.
Norėdami suprasti, kaip „Jalapeño“ veikia praktiškai, išbandėme jį naudodami „InferenceX“ – viešą „SemiAnalysis“ lyginamųjų testų įrankį, kuriuo matuojamas visas DI užklausos aptarnavimo procesas. „Jalapeño“ lyginome su pirmaujančiomis komerciškai prieinamomis DI sistemomis visame testuotame veikimo diapazone: nuo didelio pralaidumo apdorojimo iki itin interaktyvaus, mažo vėlavimo naudojimo. „Jalapeño“ užtikrino geresnį pralaidumo, energijos efektyvumo ir mažo vėlavimo derinį. Nors kartais našumas nurodomas vienam lustui, manome, kad kur kas naudingesnis standartas – našumas vienam energijos vienetui.
Naudojant visus tris viešus modelius, „Jalapeño“ užtikrino geresnį našumo vienam vatui ir vėlavimo derinį visame testuotame veikimo diapazone, taip pasiekdamas Pareto ribą. Siekdami nuosekliai palyginti sistemas, rezultatus normalizavome pagal kiekvieno greitintuvo oficialiai nurodytą lusto galią. „Jalapeño“ nominalioji galia siekia 700 vatų, nors testuojant su numatytais darbo krūviais išmatuota nuolatinė galia neviršijo 550 vatų.
„Jalapeño“ parodė puikius rezultatus naudojant GPT‑OSS 120B, „DeepSeek R1 670B“ ir „Kimi K2.5 1T“. Su didžiausiu mūsų testuotu viešu modeliu „Kimi“ lustas užtikrino maždaug 1,5 karto didesnį maksimalų našumą vienam vatui ir 3,4 karto mažesnį visos užklausos vėlavimą nei lyginamoji sistema. Atliekant vidinius testavimus, „Jalapeño“ pranašumas dar labiau išaugo naudojant priešakinius „OpenAI“ modelius. Tai rodo, kad ši architektūra tampa dar naudingesnė didėjant ir sudėtingėjant darbo krūviams.
Kurdami „Jalapeño“ nuo pat pradžių kėlėme klausimą: kokią techninę įrangą sukurtume, jei jos pagrindinis tikslas būtų užtikrinti šiuolaikinių ir būsimų kalbos modelių, ypač interaktyvių agentų, veikimą? „Jalapeño“ pranašumus lėmė tai, kad lustas, atmintis, tinklas, programinė įranga ir visos spintos lygmens sistema buvo projektuojami kartu, atsižvelgiant į realius kalbos modelių darbo krūvius. Kalbos modelio vykdymas apima kelis skirtingus etapus, kuriuose susiduriama su skirtingomis siaurosiomis vietomis. Pirminio užpildymo (angl. „prefill“) etapas, kai sistema apdoroja užklausą, reikalauja daug skaičiavimo resursų, o dekodavimo etapas, kai sistema generuoja atsakymą žetonas po žetono, labiau priklauso nuo atminties pralaidumo. Duomenų perdavimas taip pat gali padidinti vėlavimą, kai duomenys turi judėti tarp branduolių ir lustų – dėl to laukiantys apdorojimo blokai lieka neveiklūs. Viename etape puikiai veikianti sistema gali prarasti šį pranašumą laukdama duomenų arba perkeldama modelio būseną tarp skirtingų resursų.
„Jalapeño“ sukūrėme taip, kad sumažintume duomenų judėjimo ir perdavimo vėlavimą. Tai reiškia, kad modelio būsena, įskaitant generuojant atsakymą naudojamą KV podėlį (angl. „KV cache“), gali būti tiksliai paskirstoma ir laikoma lokaliai, kol sistema kiekvienam modelio vykdymo etapui aktyvina tinkamą skaičiavimo resursų, atminties ir tinklo derinį. Tinklas – neatsiejama architektūros dalis. Didelė jo aprėptis leidžia visą darbo krūvį išlaikyti vienoje sujungtoje sistemoje, taip sumažinant duomenų judėjimą ir užtikrinant greitą bei efektyvų visos užklausos apdorojimą nuo pat pradžios iki pabaigos. Rezultatas – subalansuotas ir universalus greitintuvas, galintis palaikyti besikeičiančias modelių architektūras, puikiai veikiantis tiek pirminio užpildymo, tiek dekodavimo etapuose ir prisitaikantis keičiantis pusiausvyrai tarp jų – tai pagrindinis agentinių darbo krūvių bruožas.
DI tiesiogiai prisidėjo prie „Jalapeño“ kūrimo – tai leido komandai per devynis mėnesius pereiti nuo pradinio projekto iki paruošimo gamybai (angl. „tapeout“), išnagrinėjus įvairias realizacijas, sutrumpinus projektavimo, matavimo ir tikrinimo ciklus bei nuolat atliekant modelių darbo krūvių iteracijas. DI taip pat padėjo optimizuoti lusto aritmetines grandines, todėl komanda sugebėjo laiku integruoti luste didesnį skaičiavimo našumą.
„Jalapeño“ sukurtas kaip aiškus, nuspėjamas programavimo objektas tiek žmonėms, tiek DI. Inžinieriai gali aprašyti darbą naudodami vietinius tenzorius, aiškų duomenų perdavimą ir nuspėjamą sinchronizaciją. Tuomet DI gali optimizuoti, kaip tas darbas atvaizduojamas, išdėstomas, planuojamas ir koordinuojamas visoje sistemoje. Dėl šios aiškios ir nuspėjamos struktūros DI gali lengviau išspręsti tradiciškai sudėtingą lygiagrečiojo programavimo problemą.
Norint palaikyti kiekvieną naują modelių šeimą, vis dar reikia naujų branduolių ir modeliui pritaikytų optimizavimų. Naudodama „Codex“ su „GPT‑Astra“, komanda per du mėnesius užtikrino aukštą našumą trims atvirųjų svorių modeliams, kurie nebuvo įtraukti į pirminį „Jalapeño“ realių sąlygų planą. Tai parodė tiek architektūros lankstumą, tiek greitį, kuriuo DI padeda mums ją programuoti. Pasirinktuose GPT‑OSS dėmesio (angl. „attention“) ir ekspertų mišinio (angl. „mixture-of-experts“) blokuose DI sugeneruotos realizacijos veikė nuo 1,5 iki 1,8 karto greičiau nei esamos žmonių ekspertų parašytos realizacijos. Šie skaičiai taikomi pasirinktiems blokams, o ne visam modeliui, bet jie signalizuoja apie galingą naują kūrimo ciklą.
DI infrastruktūra vertinga tuo, kad leidžia atlikti naudingus darbus realiame pasaulyje. Atlikdamas daugiau naudingo darbo su ta pačia energija ir technine įranga, „Jalapeño“ padeda patenkinti didesnę paklausą ir sumažinti sėkmingo rezultato užtikrinimo išlaidas. „OpenAI“ tai padeda padidinti veiklos svertą, nes naudingas darbas ir pajamos auga greičiau nei paslaugų teikimo išlaidos. Tai taip pat padeda užtikrinti platesnį pritaikymą ir nuolatines investicijas į geresnius modelius, produktus bei infrastruktūrą. Greitesnis modelio vykdymas leidžia sparčiau atlikti iteracijas ir atrasti naujus panaudojimo būdus.
„Jalapeño“ išplečia efektyvaus, mažo vėlavimo modelio vykdymo galimybes:
- Itin spartaus režimo modelio vykdymas tokiu efektyvumu, koks anksčiau buvo įmanomas tik sparčiuoju režimu
- Spartaus režimo modelio vykdymas tokiu efektyvumu, koks anksčiau buvo įmanomas tik masinių užklausų režimu
- Didesnis masinių užklausų režimo modelio vykdymo efektyvumas
Iki metų pabaigos planuojame pradėti diegti „Jalapeño“ „OpenAI“ skaičiavimo resursų infrastruktūroje. Tai tik pirmoji karta ilgalaikiame plane: 2-oji karta jau intensyviai kuriama, o 3-ioji – dar tik pradedama formuoti. Kiekviena karta bus tobulinama remiantis mūsų sukaupta patirtimi, dar labiau didinant efektyvumą ir greitį.
Norint patenkinti augančią DI paklausą, prireiks daugiau skaičiavimo resursų iš visų prieinamų šaltinių. Toliau plačiai diegsime NVIDIA ir kitų partnerių greitintuvus tiek mokymo, tiek modelio vykdymo krūviams apdoroti. Mūsų misija – užtikrinti, kad bendrasis dirbtinis intelektas būtų naudingas visai žmonijai.
Ruošdamiesi diegimui, toliau atliekame tinkamumo realioms sąlygoms vertinimą, tobuliname programinę įrangą, rengiamės naudoti „Jalapeño“ dideliu mastu ir tikriname jo veikimą su įvairesniais modeliais. Iki šiol gauti rezultatai rodo, ką galima pasiekti, kai visa sistema kuriama kompleksiškai: greičiau reaguojantis, pajėgesnis ir agentinis DI efektyviau pasiekia daugiau žmonių.
PRALAIDUMO 1 kW RIBA
„InferenceX“ · GPT‑OSS‑120B · nominalus 8k/1k · STP · paketo TDP: „Jalapeño“ 700 W; GB200 1 200 W
MAKSIMALUS IR PRITAIKYTAS PRALAIDUMAS
„InferenceX“ · GPT‑OSS‑120B · nominalus 8k/1k · STP · paketo TDP: „Jalapeño“ 700 W; GB200 1 200 W
Didesnis maksimalus mišrusis TPS/kW
≈1,9 karto
85 448, palyginti su 44 960 mišriųjų žet./kW
Mažesnis visos užklausos vėlavimas
≈1,7 karto
1,03 s, palyginti su 1,80 s
Mažesnis min. TBT
≈2,7 karto
0,69, palyginti su 1,87 ms(1 459, palyginti su 535 žet./s naudotojui)
Didesnis pralaidumas išlaikant ankstesnį TBT
≈53,7 karto
22 935, palyginti su 427 mišriaisiais žet./kW (esant 535,28 žet./s naudotojui)
PRALAIDUMO 1 kW RIBA
„InferenceX“ · „DeepSeek R1 MXFP4“ · nominalus 8k/1k · STP · paketo TDP: „Jalapeño“ 700 W; GB300 1 400 W
MAKSIMALUS IR PRITAIKYTAS PRALAIDUMAS
„InferenceX“ · „DeepSeek R1 MXFP4“ · nominalus 8k/1k · STP · paketo TDP: „Jalapeño“ 700 W; GB300 1 400 W
Didesnis maksimalus mišrusis TPS/kW
≈1,7 karto
19 641, palyginti su 11 781 mišriųjų žet./kW
Mažesnis visos užklausos vėlavimas
≈3,6 karto
1,65 s, palyginti su 5,99 s
Mažesnis min. TBT
≈4,1 karto
1,43, palyginti su 5,90 ms(700, palyginti su 169 žet./s naudotojui)
Didesnis pralaidumas išlaikant ankstesnį TBT
≈104,3 karto
12 258, palyginti su 118 mišriųjų žet./kW(esant 169,41 žet./s naudotojui)
PRALAIDUMO 1 kW RIBA
„InferenceX“ · „Kimi K2.5 MXFP4“ · nominalus 8k/1k · STP · paketo TDP: „Jalapeño“ 700 W; GB300 1 400 W
MAKSIMALUS IR PRITAIKYTAS PRALAIDUMAS
„InferenceX“ · „Kimi K2.5 MXFP4“ · nominalus 8k/1k · STP · paketo TDP: „Jalapeño“ 700 W; GB300 1 400
Didesnis maksimalus mišrusis TPS/kW
≈1,5 karto
18 195, palyginti su 11 862 mišriųjų žet./kW
Mažesnis visos užklausos vėlavimas
≈3,4 karto
1,56 s, palyginti su 5,31 s
Mažesnis min. TBT
≈3,8 karto
1,44, palyginti su 5,48 ms(694, palyginti su 182 žet./s naudotojui)
Didesnis pralaidumas išlaikant ankstesnį TBT
≈56,1 karto
6 744, palyginti su 120 mišriųjų žet./kW(esant 182,46 žet./s naudotojui)


