A Jalapeño első eredményei iparágvezető sebességet és hatékonyságot mutatnak az AI-inferenciában

A Jalapeño, az OpenAI első egyedi inferenciachipjének bejelentése óta teszteljük a chipet és a köré épített rendszert. Az eredmények jelentős teljesítménybeli előrelépést mutatnak: a Jalapeño egységnyi energiafelhasználás mellett több AI-feladatot képes kiszolgálni, miközben gyorsabban ad válaszokat. A Jalapeño egy architektúrával egyszerre biztosít nagyobb átviteli sebességet és alacsonyabb késleltetést, míg a meglévő hardverrendszereknek gyakran kompromisszumot kell kötniük a kettő között.
Az ügyfelek számára ez gyorsabb válaszokat, gyorsabban reagáló ügyintézőket és megbízhatóbb hozzáférést jelenthet az igények növekedésével. Küldetésünk annak biztosítása, hogy a mesterséges általános intelligencia az egész emberiség javát szolgálja. Ezek az eredmények hozzájárulnak ahhoz, hogy az egyre fejlettebb AI megfizethetőbbé és szélesebb körben elérhetővé váljon.
Az OpenAI modelljei a Jalapeño fejlesztését is felgyorsították. A korábbi generációk segítették a csapatot a chip megtervezésében és üzembe helyezésében, míg legújabb modelljeink felgyorsítják annak optimalizálását és programozását. A Jalapeño teljesítménye a GPT‑OSS 120B, a DeepSeek R1 és a Kimi K2.5 1T esetében is érvényesül, ami azt mutatja, hogy az architektúra mind az OpenAI-on belül, mind azon kívül fejlesztett modellekkel működik. Mindhárom esetében a Jalapeño csúcs adatátviteli egység mellett wattonként 1,5–1,9-szer több AI-munkát végzett, és a végponttól végpontig terjedő késleltetése 1,7–3,6-szer alacsonyabb volt, mint az összehasonlítási rendszereké. A rendkívül interaktív munkaterhelések esetében 2,1–4,1-szer nagyobb teljesítményt nyújtott.
A Jalapeño arra is bizonyíték, hogy szélesebb körű full-stack előnnyel rendelkezik. Az OpenAI modelleket, termékeket, kiszolgálószoftvereket, chipeket, memóriát, hálózatokat és rendszereket együtt tervezhet, a valós munkaterhelésekből szerzett tapasztalatokat pedig a rendszer minden rétegének fejlesztésére használhatja. A Jalapeño működő első fél által fejlesztett szilícium, amely mérhető eredményeket mutat, és egy több generáción átívelő platform kezdete. Az előttünk álló hónapokban felgyorsítjuk a Jalapeñó fejlesztését, hogy gyorsabb, képességesebb és hatékonyabb termékeket kínálhassunk ügyfeleinknek.
A teljesítményt azonos felhasználói élmény mellett értékeljük: azt mérjük, hogy az egyes rendszerek egységnyi felvett villamos teljesítményre vetítve mennyi hasznos MI-munkát képesek elvégezni, miközben teljesítik az ügyfelek és az interaktív ágensek által megkövetelt késleltetési követelményeket. Ez különösen az ügynökök esetében fontos, mert sok lépést kell sorban elvégezniük, így a késések egy teljes feladat során összeadódhatnak.
Ahhoz, hogy megértsük, hogyan teljesít a Jalapeño a gyakorlatban, az InferenceX-en teszteltük, a SemiAnalysis nyilvános benchmarkján, amely az AI-kérés kiszolgálásának teljes folyamatát méri. A Jalapeñót a tesztelt működési tartományban vezető, kereskedelmi forgalomban kapható AI-rendszerekkel hasonlítottuk össze, az erős adatátviteli egységű kiszolgálástól a rendkívül interaktív, alacsony késleltetésű használatig. A Jalapeño az adatátviteli egység, az energiahatékonyság és a késleltetés kedvezőbb kombinációját nyújtotta. Bár a teljesítményt néha chipenként adják meg, úgy véljük, hogy a hasznosabb mérce a teljesítmény egységnyi energiafelvételre vetítve.
Mindhárom nyilvános modell esetében a Jalapeño a tesztelt működési tartományban a wattonkénti teljesítmény és a késleltetés jobb kombinációját nyújtotta, így élvonalbeli lett. A rendszerek következetes összehasonlítása érdekében az eredményeket az egyes gyorsítók közzétett chipteljesítmény-értéke alapján normalizáltuk. A Jalapeño névleges teljesítménye 700 watt, bár a mért tartós teljesítménye a tesztelt terhelések mellett legfeljebb 550 watt volt.
A Jalapeño erősen teljesített a GPT‑OSS 120B, a DeepSeek R1 670B és a Kimi K2.5 1T modelleken. A Kimi esetében – amely az általunk tesztelt legnagyobb nyilvános modell – megközelítőleg 1,5-szer nagyobb csúcsteljesítményt nyújtott wattonként, és 3,4-szer alacsonyabb végponttól végpontig tartó késleltetést ért el, mint az összehasonlítási rendszer. Belső tesztjeinkben a Jalapeño előnye tovább nőtt az élvonalbeli OpenAI modelleken, ami arra utal, hogy az architektúra értékesebbé válik, ahogy a munkaterhelések nagyobbak és igényesebbek lesznek.
A Jalapeño tervezése kezdetektől fogva abból a kérdésből indult ki: milyen hardvert építenénk, ha elsődleges feladata a modern és jövőbeli nyelvi modellek, különösen az interaktív ügynökök támogatása lenne? A Jalapeño előnyei abból fakadnak, hogy a chipet, a memóriát, a hálózatot, a szoftvert és a rackszintű rendszert valós nyelvi modell-munkaterhelésekhez igazítva tervezték. A nyelvimodell-inferencia több különböző szakaszon halad keresztül, amelyek eltérő szűk keresztmetszetekkel rendelkeznek. Az előfeldolgozás, amikor a rendszer feldolgoz egy utasítást, számításigényes, míg a dekódolás, amikor a rendszer tokenről tokenre generálja a választ, inkább a memóriasávszélesség által van korlátozva. A kommunikáció növelheti a késleltetést, amikor az adatoknak magok és chipek között kell mozogniuk, így egyes feldolgozóegységek tétlenül várakoznak. Az egyik szakaszban kiemelkedően teljesítő rendszer elveszítheti előnyét, miközben adatokra vár vagy különböző erőforrások között mozgatja a modell állapotát.
A Jalapeñót úgy terveztük, hogy minimalizálja az adatmozgatást és a kommunikációs késleltetéseket. Ez azt jelenti, hogy a modell állapota – beleértve a válasz generálása során használt KV-gyorsítótárat is – explicit módon elhelyezhető és helyben tartható, miközben a rendszer minden inferenciafázishoz aktiválja a számítási kapacitás, a memória és a hálózat megfelelő kombinációját. A hálózat az architektúra szerves része. Nagy tartománya lehetővé teszi, hogy a teljes munkaterhelés egyetlen összekapcsolt rendszeren belül maradjon, csökkentve az adatmozgatást, és elősegítve, hogy a teljes kérés elejétől a végéig gyors és hatékony maradjon. Az eredmény egy kiegyensúlyozott és rugalmasan felhasználható gyorsító, amely támogatni tudja a változó modellarchitektúrákat, az előkitöltésben és a dekódolásban egyaránt kiváló teljesítményt nyújt, és alkalmazkodik a köztük lévő egyensúly változásaihoz, ami az ágensalapú munkaterhelések meghatározó jellemzője.
Az AI közvetlen szerepet játszott a Jalapeño fejlesztésében: lehetővé tette, hogy a csapat a megvalósítási lehetőségek feltárásával, a tervezési, mérési és ellenőrzési ciklusok lerövidítésével, valamint a modellterhelések folyamatos iterálásával kilenc hónap alatt jusson el a kezdeti tervezéstől a tapeoutig. Az AI emellett segített optimalizálni a chip aritmetikai áramköreit, így a csapat az ütemtervnek megfelelően nagyobb számítási teljesítményt tudott beépíteni a chipbe.
A Jalapeñót úgy tervezték, hogy egyértelmű, kiszámítható programozási cél legyen emberek és MI számára egyaránt. A mérnökök helyi tenzorokon, explicit kommunikáción és kiszámítható szinkronizáción keresztül írhatják le a munkát. Az MI ezután optimalizálhatja, hogy az adott munka hogyan legyen leképezve, elhelyezve, ütemezve és összehangolva a rendszer egészében. Ez az átlátható, kiszámítható struktúra kezelhető megközelítést kínál az MI számára a párhuzamos programozás hagyományosan nehéz problémájának kezelésére.
Minden új modellcsalád támogatása továbbra is új kerneleket és modellspecifikus optimalizálásokat igényel. A Codexet a GPT‑Astrával használva a csapat két hónap alatt három olyan nyílt súlyú modellt hozott erős teljesítményre, amelyek nem szerepeltek a Jalapeño eredeti gyártási tervében. Ez egyszerre szemléltette az architektúra rugalmasságát és azt, hogy az AI milyen gyorsan tud segíteni nekünk a programozásában. Egyes GPT‑OSS figyelmi és keverék-szakértői blokkok esetében az MI által generált implementációk 1,5–1,8-szor gyorsabban futottak, mint a meglévő, emberi szakértők által írt implementációk. Ezek a számok a kijelölt blokkokra vonatkoznak, nem a teljes modellre, de egy hatékony új fejlesztési ciklus felé mutatnak.
Az MI-infrastruktúra azért értékes, mert hasznos, valós feladatok elvégzését teszi lehetővé. Azáltal, hogy ugyanazzal az energiafelhasználással és hardverrel több hasznos munkát végez, a Jalapeño segíthet nekünk nagyobb igényt kiszolgálni, és csökkenteni a sikeres eredmény elérésének költségét. Az OpenAI számára ez javíthatja a működési tőkeáttételt azáltal, hogy a hasznos munka és a bevétel gyorsabban növekedhet, mint a kiszolgálás költsége. Ez a szélesebb körű elfogadást és a jobb modellekbe, termékekbe és infrastruktúrába irányuló folyamatos beruházást is támogathatja. A gyorsabb inferencia gyorsabb iterációt és új felhasználási lehetőségeket tesz lehetővé.
Jalapeño kibővíti a hatékony, alacsony késleltetésű inferencia lehetőségeit:
- Ultragyors módú következtetés, a korábban csak gyors módban elérhető hatékonysággal
- Gyors módú következtetés korábban csak kötegelt módban elérhető hatékonysággal
- Nagyobb hatékonyság a kötegelt módú inferenciához
Terveink szerint az év végéig megkezdjük a Jalapeño bevezetését az OpenAI számítási infrastruktúrájában. Ez egy több generáción átívelő ütemterv első generációja: a 2. generáció javában fejlesztés alatt áll, a 3. generáció pedig már körvonalazódik. Minden generáció arra épít majd, amit megtanulunk, és tovább javítja mind a hatékonyságot, mind a sebességet.
Az AI iránti növekvő kereslet kielégítéséhez minden elérhető forrásból több számítási kapacitásra lesz szükség. Továbbra is széles körben fogunk NVIDIA és más partnerek gyorsítóit alkalmazni mind a betanítási, mind az inferenciai munkaterhelésekhez. Küldetésünk annak biztosítása, hogy a mesterséges általános intelligencia az egész emberiség javát szolgálja.
Miközben a bevezetésre készülünk, folytatjuk az éles üzembe helyezéshez szükséges minősítést, továbbfejlesztjük a szoftvert, felkészülünk a Jalapeño nagyléptékű üzemeltetésére, és több modellen is validáljuk a teljesítményt. Az eddigi eredmények megmutatják, mi lehetséges, ha a teljes rendszert együtt tervezzük meg: gyorsabban reagáló, nagyobb képességű és ügynökalapú MI, amelyet hatékonyabban juttatunk el több emberhez.
ADATÁTVITELI EGYSÉG/kW ÉLVONALBELI
InferenceX · GPT‑OSS‑120B · névleges 8k/1k · STP · csomag TDP: Jalapeño 700 W; GB200 1200 W
CSÚCS- ÉS ILLESZTETT ADATÁTVITELI EGYSÉG
InferenceX · GPT‑OSS‑120B · névleges 8 000/1 000 · STP · csomag TDP: Jalapeño 700 W; GB200 1200 W
Magasabb vegyes csúcs TPS / kW
≈1,9×
85 448 vs. 44 960 vegyes / kW
Alacsonyabb végponttól végpontig tartó késleltetés
≈1,7×
1,03 s vs. 1,80 s
Alacsonyabb minimális TBT
≈2,7×
0,69 vs. 1,87 ms (1459 vs. 535 tok/s/felhasználó)
Nagyobb adatátviteli egység az előző TBT-nél
≈53.7×
22 935 vs. 427 vegyes / kW (535,28 tok/s/felhasználó mellett)
ADATÁTVITELI EGYSÉG/kW ÉLVONALBELI
InferenceX · DeepSeek R1 MXFP4 · névleges 8k/1k · STP · csomag TDP: Jalapeño 700 W; GB300 1400 W
CSÚCS- ÉS ILLESZTETT ADATÁTVITELI EGYSÉG
InferenceX · DeepSeek R1 MXFP4 · névleges 8k/1k · STP · csomag TDP: Jalapeño 700 W; GB300 1400 W
Magasabb csúcsteljesítményű vegyes TPS/kW
≈1,7×
19 641 vs. 11 781 vegyes / kW
Alacsonyabb végponttól végpontig tartó késleltetés
≈3,6×
1,65 s vs. 5,99 s
Alacsonyabb minimális TBT
≈4.1×
1,43 vs. 5.90 ms (700 vs. 169 tok/s/felhasználó)
Nagyobb adatátviteli egység az előző TBT-nél
≈104,3×
12 258 vs. 118 vegyes / kW (169,41 tok/s/felhasználó mellett)
ADATÁTVITELI EGYSÉG/kW ÉLVONALBELI
InferenceX · Kimi K2.5 MXFP4 · névleges 8k/1k · STP · csomag TDP: Jalapeño 700 W; GB300 1400 W
CSÚCS- ÉS ILLESZTETT ADATÁTVITELI EGYSÉG
InferenceX · Kimi K2.5 MXFP4 · névleges 8k/1k · STP · csomag TDP: Jalapeño 700 W; GB300 1400 W
Magasabb csúcsteljesítményű vegyes TPS/kW
≈1,5×
18 195 vs. 11 862 kevert / kW
Alacsonyabb végpontok közötti késleltetés
≈3.4×
1,56 s vs. 5,31 s
Alacsonyabb minimális TBT
≈3,8×
1,44 vs. 5.48 ms (694 vs. 182 tok/s/felhasználó)
Nagyobb adatátviteli egység az előző TBT-nél
≈56.1×
6744 vs. 120 vegyes / kW (182,46 tok/s/felhasználó mellett)


