Ugrás a fő tartalomra
OpenAI

A Jalapeño első eredményei iparágvezető sebességet és hatékonyságot mutatnak az AI-inferenciában

Betöltés…
Közeli felvétel a türkiz színű áramköri lapra szerelt Jalapeño inferenciachipről.

A Jalapeño, az OpenAI első egyedi inferenciachipjének bejelentése óta teszteljük a chipet és a köré épített rendszert. Az eredmények jelentős teljesítménybeli előrelépést mutatnak: a Jalapeño egységnyi energiafelhasználás mellett több AI-feladatot képes kiszolgálni, miközben gyorsabban ad válaszokat. A Jalapeño egy architektúrával egyszerre biztosít nagyobb átviteli sebességet és alacsonyabb késleltetést, míg a meglévő hardverrendszereknek gyakran kompromisszumot kell kötniük a kettő között.

Az ügyfelek számára ez gyorsabb válaszokat, gyorsabban reagáló ügyintézőket és megbízhatóbb hozzáférést jelenthet az igények növekedésével. Küldetésünk annak biztosítása, hogy a mesterséges általános intelligencia az egész emberiség javát szolgálja. Ezek az eredmények hozzájárulnak ahhoz, hogy az egyre fejlettebb AI megfizethetőbbé és szélesebb körben elérhetővé váljon.

Az OpenAI modelljei a Jalapeño fejlesztését is felgyorsították. A korábbi generációk segítették a csapatot a chip megtervezésében és üzembe helyezésében, míg legújabb modelljeink felgyorsítják annak optimalizálását és programozását. A Jalapeño teljesítménye a GPT‑OSS 120B, a DeepSeek R1 és a Kimi K2.5 1T esetében is érvényesül, ami azt mutatja, hogy az architektúra mind az OpenAI-on belül, mind azon kívül fejlesztett modellekkel működik. Mindhárom esetében a Jalapeño csúcs adatátviteli egység mellett wattonként 1,5–1,9-szer több AI-munkát végzett, és a végponttól végpontig terjedő késleltetése 1,7–3,6-szer alacsonyabb volt, mint az összehasonlítási rendszereké. A rendkívül interaktív munkaterhelések esetében 2,1–4,1-szer nagyobb teljesítményt nyújtott.

A Jalapeño arra is bizonyíték, hogy szélesebb körű full-stack előnnyel rendelkezik. Az OpenAI modelleket, termékeket, kiszolgálószoftvereket, chipeket, memóriát, hálózatokat és rendszereket együtt tervezhet, a valós munkaterhelésekből szerzett tapasztalatokat pedig a rendszer minden rétegének fejlesztésére használhatja. A Jalapeño működő első fél által fejlesztett szilícium, amely mérhető eredményeket mutat, és egy több generáción átívelő platform kezdete. Az előttünk álló hónapokban felgyorsítjuk a Jalapeñó fejlesztését, hogy gyorsabb, képességesebb és hatékonyabb termékeket kínálhassunk ügyfeleinknek.

Hogyan mértük a Jalapeño teljesítményét

A teljesítményt azonos felhasználói élmény mellett értékeljük: azt mérjük, hogy az egyes rendszerek egységnyi felvett villamos teljesítményre vetítve mennyi hasznos MI-munkát képesek elvégezni, miközben teljesítik az ügyfelek és az interaktív ágensek által megkövetelt késleltetési követelményeket. Ez különösen az ügynökök esetében fontos, mert sok lépést kell sorban elvégezniük, így a késések egy teljes feladat során összeadódhatnak.

Ahhoz, hogy megértsük, hogyan teljesít a Jalapeño a gyakorlatban, az InferenceX-en teszteltük, a SemiAnalysis nyilvános benchmarkján, amely az AI-kérés kiszolgálásának teljes folyamatát méri. A Jalapeñót a tesztelt működési tartományban vezető, kereskedelmi forgalomban kapható AI-rendszerekkel hasonlítottuk össze, az erős adatátviteli egységű kiszolgálástól a rendkívül interaktív, alacsony késleltetésű használatig. A Jalapeño az adatátviteli egység, az energiahatékonyság és a késleltetés kedvezőbb kombinációját nyújtotta. Bár a teljesítményt néha chipenként adják meg, úgy véljük, hogy a hasznosabb mérce a teljesítmény egységnyi energiafelvételre vetítve.

A Jalapeño növeli az előnyét az eddigi legjobb TBT-n

A Jalapeño felhasználónként több tokent biztosít

A Jalapeño kilowattóránként nagyobb átviteli teljesítményt nyújt

Mindhárom nyilvános modell esetében a Jalapeño a tesztelt működési tartományban a wattonkénti teljesítmény és a késleltetés jobb kombinációját nyújtotta, így élvonalbeli lett. A rendszerek következetes összehasonlítása érdekében az eredményeket az egyes gyorsítók közzétett chipteljesítmény-értéke alapján normalizáltuk. A Jalapeño névleges teljesítménye 700 watt, bár a mért tartós teljesítménye a tesztelt terhelések mellett legfeljebb 550 watt volt.

A Jalapeño erősen teljesített a GPT‑OSS 120B, a DeepSeek R1 670B és a Kimi K2.5 1T modelleken. A Kimi esetében – amely az általunk tesztelt legnagyobb nyilvános modell – megközelítőleg 1,5-szer nagyobb csúcsteljesítményt nyújtott wattonként, és 3,4-szer alacsonyabb végponttól végpontig tartó késleltetést ért el, mint az összehasonlítási rendszer. Belső tesztjeinkben a Jalapeño előnye tovább nőtt az élvonalbeli OpenAI modelleken, ami arra utal, hogy az architektúra értékesebbé válik, ahogy a munkaterhelések nagyobbak és igényesebbek lesznek.

Architektúra a sebességért és hatékonyságért egyetlen chipen belül

A Jalapeño tervezése kezdetektől fogva abból a kérdésből indult ki: milyen hardvert építenénk, ha elsődleges feladata a modern és jövőbeli nyelvi modellek, különösen az interaktív ügynökök támogatása lenne? A Jalapeño előnyei abból fakadnak, hogy a chipet, a memóriát, a hálózatot, a szoftvert és a rackszintű rendszert valós nyelvi modell-munkaterhelésekhez igazítva tervezték. A nyelvimodell-inferencia több különböző szakaszon halad keresztül, amelyek eltérő szűk keresztmetszetekkel rendelkeznek. Az előfeldolgozás, amikor a rendszer feldolgoz egy utasítást, számításigényes, míg a dekódolás, amikor a rendszer tokenről tokenre generálja a választ, inkább a memóriasávszélesség által van korlátozva. A kommunikáció növelheti a késleltetést, amikor az adatoknak magok és chipek között kell mozogniuk, így egyes feldolgozóegységek tétlenül várakoznak. Az egyik szakaszban kiemelkedően teljesítő rendszer elveszítheti előnyét, miközben adatokra vár vagy különböző erőforrások között mozgatja a modell állapotát.

A Jalapeñót úgy terveztük, hogy minimalizálja az adatmozgatást és a kommunikációs késleltetéseket. Ez azt jelenti, hogy a modell állapota – beleértve a válasz generálása során használt KV-gyorsítótárat is – explicit módon elhelyezhető és helyben tartható, miközben a rendszer minden inferenciafázishoz aktiválja a számítási kapacitás, a memória és a hálózat megfelelő kombinációját. A hálózat az architektúra szerves része. Nagy tartománya lehetővé teszi, hogy a teljes munkaterhelés egyetlen összekapcsolt rendszeren belül maradjon, csökkentve az adatmozgatást, és elősegítve, hogy a teljes kérés elejétől a végéig gyors és hatékony maradjon. Az eredmény egy kiegyensúlyozott és rugalmasan felhasználható gyorsító, amely támogatni tudja a változó modellarchitektúrákat, az előkitöltésben és a dekódolásban egyaránt kiváló teljesítményt nyújt, és alkalmazkodik a köztük lévő egyensúly változásaihoz, ami az ágensalapú munkaterhelések meghatározó jellemzője.

AI segítségével terveztük meg a chipet, és úgy alakítottuk ki, hogy az AI programozhassa.

Az AI közvetlen szerepet játszott a Jalapeño fejlesztésében: lehetővé tette, hogy a csapat a megvalósítási lehetőségek feltárásával, a tervezési, mérési és ellenőrzési ciklusok lerövidítésével, valamint a modellterhelések folyamatos iterálásával kilenc hónap alatt jusson el a kezdeti tervezéstől a tapeoutig. Az AI emellett segített optimalizálni a chip aritmetikai áramköreit, így a csapat az ütemtervnek megfelelően nagyobb számítási teljesítményt tudott beépíteni a chipbe.

A Jalapeñót úgy tervezték, hogy egyértelmű, kiszámítható programozási cél legyen emberek és MI számára egyaránt. A mérnökök helyi tenzorokon, explicit kommunikáción és kiszámítható szinkronizáción keresztül írhatják le a munkát. Az MI ezután optimalizálhatja, hogy az adott munka hogyan legyen leképezve, elhelyezve, ütemezve és összehangolva a rendszer egészében. Ez az átlátható, kiszámítható struktúra kezelhető megközelítést kínál az MI számára a párhuzamos programozás hagyományosan nehéz problémájának kezelésére.

Minden új modellcsalád támogatása továbbra is új kerneleket és modellspecifikus optimalizálásokat igényel. A Codexet a GPT‑Astrával használva a csapat két hónap alatt három olyan nyílt súlyú modellt hozott erős teljesítményre, amelyek nem szerepeltek a Jalapeño eredeti gyártási tervében. Ez egyszerre szemléltette az architektúra rugalmasságát és azt, hogy az AI milyen gyorsan tud segíteni nekünk a programozásában. Egyes GPT‑OSS figyelmi és keverék-szakértői blokkok esetében az MI által generált implementációk 1,5–1,8-szor gyorsabban futottak, mint a meglévő, emberi szakértők által írt implementációk. Ezek a számok a kijelölt blokkokra vonatkoznak, nem a teljes modellre, de egy hatékony új fejlesztési ciklus felé mutatnak.

A hatékony, ultragyors következtetés jövője

Az MI-infrastruktúra azért értékes, mert hasznos, valós feladatok elvégzését teszi lehetővé. Azáltal, hogy ugyanazzal az energiafelhasználással és hardverrel több hasznos munkát végez, a Jalapeño segíthet nekünk nagyobb igényt kiszolgálni, és csökkenteni a sikeres eredmény elérésének költségét. Az OpenAI számára ez javíthatja a működési tőkeáttételt azáltal, hogy a hasznos munka és a bevétel gyorsabban növekedhet, mint a kiszolgálás költsége. Ez a szélesebb körű elfogadást és a jobb modellekbe, termékekbe és infrastruktúrába irányuló folyamatos beruházást is támogathatja. A gyorsabb inferencia gyorsabb iterációt és új felhasználási lehetőségeket tesz lehetővé.

Jalapeño kibővíti a hatékony, alacsony késleltetésű inferencia lehetőségeit:

  • Ultragyors módú következtetés, a korábban csak gyors módban elérhető hatékonysággal
  • Gyors módú következtetés korábban csak kötegelt módban elérhető hatékonysággal
  • Nagyobb hatékonyság a kötegelt módú inferenciához

Terveink szerint az év végéig megkezdjük a Jalapeño bevezetését az OpenAI számítási infrastruktúrájában. Ez egy több generáción átívelő ütemterv első generációja: a 2. generáció javában fejlesztés alatt áll, a 3. generáció pedig már körvonalazódik. Minden generáció arra épít majd, amit megtanulunk, és tovább javítja mind a hatékonyságot, mind a sebességet.

Az AI iránti növekvő kereslet kielégítéséhez minden elérhető forrásból több számítási kapacitásra lesz szükség. Továbbra is széles körben fogunk NVIDIA és más partnerek gyorsítóit alkalmazni mind a betanítási, mind az inferenciai munkaterhelésekhez. Küldetésünk annak biztosítása, hogy a mesterséges általános intelligencia az egész emberiség javát szolgálja.

Miközben a bevezetésre készülünk, folytatjuk az éles üzembe helyezéshez szükséges minősítést, továbbfejlesztjük a szoftvert, felkészülünk a Jalapeño nagyléptékű üzemeltetésére, és több modellen is validáljuk a teljesítményt. Az eddigi eredmények megmutatják, mi lehetséges, ha a teljes rendszert együtt tervezzük meg: gyorsabban reagáló, nagyobb képességű és ügynökalapú MI, amelyet hatékonyabban juttatunk el több emberhez.

Függelék

A Jalapeño élvonalbeli a GPT‑OSS 120B esetében

ADATÁTVITELI EGYSÉG/kW ÉLVONALBELI

InferenceX · GPT‑OSS‑120B · névleges 8k/1k · STP · csomag TDP: Jalapeño 700 W; GB200 1200 W

A Jalapeño vezet a GPT‑OSS működési pontjain

CSÚCS- ÉS ILLESZTETT ADATÁTVITELI EGYSÉG

InferenceX · GPT‑OSS‑120B · névleges 8 000/1 000 · STP · csomag TDP: Jalapeño 700 W; GB200 1200 W

Magasabb vegyes csúcs TPS / kW

≈1,9×

85 448 vs. 44 960 vegyes / kW

Alacsonyabb végponttól végpontig tartó késleltetés

≈1,7×

1,03 s vs. 1,80 s

Alacsonyabb minimális TBT

≈2,7×

0,69 vs. 1,87 ms (1459 vs. 535 tok/s/felhasználó)

Nagyobb adatátviteli egység az előző TBT-nél

≈53.7×

22 935 vs. 427 vegyes / kW (535,28 tok/s/felhasználó mellett)

A Jalapeño élvonalbeli a DeepSeek R1 670B esetében

ADATÁTVITELI EGYSÉG/kW ÉLVONALBELI

InferenceX · DeepSeek R1 MXFP4 · névleges 8k/1k · STP · csomag TDP: Jalapeño 700 W; GB300 1400 W

A Jalapeño vezet a DeepSeek R1 működési pontjain

CSÚCS- ÉS ILLESZTETT ADATÁTVITELI EGYSÉG

InferenceX · DeepSeek R1 MXFP4 · névleges 8k/1k · STP · csomag TDP: Jalapeño 700 W; GB300 1400 W

Magasabb csúcsteljesítményű vegyes TPS/kW

≈1,7×

19 641 vs. 11 781 vegyes / kW

Alacsonyabb végponttól végpontig tartó késleltetés

≈3,6×

1,65 s vs. 5,99 s

Alacsonyabb minimális TBT

≈4.1×

1,43 vs. 5.90 ms (700 vs. 169 tok/s/felhasználó)

Nagyobb adatátviteli egység az előző TBT-nél

≈104,3×

12 258 vs. 118 vegyes / kW (169,41 tok/s/felhasználó mellett)

A Jalapeño élvonalbeli a Kimi K2.5 1T esetében

ADATÁTVITELI EGYSÉG/kW ÉLVONALBELI

InferenceX · Kimi K2.5 MXFP4 · névleges 8k/1k · STP · csomag TDP: Jalapeño 700 W; GB300 1400 W

A Jalapeño vezet a Kimi K2.5 összes működési pontjain

CSÚCS- ÉS ILLESZTETT ADATÁTVITELI EGYSÉG

InferenceX · Kimi K2.5 MXFP4 · névleges 8k/1k · STP · csomag TDP: Jalapeño 700 W; GB300 1400 W

Magasabb csúcsteljesítményű vegyes TPS/kW

≈1,5×

18 195 vs. 11 862 kevert / kW

Alacsonyabb végpontok közötti késleltetés

≈3.4×

1,56 s vs. 5,31 s

Alacsonyabb minimális TBT

≈3,8×

1,44 vs. 5.48 ms (694 vs. 182 tok/s/felhasználó)

Nagyobb adatátviteli egység az előző TBT-nél

≈56.1×

6744 vs. 120 vegyes / kW (182,46 tok/s/felhasználó mellett)

Szerző

OpenAI