Jäta vahele ja mine põhisisu juurde
OpenAI

Jalapeño esimesed tulemused näitavad AI järeldamisel tööstuse juhtivat kiirust ja tõhusust

Laadimine…
Lähivõte sinakasrohelisele trükkplaadile paigaldatud Jalapeño järelduskiibist.

Alates Jalapeño — OpenAI esimese kohandatud järelduskiibi — teavitamisest oleme katsetanud kiipi ja selle ümber ehitatud süsteemi. Tulemused näitavad märkimisväärset jõudluse hüpet: Jalapeño suudab teenindada rohkem AI-tööd võimsusühiku kohta, tagastades samal ajal vastused kiiremini. Jalapeño pakub ühe arhitektuuriga nii suuremat läbilaskevõimet kui ka madalamat viivitust, kus olemasolevad riistvarasüsteemid peavad sageli tegema nende kahe vahel järeleandmisi.

Klientide jaoks võib see tähendada kiiremaid vastuseid, reageerimisvõimelisemaid agendisüsteeme ja usaldusväärsemat juurdepääsu nõudluse kasvades. Meie missiooniks on tagada, et üldine tehisintellekt teeniks kogu inimkonna huve. Need edusammud aitavad muuta üha võimekamat tehisintellekti taskukohasemaks ja laiemalt kättesaadavaks.

OpenAI mudelid kiirendasid ka Jalapeño arendamist. Varasemate põlvkondade mudelid aitasid meeskonnal kiibi projekteerida ja tööle võtta, samal ajal kui meie uusimad mudelid kiirendavad selle optimeerimist ja programmeerimist. Jalapeño jõudlus laieneb mudelitele GPT‑OSS 120B, DeepSeek R1 ja Kimi K2.5 1T, näidates, et arhitektuur töötab mudelitel, mis on välja töötatud nii OpenAI sees kui ka väljaspool. Kõigi kolme puhul pakkus Jalapeño 1,5 kuni 1,9 korda rohkem AI-tööd vati kohta tipp-läbilaskevõimel ning 1,7 kuni 3,6 korda madalamat kogu päringu viivitust kui võrdlussüsteemid. Tugevalt interaktiivsete töökoormuste puhul pakkus meile 2,1 kuni 4,1 korda suuremat jõudlust.

Jalapeño annab samuti tunnistust laiemast eelisest kogu tehnoloogiapinu ulatuses. OpenAI saab projekteerida mudeleid, tooteid, teenindustarkvara, kiipe, mälu, võrke ja süsteeme koos, kasutades seda, mida õpime reaalsetest töökoormustest, et parandada pinu iga kihti. Jalapeño on toimiv esimese osapoole ränikiip mõõdetud tulemustega ja see on mitme põlvkonna platvormi algus. Lähikuudel kasvatame Jalapeño mahtusid, et pakkuda oma klientidele kiiremaid, võimekamaid ja tõhusamaid tooteid.

Kuidas me mõõtsime Jalapeño jõudlust

Hindame jõudlust ühtlustatud kasutajakogemuse juures, mõõtes, kui palju kasulikku AI-tööd suudab iga süsteem teha võimsusühiku kohta, vastates samal ajal viivitusele, mida kliendid ja interaktiivsed agendid nõuavad. See on eriti oluline agentide puhul, kes peavad järjestikku sooritama palju samme, nii et viivitused võivad kogu ülesande ulatuses kuhjuda.

Et mõista, kuidas Jalapeño praktikas toimib, testisime seda InferenceX-il, SemiAnalysise avalikul võrdlustestil, mis mõõdab kogu AI-päringu teenindamise protsessi. Võrdlesime Jalapeñot juhtivate turul saadaolevate AI-süsteemidega kogu testitud töövahemikus, alates suure läbilaskevõimega teenindamisest kuni tugevalt interaktiivse ja madala viivitusega kasutuseni. Jalapeño pakkus paremat kombinatsiooni läbilaskevõimest, energiatõhususest ja viivitusest. Kuigi jõudlust esitatakse mõnikord kiibi kohta, usume, et kasulikum standard on jõudlus võimsusühiku kohta.

Jalapeño suurendab edumaad eelmise parima TBT juures

Jalapeño annab rohkem tokeneid kasutaja kohta

Jalapeño annab rohkem läbilaskevõimet kilovati kohta

Kõigi kolme avaliku mudeli puhul pakkus Jalapeño testitud töövahemikus paremat kombinatsiooni jõudlusest vati kohta ja viivitusest, asetudes Pareto tipptasemele. Süsteemide järjepidevaks võrdlemiseks normaliseerisime tulemused, kasutades iga kiirendi avaldatud kiibi võimsusnäitajat. Jalapeño nimivõimsus on 700 vatti, kuigi selle mõõdetud püsivõimsus jäi testitud töökoormustel 550 vatini või alla selle.

Jalapeño toimis hästi mudelite GPT‑OSS 120B, DeepSeek R1 670B ja Kimi K2.5 1T puhul. Kimi puhul, mis oli suurim meie testitud avalik mudel, pakkus see umbes 1,5 korda suuremat tipp-jõudlust vati kohta ja 3,4 korda madalamat kogu päringu viivitust kui võrdlussüsteem. Meie sisekatsetes suurenes Jalapeño eelis veelgi OpenAI tippmudelitel, mis viitab sellele, et arhitektuur muutub veelgi väärtuslikumaks, kui töökoormused kasvavad suuremaks ja nõudlikumaks.

Kiiruse ja tõhususe projekteerimine ühe kiibi sees

Jalapeño projekteerimist alustati küsimusega: millise riistvara sa ehitaksid, kui selle peamine ülesanne oleks tänapäevaste ja tulevaste keelemudelite, eriti interaktiivsete agendisüsteemide teenindamine? Jalapeño võidud tulevad sellest, et projekteerisime kiibi, mälu, võrgu, tarkvara ja püstikupõhise süsteemi koos, lähtudes reaalsetest keelemudelite töökoormustest. Keelemudeli järeldusprotsess läbib mitu eri etappi, millel on erinevad pudelikaelad. Eeltäitmine, kui süsteem töötleb sisendviipa, on arvutusintensiivne, samas kui dekodeerimine, kui süsteem genereerib vastust token-tokeni haaval, on piiratud pigem mälu ribalaiusega. Side võib samuti lisada viivitust, kui andmed peavad liikuma tuumade ja kiipide vahel, jättes mõned töötlemisüksused ootamise ajaks jõude. Süsteem, mis on suurepärane ühes etapis, võib kaotada selle eelise, kui ootad andmeid või liigutad mudeli olekut erinevate ressursside vahel.

Projekteerisime Jalapeño nii, et see minimeeriks andmete liikumist ja sideviivitusi. See tähendab, et mudeli olekut, sealhulgas vastuse genereerimisel kasutatavat KV-vahemälu, saab selgelt paigutada ja hoida kohalikuna, samal ajal kui süsteem aktiveerib iga järeldusetapi jaoks õige arvutus-, mälu- ja võrguressursside kombinatsiooni. Võrk on arhitektuuri lahutamatu osa. Selle suur ulatus võimaldab kogu töökoormusel jääda ühte ühendatud süsteemi, vähendades andmete liikumist ja aidates kogu päringul algusest lõpuni kiiresti ja tõhusalt toimida. Tulemuseks on tasakaalustatud ja asendatav kiirendi, mis suudab toetada muutuvaid mudeliarhitektuure, olla suurepärane nii eeltäitmisel kui ka dekodeerimisel ning kohaneda nendevahelise tasakaalu muutumisega — mis on agendipõhiste töökoormuste määrav tunnus.

Kasutasime kiibi projekteerimiseks tehisintellekti ja projekteerisime kiibi nii, et AI saaks seda programmeerida

Tehisintellekt mängis Jalapeño arenduses otsest rolli, võimaldades meeskonnal liikuda algsest kavandist tootmisvalmis joonisteni (tapeout) üheksa kuuga, uurides teostusi, lühendades projekteerimis-, mõõtmis- ja verifitseerimistsükleid ning itereerides pidevalt mudelite töökoormustel. Tehisintellekt aitas optimeerida ka kiibi arveahelaid, võimaldades meeskonnal mahutada kiibile graafikujärgselt rohkem arvutusjõudlust.

Jalapeño projekteeriti selgeks ja ettearvatavaks programmeerimise sihtmärgiks nii inimestele kui ka tehisintellektile. Insenerid saavad tööd kirjeldada kohalike tensorite, eksplitsiitse kommunikatsiooni ja etteaimatava sünkroonimise kaudu. Tehisintellekt saab seejärel optimeerida seda, kuidas see töö kogu süsteemis kaardistatakse, paigutatakse, ajastatakse ja koordineeritakse. See selge ja etteaimatav struktuur annab tehisintellektile jõukohase viisi käsitleda paralleelprogrammeerimise traditsiooniliselt keerulist probleemi.

Iga uue mudeliperekonna toetamine nõuab endiselt uusi tuumi ja mudelispetsiifilisi optimeerimisi. Kasutades Codexit koos GPT‑Astraga, viis meeskond kaks kuud enne tähtaega kõrge jõudluseni kolm avatud kaaludega mudelit, mis ei kuulunud Jalapeño algse tootmisplaani hulka. See näitas nii arhitektuuri paindlikkust kui ka kiirust, millega tehisintellekt saab aidata seda programmeerida. Teatud GPT‑OSS‑i tähelepanu- ja ekspertide segu plokkide puhul töötasid tehisintellekti loodud teostused 1,5–1,8 korda kiiremini kui olemasolevad ekspertide kirjutatud teostused. Need arvud käivad valitud plokkide, mitte kogu mudeli kohta, kuid need viitavad võimsale uuele arendustsüklile.

Edasine tee tõhusa ja ülikiire tehisintellekti järeldusmootori suunas

Tehisintellekti taristu on väärtuslik tänu kasulikule reaalse maailma tööle, mida see võimaldab. Tootes sama võimsuse ja riistvara juures rohkem kasulikku tööd, aitab Jalapeño meil teenindada suuremat nõudlust ja vähendada edukate tulemuste saavutamise kulusid. OpenAI jaoks võib see parandada tegevusvõimendust, võimaldades kasulikul tööl ja tulul kasvada kiiremini kui teeninduskulud. See võib toetada ka laiemat kasutuselevõttu ja jätkuvaid investeeringuid parematesse mudelitesse, toodetesse ja taristusse. Kiirem järeldamine võimaldab kiiremat iteratsiooni ja uusi kasutusjuhte.

Jalapeño laiendab võimaluste piire tõhusa ja madala viivitusega järeldamise valdkonnas:

  • Ülikiire režiimiga järeldamine tõhususega, mis oli varem kättesaadav ainult kiirrežiimis
  • Kiirrežiimiga järeldamine tõhususega, mis oli varem kättesaadav ainult pakettrežiimis
  • Suurem tõhusus pakettrežiimiga järeldamisel

Plaanime alustada Jalapeño juurutamist OpenAI arvutustaristus aasta lõpuks. See on mitme põlvkonna teekaardi esimene põlvkond: 2. põlvkond on süvaarenduses ja 3. põlvkond võtab kuju. Iga põlvkond tugineb õpitule ning edendab veelgi nii tõhusust kui ka kiirust.

Kasvava nõudluse rahuldamine tehisintellekti järele nõuab rohkem arvutusvõimsust igast olemasolevast allikast. Jätkame NVIDIA ja teiste partnerite kiirendite laialdast kasutamist nii treenimise kui ka järeldamise töökoormuste jaoks. Meie missiooniks on tagada, et üldine tehisintellekt teeniks kogu inimkonna huve.

Juurutamiseks valmistudes jätkame tootmiskvalifitseerimist, täiustame tarkvara, valmistume Jalapeñot suures mahus käitama ja valideerime toimivust rohkemates mudelites. Senised tulemused näitavad, mis on võimalik, kui kavandame kogu süsteemi koos: reageerimisvõimelisem, võimekam ja agentne tehisintellekt jõuab tõhusamalt rohkemate inimesteni.

Lisa

Jalapeño on Pareto tipptasemel mudeliga GPT‑OSS 120B

LÄBILASKEVÕIME kW KOHTA – TIPPTASEMEL

InferenceX · GPT‑OSS‑120B · nominaalne 8k/1k · STP · paketi TDP: Jalapeño 700 W; GB200 1200 W

Jalapeño on juhtpositsioonil kõigis GPT‑OSS tööpunktides

TIPP- JA VÕRRELDAV LÄBILASKEVÕIME

InferenceX · GPT‑OSS‑120B · nominaalne 8k/1k · STP · paketi TDP: Jalapeño 700 W; GB200 1200 W

Suurem tipp-segatud TPS / kW

≈1,9×

Suurem tipp-segatud TPS / kW

Madalam kogu päringu viivitus

≈1,7×

1,03 s vs 1,80 s

Madalam minimaalne TBT

≈2,7×

0,69 vs 1,87 ms (1459 vs 535 tokenit/s/kasutaja)

Suurem läbilaskevõime eelmise TBT juures

≈53,7×

22 935 vs 427 segatud / kW (kiirusel 535,28 tokenit/s/kasutaja)

Jalapeño on Pareto tipptasemel mudeliga DeepSeek R1 670B

LÄBILASKEVÕIME kW KOHTA – TIPPTASEMEL

InferenceX · DeepSeek R1 MXFP4 · nominaalne 8k/1k · STP · paketi TDP: Jalapeño 700 W; GB300 1400 W

Jalapeño on juhtpositsioonil kõigis DeepSeek R1 tööpunktides

TIPP- JA VÕRRELDAV LÄBILASKEVÕIME

InferenceX · DeepSeek R1 MXFP4 · nominaalne 8k/1k · STP · paketi TDP: Jalapeño 700 W; GB300 1400 W

Suurem tipp-segatud TPS / kW

≈1,7×

19 641 vs 11 781 segatud / kW

Madalam kogu päringu viivitus

≈3,6×

1,65 s vs 5,99 s

Madalam minimaalne TBT

≈4,1×

1,43 vs 5,90 ms (700 vs 169 tokenit/s/kasutaja)

Suurem läbilaskevõime eelmise TBT juures

≈104,3×

12 258 vs 118 segatud / kW/kW (kiirusel 169,41 tokenit/s/kasutaja)

Jalapeño on Pareto tipptasemel mudeliga Kimi K2.5 1T

LÄBILASKEVÕIME kW KOHTA – TIPPTASEMEL

InferenceX · Kimi K2.5 MXFP4 · nominaalne 8k/1k · STP · paketi TDP: Jalapeño 700 W; GB300 1400 W

Jalapeño on juhtpositsioonil kõigis Kimi K2.5 tööpunktides

TIPP- JA VÕRRELDAV LÄBILASKEVÕIME

InferenceX · Kimi K2.5 MXFP4 · nominaalne 8k/1k · STP · paketi TDP: Jalapeño 700 W; GB300 1400 W

Suurem tipp-segatud TPS / kW

≈1,5×

18 195 vs 11 862 segatud / kW

Madalam kogu päringu viivitus

≈3,4×

1,56 s vs 5,31 s

Madalam minimaalne TBT

≈3,8×

1,44 vs 5,48 ms (694 vs 182 tokenit/s/kasutaja)

Suurem läbilaskevõime eelmise TBT juures

≈56,1×

6744 vs 120 segatud / kW (kiirusel 182,46 tokenit/s/kasutaja)

Autor

OpenAI