Пређите на главни садржај
OpenAI

Први резултати система Jalapeño показују водећу брзину и ефикасност AI инференса.

Учитавање…
Крупни план Jalapeño чипа за инференс постављеног на тиркизну штампану плочу.

Откако смо представили Jalapeño, први прилагођени чип за инференс компаније OpenAI, тестирамо чип и систем изграђен око њега. Резултати показују значајан напредак у перформансама: Jalapeño може да обради више задатака вештачке интелигенције по јединици снаге, а истовремено брже враћа одговоре. Jalapeño једном архитектуром обезбеђује и већу пропусност и мању латенцију, док постојећи хардверски системи често морају да бирају између те две предности.

За клијенте то може да значи брже одговоре, агенте који брже реагују и поузданији приступ како потражња расте. Наша мисија је да осигурамо да општа вештачка интелигенција буде од користи целом човечанству. Ова побољшања ће помоћи да све способнија вештачка интелигенција буде приступачнија и шире доступна.

OpenAI модели су такође убрзали развој система Jalapeño. Раније генерације помогле су тиму да дизајнира и покрене чип, док наши најновији модели убрзавају начин на који га оптимизујемо и програмирамо. Учинак система Jalapeño остварује се на моделима GPT‑OSS 120B, DeepSeek R1 и Kimi K2.5 1T, што показује да архитектура функционише на моделима развијеним и унутар и изван компаније OpenAI. У сва три случаја, Jalapeño је при максималној пропусности пружио 1,5 до 1,9 пута више AI рада по вату и 1,7 до 3,6 пута мању латенцију од почетка до краја у односу на упоредне системе. За високо интерактивна радна оптерећења постигао је од 2,1 до 4,1 пута веће перформансе.

Jalapeño је такође доказ шире предности интегрисаног приступа кроз цео стек. OpenAI може заједно да пројектује моделе, производе, софтвер за сервирање, чипове, меморију, умрежавање и системе, користећи оно што сазнајемо из стварних радних оптерећења да бисмо унапредили сваки слој стека. Jalapeño је силицијум развијен унутар компаније, са измереним резултатима, и представља почетак платформе која ће се развијати кроз више генерација. У наредним месецима постепено ћемо уводити Jalapeño у ширу употребу како бисмо корисницима понудили брже, способније и ефикасније производе.

Како смо мерили перформансе система Jalapeño

Перформансе оцењујемо при усклађеном корисничком искуству, мерећи колико корисног рада вештачке интелигенције сваки систем може да обави по јединици снаге, уз испуњавање захтева у погледу латенције које имају клијенти и интерактивни агенти. Ово је посебно важно за агенте, који морају да изврше много корака редом, па кашњења могу да се акумулирају током целог задатка.

Да бисмо разумели како Jalapeño функционише у пракси, тестирали смо га на InferenceX-у, јавном бенчмарку компаније SemiAnalysis који мери целокупан процес обраде AI захтева. Упоредили смо Jalapeño са водећим комерцијално доступним AI системима у читавом тестираном опсегу рада, од опслуживања са великом пропусношћу до веома интерактивне употребе са малом латенцијом. Jalapeño је понудио бољу комбинацију пропусности, енергетске ефикасности и латенције. Иако се перформансе понекад исказују по чипу, сматрамо да је кориснија мера перформансе по јединици потрошње енергије.

Jalapeño додатно повећава предност при претходно најбољем TBT-у.

Jalapeño пружа више токена по кориснику

Jalapeño пружа већу пропусну моћ по киловату

Код сва три јавна модела, Jalapeño је у читавом тестираном опсегу рада пружио бољу комбинацију перформанси по вату и латенције, чиме се нашао на Паретоовој граници. Да бисмо доследно упоредили системе, нормализовали смо резултате користећи објављену номиналну снагу чипа сваког акцелератора. Jalapeño има декларисану снагу од 700 вати, иако је његова измерена континуирана снага остала на нивоу од 550 вати или ниже при тестираним радним оптерећењима.

Jalapeño је показао добре перформансе на моделима GPT‑OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. На моделу Kimi, највећем јавном моделу који смо тестирали, Jalapeño је постигао приближно 1,5 пута веће максималне перформансе по вату и 3,4 пута мању латенцију од почетка до краја у односу на упоредни систем. У нашим интерним тестирањима, предност система Jalapeño била је још већа на најнапреднијим OpenAI моделима, што указује на то да архитектура постаје вреднија како радна оптерећења постају већа и захтевнија.

Пројектовање једног чипа с циљем постизања брзине и ефикасности

Jalapeño је од почетка осмишљен полазећи од питања: какав бисмо хардвер направили када би његов примарни задатак био опслуживање савремених и будућих језичких модела, нарочито интерактивних заступника? Предности које доноси Jalapeño резултат су заједничког пројектовања чипа, меморије, мреже, софтвера и система на нивоу целог ормана, при чему су сви они осмишљени око стварних радних оптерећења језичких модела. Инференс језичког модела одвија се кроз неколико различитих фаза, од којих свака има различита уска грла. Предпопуњавање, када систем обрађује инструкцију, захтева велику рачунарску снагу, док је декодирање, када систем генерише одговор токен по токен, више ограничено пропусним опсегом меморије. Комуникација такође може да повећа латенцију када подаци морају да се преносе између језгара и чипова, због чега неке процесорске јединице остају неактивне док чекају. Систем који се истиче у једној фази може изгубити ту предност док чека податке или премешта стање модела између различитих ресурса.

Дизајнирали смо Jalapeño тако да сведе на минимум кретање података и кашњења у комуникацији. То значи да стање модела, укључујући KV кеш који се користи током генерисања одговора, може бити експлицитно постављено и задржано локално, док систем за сваку фазу инференса активира одговарајућу комбинацију рачунарских ресурса, меморије и мрежних ресурса. Мрежа је саставни део архитектуре. Његов велики домен омогућава да целокупно радно оптерећење остане унутар једног повезаног система, чиме се смањује пренос података и доприноси томе да цео захтев буде брз и ефикасан од почетка до краја. Резултат је уравнотежен и флексибилан акцелератор који може да подржи променљиве архитектуре модела, одлично функционише и при предпопуњавању и при декодирању и прилагоди се како се мења равнотежа између њих, што је карактеристика агентских радних оптерећења.

Користили смо вештачку интелигенцију да дизајнирамо чип, а чип смо дизајнирали тако да вештачка интелигенција може да га програмира

Вештачка интелигенција је имала директну улогу у развоју система Jalapeño, омогућивши тиму да од почетног дизајна до припреме за производњу чипа стигне за девет месеци, истраживањем различитих имплементација, скраћивањем циклуса пројектовања, мерења и верификације и континуираним итеративним радом на радним оптерећењима модела. Вештачка интелигенција је такође помогла у оптимизацији аритметичких кола чипа, омогућивши тиму да у предвиђеном року постигне већу рачунарску перформансност чипа.

Jalapeño је пројектован као јасна и предвидљива платформа за програмирање, како за људе тако и за вештачку интелигенцију. Инжењери могу да опишу рад помоћу локалних тензора, експлицитне комуникације и предвидиве синхронизације. Вештачка интелигенција затим може да оптимизује начин на који се тај рад мапира, поставља, заказује и координише у целом систему. Та јасна, предвидљива структура даје вештачкој интелигенцији приступачан начин да се ухвати у коштац са традиционално тешким проблемом паралелног програмирања.

Подршка свакој новој породици модела и даље захтева нова језгра и оптимизације специфичне за модел. Користећи Codex са моделом GPT‑Astra, тим је за два месеца постигао високе перформансе на три модела са отвореним пондерима који нису били део првобитног плана производње за Jalapeño. Ово је показало и флексибилност архитектуре и брзину којом нам вештачка интелигенција може помоћи да је програмирамо. За одабране блокове механизма пажње и мешавине стручњака у моделу GPT‑OSS, имплементације генерисане помоћу вештачке интелигенције радиле су 1,5 до 1,8 пута брже од постојећих имплементација које су написали стручни људски програмери. Ове бројке односе се на одабране блокове, а не на цео модел, али указују на моћан нови развојни циклус.

Пут ка ефикасном, ултрабрзом инференсу

Инфраструктура вештачке интелигенције има вредност јер омогућава користан рад у стварном свету. Производећи више корисног рада уз исту потрошњу енергије и исти хардвер, Jalapeño нам може помоћи да одговоримо на већу потражњу и смањимо трошкове постизања успешног резултата. За OpenAI то може да побољша оперативну полугу тако што омогућава да користан рад и приходи расту брже од трошкова пружања услуга. Такође може да подржи ширу примену и наставак улагања у боље моделе, производе и инфраструктуру. Бржи инференс може да омогући брже итерације и нове случајеве употребе.

Jalapeño помера границе могућег за ефикасан, нисколатентан инференс:

  • Инференс у ултрабрзом режиму уз ефикасност која је раније била доступна само у брзом режиму.
  • Инференс у брзом режиму уз ефикасност која је раније била доступна само у пакетном режиму.
  • Висока ефикасност за инференс у пакетном режиму

Планирамо да до краја године започнемо примену система Jalapeño у OpenAI рачунарској инфраструктури. То је прва генерација вишегенерацијског плана развоја: друга генерација је у поодмаклој фази развоја, а трећа генерација поприма обрисе. Свака генерација ће се надовезивати на наша сазнања и додатно унапређивати и ефикасност и брзину.

Задовољавање све веће потражње за вештачком интелигенцијом захтеваће више рачунарских ресурса из свих доступних извора. Наставићемо да у великој мери користимо акцелераторе компаније NVIDIA и других партнера за радне задатке обуке и инференса. Наша мисија је да осигурамо да општа вештачка интелигенција буде од користи целом човечанству.

Док се припремамо за примену, настављамо са квалификацијом у производном окружењу, усавршавамо софтвер, припремамо се за рад система Jalapeño у великом обиму и проверавамо перформансе на већем броју модела. Досадашњи резултати показују шта је могуће када заједно осмишљавамо цео систем: респонзивнији, способнији и агентски AI који се ефикасније испоручује већем броју људи.

Додатак

Jalapeño представља Паретоову границу за GPT‑OSS 120B

ГРАНИЧНА ПРОПУСНА МОЋ ПО kW

InferenceX · GPT‑OSS‑120B · номинално 8k/1k · STP · TDP пакета: Jalapeño 700 W; GB200 1,200 W

Jalapeño предњачи у свим GPT‑OSS радним тачкама

МАКСИМАЛНА И УСКЛАЂЕНА ПРОПУСНОСТ

InferenceX · GPT‑OSS‑120B · номинално 8k/1k · STP · TDP пакета: Jalapeño 700 W; GB200 1,200 W

Већи максимални мешовити TPS / kW

≈1,9×

85.448 наспрам 44.960 мешовито / kW

Мања латенција од краја до краја

≈1,7×

1,03 s наспрам 1,80 s

Мањи минимални TBT

≈2,7×

0,69 наспрам 1,87 ms (1.459 наспрам 535 токена/s/кориснику)

Већа пропусност при претходној вредности TBT-а

≈53,7×

22.935 наспрам 427 мешовито / kW (при 535,28 токена/с/кориснику)

Jalapeño представља Паретоову границу за DeepSeek R1 670B.

ГРАНИЧНА ПРОПУСНА МОЋ ПО kW

InferenceX · DeepSeek R1 MXFP4 · номинално 8k/1k · STP · TDP пакета: Jalapeño 700 W; GB300 1,400 W

Jalapeño предњачи у свим радним тачкама модела DeepSeek R1

МАКСИМАЛНА И УСКЛАЂЕНА ПРОПУСНОСТ

InferenceX · DeepSeek R1 MXFP4 · номинално 8k/1k · STP · TDP пакета: Jalapeño 700 W; GB300 1,400 W

Већи максимални мешовити TPS / kW

≈1,7×

19.641 наспрам 11.781 мешовито / kW

Мања латенција од краја до краја

≈3,6×

1,65 s наспрам 5,99 s

Мањи минимални TBT

≈4.1×

1,43 наспрам 5,90 ms (700 наспрам 169 токена/с/кориснику)

Већа пропусност при претходној вредности TBT-а

≈104,3×

22.935 наспрам 427 мешовито / kW (при 535,28 токена/с/кориснику)

Jalapeño представља Паретоову границу за Kimi K2.5 1T

ГРАНИЧНА ПРОПУСНА МОЋ ПО kW

InferenceX · Kimi K2.5 MXFP4 · номинално 8.000/1.000 · STP · TDP пакета: Jalapeño 700 W; GB300 1.400 W

Jalapeño предњачи у свим радним тачкама модела Kimi K2.5

МАКСИМАЛНА И УСКЛАЂЕНА ПРОПУСНОСТ

InferenceX · Kimi K2.5 MXFP4 · номинално 8.000/1.000 · STP · TDP пакета: Jalapeño 700 W; GB300 1.400 W

Већи максимални мешовити TPS / kW

≈1,5×

18.195 у односу на 11.862 мешовито / kW

Мања латенција од краја до краја

≈3,4×

1,56 s наспрам 5,31 s

Мањи минимални TBT

≈3,8×

1,44 наспрам 5,48 ms (694 наспрам 182 токена/с/кориснику)

Већа пропусност при претходној вредности TBT-а

≈56,1×

6.744 у односу на 120 мешовито / kW (при 182,46 токена/с/кориснику)

Аутор

OpenAI