Прескокни до главната содржина
OpenAI

Првите резултати на Jalapeño покажуваат водечка брзина и ефикасност во инференцијата на ВИ

Се вчитува...
Крупен кадар од чипот за инференција Jalapeño, монтиран на тиркизна печатена плоча.

Откако го најавивме Jalapeño, првиот прилагоден чип за инференција на OpenAI, го тестираме чипот и системот изграден околу него. Резултатите покажуваат значителен напредок во перформансите: Jalapeño може да обработува повеќе задачи за вештачка интелигенција по единица потрошена моќност, а истовремено побрзо да враќа одговори. Jalapeño обезбедува и поголем капацитет и помала латентност со една архитектура, додека постојните хардверски системи често мораат да направат компромис меѓу двете.

За клиентите, тоа може да значи побрзи одговори, пореспонзивни агенти и посигурен пристап како што расте побарувачката. Нашата мисија е да обезбедиме општата вештачка интелигенција да биде од корист за целото човештво. Овие подобрувања ќе помогнат сè поспособната вештачка интелигенција да стане поприфатлива по цена и пошироко достапна.

Моделите на OpenAI исто така го забрзаа развојот на Jalapeño. Претходните генерации му помогнаа на тимот да го дизајнира и пушти во работа чипот, додека нашите најнови модели го забрзуваат начинот на кој го оптимизираме и програмираме. Перформансите на Jalapeño се однесуваат на GPT‑OSS 120B, DeepSeek R1 и Kimi K2.5 1 трилион, покажувајќи дека архитектурата функционира кај модели развиени и во и надвор од OpenAI. Кај сите три, Jalapeño испорача 1,5 до 1,9 пати повеќе работа со вештачка интелигенција по вати при максимален капацитет и 1,7 до 3,6 пати помала латентност од почеток до крај во споредба со споредбените системи. За високоинтерактивни работни оптоварувања, постигна 2,1 до 4,1 пати повисоки перформанси.

Jalapeño е и доказ за поширока предност во целосниот стек. OpenAI може заедно да дизајнира модели, производи, софтвер за сервисирање, чипови, меморија, вмрежување и системи, користејќи ги сознанијата од реалните работни оптоварувања за да го подобриме секој слој од целосниот стек. Jalapeño е сопствен силициум со измерени резултати и претставува почеток на повеќегенерациска платформа. Во месеците што следуваат, ќе го засилиме Jalapeño за да испорачаме побрзи, поспособни и поефикасни производи за нашите клиенти.

Како ги измеривме перформансите на Jalapeño

Ги оценуваме перформансите при усогласено корисничко искуство, мерејќи колку корисна работа со вештачка интелигенција може да заврши секој систем по единица моќност, истовремено исполнувајќи ја латентноста што ја бараат клиентите и интерактивните агенти. Ова е особено важно за агентите, кои треба да завршат многу чекори последователно, па доцнењата може да се акумулираат во рамки на целата задача.

За да разбереме како Jalapeño функционира во практика, го тестиравме на InferenceX, јавен референтен тест од SemiAnalysis што го мери целосниот процес на опслужување на барање за вештачка интелигенција. Го споредивме Jalapeño со водечките комерцијално достапни системи со ВИ низ тестираниот работен опсег, од опслужување со висок капацитет до високоинтерактивна употреба со ниска латентност. Jalapeño обезбеди подобра комбинација од капацитет, енергетска ефикасност и латентност. Иако перформансите понекогаш се наведуваат по чип, сметаме дека покорисно мерило се перформансите по единица моќност.

Jalapeño ја зголемува предноста во однос на претходно најдобриот резултат

Jalapeño обезбедува повеќе токени по корисник

Jalapeño обезбедува поголем капацитет по киловат

Во сите три јавни модели, Jalapeño испорача подобра комбинација од перформанси по ват и латентност низ тестираниот работен опсег, со што се најде на Паретова граница. За доследно да ги споредиме системите, ги нормализиравме резултатите користејќи ја објавената номинална моќност на чипот за секој акцелератор. Jalapeño е деклариран на 700 вати, иако неговата измерена континуирана моќност, остана на или под 550 вати при тестираните работни оптоварувања.

Jalapeño покажа добри резултати кај GPT‑OSS 120 милијарди, DeepSeek R1 670 милијарди и Kimi K2.5 1 трилион. Кај Kimi, најголемиот јавен модел што го тестиравме, испорача приближно 1,5 пати повисоки врвни перформанси по ват и 3,4 пати помала латентност од крај до крај во споредба со системот за споредба. Во нашите интерни тестирања, предноста на Jalapeño дополнително се зголеми кај напредните модели на OpenAI, што укажува дека архитектурата станува повредна како што оптоварувањата стануваат поголеми и поинтензивни.

Дизајнирање за брзина и ефикасност во рамките на еден чип

Jalapeño беше дизајниран од самиот почеток со прашањето: каков хардвер би изградиле ако неговата главна задача е да опслужува современи и идни јазични модели, особено интерактивни агенти? Предностите на Jalapeño произлегуваат од заедничкото дизајнирање на чипот, меморијата, мрежата, софтверот и системот на ниво на сталак, прилагоден на реални работни оптоварувања на јазични модели. Инференцијата кај јазичните модели поминува низ неколку различни фази со различни тесни грла. Претходно вчитување, кога системот обработува промпт, е компјутерски интензивно, додека декодирањето, кога системот го генерира одговорот токен по токен, е повеќе ограничено од пропусниот опсег на меморијата. Комуникацијата може исто така да додаде латентност кога податоците мора да се пренесуваат меѓу јадра и чипови, оставајќи ги некои единици за обработка неактивни додека чекаат. Систем што се истакнува во една фаза може да ја изгуби таа предност додека чека податоци или ја пренесува состојбата на моделот меѓу различни ресурси.

Го дизајниравме Jalapeño за да го сведеме на минимум преместувањето на податоци и доцнењата во комуникацијата. Ова значи дека состојбата на моделот, вклучително и KV кеш-меморијата што се користи при генерирање одговор, може експлицитно да се смести и да остане локална, додека системот ја активира вистинската комбинација од пресметковни ресурси, меморија и вмрежување за секоја фаза на инференција. Мрежата е составен дел од архитектурата. Неговиот голем домен овозможува целото работно оптоварување да остане во рамките на еден поврзан систем, со што се минимизира движењето на податоците и се помага целосното пребарување да остане брзо и ефикасно од почеток до крај. Резултатот е урамнотежен и заменлив акцелератор што може да поддржува променливи архитектури на модели, да се истакнува и во претходното пополнување и во декодирањето и да се приспособува како што се менува рамнотежата меѓу нив – клучна карактеристика на агентските оптоварувања.

Користевме ВИ за да го дизајнираме чипот, и го дизајниравме чипот за да може ВИ да го програмира

Вештачката интелигенција одигра директна улога во развојот на Jalapeño, овозможувајќи му на тимот да премине од првичен дизајн до завршување за девет месеци преку истражување на имплементации, скратување на циклусите на дизајн, мерење и верификација и постојано усовршување на работните оптоварувања на моделите. Вештачката интелигенција, исто така, помогна да се оптимизираат аритметичките кола на чипот, овозможувајќи му на тимот да вгради повеќе компјутерска моќ во чипот во предвидениот рок.

Jalapeño беше дизајниран како јасна и предвидлива цел за програмирање и за луѓето и за вештачката интелигенција. Инженерите можат да ја опишат работата преку локални тензори, експлицитна комуникација и предвидлива синхронизација. Вештачката интелигенција потоа може да оптимизира како таа работа се мапира, поставува, распоредува и координира низ системот. Таа јасна, предвидлива структура ѝ дава на вештачката интелигенција изводлив начин да се справи со традиционално тешкиот проблем на паралелното програмирање.

Поддршката за секое ново семејство модели и понатаму бара нови кернели и оптимизации специфични за моделот. Користејќи го Codex со GPT‑Astra, тимот доведе три модели со отворени параметри, кои не беа дел од првичниот производствен план на Jalapeño, до високи перформанси во рок од два месеца. Ова ги покажа и флексибилноста на архитектурата и брзината со која вештачката интелигенција може да ни помогне да ја програмираме. За избрани блокови за внимание и мешавина од експерти на GPT‑OSS, имплементациите генерирани од вештачката интелигенција работеа 1,5 до 1,8 пати побрзо од постојните имплементации напишани од човечки експерти. Тие бројки важат за избраните блокови, а не за целиот модел, но укажуваат на моќен нов циклус на развој.

Патот напред кон ефикасна и ултрабрза инференција

Инфраструктурата за вештачка интелигенција е вредна поради корисната работа во реалноста што ја овозможува. Произведувајќи повеќе корисна работа со иста моќ и хардвер, Jalapeño може да ни помогне да одговориме на поголема побарувачка и да ги намалиме трошоците за постигнување успешен резултат. За OpenAI, тоа може да ја подобри оперативната ефикасност овозможувајќи корисната работа и приходите да растат побрзо од трошоците за опслужување. Исто така, може да поддржи поширока примена и континуирано вложување во подобри модели, производи и инфраструктура. Побрзото заклучување може да овозможи побрзо повторување и нови случаи на употреба.

Jalapeño ги проширува можностите за ефикасна инференција со мала латентност:

  • Изведување во ултрабрз режим со ефикасност што порано беше достапна само во брз режим
  • Инференција во брз режим со ефикасност што претходно беше достапна само во сериски режим
  • Поголема ефикасност при обработка во сериски режим

Планираме да започнеме со распоредување на Jalapeño во рамките на компјутерската инфраструктура на OpenAI до крајот на годината. Тоа е првата генерација од повеќегенерациски патоказ: Gen 2 е во напредна фаза на развој, а Gen 3 почнува да добива облик. Секоја генерација ќе се надоврзува на она што го учиме и дополнително ќе ги унапредува и ефикасноста и брзината.

За да се задоволи растечката побарувачка за вештачка интелигенција, ќе биде потребна поголема пресметувачка моќ од секој достапен извор. Ќе продолжиме широко да распоредуваме збрзувачи од NVIDIA и други партнери за работни оптоварувања за обука и инференција. Нашата мисија е да обезбедиме општата вештачка интелигенција да биде од корист за целото човештво.

Додека се подготвуваме за воведување во употреба, продолжуваме со квалификацијата за продукциска употреба, го доусовршуваме софтверот, се подготвуваме да управуваме со Jalapeño во голем обем и ги потврдуваме перформансите кај поголем број модели. Досегашните резултати покажуваат што е можно кога заедно го проектираме целиот систем: пореспонзивна, поспособна и автономна вештачка интелигенција, поефикасно достапна за повеќе луѓе.

Прилог

Jalapeño е на паретова граница на GPT‑OSS 120 милијарди

ГРАНИЧЕН КАПАЦИТЕТ по киловат

InferenceX · GPT‑OSS‑120 милијарди · номинална моќност 8 илјади /1 илјада · STP · TDP на пакетот: Jalapeño 700 вати; GB200 1.200 вати

Jalapeño е водечки во сите работни точки на GPT‑OSS

МАКСИМАЛЕН И УСОГЛАСЕН КАПАЦИТЕТ

InferenceX · GPT‑OSS‑120 милијарди · номинална моќност 8.000/1.000 · STP · TDP на пакетот: Jalapeño 700 вати; GB200 1.200 вати

Повисок максимум мешан TPS/киловат

≈1,9×

85.448 наспроти 44.960 мешано / киловат

Пониска латентност од крај до крај

≈1,7×

1,03 сек. наспроти 1,80 сек.

Пониска минимална TBT

≈2,7×

0,69 наспроти 1,87 мс (1.459 наспроти 535 токени/сек./корисник)

Поголем капацитет при претходниот TBT

≈53,7×

22.935 наспроти 427 мешано / киловат (при 535,28 токени/сек./корисник)

Jalapeño е на паретова граница кај DeepSeek R1 670 милијарди

ГРАНИЧЕН КАПАЦИТЕТ по киловат

InferenceX · DeepSeek R1 MXFP4 · номинална моќност 8 илјади/1 илјада · STP · TDP на пакетот: Jalapeño 700 вати; GB300 1.400 вати

Jalapeño води низ работните точки на DeepSeek R1

МАКСИМАЛЕН И УСОГЛАСЕН КАПАЦИТЕТ

InferenceX · DeepSeek R1 MXFP4 · номинална моќност 8 илјади/1 илјада · STP · TDP на пакетот: Jalapeño 700 вати; GB300 1.400 вати

Повисок максимум мешан TPS/киловат

≈1,7×

19.641 наспроти 11.781 мешано/киловат

Пониска латентност од крај до крај

≈3,6×

1,65 с наспроти 5,99 сек.

Пониска минимална TBT

≈4.1×

1,43 наспроти 5,90 ms (700 наспроти 169 токени/сек./корисник)

Поголем капацитет при претходниот TBT

≈104,3×

12.258 наспроти 118 мешано / киловат (при 169,41 токени/сек./корисник)

Jalapeño е на паретова граница кај Kimi K2.5 1 трилион

ГРАНИЧЕН КАПАЦИТЕТ по киловат

InferenceX · Kimi K2.5 MXFP4 · номинална моќност 8 илјади/1 илјада · STP · TDP на пакетот: Jalapeño 700 вати; GB300 1.400 вати

Jalapeño води во сите работни точки на Kimi K2.5

МАКСИМАЛЕН И УСОГЛАСЕН КАПАЦИТЕТ

InferenceX · Kimi K2.5 MXFP4 · номинална моќност 8k/1k · STP · TDP на пакетот: Jalapeño 700 вати; GB300 1.400 вати

Повисок максимум мешан TPS/киловат

≈1,5×

18.195 наспроти 11.862 мешано/киловат

Пониска латентност од крај до крај

≈3,4×

1,56 сек. наспроти 5,31 сек.

Пониска минимална TBT

≈3,8×

1,44 наспроти 5,48 мс (694 наспроти 182 токени/сек./корисник)

Поголем капацитет при претходниот TBT

≈56,1×

6.744 наспроти 120 мешано / киловат (при 182,46 токени/сек./корисник)

Автор

OpenAI