Първите резултати на Jalapeño показват водещи за индустрията скорост и ефективност при ИИ инференция

Откакто обявихме Jalapeño — първия специално разработен от OpenAI чип за инференция — тестваме чипа и изградената около него система. Резултатите показват значителен напредък в производителността: Jalapeño може да обработва повече задачи с ИИ на единица мощност и същевременно да връща отговорите по-бързо. Jalapeño осигурява едновременно по-висока производителност и по-ниска латентност с една архитектура, докато при съществуващите хардуерни системи често се налага компромис между двете.
За клиентите това може да означава по-бързи отговори, по-отзивчиви агенти и по-надежден достъп с нарастването на търсенето. Нашата мисия е да гарантираме, че изкуственият общ интелект е от полза за цялото човечество. Тези подобрения ще помогнат все по-способният ИИ да стане по-достъпен като цена и за по-широк кръг хора.
Моделите на OpenAI също ускориха разработването на Jalapeño. По-ранните поколения помогнаха на екипа да проектира и въведе чипа в действие, а най-новите ни модели ускоряват оптимизирането и програмирането му. Високата производителност на Jalapeño се запазва при GPT‑OSS 120B, DeepSeek R1 и Kimi K2.5 1T, което показва, че архитектурата работи с модели, разработени както в OpenAI, така и извън компанията. При трите модела Jalapeño извърши от 1,5 до 1,9 пъти повече работа с ИИ на ват при пикова производителност и постигна от 1,7 до 3,6 пъти по-ниска обща латентност от системите за сравнение. При натоварвания с висока интерактивност той постигна от 2,1 до 4,1 пъти по-висока производителност.
Jalapeño е доказателство и за по-широкото предимство на цялостния технологичен стек. OpenAI може да проектира съвместно моделите, продуктите, софтуера за обслужване, чиповете, паметта, мрежовата инфраструктура и системите, като използва наученото от реалните натоварвания, за да подобрява всеки слой на стека. Jalapeño е работещ собствен силициев чип с измерени резултати и поставя началото на платформа, която ще обхване няколко поколения. През следващите месеци ще разширим внедряването на Jalapeño, за да предоставяме на клиентите си по-бързи, по-способни и по-ефективни продукти.
Оценяваме производителността при съпоставимо потребителско изживяване, като измерваме колко полезна работа с ИИ може да извърши всяка система на единица мощност, при спазване на изискванията за латентност на клиентите и интерактивните агенти. Това е особено важно за агентите, които трябва да изпълняват последователно множество стъпки, поради което забавянията могат да се натрупат в рамките на цялата задача.
За да разберем как се представя Jalapeño на практика, го тествахме с InferenceX — публичен бенчмарк на SemiAnalysis, който измерва целия процес на обслужване на заявка към ИИ. Сравнихме Jalapeño с водещи налични на пазара системи за ИИ в целия тестван диапазон от работни режими — от обслужване с висока производителност до силно интерактивна работа с ниска латентност. Jalapeño постигна по-добра комбинация от производителност, енергийна ефективност и латентност. Макар че производителността понякога се отчита на чип, смятаме, че по-полезният показател е производителността на единица мощност.
При трите общодостъпни модела Jalapeño постигна по-добра комбинация от производителност на ват и латентност в целия тестван диапазон от работни режими, което го поставя на границата на Парето. За да сравним системите последователно, нормализирахме резултатите според публикуваната номинална мощност на всеки ускорител. Номиналната мощност на Jalapeño е 700 вата, въпреки че измерената му постоянна консумация при тестваните натоварвания не надвишаваше 550 вата.
Jalapeño се представи убедително при GPT‑OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. При Kimi — най-големия общодостъпен модел, който тествахме — Jalapeño постигна приблизително 1,5 пъти по-висока пикова производителност на ват и 3,4 пъти по-ниска обща латентност от системата за сравнение. При вътрешните ни тестове предимството на Jalapeño нарасна още повече при авангардните модели на OpenAI. Това показва, че архитектурата става по-ценна с увеличаването на мащаба и сложността на натоварванията.
Jalapeño е проектиран от самото начало около въпроса: какъв хардуер бихме създали, ако основната му задача е да обслужва съвременните и бъдещите езикови модели, особено интерактивните агенти? Предимствата на Jalapeño произтичат от съвместното проектиране на чипа, паметта, мрежата, софтуера и системата на ниво шкаф според реалните натоварвания на езиковите модели. Инференцията при езиковите модели преминава през няколко отделни фази с различни тесни места. Фазата на предварителна обработка, в която системата обработва подканата, изисква значителни изчислителни ресурси, докато декодирането, при което системата генерира отговора токен по токен, е ограничено в по-голяма степен от пропускателната способност на паметта. Обменът на данни също може да увеличи латентността, когато данните трябва да се прехвърлят между ядра и чипове, при което част от изчислителните блокове остават неактивни, докато чакат. Система, която се представя отлично в една фаза, може да изгуби това предимство, докато чака данни или прехвърля състоянието на модела между различни ресурси.
Проектирахме Jalapeño така, че да сведем до минимум прехвърлянето на данни и забавянията при комуникацията. Това означава, че състоянието на модела, включително KV кешът, използван при генерирането на отговор, може да бъде разположено целенасочено и запазено локално, докато системата активира подходящата комбинация от изчислителни ресурси, памет и мрежови ресурси за всяка фаза на инференцията. Мрежата е неразделна част от архитектурата. Големият ѝ обхват позволява цялото натоварване да остане в рамките на една свързана система. Така се свежда до минимум прехвърлянето на данни и се осигурява бърза и ефективна обработка на цялата заявка от началото до края. Резултатът е балансиран и гъвкав ускорител, чиито ресурси могат да се пренасочват. Той поддържа променящи се архитектури на модели, представя се отлично както при предварителната обработка, така и при декодирането, и се адаптира при промяна на съотношението между тях — определяща характеристика на агентните натоварвания.
ИИ изигра пряка роля в разработването на Jalapeño, като помогна на екипа да премине от първоначалния проект до предаването на окончателния дизайн за производство само за девет месеца. Това стана чрез проучване на различни варианти за реализация, съкращаване на циклите на проектиране, измерване и проверка и непрекъснати итерации спрямо натоварванията на моделите. ИИ помогна и за оптимизирането на аритметичните схеми на чипа, което позволи на екипа да постигне по-висока изчислителна производителност в рамките на чипа, без да изостава от графика.
Jalapeño е проектиран като ясна и предвидима целева платформа за програмиране както от хора, така и от ИИ. Инженерите могат да описват работата чрез локални тензори, изрично зададена комуникация и предвидима синхронизация. След това ИИ може да оптимизира начина, по който работата се разпределя, разполага, планира и координира в цялата система. Тази ясна и предвидима структура дава на ИИ практически приложим начин да се справи с традиционно трудния проблем на паралелното програмиране.
Поддръжката на всяко ново семейство модели все още изисква нови изчислителни ядра и оптимизации, съобразени с конкретния модел. Използвайки Codex с GPT‑Astra, екипът постигна висока производителност само за два месеца при три модела с отворени тегла, които не бяха включени в първоначалния производствен план за Jalapeño. Това показа както гъвкавостта на архитектурата, така и скоростта, с която ИИ може да ни помага да я програмираме. При избрани блокове за внимание и „смес от експерти“ в GPT‑OSS реализациите, генерирани от ИИ, работеха от 1,5 до 1,8 пъти по-бързо от съществуващите реализации, написани от специалисти. Тези стойности се отнасят за избраните блокове, а не за целия модел, но сочат към мощен нов цикъл на разработка.
Инфраструктурата за ИИ е ценна заради полезната работа в реални условия, която прави възможна. Като извлича повече полезна работа при същото енергопотребление и със същия хардуер, Jalapeño може да ни помогне да посрещнем по-голямо търсене и да намалим разходите за постигането на успешен резултат. За OpenAI това може да подобри оперативния ливъридж, като позволи на обема на полезната работа и на приходите да нарастват по-бързо от разходите за обслужване. То може също да подпомогне по-широкото внедряване и продължаващите инвестиции в по-добри модели, продукти и инфраструктура. По-бързата инференция може да ускори итерациите и да направи възможни нови приложения.
Jalapeño разширява възможностите за ефективна инференция с ниска латентност:
- Инференция в свръхбърз режим при нива на ефективност, досега постижими само в бърз режим
- Инференция в бърз режим при нива на ефективност, досега постижими само в пакетен режим
- По-висока ефективност при инференс в пакетен режим
Планираме да започнем внедряването на Jalapeño в изчислителната инфраструктура на OpenAI до края на годината. Това е първото поколение от план, обхващащ няколко поколения: второто поколение вече е в напреднал етап на разработка, а третото започва да придобива форма. Всяко следващо поколение ще надгражда наученото и допълнително ще подобрява както ефективността, така и скоростта.
За да отговорим на нарастващото търсене на ИИ, ще са необходими повече изчислителни ресурси от всички налични източници. Ще продължим да внедряваме в голям мащаб ускорители от NVIDIA и други партньори както за обучение, така и за инференция. Нашата мисия е да гарантираме, че изкуственият общ интелект е от полза за цялото човечество.
Докато се подготвяме за внедряването, продължаваме квалификационните изпитвания за серийно производство, усъвършенстваме софтуера, подготвяме използването на Jalapeño в голям мащаб и проверяваме производителността му с още модели. Резултатите досега показват какво е възможно, когато проектираме цялата система като едно цяло: по-отзивчив и по-способен агентен изкуствен интелект, който достига по-ефективно до повече хора.
ГРАНИЦА НА ПРОИЗВОДИТЕЛНОСТТА НА kW
InferenceX · GPT‑OSS‑120B · номинално 8k/1k · STP · TDP на пакета: Jalapeño — 700 W; GB200 — 1200 W
ПИКОВА И СЪПОСТАВЕНА ПРОИЗВОДИТЕЛНОСТ
InferenceX · GPT‑OSS‑120B · номинално 8k/1k · STP · TDP на пакета: Jalapeño — 700 W; GB200 — 1200 W
По-висок пиков TPS на kW при смесени токени
≈1,9×
85 448 спрямо 44 960 смесени токена/kW
По-ниска обща латентност
≈1,7×
1,03 сек спрямо 1,80 сек
По-ниска мин. стойност на TBT
≈2,7×
0,69 спрямо 1,87 мс (1459 спрямо 535 токена/сек/потребител)
По-висока производителност при предишното TBT
≈53,7×
22 935 срещу 427 смесени / kW (при 535,28 tok/s/user)
ГРАНИЦА НА ПРОИЗВОДИТЕЛНОСТТА НА kW
InferenceX · DeepSeek R1 MXFP4 · номинално 8k/1k · STP · TDP на пакета: Jalapeño 700 W; GB300 1 400 W
ПИКОВА И СЪПОСТАВЕНА ПРОИЗВОДИТЕЛНОСТ
InferenceX · DeepSeek R1 MXFP4 · номинално 8k/1k · STP · TDP на пакета: Jalapeño 700 W; GB300 1 400 W
По-висок пиков TPS на kW при смесени токени
≈1,7×
19 641 спрямо 11 781 смесени токена/kW
По-ниска обща латентност
≈ 3,6 ×
1,65 сек. спрямо 5,99 сек.
По-ниска мин. стойност на TBT
≈4,1×
1,433 спрямо 5,90 мс (700 спрямо 169 ток/сек/потребител)
По-висока производителност при предишното TBT
≈104,3×
12 258 срещу 118 смесени/кВт (при 169,41 ток/сек/потребител)
ГРАНИЦА НА ПРОИЗВОДИТЕЛНОСТТА НА kW
InferenceX · Kimi K2.5 MXFP4 · номинално 8k/1k · STP · TDP на пакета: Jalapeño 700 W; GB300 1 400 W
ПИКОВА И СЪПОСТАВЕНА ПРОИЗВОДИТЕЛНОСТ
InferenceX · Kimi K2.5 MXFP4 · номинално 8k/1k · STP · TDP на пакета: Jalapeño 700 W; GB300 1 400 W
По-висок пиков TPS на kW при смесени токени
≈ 1,5 ×
18 195 спрямо 11 862 смесени токена/kW
По-ниска обща латентност
≈ 3,4 ×
1,56 сек спрямо 5,31 сек
По-ниска мин. стойност на TBT
≈3,8×
1,44 спрямо 5,48 мс (694 спрямо 182 ток/сек/потребител)
По-висока производителност при предишното TBT
≈ 56,1 ×
6744 спрямо 120 смесени токена/kW (при 182,46 токена/сек/потребител)


