Переход к основному контенту
OpenAI

25 августа 2026 г.

ИнженерияКомпания

Первые результаты Jalapeño: ведущие в отрасли показатели скорости и эффективности ИИ-инференса

Загрузка…
Крупный план инференс-чипа Jalapeño, установленного на бирюзовой печатной плате.

С момента анонса Jalapeño, первого специализированного чипа OpenAI для инференса, мы тестировали сам чип и систему, построенную вокруг него. Результаты показывают значительный прирост производительности: Jalapeño может обрабатывать больше задач ИИ на единицу потребляемой мощности и при этом быстрее выдавать ответы. Jalapeño обеспечивает более высокую пропускную способность и меньшую задержку в рамках одной архитектуры, тогда как существующим аппаратным системам часто приходится идти на компромисс между этими двумя показателями.

Для клиентов это может означать более быстрые ответы, более оперативную работу специалистов и более надежный доступ по мере роста спроса. Наша миссия заключается в том, чтобы искусственный интеллект приносил пользу всему человечеству. Эти улучшения помогут сделать ИИ с постоянно расширяющимися возможностями доступнее по цене и для более широкого круга пользователей.

Модели OpenAI также ускорили разработку Jalapeño. Предыдущие поколения помогли команде спроектировать и запустить чип, а наши новейшие модели ускоряют процесс его оптимизации и программирования. Производительность Jalapeño распространяется на GPT‑OSS 120B, DeepSeek R1 и Kimi K2.5 1T, демонстрируя, что архитектура работает с моделями, разработанными как внутри OpenAI, так и за её пределами. Во всех трёх случаях Jalapeño обеспечил в 1,5–1,9 раза больше ИИ-работы на ватт при пиковой пропускной способности и в 1,7–3,6 раза меньшую сквозную задержку, чем сравниваемые системы. Для высокоинтерактивных рабочих нагрузок он обеспечил производительность в 2,1–4,1 раза выше.

Jalapeño также служит подтверждением более широкого преимущества полного стека. OpenAI может совместно проектировать модели, продукты, программное обеспечение для обслуживания, чипы, память, сети и системы, используя знания, полученные из реальных рабочих нагрузок, чтобы улучшать каждый уровень стека. Jalapeño — это работающий собственный кремниевый чип с измеренными результатами и начало платформы на несколько поколений. В ближайшие месяцы мы будем наращивать внедрение Jalapeño, чтобы предлагать нашим клиентам более быстрые, функциональные и эффективные продукты.

Как мы оценивали эффективность работы Jalapeño

Мы оцениваем производительность при сопоставимом пользовательском опыте, измеряя, сколько полезной работы ИИ каждая система может выполнить на единицу потребляемой мощности, соблюдая требования к задержке, предъявляемые клиентами и интерактивными агентами. Это особенно важно для агентов, которым нужно выполнять множество шагов последовательно, поэтому задержки могут накапливаться на протяжении всей задачи.

Чтобы понять, как Jalapeño показывает себя на практике, мы протестировали его на InferenceX — публичном бенчмарке от SemiAnalysis, который измеряет полный процесс обслуживания запроса к ИИ. Мы сравнили Jalapeño с ведущими коммерчески доступными системами ИИ во всём протестированном рабочем диапазоне — от обслуживания с высокой пропускной способностью до высокоинтерактивного использования с низкой задержкой. Jalapeño обеспечил лучшее сочетание пропускной способности, энергоэффективности и задержки. Хотя иногда производительность указывают в расчете на один чип, мы считаем, что более полезным стандартом является производительность на единицу потребляемой мощности.

Jalapeño увеличивает отрыв от предыдущего лучшего TBT

Jalapeño предоставляет больше токенов на одного пользователя

Jalapeño обеспечивает более высокую пропускную способность на киловатт

Среди всех трёх общедоступных моделей Jalapeño продемонстрировала лучшее сочетание производительности на ватт и задержки во всём протестированном рабочем диапазоне, оказавшись на передовой Парето. Чтобы единообразно сравнить системы, мы нормализовали результаты с использованием опубликованной номинальной мощности чипа каждого ускорителя. Номинальная мощность Jalapeño составляет 700 Вт, хотя его измеренная устойчивая мощность не превышала 550 Вт на протестированных нагрузках.

Jalapeño продемонстрировала высокие результаты в GPT‑OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. В случае Kimi самой крупной общедоступной модели из протестированных нами она обеспечила примерно в 1,5 раза более высокую пиковую производительность на ватт и в 3,4 раза меньшую сквозную задержку по сравнению с системой сравнения. В наших внутренних тестах преимущество Jalapeño стало еще более выраженным на передовых моделях OpenAI, что указывает на то, что эта архитектура становится более ценной по мере роста размера и требовательности рабочих нагрузок.

Проектирование для скорости и эффективности на одном микросхеме

Jalapeño с самого начала проектировался с вопроса: какую аппаратную платформу мы бы создали, если бы её основной задачей было обслуживание современных и будущих языковых моделей, особенно интерактивных агентов? Прирост производительности Jalapeño достигается за счёт совместного проектирования чипа, памяти, сети, программного обеспечения и системы уровня стойки, ориентированной на реальные рабочие нагрузки языковых моделей. Вывод языковой модели проходит через несколько чётко различимых этапов с разными узкими местами. Предварительная обработка, когда система обрабатывает промпт, требует больших вычислительных ресурсов, тогда как декодирование, когда система генерирует ответ токен за токеном, в большей степени ограничено пропускной способностью памяти. Обмен данными также может увеличивать задержку, когда данные необходимо перемещать между ядрами и чипами, из-за чего некоторые вычислительные блоки простаивают в ожидании. Система, которая превосходно справляется с одним этапом, может утратить это преимущество в ожидании данных или при перемещении состояния модели между разными ресурсами.

Мы разработали Jalapeño, чтобы минимизировать перемещение данных и задержки связи. Это означает, что состояние модели, включая KV-кэш, используемый при генерации ответа, можно явно размещать и сохранять локально, пока система задействует нужную комбинацию вычислительных ресурсов, памяти и сетевых ресурсов для каждой фазы инференса. Сеть является неотъемлемой частью архитектуры. Ее большая область позволяет всей рабочей нагрузке оставаться в рамках одной связанной системы, сводя к минимуму перемещение данных и помогая всему запросу оставаться быстрым и эффективным от начала до конца. В результате получается сбалансированный и универсальный ускоритель, способный поддерживать меняющиеся архитектуры моделей, эффективно справляться как с предзаполнением, так и с декодированием, а также адаптироваться по мере изменения баланса между ними, что является определяющей особенностью агентных рабочих нагрузок.

Мы использовали ИИ для проектирования чипа и спроектировали чип так, чтобы ИИ мог его программировать

ИИ сыграл непосредственную роль в разработке Jalapeño, позволив команде пройти путь от первоначального проектирования до передачи проекта в производство (tapeout) всего за девять месяцев; это стало возможным благодаря анализу различных вариантов реализации, сокращению циклов проектирования, измерений и верификации, а также непрерывной итеративной доработке рабочих нагрузок для моделей. ИИ также помог оптимизировать арифметические схемы чипа, что позволило команде в срок реализовать в чипе более высокую вычислительную производительность.

Jalapeño создавался как понятная и предсказуемая целевая среда программирования как для людей, так и для ИИ. Инженеры могут описывать работу с помощью локальных тензоров, явного обмена данными и предсказуемой синхронизации. Затем ИИ может оптимизировать то, как эта работа сопоставляется, размещается, планируется и координируется в рамках всей системы. Такая ясная, предсказуемая структура дает ИИ решаемый способ решения традиционно сложной задачи параллельного программирования.

Поддержка каждого нового семейства моделей по-прежнему требует новых ядер и оптимизаций, специфичных для моделей. Используя Codex с GPT‑Astra, команда за два месяца довела до высокой производительности три модели с открытыми весами, которые не входили в первоначальный производственный план Jalapeño. Это продемонстрировало, как гибкость архитектуры, так и скорость, с которой ИИ может помочь нам программировать её. Для отдельных блоков внимания и блоков «смесь экспертов» GPT‑OSS реализации, сгенерированные ИИ, работали от 1,5 до 1,8 раза быстрее, чем существующие реализации, написанные экспертами-людьми. Эти показатели относятся к выбранным блокам, а не ко всей модели, но они указывают на мощный новый цикл разработки.

Путь к эффективному, сверхбыстрому инференсу

Инфраструктура ИИ ценна, поскольку позволяет выполнять полезную работу в реальном мире. Выполняя больше полезной работы при том же энергопотреблении и на том же аппаратном обеспечении, Jalapeño может помочь нам обрабатывать больший объем спроса и снизить стоимость получения успешного результата. Для OpenAI это может повысить операционный рычаг, позволяя полезной работе и выручке расти быстрее, чем затраты на обслуживание. Это также может способствовать более широкому внедрению и дальнейшим инвестициям в более совершенные модели, продукты и инфраструктуру. Более быстрое вычисление вывода может обеспечить более быстрые итерации и новые варианты использования.

Jalapeño расширяет возможности эффективного инференса с низкой задержкой:

  • Вывод в Ultra-fast режиме с эффективностью, ранее доступной только в быстром режиме
  • Вывод в быстром режиме с эффективностью, ранее доступной только в пакетном режиме
  • Высокая эффективность вывода в пакетном режиме

Мы планируем начать развертывание Jalapeño в вычислительной инфраструктуре OpenAI к концу года. Это первое поколение в дорожной карте, охватывающей несколько поколений: второе поколение находится на продвинутой стадии разработки, а третье уже обретает форму. Каждое поколение будет опираться на полученные нами знания и еще больше повышать как эффективность, так и скорость.

Для удовлетворения растущего спроса на ИИ потребуется больше вычислительных ресурсов из всех доступных источников. Мы продолжим широко внедрять ускорители NVIDIA и других партнёров как для обучения, так и для вывода. Наша миссия заключается в том, чтобы искусственный интеллект приносил пользу всему человечеству.

В рамках подготовки к развертыванию мы продолжаем квалификацию для промышленной эксплуатации, повышаем зрелость программного обеспечения, готовимся эксплуатировать Jalapeño в масштабном режиме и проверяем производительность на большем числе моделей. Результаты на данный момент показывают, что возможно, когда мы совместно проектируем всю систему: более отзывчивый, более способный и агентный ИИ, который доставляется большему числу людей более эффективно.

Приложение

Jalapeño находится на передовой Парето для GPT‑OSS 120B

ПЕРЕДОВАЯ ПРОПУСКНАЯ СПОСОБНОСТЬ НА КВт

InferenceX · GPT‑OSS‑120B · номинально 8 тыс./1 тыс. · STP · TDP пакета: Jalapeño 700 Вт; GB200 1 200 Вт

Jalapeño лидирует по всем рабочим конфигурациям GPT‑OSS

ПИКОВАЯ И СОГЛАСОВАННАЯ ПРОПУСКНАЯ СПОСОБНОСТЬ

InferenceX · GPT‑OSS‑120B · номинальная мощность 8 тыс./1 тыс. · STP · TDP пакета: Jalapeño 700 Вт; GB200 1 200 Вт

Более высокий пиковый смешанный TPS/кВт

≈1,9×

85 448 против 44 960 смешанный/кВт

Низкая сквозная задержка

≈1,7×

1,03 с против 1,80 с

Снизить минимальный TBT

≈2,7×

0,69 против 1,87 мс (1459 против 535 токен/с/пользователь)

Более высокая пропускная способность на предыдущем TBT

≈53,7 ×

22 935 против 427 смешанных/кВт (при 535,28 токен/с/пользователь)

Jalapeño находится на передовой парето DeepSeek R1 670B

ПЕРЕДОВАЯ ПРОПУСКНАЯ СПОСОБНОСТЬ НА КВт

InferenceX · DeepSeek R1 MXFP4 · номинально 8k/1k · STP · TDP пакета: Jalapeño 700 Вт; GB300 1 400 Вт

Jalapeño лидирует во всех рабочих точках DeepSeek R1

ПИКОВАЯ И СОГЛАСОВАННАЯ ПРОПУСКНАЯ СПОСОБНОСТЬ

InferenceX · DeepSeek R1 MXFP4 · номинально 8k/1k · STP · TDP пакета: Jalapeño 700 Вт; GB300 1 400 Вт

Более высокий пиковый смешанный TPS/кВт

≈1,7×

19 641 против 11 781 смешанные / кВт

Снижение сквозной задержки

≈3,6×

1,65 с по сравнению с 5,99 с

Снизить минимальный TBT

≈4,1×

1,43 против 5,90 мс (700 против 169 токен/с/пользователь)

Более высокая пропускная способность на предыдущем TBT

≈104,3×

12 258 против 118 смешанных / кВт (при 169,41 токен/с/пользователь)

Jalapeño находится на передовой Парето при Kimi K2.5 1T

ПЕРЕДОВОЙ УРОВЕНЬ ПРОПУСКНОЙ СПОСОБНОСТИ НА кВт

InferenceX · Kimi K2.5 MXFP4 · номинал 8 000/1 000 · STP · TDP пакета: Jalapeño 700 Вт; GB300 1 400 Вт

Jalapeño лидирует по всем рабочим точкам Kimi K2.5

ПИКОВАЯ И СОГЛАСОВАННАЯ ПРОПУСКНАЯ СПОСОБНОСТЬ

InferenceX · Kimi K2,5 MXFP4 · номинальная мощность 8 кВт/1 кВт · STP · пакет TDP: Jalapeño 700 Вт; GB300 1 400 Вт

Более высокий пиковый смешанный TPS/кВт

≈ 1,5 ×

18 195 против 11 862 смешанный/кВт

Низкая сквозная задержка

≈3,4×

1,56 с по сравнению с 5,31 с

Снизить минимальный TBT

≈3,8×

1,44 против 5,48 мс (694 против 182 токен/с/пользователь)

Более высокая пропускная способность на предыдущем TBT

≈56,1×

6 744 против 120 смешанных / кВт (при 182,46 токен/с/пользователь)

Автор

OpenAI