Перейти до основного вмісту
OpenAI

25 серпня 2026 р.

ІнженеріяКомпанія

Перші результати Jalapeño демонструють лідерську швидкість і ефективність у висновках ШІ

Завантаження…
Крупний план інференсного чипа Jalapeño, змонтованого на бірюзовій друкованій платі.

Від часу анонсу Jalapeño, першого спеціалізованого чіпа OpenAI для інференсу, ми тестуємо цей чіп і систему, побудовану навколо нього. Результати демонструють суттєве підвищення продуктивності: Jalapeño може обробляти більше завдань ШІ на одиницю потужності, а також швидше повертати відповіді. Jalapeño забезпечує одночасно вищу пропускну здатність і меншу затримку в межах однієї архітектури, тоді як наявним апаратним системам часто доводиться йти на компроміс між цими двома показниками.

Для клієнтів це означає швидші відповіді, більш оперативних агентів і надійніший доступ у міру зростання попиту. Наша місія полягає в забезпеченні того, щоб штучний інтелект приносив користь усьому людству. Ці покращення допоможуть зробити ШІ з дедалі більшими можливостями більш доступним за ціною та ширше поширеним.

Моделі OpenAI також прискорили розробку Jalapeño. Попередні покоління допомогли команді спроєктувати й запустити чип, тоді як наші найновіші моделі прискорюють його оптимізацію та програмування. Jalapeño демонструє продуктивність із GPT‑OSS 120B, DeepSeek R1 і Kimi K2.5 1T, показуючи, що архітектура працює з моделями, розробленими як в OpenAI, так і поза її межами. У всіх трьох випадках Jalapeño забезпечив у 1,5–1,9 раз більше роботи ШІ на ват за пікової пропускної здатності та у 1,7–3,6 раз меншу наскрізну затримку, ніж системи для порівняння. Для високоінтерактивних робочих навантажень він забезпечив продуктивність у 2,1–4,1 раз вищу.

Jalapeño також свідчить про ширшу перевагу повного стеку. OpenAI може розробляти моделі, продукти, програмне забезпечення, чипи, пам’ять, мережі та системи разом, використовуючи знання, отримані з реальних робочих навантажень, щоб удосконалювати кожен рівень стеку. Jalapeño — це чип власної розробки з виміряними показниками, який є початком багатопоколінної платформи. У найближчі місяці ми масштабуватимемо Jalapeño, щоб надавати нашим клієнтам швидші, функціональніші та ефективніші продукти.

Як ми оцінювали ефективність Jalapeño

Ми оцінюємо продуктивність за умов зіставного користувацького досвіду, вимірюючи, скільки корисної роботи ШІ кожна система може виконати на одиницю потужності, водночас відповідаючи вимогам до затримки, яких потребують клієнти та інтерактивні агенти. Це особливо важливо для агентів, яким потрібно виконувати багато кроків послідовно, тому затримки можуть накопичуватися протягом усього завдання.

Щоб зрозуміти, яку продуктивність Jalapeño демонструє на практиці, ми протестували його на InferenceX — публічному бенчмарку від SemiAnalysis, який вимірює повний процес обробки запиту до ШІ. Ми порівняли Jalapeño з провідними комерційно доступними системами ШІ в усьому протестованому робочому діапазоні: від обслуговування з високою пропускною здатністю до високоінтерактивного використання з низькою затримкою. Jalapeño забезпечив оптимальніше поєднання пропускної здатності, енергоефективності та затримки. Хоча продуктивність іноді вказують у розрахунку на чип, ми вважаємо, що кориснішим стандартом є продуктивність на одиницю потужності.

Jalapeño збільшує перевагу над попереднім найкращим результатом TBT

Jalapeño забезпечує більше токенів на користувача

Jalapeño забезпечує більшу пропускну здатність на кіловат

Серед усіх трьох загальнодоступних моделей Jalapeño продемонстрував краще поєднання продуктивності на ватт і затримки в усьому протестованому робочому діапазоні, що виводить його на межу Парето. Щоб забезпечити узгоджене порівняння систем, ми нормалізували результати, використовуючи опубліковані номінальні показники потужності мікросхем кожного прискорювача. Jalapeño має номінальну потужність 700 Вт, хоча під час протестованих робочих навантажень його виміряна стійка потужність залишалася на рівні 550 Вт або нижче.

Jalapeño продемонстрував високі результати в GPT‑OSS 120B, DeepSeek R1 670B і Kimi K2.5 1T. На Kimi — найбільшій загальнодоступній моделі, яку ми тестували, — він забезпечив приблизно у 1,5 раза вищу пікову продуктивність на ват і у 3,4 раза нижчу наскрізну затримку, ніж система для порівняння. У нашому внутрішньому тестуванні перевага Jalapeño ще більше зросла на передових моделях OpenAI, що свідчить про те, що ця архітектура стає ціннішою зі збільшенням масштабу та вимогливості робочих навантажень.

Проєктування для швидкості та ефективності в межах одного чипа

Jalapeño від самого початку проєктували, запитуючи: яке апаратне забезпечення ми б створили, якби його основним завданням було обслуговування сучасних і майбутніх мовних моделей, зокрема інтерактивних агентів? Переваги Jalapeño забезпечує спільне проєктування чипа, пам’яті, мережі, програмного забезпечення та стійкової системи з урахуванням реальних навантажень мовних моделей. Інференс мовних моделей проходить через кілька окремих етапів із різними вузькими місцями. Префіл, коли система обробляє запит, потребує значних обчислювальних ресурсів, тоді як декодування, коли система генерує відповідь токен за токеном, більше обмежене пропускною здатністю пам’яті. Обмін даними також може збільшувати затримку, коли дані мають переміщуватися між ядрами й чипами, через що деякі обчислювальні блоки простоюють в очікуванні. Система, що чудово справляється з одним етапом, може втратити цю перевагу, очікуючи на дані або переміщуючи стан моделі між різними ресурсами.

Ми спроєктували Jalapeño так, щоб мінімізувати переміщення даних і затримки зв’язку. Це означає, що стан моделі, зокрема KV-кеш, який використовується під час генерування відповіді, можна явно розміщувати та зберігати локально, тоді як система активує належне поєднання обчислювальних ресурсів, пам’яті й мережі для кожної фази інференсу. Мережа є невід’ємною частиною архітектури. Її великий домен дозволяє всьому робочому навантаженню залишатися в межах однієї з’єднаної системи, мінімізуючи переміщення даних і допомагаючи повному запиту залишатися швидким і ефективним від початку до кінця. Результатом є збалансований і універсальний прискорювач, який може підтримувати мінливі архітектури моделей, ефективно працювати як із попереднім заповненням, так і з декодуванням, а також адаптуватися до змін у балансі між ними — визначальної особливості агентних робочих навантажень.

Ми використали ШІ, щоб спроєктувати чип, і спроєктували чип так, щоб ШІ міг його програмувати

Штучний інтелект відіграв безпосередню роль у розробці Jalapeño, що дозволило команді перейти від початкового проєктування до передачі у виробництво за дев’ять місяців завдяки дослідженню варіантів реалізації, скороченню циклів проєктування, вимірювання та верифікації, а також постійному вдосконаленню модельних навантажень. Штучний інтелект також допоміг оптимізувати арифметичні схеми мікросхеми, що дозволило команді вчасно забезпечити більшу обчислювальну продуктивність.

Jalapeño було розроблено як чітку та передбачувану ціль програмування як для людей, так і для ШІ. Інженери можуть описувати роботу за допомогою локальних тензорів, явної комунікації та передбачуваної синхронізації. Після цього ШІ може оптимізувати те, як ця робота зіставляється, розміщується, планується та координується в усій системі. Така чітка, передбачувана структура дає ШІ практичний спосіб розв’язати традиційно складну проблему паралельного програмування.

Підтримка кожного нового сімейства моделей усе ще потребує нових ядер і оптимізацій, специфічних для моделей. Використовуючи Codex із GPT‑Astra, команда за два місяці досягла високої продуктивності трьох моделей з відкритими вагами, які не входили до початкового виробничого плану Jalapeño. Це продемонструвало, як гнучкість архітектури, так і швидкість, з якою ШІ може допомогти нам програмувати її. Для вибраних блоків уваги та блоків суміші експертів GPT‑OSS реалізації, створені ШІ, працювали у 1,5–1,8 рази швидше, ніж наявні реалізації, написані експертами-людьми. Ці показники стосуються вибраних блоків, а не всієї моделі, але вони вказують на потужний новий цикл розробки.

Шлях до ефективного та ультрашвидкого виведення

Інфраструктура ШІ є цінною, оскільки вона уможливлює корисну роботу в реальному світі. Виконуючи більше корисної роботи за тієї самої потужності та того самого обладнання, Jalapeño може допомогти нам задовольняти більший попит і знизити вартість досягнення успішного результату. Для OpenAI це може покращити операційний вплив, даючи змогу корисній роботі та доходу зростати швидше, ніж вартість обслуговування. Це також може сприяти ширшому впровадженню та подальшим інвестиціям у кращі моделі, продукти й інфраструктуру. Швидший аналіз може забезпечити швидші ітерації та нові сценарії використання.

Jalapeño розширює можливості для ефективного виведення з низькою затримкою:

  • Ультрашвидке виведення з ефективністю, раніше доступною лише в швидкому режимі
  • Інференс у швидкому режимі з ефективністю, раніше доступною лише в пакетному режимі
  • Вища ефективність пакетного інференсу

Ми плануємо розпочати розгортання Jalapeño в обчислювальній інфраструктурі OpenAI до кінця року. Це перше покоління в дорожній карті, розрахованій на кілька поколінь: Gen 2 уже на активній стадії розробки, а Gen 3 починає набувати обрисів. Кожне покоління спиратиметься на здобуті нами знання й надалі підвищуватиме як ефективність, так і швидкість.

Щоб задовольнити зростаючий попит на ШІ, знадобиться більше обчислювальних ресурсів з усіх доступних джерел. Ми продовжимо масштабне впровадження прискорювачів від NVIDIA та інших партнерів для робочих навантажень з навчання та виведення. Наша місія полягає в забезпеченні того, щоб штучний інтелект приносив користь усьому людству.

Поки ми готуємося до розгортання, ми продовжуємо виробничу кваліфікацію, удосконалюємо програмне забезпечення, готуємося до масштабної експлуатації Jalapeño та перевіряємо продуктивність на більшій кількості моделей. Результати на сьогоднішній день показують, що можливо, коли ми проєктуємо всю систему разом: більш оперативний, потужний та автономний ШІ, який ефективніше надається в користування більшій кількості людей.

Додаток

Jalapeño перебуває на межі Парето на GPT‑OSS 120B

ПЕРЕДОВА ПРОПУСКНА ЗДАТНІСТЬ на кВт

InferenceX · GPT‑OSS‑120B · номінально 8 тис./1 тис. · STP · TDP пакету: Jalapeño 700 Вт; GB200 1 200 Вт

Jalapeño лідирує за всіма операційними точками GPT‑OSS

ПІКОВА ТА УЗГОДЖЕНА ПРОПУСКНА ЗДАТНІСТЬ

InferenceX · GPT‑OSS‑120B · номінально 8 тис./1 тис. · STP · TDP пакету: Jalapeño 700 Вт; GB200 1 200 Вт

Вища пікова змішана TPS / кВт

≈1,9×

85 448 проти 44 960 змішаних / кВт

Менша наскрізна затримка

≈1,7×

1,03 с проти 1,80 с

Нижній мінімум TBT

≈2,7×

0,69 проти 1,87 мс (1 459 проти 535 токенів/с на користувача)

Більша пропускна здатність при попередньому TBT

≈53,7×

22 935 проти 427 змішаних кВт (при 535,28 токенів/с на користувача)

Jalapeño перебуває на межі Парето на DeepSeek R1 670B

ПЕРЕДОВА ПРОПУСКНА ЗДАТНІСТЬ на кВт

InferenceX · DeepSeek R1 MXFP4 · номінально 8 тис./1 тис. · STP · TDP пакету: Jalapeño 700 Вт; GB300 1 400 Вт

Jalapeño лідирує на всіх робочих точках DeepSeek R1

ПІКОВА ТА УЗГОДЖЕНА ПРОПУСКНА ЗДАТНІСТЬ

InferenceX · DeepSeek R1 MXFP4 · номінально 8 тис./1 тис. · STP · TDP пакету: Jalapeño 700 Вт; GB300 1 400 Вт

Вища пікова змішана TPS / кВт

≈1,7×

19 641 проти 11 781 змішаних/kW

Менша наскрізна затримка

≈3,6×

1,65 с проти 5,99 с

Нижній мінімальний TBT

≈4,1×

1,43 мс проти 5,90 мс (700 проти 169 токенів/с на користувача)

Вища пропускна здатність за попереднього TBT

≈104,3×

12 258 проти 118 змішаних / кВт (за 169,41 токенів/с на користувача)

Jalapeño перебуває на межі Парето на Kimi K2.5 1T

ПЕРЕДОВА ПРОПУСКНА ЗДАТНІСТЬ на кВт

InferenceX · Kimi K2.5 MXFP4 · номінально 8 тис./1 тис. · STP · TDP пакету: Jalapeño 700 Вт; GB300 1 400 Вт

Jalapeño лідирує на всіх робочих точках Kimi K2.5

ПІКОВА ТА УЗГОДЖЕНА ПРОПУСКНА ЗДАТНІСТЬ

InferenceX · Kimi K2.5 MXFP4 · номінально 8 тис./1 тис. · STP · TDP пакету: Jalapeño 700 Вт; GB300 1 400 Вт

Вища пікова змішана TPS / кВт

≈1,5×

18 195 проти 11 862 змішане / кВт

Менша наскрізна затримка

≈3,4×

1,56 с проти 5,31 с

Менший мінімальний TBT

≈3,8×

1,44 проти 5,48 мс (694 проти 182 токенів/с на користувача)

Більша пропускна здатність під час попереднього TBT

≈56,1×

6 744 проти 120 змішаних / кВт (при 182,46 токенів/с на користувача)

Автор

OpenAI