Přeskoč na hlavní obsah
OpenAI

První výsledky Jalapeña ukazují špičkovou rychlost a efektivitu inference AI

Načítání…
Detailní záběr inferenčního čipu Jalapeño osazeného na tyrkysové desce plošných spojů.

Od oznámení Jalapeña, prvního vlastního inferenčního čipu OpenAI, testujeme čip i systém kolem něj. Výsledky ukazují výrazný výkonnostní posun: Jalapeño dokáže obsloužit více úloh AI na jednotku příkonu a zároveň rychleji vracet odpovědi. Jalapeño v jediné architektuře nabízí vyšší výkon i nižší latenci, zatímco stávající hardwarové systémy mezi nimi často musí volit kompromis.

Pro zákazníky to může znamenat rychlejší odpovědi, pohotovější agenty a spolehlivější přístup i s rostoucí poptávkou. Naším posláním je zajistit, aby obecná umělá inteligence sloužila ku prospěchu celému lidstvu. Tyto pokroky pomohou zajistit, aby stále schopnější umělá inteligence byla cenově dostupnější a a přístupnější pro širší okruh uživatel.

Modely OpenAI také urychlily vývoj Jalapeña. Dřívější generace pomohly týmu navrhnout a zprovoznit čip, zatímco naše nejnovější modely urychlují jeho optimalizaci a programování. Vysoký výkon Jalapeña se projevuje u modelů GPT‑OSS 120B, DeepSeek R1 a Kimi K2.5 1T, což ukazuje, že tato architektura funguje napříč modely vyvinutými v OpenAI i mimo něj. Ve všech třech případech Jalapeño při špičkovém výkonu zpracovalo 1,5 až 1,9krát více úloh AI na watt a dosáhlo 1,7 až 3,6krát nižší end-to-end latence než srovnávací systémy. U vysoce interaktivních úloh dosahovalo 2,1 až 4,1krát vyššího výkonu.

Jalapeño je také důkazem širších výhod full-stackového přístupu. OpenAI může společně navrhovat modely, produkty, software pro nasazení, čipy, paměti, síťové technologie i systémy a využívat poznatky z reálných úloh ke zlepšování každé vrstvy technologického stacku. Jalapeño je funkční čip vlastní konstrukce s naměřenými výsledky a představuje začátek vícegenerační platformy. V nadcházejících měsících budeme rozšiřovat nasazení Jalapeña, abychom našim zákazníkům mohli nabízet rychlejší, schopnější a efektivnější produkty.

Jak jsme měřili výkon Jalapeña

Vyhodnocujeme výkon při srovnatelné uživatelské zkušenosti a měříme, kolik užitečných úloh AI dokáže každý systém zpracovat na jednotku příkonu při současném splnění požadavků zákazníků a interaktivních agentů na latenci. To je důležité zejména u agentů, kteří musí provést mnoho kroků po sobě, takže zpoždění se mohou nasčítat v průběhu celého úkolu.

Abychom pochopili, jak si Jalapeño vede v praxi, otestovali jsme jej na InferenceX, veřejném benchmarku od SemiAnalysis, který měří celý proces obsluhy požadavku na AI. Porovnali jsme Jalapeño s předními komerčně dostupnými systémy AI v celém testovaném provozním rozsahu, od obsluhy s vysokým výkonem po vysoce interaktivní využití s nízkou latencí. Jalapeño nabídlo lepší kombinaci výkonu, efektivity spotřeby energie a latence. Ačkoli se výkon někdy uvádí na čip, domníváme se, že užitečnějším měřítkem je výkon na jednotku příkonu.

Jalapeño zvyšuje náskok při dosud nejlepší hodnotě TBT

Jalapeño poskytuje více tokenů na uživatele

Jalapeño poskytuje vyšší výkon na kilowatt

Ve všech třech veřejně dostupných modelech nabídlo Jalapeño v celém testovaném provozním rozsahu lepší kombinaci výkonu na watt a latence, čímž se zařadilo na Paretovu hranici. Abychom zajistili konzistentní porovnání systémů, normalizovali jsme výsledky pomocí zveřejněného jmenovitého příkonu čipu každého akcelerátoru. Jalapeño má jmenovitý příkon 700 wattů, ačkoli jeho naměřený trvalý příkon při testovaných pracovních zátěžích zůstal na hodnotě 550 wattů nebo nižší.

Jalapeño dosáhlo velmi dobrých výsledků u modelů GPT‑OSS 120B, DeepSeek R1 670B a Kimi K2.5 1T. U modelu Kimi, největšího veřejně dostupného modelu, který jsme testovali, dosáhlo Jalapeño přibližně 1,5krát vyššího špičkového výkonu na watt a 3,4krát nižší celkové latence ve srovnání se srovnávacím systémem. V našich interních testech se výhoda Jalapeña u nejpokročilejších modelů OpenAI ještě zvětšila, což naznačuje, že tato architektura nabývá na významu s rostoucí velikostí a náročností pracovních zátěží.

Při návrhu Jalapeña jsme si od začátku kladli otázku: Jaký hardware bychom vytvořili, kdyby jeho hlavním úkolem bylo zajišťovat provoz moderních a budoucích jazykových modelů, zejména interaktivních agentů? Výhody Jalapeña plynou ze společného návrhu čipu, paměti, sítě, softwaru a systému na úrovni racku pro skutečné zátěže jazykových modelů. Inferenční proces jazykových modelů probíhá v několika odlišných fázích s různými úzkými místy. Fáze prefill, kdy systém zpracovává prompt, je výpočetně náročná, zatímco dekódování, kdy systém generuje odpověď token po tokenu, je omezeno především šířkou pásma paměti. Komunikace může také zvyšovat latenci, když se data musí přesouvat mezi jádry a čipy, což způsobuje, že některé výpočetní jednotky zůstávají při čekání nečinné. Systém, který vyniká v jedné fázi, může o tuto výhodu přijít, když čeká na data nebo přesouvá stav modelu mezi různými zdroji.

Jalapeño jsme navrhli tak, aby minimalizovalo přesuny dat a komunikační prodlevy. To znamená, že stav modelu včetně mezipaměti KV používané při generování odpovědi lze cíleně umístit a uchovávat lokálně, zatímco systém pro každou fázi inference aktivuje vhodnou kombinaci výpočetních prostředků, paměti a síťových prostředků. Síť je nedílnou součástí architektury. Její rozsáhlá doména umožňuje, aby celá úloha zůstala v rámci jednoho propojeného systému, což minimalizuje přesuny dat a umožňuje rychlé a efektivní zpracování celého požadavku od začátku do konce. Výsledkem je vyvážený a flexibilní akcelerátor, který dokáže podporovat měnící se architektury modelů, dosahovat vysokého výkonu ve fázi prefill i při dekódování a přizpůsobovat se změnám jejich vzájemného poměru, což je charakteristickým rysem agentních úloh.

Použili jsme AI k návrhu čipu a čip jsme navrhli tak, aby ho AI mohla programovat

AI hrála přímou roli při vývoji Jalapeña a umožnila týmu přejít od prvotního návrhu k tapeoutu za pouhých devět měsíců díky testování různých implementací, zkrácení cyklů návrhu, měření a ověřování a průběžnému zdokonalování řešení na základě úloh jazykových modelů. AI také pomohla optimalizovat aritmetické obvody čipu, díky čemuž se týmu podařilo ve stanoveném termínu dosáhnout vyššího výpočetního výkonu čipu.

Jalapeño bylo navrženo jako srozumitelná a předvídatelná platforma pro programování lidmi i umělou inteligencí. Inženýři mohou definovat úlohy pomocí lokálních tenzorů, explicitní komunikace a předvídatelné synchronizace. Umělá inteligence pak může optimalizovat způsob, jakým jsou tyto úlohy v rámci systému mapovány, rozmísťovány, plánovány a koordinovány. Tato jasná a předvídatelná struktura umožňuje umělé inteligenci řešit tradičně obtížný problém paralelního programování.

Podpora každé nové rodiny modelů stále vyžaduje nová jádra a optimalizace specifické pro daný model. S využitím Codexu a GPT‑Astra tým během dvou měsíců dosáhl vysokého výkonu u tří modelů s otevřenými váhami, které nebyly součástí původního plánu produkčního nasazení Jalapeña. To ukázalo, jak flexibilitu architektury, tak rychlost, s jakou nám AI může pomoci ji naprogramovat. U vybraných bloků pozornosti a směsi expertů GPT‑OSS byly implementace vytvořené AI 1,5 až 1,8krát rychlejší než stávající implementace vytvořené odborníky. Tyto údaje se vztahují na vybrané bloky, nikoli na celý model, ale naznačují potenciál nového, vysoce efektivního vývojového cyklu.

Cesta k efektivní a ultrarychlé inferenci

Hodnota infrastruktury AI spočívá v užitečné práci, kterou díky ní lze vykonávat v reálném světě. Tím, že se stejnou spotřebou energie a stejným hardwarem vykoná více užitečné práce, nám Jalapeño může pomoci uspokojit vyšší poptávku a snížit náklady na dosažení úspěšného výsledku. OpenAI tak může zvýšit provozní páku, protože objem užitečné práce a příjmy mohou růst rychleji než náklady na poskytování služeb. Může také podpořit širší využívání a pokračující investice do lepších modelů, produktů a infrastruktury. Rychlejší inference může urychlit iterace a umožnit nové případy použití.

Jalapeño rozšiřuje možnosti efektivní inference s nízkou latencí:

  • Inference v ultrarychlém režimu s efektivitou, která byla dříve dostupná pouze v rychlém režimu
  • Inference v rychlém režimu s efektivitou, která byla dříve dostupná pouze v dávkovém režimu
  • Vyšší efektivita inference v dávkovém režimu

Plánujeme začít nasazovat Jalapeño v rámci výpočetní infrastruktury OpenAI do konce roku. Jde o první generaci vícegeneračního plánu vývoje: Gen 2 je v pokročilé fázi vývoje a Gen 3 se začíná rýsovat. Každá generace bude stavět na tom, co se naučíme, a dále zvyšovat efektivitu i rychlost.

Uspokojení rostoucí poptávky po AI si vyžádá více výpočetního výkonu ze všech dostupných zdrojů. Budeme i nadále ve velkém nasazovat akcelerátory od společnosti NVIDIA a dalších partnerů pro trénovací i inferenční úlohy. Naším posláním je zajistit, aby obecná umělá inteligence sloužila ku prospěchu celému lidstvu.

V rámci příprav na nasazení pokračujeme v kvalifikaci pro produkční provoz, zdokonalujeme software, připravujeme se na provoz Jalapeño ve velkém měřítku a ověřujeme výkon u dalších modelů. Dosavadní výsledky ukazují, čeho lze dosáhnout, když celý systém navrhujeme jako celek: pohotovější, schopnější a agentní AI poskytovaná efektivněji většímu počtu lidí.

Příloha

Jalapeño dosahuje Paretovy hranice pro GPT‑OSS 120B

HRANICE VÝKONU NA kW

InferenceX · GPT‑OSS‑120B · nominálně 8k/1k · STP · TDP balíčku: Jalapeño 700 W; GB200 1 200 W

Jalapeño vede ve všech provozních bodech GPT‑OSS

ŠPIČKOVÝ A ODPOVÍDAJÍCÍ VÝKON

InferenceX · GPT‑OSS‑120B · nominálně 8k/1k · STP · TDP balíčku: Jalapeño 700 W; GB200 1 200 W

Vyšší špičkový výkon se smíšenými tokeny v TPS/kW

≈1,9×

85 448 vs. 44 960 se smíšenými tokeny na kW

Nižší celková latence

≈1,7×

1,03 s vs. 1,80 s

Nižší minimální TBT

≈2,7×

0,69 vs. 1,87 ms (1 459 vs. 535 tok/s/uživatel)

Vyšší výkon při předchozím TBT

≈53,7×

22 935 vs. 427 se smíšenými tokeny na kW (při 535,28 tok/s/uživatel)

Jalapeño dosahuje Paretovy hranice pro DeepSeek R1 670B

HRANICE VÝKONU NA kW

InferenceX · DeepSeek R1 MXFP4 · nominální 8k/1k · STP · TDP balíčku: Jalapeño 700 W, GB300 1 400 W

Jalapeño vede ve všech provozních bodech DeepSeek R1

ŠPIČKOVÝ A ODPOVÍDAJÍCÍ VÝKON

InferenceX · DeepSeek R1 MXFP4 · nominální 8k/1k · STP · TDP balíčku: Jalapeño 700 W, GB300 1 400 W

Vyšší špičkový výkon se smíšenými tokeny v TPS/kW

≈1,7×

19 641 vs. 11 781 se smíšenými tokeny na kW

Nižší celková latence

≈3,6×

1,65 s vs. 5,99 s

Nižší minimální TBT

≈4,1×

1,43 vs. 5,90 ms (700 vs. 169 tok/s/uživatel)

Vyšší výkon při předchozím TBT

≈104,3×

12 258 vs. 118 se smíšenými tokeny na kW (při 169,41 tok/s/uživatel)

Jalapeño dosahuje Paretovy hranice pro Kimi K2.5 1T

HRANICE VÝKONU NA kW

InferenceX · Kimi K2.5 MXFP4 · nominálně 8k/1k · STP · TDP balíčku: Jalapeño 700 W; GB300 1 400 W

Jalapeño vede ve všech provozních bodech Kimi K2.5

ŠPIČKOVÝ A ODPOVÍDAJÍCÍ VÝKON

InferenceX · Kimi K2.5 MXFP4 · nominálně 8k/1k · STP · TDP balíčku: Jalapeño 700 W; GB300 1 400 W

Vyšší špičkový výkon se smíšenými tokeny v TPS/kW

≈1,5×

18 195 vs. 11 862 se smíšenými tokeny na kW

Nižší celková latence

≈3,4×

1,56 s vs. 5,31 s

Nižší minimální TBT

≈3,8×

1,44 vs. 5,48 ms (694 vs. 182 tok/s/uživatel)

Vyšší výkon při předchozím TBT

≈56,1×

6 744 vs. 120 se smíšenými tokeny na kW (při 182,46 tok/s/uživatel)

Autor

OpenAI