Salta al contingut principal
OpenAI

25 d’agost del 2026

EnginyeriaEmpresa

Primers resultats de Jalapeño: velocitat i eficiència líders del sector en inferència d’IA

S'està carregant…
Primer pla del xip d’inferència Jalapeño muntat en una placa de circuit de color verd blavós.

Des que vam anunciar Jalapeño, el primer xip d’inferència personalitzat d’OpenAI, hem estat provant el xip i el sistema creat al seu voltant. Els resultats mostren una millora significativa del rendiment: Jalapeño pot gestionar més càrrega de treball d’IA per unitat de potència, alhora que retorna les respostes més ràpidament. Jalapeño ofereix tant més alt rendiment com menys latència amb una sola arquitectura, mentre que els sistemes de maquinari existents sovint han de fer un compromís entre ambdues.

Per als clients, això pot significar respostes més ràpides, agents més receptius i un accés més fiable a mesura que augmenta la demanda. La nostra missió és garantir que la intel·ligència artificial general beneficiï tota la humanitat. Aquests avenços ajudaran a fer que la IA cada vegada més capaç sigui més assequible i estigui més àmpliament disponible.

Models d’OpenAI també van accelerar el desenvolupament de Jalapeño. Generacions anteriors van ajudar l’equip a dissenyar i posar en marxa el xip, mentre que els nostres models més recents acceleren la manera com l’optimitzem i el programem. Rendiment de Jalapeño s’estén a GPT‑OSS 120B, DeepSeek R1 i Kimi K2.5 1T, cosa que demostra que l’arquitectura funciona amb models desenvolupats tant dins com fora d’OpenAI. Als tres casos, Jalapeño va oferir entre 1,5 i 1,9 vegades més treball d’IA per watt amb el rendiment màxim i una latència d’extrem a extrem entre 1,7 i 3,6 vegades més baixa que els sistemes de comparació. Per a càrregues de treball molt interactives, va oferir un rendiment entre 2,1 i 4,1 vegades més alt.

Jalapeño també és una prova d’un avantatge full-stack més ampli. OpenAI pot dissenyar conjuntament models, productes, programari de servei, xips, memòria, xarxes i sistemes, i utilitzar el que aprenem de les càrregues de treball reals per millorar cada capa de la pila. Jalapeño és silici propi funcional amb resultats mesurats, i és l’inici d’una plataforma multigeneracional. En els propers mesos, impulsarem Jalapeño per oferir productes més ràpids, amb més prestacions i més eficients als nostres clients.

Com hem mesurat el rendiment de Jalapeño

Avaluem el rendiment amb una experiència d’usuari equivalent, mesurant la quantitat de treball útil d’IA que cada sistema pot completar per unitat de potència tot complint la latència que requereixen els clients i els agents interactius. Això és especialment important per als agents, que han de completar molts passos de manera seqüencial, de manera que els retards es poden acumular al llarg de tota una tasca.

Per entendre quin rendiment ofereix Jalapeño a la pràctica, el vam provar a InferenceX, una prova de referència pública de SemiAnalysis que mesura el procés complet d’atendre una sol·licitud d’IA. Vam comparar Jalapeño amb sistemes d’IA comercials líders en tot l’interval operatiu provat, des del servei d’alt rendiment fins a l’ús molt interactiu i de baixa latència. Jalapeño va oferir una combinació millor de rendiment, eficiència energètica i latència. Tot i que de vegades el rendiment s’indica per xip, creiem que el criteri més útil és el rendiment per unitat de potència.

Jalapeño amplia l’avantatge al TBT que fins ara era el seu millor

Jalapeño ofereix més segments per usuari

Jalapeño ofereix més rendiment per quilowatt

En els tres models públics, Jalapeño va oferir una millor combinació de rendiment per watt i latència en tot el rang operatiu provat, situant-se a la frontera d'avantguarda. Per comparar els sistemes de manera coherent, vam normalitzar els resultats utilitzant la potència nominal publicada del xip de cada accelerador. Jalapeño té una potència nominal de 700 watts, tot i que la seva potència sostinguda mesurada es va mantenir igual o inferior a 550 watts en les càrregues de treball provades.

Jalapeño va tenir un bon rendiment amb GPT‑OSS 120B, DeepSeek R1 670B i Kimi K2.5 1T. Amb Kimi, el model públic més gran que vam provar, va oferir aproximadament 1,5 vegades un rendiment màxim més alt per watt i una latència d’extrem a extrem 3,4 vegades inferior a la del sistema de comparació. En les nostres proves internes, l’avantatge de Jalapeño es va ampliar encara més amb els models d’OpenAI d’avantguarda, cosa que suggereix que l’arquitectura esdevé més valuosa a mesura que les càrregues de treball augmenten de mida i complexitat.

Disseny d’arquitectures per a la velocitat i l’eficiència en un únic xip

Jalapeño es va dissenyar des del principi plantejant-nos la pregunta següent: quin maquinari construiríem si la seva funció principal fos servir models de llenguatge actuals i futurs, especialment agents interactius? Els avantatges de Jalapeño provenen de dissenyar conjuntament el xip, la memòria, la xarxa, el programari i el sistema a escala de rack per a càrregues de treball reals de models de llenguatge. La inferència de models de llenguatge passa per diverses fases diferenciades amb colls d’ampolla diferents. El preomplert, quan el sistema processa una indicació, requereix molta capacitat de càlcul, mentre que la descodificació, quan el sistema genera la resposta segment a segment, està més limitada per l’amplada de banda de la memòria. La comunicació també pot afegir latència quan les dades s’han de moure entre nuclis i xips, cosa que deixa algunes unitats de processament inactives mentre esperen. Un sistema que destaca en una fase pot perdre aquest avantatge mentre espera dades o mou l'estat del model entre recursos diferents.

Hem dissenyat Jalapeño per minimitzar el moviment de dades i els retards en la comunicació. Això significa que l’estat del model, inclosa la memòria cau KV que s’utilitza mentre es genera una resposta, es pot ubicar explícitament i mantenir localment mentre el sistema activa la combinació adequada de computació, memòria i xarxes per a cada fase d’inferència. La xarxa és una part integral de l’arquitectura. El seu domini ampli permet que tota la càrrega de treball es mantingui dins d’un únic sistema connectat, minimitzant el moviment de dades i ajudant a fer que la sol·licitud completa continuï sent ràpida i eficient de principi a fi. El resultat és un accelerador equilibrat i fungible que pot suportar arquitectures de models canviants, excel·lir tant en el preompliment com en la descodificació i adaptar-se a mesura que canvia l’equilibri entre tots dos, una característica definidora de les càrregues de treball agentives.

Hem fet servir la IA per dissenyar el xip, i hem dissenyat el xip perquè la IA el puguis programar

La IA va tenir un paper directe en el desenvolupament de Jalapeño, ja que va permetre a l’equip passar del disseny inicial a la fase de tapeout en nou mesos, explorant implementacions, escurçant els cicles de disseny, mesurament i verificació, i iterant contínuament sobre les càrregues de treball dels models. La IA també va ajudar a optimitzar els circuits aritmètics del xip, cosa que va permetre a l’equip encabir més rendiment de càlcul al xip dins del termini previst.

Jalapeño es va dissenyar com un objectiu de programació clar i previsible tant per a humans com per a la IA. Els enginyers poden descriure el treball mitjançant tensors locals, comunicació explícita i sincronització previsible. Aleshores, la IA pot optimitzar la manera com aquest treball s’assigna, s’ubica, es programa i es coordina a tot el sistema. Aquesta estructura clara i previsible ofereix a la IA una manera abordable d’afrontar el problema tradicionalment difícil de la programació paral·lela.

Donar suport a cada nova família de models continua requerint nous nuclis i optimitzacions específiques del model. Amb Codex i GPT‑Astra, l’equip va aconseguir un alt rendiment en dos mesos per a tres models de pes obert que no formaven part del pla de producció original de Jalapeño. Això va demostrar tant la flexibilitat de l’arquitectura com la velocitat amb què la IA ens pot ajudar a programar-la. Per a determinats blocs d’atenció i de barreja d’experts de GPT‑OSS, les implementacions generades per IA van funcionar entre 1,5 i 1,8 vegades més ràpid que les implementacions existents escrites per experts humans. Aquestes xifres s’apliquen als blocs seleccionats, no al model complet, però apunten cap a un nou i potent cicle de desenvolupament.

El camí a seguir per a una inferència eficient i ultraràpida

La infraestructura d’IA és valuosa perquè permet dur a terme tasques útils en el món real. En produir més feina útil amb la mateixa potència i el mateix maquinari, Jalapeño ens pot ajudar a satisfer més demanda i a reduir el cost d’obtenir un resultat satisfactori. Per a OpenAI, això pot millorar l’apalancament operatiu, ja que permet que la feina útil i els ingressos creixin més ràpidament que el cost de prestar el servei. També pot fomentar una adopció més àmplia i la inversió continuada en models, productes i infraestructura millor. Una inferència més ràpida pot permetre una iteració més ràpida i nous casos d’ús.

Jalapeño amplia les possibilitats per a una inferència eficient i de baixa latència:

  • Inferència en mode ultra-ràpid amb eficiències disponibles anteriorment només en el mode ràpid
  • Inferència en mode ràpid amb eficiències que abans només estaven disponibles en mode per lots
  • Més alta eficiència per a la inferència en mode de lots

Tenim previst començar a desplegar Jalapeño dins de la infraestructura de còmput d’OpenAI abans de finals d’any. És la primera generació d’un full de ruta multigeneracional: la Gen 2 està en ple desenvolupament i la Gen 3 va prenent forma. Cada generació es basarà en el que aprenguem i millorarà encara més tant l’eficiència com la velocitat.

Satisfer la demanda creixent d’IA requerirà més capacitat de càlcul de totes les fonts disponibles. Continuarem desplegant àmpliament acceleradors de NVIDIA i d’altres socis per a càrregues de treball tant d’entrenament com d’inferència. La nostra missió és garantir que la intel·ligència artificial general beneficiï tota la humanitat.

Mentre ens preparem per al desplegament, continuem amb la qualificació de producció, perfeccionant el programari, preparant-nos per operar Jalapeño a escala i validant el rendiment en més models. Els resultats fins ara mostren què és possible quan dissenyem tot el sistema conjuntament: IA més receptiva, capaç i agentiva, proporcionada de manera més eficient a més persones.

Apèndix

Jalapeño és d'avantguarda a GPT‑OSS 120B

RENDIMENT-per-kW D’AVANTGUARDA

InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP del paquet: Jalapeño 700 W; GB200 1.200 W

Jalapeño lidera en tots els punts operatius de GPT‑OSS

RENDIMENT MÀXIM I ASSOCIAT

InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP del paquet: Jalapeño 700 W; GB200 1.200 W

TPS màxim mixt per kW més alt

≈1,9×

85 448 vs. 44 960 mixt / kW

Menor latència d’extrem a extrem

≈1,7×

1,03 s en comparació amb 1,80 s

Redueix el TBT mínim

≈2,7×

0,69 vs. 1,87 ms (1 459 vs. 535 segm./s/usuari)

Més rendiment amb el TBT anterior

≈53,7×

22.935 vs. 427 mixt / kW (a 535,28 segm./s/usuari)

Jalapeño és d'avantguarda a DeepSeek R1 670B

RENDIMENT-per-kW D’AVANTGUARDA

InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP del paquet: Jalapeño 700 W; GB300 1.400 W

Jalapeño lidera en tots els punts de funcionament de DeepSeek R1

RENDIMENT MÀXIM I ASSOCIAT

InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP del paquet: Jalapeño 700 W; GB300 1.400 W

TPS màxim mixt per kW més alt

≈1,7×

19 641 vs. 11 781 mixt / kW

Menor latència d’extrem a extrem

≈3,6×

1.65 s vs. 5.99 s

Redueix el TBT mínim

≈4.1×

1,43 vs. 5,90 ms (700 vs. 169 segm./s/usuari)

Més rendiment amb el TBT anterior

≈104,3×

12.258 vs. 118 mixtes / kW (a 169,41 segm./s/usuari)

Jalapeño se situa d'avantguarda a Kimi K2.5 1T

RENDIMENT-per-kW D’AVANTGUARDA

InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · TDP del paquet: Jalapeño 700 W; GB300 1.400 W

Jalapeño lidera en tots els punts de funcionament de Kimi K2.5

RENDIMENT MÀXIM I ASSOCIAT

InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · TDP del paquet: Jalapeño 700 W; GB300 1.400 W

TPS màxim mixt per kW més alt

≈1,5×

18.195 vs. 11.862 mixt / kW

Menor latència d’extrem a extrem

≈3.4×

1,56 s vs. 5,31 s

Redueix el TBT mínim

≈3,8×

1,44 vs. 5,48 ms (694 vs. 182 segm./s/usuari)

Més rendiment amb el TBT anterior

≈56.1×

6.744 vs. 120 mixtes / kW (a 182,46 segm./s/usuari)

Autor

OpenAI