Passer au contenu principal
OpenAI

Les premiers résultats de Jalapeño démontrent une inférence IA de pointe, rapide et efficace

Chargement…
Gros plan de la puce d’inférence Jalapeño montée sur un circuit imprimé bleu sarcelle.

Depuis l’annonce de Jalapeño, la première puce d’inférence sur mesure d’OpenAI, nous testons la puce et le système conçu autour d’elle. Les résultats montrent une nette avancée en matière de performance : Jalapeño peut traiter davantage de tâches d’IA par unité d’énergie tout en générant des réponses plus rapidement. Jalapeño offre à la fois un débit plus élevé et une latence réduite grâce à une architecture unique, alors que les systèmes matériels existants doivent souvent faire un compromis entre les deux.

Pour les clients, cela peut se traduire par des réponses plus rapides, des agents plus réactifs et un accès plus fiable à mesure que la demande augmente. Notre mission est de veiller à ce que l’intelligence artificielle générale profite à l’ensemble de l’humanité. Ces avancées contribueront à rendre l’IA toujours plus performante, abordable et accessible.

Les modèles d’OpenAI ont également accéléré le développement de Jalapeño. Les générations précédentes ont aidé l’équipe à concevoir et à mettre au point la puce, tandis que nos modèles les plus récents accélèrent son optimisation et sa programmation. Les performances de Jalapeño s’étendent à GPT‑OSS 120B, DeepSeek R1 et Kimi K2.5 1T, montrant que l’architecture fonctionne avec des modèles développés par OpenAI comme par d’autres. Pour les trois modèles, Jalapeño a offert 1,5 à 1,9 fois plus de tâches d’IA par watt au débit maximal, et une latence de bout en bout 1,7 à 3,6 fois moindre que les systèmes de comparaison. Pour les charges de travail hautement interactives, il a offert des performances de 2,1 à 4,1 fois supérieures.

Jalapeño témoigne également d’un avantage plus large à l’échelle de toute la pile technologique. OpenAI peut concevoir conjointement les modèles, les produits, les logiciels de service, les puces, la mémoire, les réseaux et les systèmes, en tirant parti des enseignements des charges de travail réelles pour améliorer chaque couche de la pile technologique. Jalapeño est une puce conçue en interne, dont les résultats ont été mesurés, et constitue le début d’une plateforme appelée à évoluer sur plusieurs générations. Dans les prochains mois, nous déploierons progressivement Jalapeño afin d’offrir à nos clients des produits plus rapides, plus performants et plus efficaces.

Comment nous avons mesuré la performance de Jalapeño

Nous évaluons les performances dans des conditions d’utilisation comparables, en mesurant la quantité de travail d’IA utile que chaque système peut accomplir par unité d’énergie, tout en respectant la latence requise par les clients et les agents interactifs. C’est particulièrement important pour les agents, qui doivent exécuter de nombreuses étapes en séquence : les délais peuvent ainsi s’accumuler sur l’ensemble d’une tâche.

Pour évaluer les performances réelles de Jalapeño, nous l’avons testé sur InferenceX, une référence publique de SemiAnalysis qui mesure l’ensemble du processus de traitement d’une requête d’IA. Nous avons comparé Jalapeño aux principaux systèmes d’IA commerciaux disponibles, sur toute la plage d’utilisation testée, du traitement à haut débit aux usages hautement interactifs à faible latence. Jalapeño offre un meilleur équilibre entre débit, efficacité énergétique et latence. Bien que les performances soient parfois mesurées par puce, nous estimons qu’il est plus pertinent de les mesurer par unité d’énergie.

Jalapeño creuse l’écart avec son meilleur TBT à ce jour

Jalapeño offre davantage de tokens par utilisateur

Jalapeño offre un débit supérieur par kilowatt

Pour les trois modèles publics, Jalapeño a offert un meilleur équilibre entre performances par watt et latence sur toute la plage d’utilisation testée, se situant ainsi sur la frontière de Pareto. Pour comparer les systèmes de façon uniforme, nous avons normalisé les résultats à partir de la puissance nominale publiée de chaque accélérateur. Jalapeño affiche une puissance nominale de 700 watts, bien que sa consommation soutenue mesurée soit restée à 550 watts ou moins pour les charges de travail testées.

Jalapeño a affiché d’excellentes performances sur les modèles GPT‑OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T. Sur Kimi, le plus grand modèle public que nous avons testé, il a affiché une performance de pointe par watt environ 1,5 fois supérieure et une latence de bout en bout 3,4 fois inférieure à celle du système de comparaison. Lors de nos essais internes, l’avantage de Jalapeño s’est encore accru sur les modèles de pointe d’OpenAI, ce qui laisse entendre que l’architecture gagne en valeur à mesure que les charges de travail deviennent plus volumineuses et plus exigeantes.

Concevoir une puce alliant vitesse et efficacité

Dès le départ, Jalapeño a été conçu autour d’une question : quel matériel construirions-nous si sa fonction première était de prendre en charge les modèles de langage actuels et futurs, en particulier les agents interactifs? Les gains de Jalapeño découlent de la conception conjointe de la puce, de la mémoire, du réseau, du logiciel et du système à l’échelle du rack, axée sur des charges de travail réelles de modèles de langage. L’inférence des modèles de langage se déroule en plusieurs phases distinctes, chacune présentant différents goulots d’étranglement. Le préremplissage, pendant lequel le système traite une invite, exige une grande puissance de calcul, tandis que le décodage, pendant lequel il génère la réponse token par token, est davantage limité par la bande passante de la mémoire. Les communications peuvent également accroître la latence lorsque les données doivent circuler entre les cœurs et les puces, laissant certaines unités de traitement inactives pendant qu’elles attendent. Un système qui excelle à une phase peut perdre cet avantage lorsqu’il attend des données ou transfère l’état du modèle entre différentes ressources.

Nous avons conçu Jalapeño de manière à réduire au minimum les transferts de données et les délais de communication. Cela signifie que l’état du modèle, y compris le cache KV utilisé pour générer une réponse, peut être placé explicitement et maintenu localement, tandis que le système active la combinaison appropriée de ressources de calcul, de mémoire et de réseau à chaque phase d’inférence. Le réseau fait partie intégrante de l’architecture. Sa vaste portée permet de maintenir l’ensemble de la charge de travail au sein d’un seul système connecté, réduisant ainsi les transferts de données et assurant le traitement rapide et efficace de la requête de bout en bout. Il en résulte un accélérateur équilibré et polyvalent, capable de prendre en charge l’évolution des architectures de modèles, d’exceller tant en préremplissage qu’en décodage et de s’adapter à l’évolution de l’équilibre entre les deux, une caractéristique essentielle des charges de travail agentiques.

Nous avons utilisé l’IA pour concevoir la puce, puis conçu la puce pour que l’IA puisse la programmer.

L’IA a joué un rôle direct dans le développement de Jalapeño, permettant à l’équipe de passer de la conception initiale au tape-out en neuf mois grâce à l’exploration de différentes implémentations, au raccourcissement des cycles de conception, de mesure et de vérification, ainsi qu’à l’amélioration continue fondée sur les charges de travail des modèles. L’IA a également contribué à optimiser les circuits arithmétiques de la puce, ce qui a permis à l’équipe d’en accroître les performances de calcul tout en respectant l’échéancier.

Jalapeño a été conçu comme une cible de programmation claire et prévisible, tant pour les humains que pour l’IA. Les ingénieurs peuvent décrire les tâches à l’aide de tenseurs locaux, de communications explicites et d’une synchronisation prévisible. L’IA peut ensuite optimiser la façon dont ce travail est réparti, placé, planifié et coordonné dans l’ensemble du système. Cette structure claire et prévisible permet à l’IA de s’attaquer de manière concrète au problème notoirement complexe de la programmation parallèle.

La prise en charge de chaque nouvelle famille de modèles nécessite toujours de nouveaux kernels et des optimisations propres à chaque modèle. En utilisant Codex avec GPT‑Astra, l’équipe a porté en deux mois trois modèles à poids ouverts, absents du plan de production initial de Jalapeño, à un niveau de performance élevé. Cela a démontré à la fois la flexibilité de l’architecture et la rapidité avec laquelle l’IA peut nous aider à la programmer. Pour certains blocs d’attention et de mélange d’experts de GPT‑OSS, les implémentations générées par l’IA s’exécutaient de 1,5 à 1,8 fois plus rapidement que les implémentations existantes conçues par des experts humains. Ces chiffres concernent les blocs sélectionnés, et non le modèle complet, mais ils laissent entrevoir un nouveau cycle de développement à fort potentiel.

La voie à suivre pour une inférence efficace et ultra-rapide

L’infrastructure d’IA tire sa valeur des tâches concrètes et utiles qu’elle permet d’accomplir. En accomplissant davantage de tâches utiles avec la même puissance et le même matériel, Jalapeño peut nous aider à répondre à une demande accrue et à réduire le coût d’obtention d’un résultat satisfaisant. Pour OpenAI, cela peut améliorer le levier d’exploitation en permettant au travail utile et aux revenus de croître plus rapidement que les coûts de prestation. Cela peut également favoriser une adoption plus large et la poursuite des investissements dans de meilleurs modèles, produits et infrastructures. Une inférence plus rapide peut accélérer les itérations et ouvrir la voie à de nouveaux cas d’utilisation.

Jalapeño repousse les limites du possible en matière d’inférence efficace à faible latence :

  • Inférence en mode ultra-rapide avec des rendements qui n’étaient auparavant atteints qu’en mode rapide
  • Inférence en mode rapide avec des rendements jusqu’alors réservés au mode par lots
  • Une efficacité accrue pour l’inférence en mode par lots

Nous prévoyons commencer à déployer Jalapeño au sein de l’infrastructure de calcul d’OpenAI d’ici la fin de l’année. Il s’agit de la première génération d’une feuille de route multigénérationnelle : la Gen 2 est en plein développement, et la Gen 3 commence à prendre forme. Chaque génération s’appuiera sur nos apprentissages et permettra de faire progresser encore davantage l’efficacité et la rapidité.

Répondre à la demande croissante en IA nécessitera une capacité de calcul accrue provenant de toutes les sources disponibles. Nous continuerons de déployer à grande échelle les accélérateurs de NVIDIA et d’autres partenaires pour les charges de travail d’entraînement et d’inférence. Notre mission est de veiller à ce que l’intelligence artificielle générale profite à l’ensemble de l’humanité.

En prévision du déploiement, nous poursuivons la qualification en production et le perfectionnement du logiciel, préparons l’exploitation à grande échelle de Jalapeño et validons ses performances sur davantage de modèles. Les résultats obtenus jusqu’à présent montrent ce qu’il est possible d’accomplir en concevant l’ensemble du système de façon intégrée : une IA plus réactive, plus performante et plus autonome, fournie plus efficacement à un plus grand nombre de personnes.

Annexe

Jalapeño se situe sur la frontière de Pareto pour GPT‑OSS 120B

FRONTIÈRE DU DÉBIT PAR kW

InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP du package : Jalapeño 700 W; GB200 1 200 W

Jalapeño domine à tous les points de fonctionnement de GPT‑OSS

DÉBIT DE POINTE ET DÉBIT CORRESPONDANT

InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP du package : Jalapeño 700 W; GB200 1 200 W

TPS mixtes de pointe supérieurs/kW

≈1,9×

85 448 vs 44 960 mixte/kW

Latence de bout en bout réduite

≈1,7×

1,03 s vs 1,80 s

Réduire le TBT min

≈2,7×

0,69 vs. 1,87 ms (1 459 vs. 535 tok/s/utilisateur)

Plus de débit au TBT précédent

≈53,7×

22 935 vs 427 mixte/kW (à 535,28 tok/s/utilisateur)

Jalapeño se situe sur la frontière de Pareto pour DeepSeek R1 670B

FRONTIÈRE DU DÉBIT PAR kW

InferenceX · DeepSeek R1 MXFP4 · valeur nominale 8k/1k · STP · TDP du boîtier : Jalapeño 700 W; GB300 1 400 W

Jalapeño domine à tous les points de fonctionnement de DeepSeek R1

DÉBIT DE POINTE ET DÉBIT CORRESPONDANT

InferenceX · DeepSeek R1 MXFP4 · valeur nominale 8k/1k · STP · TDP du boîtier : Jalapeño 700 W; GB300 1 400 W

TPS mixtes de pointe supérieurs/kW

≈1,7×

19 641 vs 11 781 mixte/kW

Latence de bout en bout réduite

≈3,6×

1,65 s vs 5,99 s

Réduire le TBT min

≈4,1×

1,43 vs 5,90 ms (700 vs 169 tok/s/utilisateur)

Plus de débit au TBT précédent

≈104,3×

12 258 vs. 118 mixte/kW (à 169,41 tok/s/utilisateur)

Jalapeño se situe sur la frontière de Pareto pour Kimi K2.5 1T

FRONTIÈRE DU DÉBIT PAR kW

InferenceX · Kimi K2.5 MXFP4 · 8k/1k nominal · STP · TDP du boîtier : Jalapeño 700 W; GB300 1 400 W

Jalapeño est en tête sur l’ensemble des points de fonctionnement de Kimi K2.5

DÉBIT DE POINTE ET DÉBIT CORRESPONDANT

InferenceX · Kimi K2.5 MXFP4 · 8k/1k nominal · STP · TDP du boîtier : Jalapeño 700 W; GB300 1 400 W

TPS mixtes de pointe supérieurs/kW

≈1,5×

18 195 vs 11 862 mixte /kW

Latence de bout en bout réduite

≈ 3,4 ×

1,56 s vs 5,31 s

Réduire le TBT min

≈3,8×

1,44 vs 5,48 ms (694 vs 182 tok/s/utilisateur)

Plus de débit au TBT précédent

≈56,1×

6 744 vs. 120 mixtes/kW (à 182,46 tok/s/utilisateur)

Auteur

OpenAI