Les premiers résultats de Jalapeño affichent une vitesse et une efficacité de pointe en inférence IA

Depuis l’annonce de Jalapeño, la première puce d’inférence sur mesure d’OpenAI, nous testons la puce et le système conçu autour d’elle. Les résultats montrent un gain de performances significatif : Jalapeño traite davantage de tâches d’IA par unité de puissance et renvoie les réponses plus rapidement. Jalapeño offre à la fois un débit supérieur et une latence réduite avec une seule architecture, alors que les systèmes matériels existants doivent souvent choisir entre les deux.
Pour les clients, cela peut se traduire par des réponses plus rapides, des agents plus réactifs et un accès plus fiable à mesure que la demande augmente. Notre mission est de faire en sorte que l’intelligence artificielle générale profite à toute l’humanité. Ces avancées contribueront à rendre une IA de plus en plus performante, plus abordable et largement accessible.
Les modèles d’OpenAI ont également accéléré le développement de Jalapeño. Les générations précédentes ont aidé l’équipe à concevoir et à mettre au point la puce, tandis que nos modèles les plus récents accélèrent son optimisation et sa programmation. Les performances de Jalapeño s’étendent à GPT‑OSS 120B, DeepSeek R1 et Kimi K2.5 1T, ce qui montre que l’architecture fonctionne avec des modèles développés au sein d’OpenAI comme en dehors. Dans les trois cas, Jalapeño a fourni 1,5 à 1,9 fois plus de travail d’IA par watt au débit de pointe et une latence de bout en bout 1,7 à 3,6 fois inférieure à celle des systèmes de comparaison. Pour les charges de travail très interactives, il a offert des performances 2,1 à 4,1 fois supérieures.
Jalapeño illustre également un avantage plus large d’une approche full-stack. OpenAI peut concevoir conjointement des modèles, des produits, des logiciels d’inférence, des puces, de la mémoire, des réseaux et des systèmes, en s’appuyant sur les enseignements tirés de charges de travail réelles pour améliorer chaque couche de la pile. Jalapeño est une puce propriétaire conçue en interne, avec des résultats mesurés, et marque le début d’une plateforme couvrant plusieurs générations. Dans les mois à venir, nous augmenterons progressivement le déploiement de Jalapeño afin de proposer à nos clients des produits plus rapides, plus performants et plus efficaces.
Nous évaluons les performances avec une expérience utilisateur équivalente, en mesurant la quantité de travail utile d’IA que chaque système peut accomplir par unité de puissance tout en respectant les exigences de latence des clients et des agents interactifs. C’est particulièrement important pour les agents, qui doivent exécuter de nombreuses étapes successives : les retards peuvent donc s’accumuler sur l’ensemble d’une tâche.
Pour comprendre les performances concrètes de Jalapeño, nous l’avons testé sur InferenceX, un benchmark public de SemiAnalysis qui mesure l’ensemble du processus de traitement d’une requête d’IA. Nous avons comparé Jalapeño aux principaux systèmes d’IA commerciaux disponibles sur l’ensemble de la plage de fonctionnement testée, du traitement à débit élevé aux usages très interactifs à faible latence. Jalapeño a offert une meilleure combinaison de débit, d’efficacité énergétique et de latence. Bien que les performances soient parfois indiquées par puce, nous estimons que la norme la plus utile est celle des performances par unité de puissance.
Sur les trois modèles publics, Jalapeño a offert une meilleure combinaison de performances par watt et de latence sur l’ensemble de la plage de fonctionnement testée, ce qui le place sur la frontière de Pareto. Afin de comparer les systèmes de manière cohérente, nous avons normalisé les résultats en utilisant la puissance nominale publiée de la puce de chaque accélérateur. Jalapeño affiche une puissance nominale de 700 W, bien que sa puissance soutenue mesurée soit restée inférieure ou égale à 550 W pour les charges de travail testées.
Jalapeño a affiché de solides performances sur GPT‑OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T. Pour Kimi, le plus grand modèle public testé, il a fourni des performances de pointe par watt environ 1,5 fois supérieures et une latence de bout en bout 3,4 fois inférieure à celle du système de comparaison. Lors de nos tests internes, l’avantage de Jalapeño s’est encore accentué sur les modèles OpenAI de pointe, ce qui suggère que l’architecture devient plus précieuse à mesure que les charges de travail deviennent plus importantes et plus exigeantes.
Jalapeño a été conçu dès le départ autour de la question suivante : quel matériel construirions-nous si sa mission principale était de faire fonctionner les modèles de langage modernes et futurs, en particulier les agents interactifs ? Les gains de Jalapeño proviennent de la conception conjointe de la puce, de la mémoire, du réseau, du logiciel et du système à l’échelle du rack, en fonction des charges de travail réelles des modèles de langage. L’inférence des modèles de langage se déroule en plusieurs phases distinctes, avec des goulets d’étranglement différents. La phase de préremplissage, pendant laquelle le système traite un prompt, est gourmande en calcul, tandis que la phase de décodage, pendant laquelle le système génère la réponse token par token, est davantage limitée par la bande passante mémoire. La communication peut également ajouter de la latence lorsque les données doivent circuler entre les cœurs et les puces, laissant certaines unités de traitement inactives pendant leur attente. Un système qui excelle dans une phase peut perdre cet avantage lorsqu’il attend des données ou déplace l’état du modèle entre différentes ressources.
Nous avons conçu Jalapeño pour réduire les déplacements de données et les délais de communication. Cela signifie que l’état du modèle, y compris le cache KV utilisé pendant la génération d’une réponse, peut être positionné explicitement et conservé localement, tandis que le système active la combinaison adaptée de ressources de calcul, de mémoire et de réseau pour chaque phase d’inférence. Le réseau fait partie intégrante de l’architecture. Sa large couverture permet à l’ensemble de la charge de travail de rester au sein d’un seul système connecté, ce qui réduit les déplacements de données et contribue à maintenir la rapidité et l’efficacité de la requête de bout en bout. Il en résulte un accélérateur équilibré et polyvalent, capable de prendre en charge l’évolution des architectures de modèles, d’exceller à la fois dans le préremplissage et le décodage et de s’adapter à l’évolution de l’équilibre entre ces deux phases, une caractéristique déterminante des charges de travail d’agents.
L’IA a joué un rôle direct dans le développement de Jalapeño. Elle a permis à l’équipe de passer de la conception initiale au tape-out en neuf mois, en explorant différentes implémentations, en raccourcissant les cycles de conception, de mesure et de vérification et en itérant en continu sur les charges de travail des modèles. L’IA a également contribué à optimiser les circuits arithmétiques de la puce, ce qui a permis à l’équipe d’y intégrer davantage de performances de calcul dans les délais prévus.
Jalapeño a été conçu comme une cible de programmation claire et prévisible, aussi bien pour les humains que pour l’IA. Les ingénieurs peuvent décrire le travail à l’aide de tenseurs locaux, d’une communication explicite et d’une synchronisation prévisible. L’IA peut ensuite optimiser la manière dont ce travail est réparti, positionné, planifié et coordonné dans l’ensemble du système. Cette structure claire et prévisible donne à l’IA un moyen concret de s’attaquer au problème traditionnellement difficile de la programmation parallèle.
La prise en charge de chaque nouvelle famille de modèles nécessite toujours de nouveaux noyaux et des optimisations propres à chaque modèle. Avec Codex et GPT‑Astra, l’équipe a amené à un haut niveau de performance, en moins de deux mois, trois modèles à poids ouverts qui ne faisaient pas partie du plan de production initial de Jalapeño. Cela a démontré à la fois la flexibilité de l’architecture et la rapidité avec laquelle l’IA peut nous aider à la programmer. Pour certains blocs d’attention et de mixture-of-experts de GPT‑OSS, les implémentations générées par l’IA se sont exécutées 1,5 à 1,8 fois plus vite que les implémentations existantes écrites par des experts humains. Ces chiffres concernent les blocs sélectionnés et non le modèle complet, mais ils ouvrent la voie à une nouvelle boucle de développement particulièrement prometteuse.
L’infrastructure d’IA tire sa valeur des applications concrètes qu’elle rend possibles. En produisant davantage de travail utile avec la même puissance et le même matériel, Jalapeño peut nous aider à répondre à une demande accrue et à réduire le coût d’obtention d’un résultat utile. Pour OpenAI, cela peut améliorer le levier opérationnel en permettant au travail utile et au chiffre d’affaires de croître plus vite que le coût de fourniture du service. Cela peut également favoriser une adoption plus large et la poursuite des investissements dans de meilleurs modèles, produits et infrastructures. Une inférence plus rapide peut accélérer les itérations et ouvrir la voie à de nouveaux cas d’usage.
Jalapeño élargit les possibilités d’une inférence efficace à faible latence :
- Inférence en mode ultra-rapide avec une efficacité jusque-là réservée au mode rapide
- Inférence en mode rapide avec une efficacité jusque-là réservée au mode par lots
- Efficacité accrue de l’inférence en mode par lots
Nous prévoyons de commencer à déployer Jalapeño au sein de l’infrastructure de calcul d’OpenAI d’ici la fin de l’année. Il s’agit de la première génération d’une feuille de route couvrant plusieurs générations : la Gen 2 est déjà bien avancée et la Gen 3 prend forme. Chaque génération s’appuiera sur les enseignements tirés pour améliorer encore l’efficacité et la vitesse.
Répondre à la demande croissante en matière d’IA nécessitera davantage de capacité de calcul issue de toutes les sources disponibles. Nous continuerons à déployer largement les accélérateurs de NVIDIA et d’autres partenaires pour les charges d’entraînement et d’inférence. Notre mission est de faire en sorte que l’intelligence artificielle générale profite à toute l’humanité.
Alors que nous nous préparons au déploiement, nous poursuivons la qualification en production, faisons progresser le logiciel, préparons l’exploitation de Jalapeño à grande échelle et validons les performances sur davantage de modèles. Les résultats obtenus jusqu’à présent montrent ce qui devient possible lorsque nous concevons l’ensemble du système de manière coordonnée : une IA plus réactive, plus performante et plus autonome, fournie plus efficacement à un plus grand nombre de personnes.
Frontière du débit par kW
InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP du package : Jalapeño 700 W ; GB200 1 200 W
DÉBIT DE POINTE ET DÉBIT À VITESSE ÉQUIVALENTE
InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP du package : Jalapeño 700 W ; GB200 1 200 W
Débit mixte de pointe supérieur/kW
≈1,9×
85 448 contre 44 960 mixed/kW
Latence de bout en bout réduite
≈1,7×
1,03 s contre 1,80 s
TBT minimal inférieur
≈2,7×
0,69 contre 1,87 ms (1 459 contre 535 tokens/s/utilisateur)
Débit supérieur pour le TBT précédent
≈53,7×
22 935 contre 427 mixed/kW (à 535,28 tok/s/utilisateur)
Frontière du débit par kW
InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP du boîtier : Jalapeño 700 W ; GB300 1 400 W
DÉBIT DE POINTE ET DÉBIT À VITESSE ÉQUIVALENTE
InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP du boîtier : Jalapeño 700 W ; GB300 1 400 W
Débit mixte de pointe supérieur/kW
≈1,7×
19 641 contre 11 781 mixed/kW
Latence de bout en bout réduite
≈3,6×
1,65 s contre 5,99 s
TBT minimal inférieur
≈4.1×
1,43 vs 5,90 ms (700 vs 169 tok/s/utilisateur)
Débit supérieur pour le TBT précédent
≈104,3×
12 258 contre 118 mixed / kW (à 169,41 tok/s/utilisateur)
Frontière du débit par kW
InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · TDP du package : Jalapeño 700 W ; GB300 1 400 W
DÉBIT DE POINTE ET DÉBIT À VITESSE ÉQUIVALENTE
InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · TDP du package : Jalapeño 700 W ; GB300 1 400 W
Débit mixte de pointe supérieur/kW
≈1,5×
18 195 contre 11 862 mixed/kW
Latence de bout en bout réduite
≈3.4×
1,56 s contre 5,31 s
TBT minimal inférieur
≈3,8×
1,44 contre 5,48 ms (694 contre 182 tok/s/utilisateur)
Débit supérieur pour le TBT précédent
≈56,1×
6 744 contre 120 mixed/kW (à 182,46 tok/s/utilisateur)


