OpenAI et Broadcom dévoilent une puce d’inférence pour LLM
- Les premiers essais montrent que l’accélérateur de première génération offrira une performance par watt nettement supérieure à celui des solutions les plus avancées actuelles.
- Conçu dès le départ pour les LLM actuels et futurs dans tout le secteur
- Développé de la conception à la production en neuf mois, grâce à l’accélération des modèles d’OpenAI
- Élargit la plateforme complète d’OpenAI, des produits aux modèles, et maintenant aux puces
- Déploiement à l’échelle du gigawatt avec des partenaires exploitant des centres de données, sur plusieurs générations.
OpenAI et Broadcom (NASDAQ: AVGO) ont dévoilé aujourd’hui Jalapeño, le premier processeur d’intelligence d’OpenAI : un accélérateur conçu autour de la vision d’OpenAI pour l’avenir de l’inférence LLM. Il s'agit également du premier accélérateur d'IA d’une plateforme de calcul à plusieurs générations que les entreprises développent ensemble afin de rendre l’IA avancée plus rapide, plus fiable et accessible au plus grand nombre.

Jalapeño a été remis à Sam Altman, chef de la direction d’OpenAI, et à Greg Brockman, président, par Hock Tan, président et chef de la direction de Broadcom, et Charlie Kawwas, président, marquant une étape importante dans la stratégie d’OpenAI visant à bâtir l’ensemble de la pile technologique qui sous-tend ses modèles et ses produits.
OpenAI a conçu la puce de zéro, en s’appuyant sur sa connaissance approfondie des fondements des LLM et sur sa feuille de route en matière de modèles, de noyaux, de systèmes de service et de besoins produits. Ses partenaires Broadcom et Celestica contribuent à industrialiser la plateforme grâce à la mise en œuvre de la puce, aux cartes, à l’intégration des cartes et des baies, en passant par les réseaux haute performance et les systèmes de production évolutifs. Jalapeño est conçue avec la souplesse nécessaire afin de fonctionner avec tous les LLM, grâce aux enseignements d’OpenAI sur les besoins d’inférence des modèles d'IA actuels et futurs dans tout le secteur. Des échantillons d’ingénierie de la puce Jalapeño exécutent déjà en laboratoire des charges de travail d’apprentissage automatique à la fréquence et à la consommation électrique cibles de production, notamment avec GPT‑5.3‑Codex‑Spark.
Même si OpenAI mesure encore les performances finales, les premiers essais montrent que Jalapeño offrira une performance par watt nettement supérieure à celui des solutions les plus avancées actuelles. Un rapport technique détaillé sur les performances sera présenté dans les prochains mois. L’architecture réduit les déplacements de données et équilibre les ressources de calcul, de mémoire et de réseau afin d’atteindre un taux d'utilisation réelle beaucoup plus proche des performances théoriques maximales. Les technologies de mise en œuvre de la puce de Broadcom et ses technologies de réseau, comme la puce de réseautage Tomahawk, contribuent à porter la plateforme à la production à grande échelle.
« Le monde se dirige vers une économie propulsée par le calcul », a déclaré Greg Brockman, président et cofondateur d’OpenAI. « Jalapeño s’inscrit dans notre stratégie à long terme visant à bâtir une infrastructure technologique intégrée, afin de rendre la puissance de calcul plus abondante. Cela permettra de rendre d'IA plus rapide, plus fiable et plus abordable aux particuliers comme aux entreprises, et capable de servir à résoudre des problèmes toujours plus importants. En concevant nous-mêmes une plus grande partie de cette infrastructure technologique, nous pouvons fournir davantage d’intelligence avec plus d’efficacité et continuer à rendre l’IA avancée accessible au plus grand nombre. »
« Jalapeño a été conçu dès le départ pour l’inférence LLM en s’appuyant sur les connaissances approfondies issus de notre étroite collaboration avec les chercheurs d’OpenAI », a déclaré Richard Ho, responsable du programme matériel d’OpenAI. « Nous avons optimisé l’architecture autour des noyaux, des déplacements de mémoire, du réseautage et des modèles d'inférence qui sont les plus importants pour les modèles d'IA de pointe. D’après les premiers essais, Jalapeño exécutera efficacement nos charges de travail les plus importantes en s’approchant des limites théoriques du matériel. »
« Notre collaboration avec OpenAI témoigne d’un engagement fondamental à faire évoluer l’infrastructure physique nécessaire pour la prochaine décennie de l’IA », a déclaré Hock Tan, président et chef de la direction de Broadcom. « Ce n’est que le début d’une feuille de route s’étendant sur plusieurs générations. En codéveloppant notre puce de pointe directement avec OpenAI, nous permettons dès 2026 le déploiement de centres de données à l’échelle du gigawatt avec Microsoft et d’autres partenaires. »
Jalapeño est une architecture conçue entièrement de zéro destinée à l’inférence LLM moderne, et non un accélérateur généraliste adapté à partir de charges de travail d'IA antérieures. Elle s’appuie sur les systèmes qu’OpenAI exploite chaque jour dans ChatGPT, Codex, l’API et de futurs produits fondés sur des agents, tout en étant aussi conçue pour les LLM actuels et futurs de tout le secteur. L’objectif est de combiner la puissance et le débit des principaux accélérateurs d'IA d’aujourd’hui avec une latence plus proche de celle des systèmes d’inférence spécialisés les plus rapides, ce qui rend Jalapeño bien adapté aux produits LLM interactifs à grande échelle.
C’est tout l’avantage d’une approche intégrée de bout en bout. OpenAI ne se contente pas de développer des modèles de pointe ou de créer des produits qui en tirent parti; elle conçoit l’infrastructure sous-jacente : architecture de puces, noyaux, systèmes de mémoire, réseautage, ordonnancement, systèmes de déploiement et expérience produit. Comme OpenAI intervient à tous les niveaux de la chaîne technologique, chaque couche peut être optimisée autour du même objectif : rendre ses modèles plus rapides, plus fiables et plus abordables pour les utilisateurs.
Jalapeño renforce la boucle vertueuse qui soutient les progrès d’OpenAI. Une meilleure infrastructure accroît l’efficacité du calcul. Une plus grande efficacité du calcul permet d’entraîner et d’exploiter les modèles plus efficacement, ce qui se traduit au bout du compte par des modèles d'IA plus performants. De meilleurs modèles deviennent de meilleurs produits pour les particuliers, les développeurs et les entreprises. De meilleurs produits entraînent plus d’utilisation, plus de clients et plus de revenus, ce qui permet à OpenAI de réinvestir dans la prochaine génération d’infrastructure. Avec le temps, ce cycle contribue à rendre l’intelligence plus performante, plus fiable et moins coûteuse pour tout le monde.
Jalapeño a été codéveloppé, de la conception initiale au tape-out de fabrication, en seulement neuf mois; selon nous, ce programme d’accélérateur d'IA sur mesure représente le cycle de développement d’ASIC le plus rapide jamais réalisé dans les semi-conducteurs avancés à haute performance. Cette rapidité est le fruit d’une étroite collaboration entre les équipes logicielle et matérielles d’OpenAI, de l’expertise de Broadcom dans la mise en œuvre de la puce et de l’utilisation des modèles d’OpenAI pour accélérer certaines parties du processus de conception et d’optimisation.
Les mêmes modèles mis à la disposition des utilisateurs aident à améliorer l’infrastructure qui servira à exécuter les futurs modèles. Si l’IA peut aider les ingénieurs à concevoir plus rapidement de meilleures puces, elle peut réduire le coût du calcul informatique dans tout le secteur et contribuer à démocratiser l’accès à l’IA avancée.
Jalapeño est la première étape d’une plateforme de calcul multigénérationnelle conçue pour un premier déploiement d’ici la fin de 2026 et appelée à prendre de l’ampleur dans les années suivantes. Cette plateforme combine les accélérateurs conçus par OpenAI avec mise en œuvre de la puce, les technologies de réseau et la connectivité de Broadcom, ainsi que l’expertise de Celestica en matière de cartes, de baies et d'intégration de systèmes.
Le but de ce travail est simple : l’inférence est le point de contact entre l’IA et les gens. Chaque amélioration du coût, de la vitesse et de la fiabilité peut se traduire par une réponse plus rapide dans ChatGPT, une tâche Codex capable d’enchaîner davantage d’étapes avec moins d’attente, un produit d’API moins coûteux à créer ou un accès plus fiable lorsque la demande est élevée.
Démocratiser l’IA signifie rendre les modèles avancés suffisamment accessibles, fiables et abordables pour qu’un plus grand nombre de personnes les utilisent chaque jour. Jalapeño aide OpenAI à transformer une plus grande part de son infrastructure en intelligence utile pour les étudiants, les développeurs, les petites entreprises, les chercheurs, les grandes organisations et toute personne qui cherche à apprendre, à créer ou à résoudre des problèmes complexes.


