Les progrès de l’IA s’accélèrent le plus lorsque tout le système s’améliore de concert. C’est ainsi que j’envisage la stratégie de calcul d’OpenAI : un système intégré couvrant les centres de données et les puces, les modèles de pointe, notre plateforme de développement, les produits grand public et d’entreprise ainsi que les appareils natifs de l’IA, chaque couche renforçant la suivante.
De meilleurs logiciels rendent le matériel plus productif. Du matériel conçu pour nos charges de travail améliore la vitesse et l’efficacité. Des modèles plus performants permettent de créer de meilleurs produits, qui génèrent davantage de demande, d’utilisation et d’apprentissage. Ces signaux sont réinjectés dans le système et nous aident à l’améliorer de nouveau.
Aujourd’hui, nous avons publié les premiers résultats de performance mesurés de Jalapeño, la première puce d’inférence personnalisée d’OpenAI. Sur InferenceX, un banc d’essai public utilisant GPT‑OSS 120B, Jalapeño a atteint un débit de pointe par kilowatt supérieur et une latence de token inférieure à ceux des systèmes commerciaux comparés. La puce a aussi obtenu d’excellents résultats avec DeepSeek R1 et Kimi K2, montrant que ses gains s’étendent à plusieurs familles de modèles.
Jalapeño nous donne un meilleur contrôle sur l’exécution de nos modèles et sur les aspects économiques de leur mise à disposition. En développant ensemble le modèle, le logiciel de mise à disposition, la puce, la mémoire et le réseau, nous pouvons améliorer le débit, la latence, l’efficacité énergétique et les coûts comme un seul système. Cela crée une option interne crédible en complément des accélérateurs de nos autres partenaires, ce qui accroît notre capacité à associer chaque charge de travail au système le plus performant selon les paramètres économiques appropriés. Nous disposons maintenant de puces internes fonctionnelles aux résultats mesurés, et les générations futures sont déjà en chantier.
Les différentes charges de travail imposent différentes exigences au système. L’entraînement de pointe, l’inférence à haut volume et les agents toujours actifs ont des exigences différentes en matière de puces, de logiciels, de réseaux, d’énergie et de latence.
Notre objectif est de rester sur la frontière de Pareto en recherchant continuellement la meilleure combinaison de capacité, de vitesse, de fiabilité, d’efficacité et de coût pour chaque charge de travail. Différentes puces et différents fournisseurs excellent selon les critères, et la frontière ne cesse d’évoluer.
Notre portefeuille nous donne la diversité nécessaire pour répondre à ces besoins. La capacité de calcul de Microsoft et les puces de NVIDIA ont joué un rôle fondamental dans la croissance d’OpenAI. Aujourd’hui, notre portefeuille comprend également AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy et SoftBank. Chacun apporte des forces distinctes en matière d’infrastructure infonuagique, de calcul accéléré, d’inférence à faible latence, de développement de centres de données et d’approvisionnement énergétique.
Nous gérons activement ce portefeuille en fonction des capacités et des paramètres économiques. Nous utilisons des systèmes haut de gamme là où la capacité compte le plus et optimisons l’efficacité là où l’échelle et les coûts sont prioritaires. Le maintien d’un choix crédible de fournisseurs, de matériel et de modèles de déploiement nous permet d’orienter la demande vers le meilleur rendement par dollar, de préserver une discipline tarifaire lorsque les conditions du marché changent et de suivre la frontière à mesure que des technologies plus performantes apparaissent. Un contrôle direct accroît l’effet de levier là où une intégration plus étroite peut améliorer l’ensemble du système. Nous formons des partenariats lorsque l’écosystème nous aide à avancer plus vite et nous développons nos propres solutions lorsque la conception conjointe procure un avantage notable.
Les centres de données offrent un autre levier. Le projet Camellia, en Géorgie, montre comment nous pouvons concevoir des installations adaptées aux charges de travail des clients tout en créant des emplois, en soutenant les entreprises locales, en assumant les coûts d’infrastructure et d’énergie du projet, en préservant l’eau grâce à un système en circuit fermé et en soumettant ses engagements à un audit public annuel indépendant.
La valeur de ce système se mesure à ce qu’il produit : une intelligence plus utile pour chaque unité de calcul.
De meilleurs modèles trouvent la bonne réponse en moins de tentatives. Un routage et une gestion du contexte plus intelligents réduisent le travail inutile. Des logiciels optimisés et du matériel spécialisé améliorent la vitesse et l’efficacité énergétique.
Dans l’Artificial Analysis Coding Agent Index, GPT‑5.6 Sol avec un raisonnement Max a atteint un nouveau sommet tout en utilisant 54 % moins de tokens de sortie qu’un autre modèle de premier plan. Pour les clients, de telles améliorations signifient des résultats plus rapides, des produits plus fiables, moins de nouvelles tentatives, des agents capables d’exécuter des flux de travail plus longs et un coût total inférieur pour les tâches réussies. La meilleure rentabilité repose sur l’intelligence utile par dollar.
À mesure que l’intelligence utile gagne en capacité et devient plus abordable, davantage de tâches deviennent économiquement viables. Une entreprise peut fournir une analyse personnalisée à chaque client, examiner chaque contrat, simuler des scénarios financiers en direct et aider les ingénieurs à tester plus d’idées. C’est le paradoxe de Jevons : une efficacité accrue rend davantage d’utilisations avantageuses, ce qui augmente la consommation et crée une nouvelle activité économique grâce à l’accomplissement de plus de tâches, à de meilleures décisions, au lancement de plus de produits et à la génération de revenus supplémentaires.
Une capacité de calcul plus productive et une base d’approvisionnement plus concurrentielle nous aident à servir davantage de clients à moindre coût et à transmettre ces gains d’efficacité aux utilisateurs. La croissance finance des investissements continus dans la recherche, l’infrastructure et la sécurité. Voilà l’avantage cumulatif d’OpenAI : une meilleure technologie améliore la rentabilité, cette rentabilité finance la prochaine vague de progrès, et chaque gain renforce l’ensemble du système.


