Les progrès de l’IA s’accélèrent le plus lorsque l’ensemble du système s’améliore de concert. C’est ainsi que j’envisage la stratégie de calcul d’OpenAI : un système intégré couvrant les centres de données et les puces, les modèles de pointe, notre plateforme pour développeurs, les produits grand public et d’entreprise, ainsi que les appareils natifs pour l’IA, chaque couche renforçant la suivante.
De meilleurs logiciels rendent le matériel plus productif. Du matériel conçu pour nos charges de travail améliore la vitesse et l’efficacité. Des modèles plus performants permettent de créer de meilleurs produits, qui génèrent davantage de demande, d’utilisation et d’apprentissage. Ces signaux parcourent le système en sens inverse et nous aident à l’améliorer de nouveau.
Aujourd’hui, nous avons présenté les premiers résultats de performance mesurés de Jalapeño, la première puce d’inférence personnalisée d’OpenAI. Sur InferenceX, un benchmark public utilisant GPT‑OSS 120B, Jalapeño a fourni un débit de pointe par kilowatt supérieur et une latence par token inférieure à ceux des systèmes commerciaux comparés. Elle a également affiché d’excellentes performances avec DeepSeek R1 et Kimi K2, montrant que ses gains s’étendent à plusieurs familles de modèles.
Jalapeño nous donne davantage de contrôle sur l’exécution de nos modèles et sur les coûts de leur mise à disposition. En développant conjointement le modèle, le logiciel de mise à disposition, la puce, la mémoire et le réseau, nous pouvons améliorer le débit, la latence, l’efficacité énergétique et les coûts comme un seul système. Cela crée une solution interne crédible, parallèlement aux accélérateurs de nos autres partenaires, et renforce notre capacité à associer chaque charge de travail au système le plus performant, au coût approprié. Nous disposons désormais de puces opérationnelles conçues en interne, avec des résultats mesurés, et les générations futures sont déjà en cours de développement.
Les différentes charges de travail imposent des exigences différentes au système. L’entraînement de pointe, l’inférence à grand volume et les agents toujours actifs ont des exigences différentes en matière de puces, de logiciels, de réseaux, d’énergie et de latence.
Notre objectif est de rester sur la frontière de Pareto : rechercher continuellement, pour chaque charge de travail, la meilleure combinaison de capacités, de vitesse, de fiabilité, d’efficacité et de coût. Les puces et fournisseurs se distinguent dans des domaines différents, et la frontière ne cesse d’évoluer.
Notre portefeuille nous offre toute la diversité nécessaire pour répondre à ces besoins. La puissance de calcul de Microsoft et les puces de NVIDIA ont été essentielles à la croissance d’OpenAI. Aujourd’hui, notre portefeuille comprend également AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy et SoftBank. Chacun apporte des atouts distincts dans l’infrastructure cloud, le calcul accéléré, l’inférence à faible latence, le développement de centres de données et la fourniture d’énergie.
Nous gérons activement ce portefeuille en fonction des capacités et des coûts. Nous utilisons des systèmes haut de gamme là où les capacités comptent le plus et optimisons l’efficacité là où l’échelle et le coût sont prioritaires. Le maintien d’un choix crédible entre les fournisseurs, le matériel et les modèles de déploiement nous permet d’orienter la demande vers les meilleures performances par dollar, de conserver une discipline tarifaire à mesure que les conditions du marché évoluent et de suivre la frontière lorsque des technologies plus performantes apparaissent. Le contrôle direct accroît notre effet de levier lorsqu’une intégration plus étroite peut améliorer l’ensemble du système. Nous nouons des partenariats lorsque l’écosystème nous aide à avancer plus vite et construisons nous-mêmes lorsque la conception conjointe crée un avantage significatif.
Les centres de données offrent un autre levier. Le projet Camellia, en Géorgie, montre comment nous pouvons concevoir des installations adaptées aux charges de travail des clients tout en créant des emplois, en soutenant les entreprises locales, en couvrant les coûts d’infrastructure et d’énergie du projet, en préservant l’eau grâce à un système en circuit fermé et en soumettant ses engagements à un audit public indépendant annuel.
La valeur de ce système se mesure à ce qu’il produit : davantage d’intelligence utile pour chaque unité de calcul.
De meilleurs modèles trouvent la bonne réponse en moins de tentatives. Un routage et une gestion du contexte plus intelligents réduisent le travail inutile. Des logiciels optimisés et du matériel spécialisé améliorent la vitesse et l’efficacité énergétique.
Dans l’Artificial Analysis Coding Agent Index, GPT‑5.6 Sol avec un raisonnement maximal a établi un nouveau record tout en utilisant 54 % de tokens de sortie en moins qu’un autre modèle de premier plan. Pour les clients, de telles améliorations signifient des résultats plus rapides, des produits plus fiables, moins de nouvelles tentatives, des agents capables de mener à bien des processus plus longs et un coût total inférieur pour les tâches réussies. La meilleure rentabilité repose sur l’intelligence utile obtenue par dollar.
À mesure que l’intelligence utile gagne en capacités et devient plus abordable, davantage de tâches deviennent économiquement viables. Une entreprise peut fournir une analyse personnalisée à chaque client, examiner chaque contrat, exécuter des scénarios financiers en temps réel et aider les ingénieurs à tester davantage d’idées. C’est le paradoxe de Jevons : une efficacité accrue rentabilise davantage d’usages, ce qui augmente la consommation et crée une nouvelle activité économique grâce à un plus grand nombre de tâches accomplies, de meilleures décisions, davantage de produits lancés et de revenus générés.
Une puissance de calcul plus productive et une offre plus concurrentielle nous aident à servir davantage de clients à moindre coût et à transmettre ces gains d’efficacité aux utilisateurs. La croissance finance des investissements continus dans la recherche, l’infrastructure et la sécurité. C’est l’avantage cumulatif d’OpenAI : une meilleure technologie améliore la rentabilité, cette rentabilité finance la prochaine vague de progrès et chaque gain renforce l’ensemble du système.


