Repousser la frontière prix-performance avec GPT‑5.6
En améliorant l’efficacité de chaque couche, OpenAI offre un meilleur rapport performance-prix pour davantage de charges de travail en entreprise.
Hier, nous avons expliqué comment GPT‑5.6 avait contribué à rendre sa propre exécution plus efficace. Aujourd’hui, nous faisons profiter nos clients de ces gains en baissant les prix de GPT‑5.6 Luna(ouverture dans une nouvelle fenêtre) et Terra(ouverture dans une nouvelle fenêtre), et en accélérant GPT‑5.6 Sol dans l’API. Ensemble, ces nouveautés permettent aux clients de mieux rentabiliser chaque dollar investi dans l’IA et d’aller plus vite lorsque le temps compte.
Dès aujourd’hui, GPT‑5.6 Luna, notre modèle le plus rapide et le plus abordable, coûtera 80 % moins cher, tandis que GPT‑5.6 Terra, notre modèle équilibré pour le travail quotidien, coûtera 20 % moins cher. La baisse des prix de Luna et Terra se répercute également sur la comptabilisation de l’utilisation dans les abonnements payants avec Codex et ChatGPT Work. Luna offre aux entreprises un moyen bien plus économique de traiter de gros volumes de travail avec un niveau de qualité très élevé. Il peut utiliser des outils et mener à bien des workflows en plusieurs étapes, rendant ainsi un éventail plus large d’applications d’IA viables à grande échelle.
Rendre l’intelligence avancée plus abondante et abordable est au cœur de la mission d’OpenAI, qui consiste à faire en sorte que l’AGI profite à toute l’humanité. Ces changements concrétisent cet engagement. Ils sont le fruit d’années d’amélioration de la conception, du déploiement et de la mise à contribution de nos modèles.
Nous lançons également le mode Rapide dans l’API, en remplacement de notre offre Priority Processing. Pour GPT‑5.6 Sol, le mode Rapide offre désormais une vitesse jusqu’à 2,5 fois supérieure au traitement Standard, pour un prix deux fois plus élevé et sans changement d’Intelligence. Le mode Rapide est rétrocompatible : les requêtes portant le tag priority l’utiliseront automatiquement.
Utiliser efficacement l’IA commence par définir le résultat recherché. Les enjeux, le coût d’une erreur, l’urgence et l’échelle déterminent le juste équilibre entre intelligence, vitesse, fiabilité et coût. Cet équilibre peut changer d’une étape à l’autre d’un workflow.
GPT‑5.6 offre aux entreprises une marge de manœuvre bien plus grande pour optimiser cette équation. Luna offre des performances comparables à celles de modèles considérés comme de pointe il y a un an, pour environ 6 cents par dollar et par tâche, et à une vitesse près de neuf fois supérieure. Pour les tâches professionnelles mesurées par Agents’ Last Exam, Luna surpasse Fable 5 avec un coût estimé par tâche inférieur de près de 99 %.
Concrètement, les entreprises peuvent définir le résultat et le niveau de qualité recherchés, puis s’appuyer sur des évaluations pour déterminer où davantage d’intelligence améliore sensiblement le résultat et où un traitement plus rapide et moins coûteux offre la même qualité. Un workflow de programmation peut, par exemple, utiliser Sol pour lever les incertitudes et définir le plan, puis Luna pour mettre en œuvre des changements bien spécifiés, écrire et exécuter des tests, et évaluer les résultats. Un autre workflow pourra nécessiter un équilibre différent.
La famille GPT‑5.6 élargit l’éventail de ces choix. Les entreprises peuvent mobiliser à chaque étape le niveau maximal d’intelligence utile, tout en payant un prix adapté à la valeur créée.
Pour offrir cette souplesse, il faut d’abord rendre plus efficace chaque couche sous-jacente aux modèles.
Notre avantage en matière d’efficacité repose sur l’amélioration des modèles, des systèmes d’inférence qui les exécutent et du harnais agentique qui les relie aux outils et au contexte. Les modèles GPT‑5.6 vont plus directement à l’essentiel. Un meilleur routage optimise l’utilisation du matériel, des logiciels de production optimisés génèrent les tokens plus efficacement, et une gestion plus intelligente du contexte évite aux agents de répéter un travail déjà accompli. Ensemble, ces améliorations nous permettent d’accomplir davantage de travail utile avec la même puissance de calcul, en réduisant le temps, le nombre de tokens et le coût nécessaires à chaque résultat.
GPT‑5.6 Sol nous aide de plus en plus à identifier et concrétiser la prochaine vague de gains. Dans le cadre d’un processus supervisé par des humains, Sol a réécrit et optimisé de manière autonome des kernels de production, conçu et mené des centaines d’expériences pour améliorer la génération de tokens, et surveillé l’entraînement en intervenant lorsque des problèmes survenaient. Le travail sur les kernels a permis de réduire de 20 % le coût de bout en bout du déploiement du modèle, tandis que les expériences ont accru de plus de 15 % l’efficacité de la génération de tokens. Ces travaux se poursuivent et créent une boucle de rétroaction plus étroite : à mesure que nos modèles progressent et gagnent en autonomie, notre capacité à améliorer l’efficacité s’accélère. En savoir plus sur l’ingénierie qui sous-tend GPT‑5.6.
Répondre à la demande d’une intelligence abondante exige à la fois davantage de puissance de calcul et une meilleure exploitation de celle-ci. Nous constituons un portefeuille d’infrastructures résilient et affectons chaque charge de travail aux systèmes les mieux adaptés à son exécution. Cette approche couvre les deux extrémités de la courbe prix-performance. Du côté des coûts les plus bas, les nouveaux prix de Luna et Terra rendent le traitement de gros volumes économiquement viable à une échelle bien supérieure. À la pointe, le mode Rapide donne aux clients de l’API un accès accéléré à Sol lorsque le temps de réponse est déterminant.
Les entreprises peuvent intégrer davantage d’IA à leurs opérations quotidiennes sans sacrifier la vitesse pour leurs tâches les plus stratégiques. L’analyse de documents à grande échelle, la classification des interactions clients et les implémentations courantes peuvent devenir économiquement viables à grande échelle, tandis que les charges de travail complexes de Sol peuvent aller plus vite lorsque le surcoût est justifié.
Ces gains peuvent se cumuler. Dans le cadre d’un processus supervisé par des humains, des modèles plus performants aident notre équipe technique à trouver la prochaine génération d’améliorations, accélérant ainsi l’obtention de meilleures performances à moindre coût. Notre stratégie reste axée sur le progrès conjoint des capacités et de l’efficacité, afin que chaque génération d’intelligence puisse accomplir davantage de travail à moindre coût.
GPT‑5.6 Terra et Luna restent disponibles dans ChatGPT Work, Codex et l’API OpenAI. Dans ChatGPT Work et Codex, les utilisateurs des offres Free et Go peuvent accéder à Terra, tandis que ceux des offres Plus, Pro, Business et Enterprise peuvent choisir Terra ou Luna.
À compter du 30 juillet, les tarifs de l’API seront de 2 $ par million de tokens d’entrée et de 12 $ par million de tokens de sortie pour Terra, contre 0,20 $ et 1,20 $ respectivement pour Luna. Le tarif de Sol reste inchangé. Les prix des abonnements et les quotas de ChatGPT et Codex restent inchangés, tandis que l’utilisation de Terra et Luna consomme désormais moins de crédits. Le déploiement des nouveaux tarifs dans AWS commencera plus tard dans la journée.
Le mode Rapide de GPT‑5.6 Sol remplace Priority Processing dans l’API et s’aligne sur /fast dans Codex. Les requêtes API existantes portant le tag priority continueront de fonctionner. Consulter tous les détails des tarifs de l’API.


