Passer au contenu principal
OpenAI

30 juillet 2026

Produit

Repousser les limites du rapport qualité-prix avec GPT‑5.6

En améliorant l’efficacité de chaque couche, OpenAI offre un meilleur rendement par dollar pour un éventail accru de charges de travail d’entreprise.

Chargement…

Hier, nous avons expliqué comment GPT‑5.6 avait contribué à rendre sa propre exécution plus efficace. Aujourd’hui, nous faisons profiter nos clients de ces gains en réduisant les prix de GPT‑5.6 Luna(s'ouvre dans une nouvelle fenêtre) et Terra(s'ouvre dans une nouvelle fenêtre), et en accélérant GPT‑5.6 Sol dans l’API. Ensemble, ces mises à jour permettent aux clients de tirer davantage de chaque dollar investi dans l’IA et d’avancer plus vite lorsque chaque instant compte.

Dès aujourd’hui, GPT‑5.6 Luna, notre modèle le plus rapide et le plus abordable, coûtera 80 % moins cher, tandis que GPT‑5.6 Terra, notre modèle équilibré pour le travail quotidien, coûtera 20 % moins cher. La baisse des prix de Luna et de Terra se reflète également dans la façon dont leur utilisation est comptabilisée dans les abonnements payants avec Codex et ChatGPT Work. Luna offre aux entreprises un moyen beaucoup plus économique de traiter d’importants volumes de travail avec un très haut niveau de qualité. Il peut utiliser des outils et exécuter des flux de travail en plusieurs étapes, ce qui permet de déployer à grande échelle un éventail élargi d’applications d’IA.

Rendre l’intelligence avancée plus abondante et plus abordable est au cœur de la mission d’OpenAI, qui consiste à faire en sorte que l’AGI profite à toute l’humanité. Ces changements concrétisent cet engagement. Ils témoignent d’années d’améliorations apportées à la conception, au déploiement et à l’utilisation de nos modèles.

Nous lançons également le Mode rapide dans l’API, en remplacement de notre offre de traitement prioritaire. Pour GPT‑5.6 Sol, le Mode rapide offre maintenant une vitesse jusqu’à 2,5 fois supérieure au traitement standard, pour le double du prix et sans aucun compromis sur l’intelligence. Le Mode rapide est rétrocompatible : les requêtes marquées comme prioritaires l’utiliseront automatiquement.

1 sur 6
GPT‑5.6 Luna est ce qui se rapproche le plus d’une intelligence si peu coûteuse qu’elle devient pratiquement gratuite. Je n’ai jamais vu un modèle aussi abordable être aussi puissant — il permet à Replit d’envisager des cas d’utilisation que nous ne pensions pas pouvoir développer avant longtemps.
Michele Catasta, président & chef de l’IA, Replit

Adapter l’intelligence au résultat recherché

L’utilisation efficace de l’IA commence par le résultat recherché. Les enjeux, le coût d’une erreur, l’urgence et l’échelle déterminent le juste équilibre entre intelligence, vitesse, fiabilité et coût. Cet équilibre peut changer d’une étape du flux de travail à l’autre.

GPT‑5.6 donne aux entreprises beaucoup plus de latitude pour optimiser cette équation. Luna offre des performances comparables à celles de modèles qui étaient de pointe il y a un an, pour environ 6 cents par dollar et par tâche, et à une vitesse près de neuf fois supérieure. Pour le travail professionnel, selon Agents’ Last Exam, Luna surpasse Fable 5 à un coût estimé par tâche inférieur de près de 99 %.

En pratique, les entreprises peuvent définir le résultat et le niveau de qualité recherchés, puis utiliser des évaluations pour déterminer où une intelligence accrue améliore réellement le résultat et où un traitement plus rapide et moins coûteux offre la même qualité. Par exemple, un flux de développement pourrait utiliser Sol pour lever les incertitudes et définir le plan, puis Luna pour mettre en œuvre des changements bien définis, écrire et exécuter des tests, et évaluer les résultats. Un autre flux de travail pourrait nécessiter un équilibre différent.

La famille GPT‑5.6 élargit l’éventail de ces choix. Les entreprises peuvent appliquer le maximum d’intelligence utile à chaque étape, tout en payant un prix adapté à la valeur créée.

Pour offrir cette souplesse, il faut d’abord accroître l’efficacité de chaque couche sous-jacente aux modèles.

Comment nous repoussons les limites de l’efficacité

Notre avance en matière d’efficacité repose sur l’amélioration des modèles, des systèmes d’inférence qui les exécutent et du harnais agentique qui les relie aux outils et au contexte. Les modèles GPT‑5.6 accomplissent le travail de façon plus directe. Un meilleur acheminement optimise l’utilisation du matériel, des logiciels de production optimisés génèrent les tokens plus efficacement et une gestion plus intelligente du contexte évite aux agents de répéter le travail déjà accompli. Ensemble, ces améliorations nous permettent d’accomplir davantage de travail utile avec la même puissance de calcul, tout en réduisant le temps, le nombre de tokens et le coût nécessaires à chaque résultat.

GPT‑5.6 Sol nous aide de plus en plus à trouver et à réaliser la prochaine série de gains. Dans le cadre d’un processus dirigé par des humains, Sol a réécrit et optimisé de façon autonome des noyaux de production, conçu et mené des centaines d’expériences pour améliorer la génération de tokens, et surveillé l’entraînement en intervenant lorsque des problèmes survenaient. Le travail sur les noyaux a contribué à réduire de 20 % le coût total de déploiement du modèle, tandis que ses expériences ont accru de plus de 15 % l’efficacité de la génération de tokens. Ce travail se poursuit et crée une boucle de rétroaction plus étroite : à mesure que nos modèles s’améliorent et gagnent en autonomie, notre capacité à accroître l’efficacité s’accélère. En savoir plus sur l’ingénierie derrière GPT‑5.6.

Une stratégie de calcul conçue pour le déploiement à grande échelle

Répondre à la demande d’une intelligence abondante exige à la fois une puissance de calcul accrue et une meilleure productivité de celle-ci. Nous bâtissons un portefeuille d’infrastructures résilientes et confions chaque charge de travail aux systèmes les mieux adaptés à son exécution. Cette approche soutient les deux extrémités de la courbe prix-performance. À l’extrémité la plus abordable, les nouveaux prix de Luna et de Terra rendent les charges de travail à volume élevé rentables à une échelle beaucoup plus grande. À l’extrémité de pointe, le Mode rapide permet aux clients de l’API d’accéder plus rapidement à Sol lorsque le temps de réponse est important.

Les entreprises peuvent intégrer davantage d’IA à leurs activités quotidiennes sans sacrifier la vitesse pour leurs tâches les plus importantes. L’analyse de documents à grande échelle, la classification des interactions avec la clientèle et les mises en œuvre courantes peuvent devenir assez économiques pour être largement déployées, tandis que les charges de travail complexes de Sol peuvent s’exécuter plus rapidement lorsque le coût supplémentaire est justifié.

Ces gains peuvent se cumuler. Dans le cadre d’un processus dirigé par des humains, des modèles plus performants aident notre équipe technique à trouver la prochaine génération d’améliorations, accélérant ainsi l’obtention de meilleures performances à moindre coût. Notre stratégie demeure axée sur l’amélioration des capacités et de l’efficacité, afin que chaque génération d’intelligence puisse accomplir davantage de travail à moindre coût.

Disponibilité et tarification

GPT‑5.6 Terra et Luna demeurent offerts dans ChatGPT Work, Codex et l’API d’OpenAI. Dans ChatGPT Work et Codex, les utilisateurs des forfaits Free et Go peuvent accéder à Terra, tandis que ceux des forfaits Plus, Pro, Business et Enterprise peuvent choisir Terra ou Luna.

À compter du 30 juillet, les prix de l’API seront de 2 $ par million de tokens d’entrée et de 12 $ par million de tokens de sortie pour Terra, et de 0,20 $ par million de tokens d’entrée et de 1,20 $ par million de tokens de sortie pour Luna. Le prix de Sol demeure inchangé. Les prix des abonnements et les quotas de ChatGPT et de Codex demeurent inchangés, tandis que l’utilisation de Terra et de Luna consomme maintenant moins de crédits. Les changements de prix commenceront à être déployés dans AWS plus tard aujourd’hui.

Le Mode rapide de GPT‑5.6 Sol remplace le traitement prioritaire dans l’API et correspond à /fast dans Codex. Les requêtes existantes de l’API marquées comme prioritaires continueront de fonctionner. Consultez tous les détails sur la tarification de l’API.

Auteur

OpenAI