Passer au contenu principal
OpenAI

Présentation de GPT‑6 Sol et Luna

Davantage de moyens d’intégrer l’intelligence de pointe à votre travail quotidien.

Chargement...

Au début du mois, nous avons lancé GPT‑6 Astra, le modèle le plus intelligent et le mieux aligné au monde. Si les projets les plus exigeants et importants nécessitent toujours toute la profondeur du raisonnement d’Astra, le travail s’effectue à différentes échelles, à différents rythmes et avec différents budgets.

C’est pourquoi nous enrichissons l’univers GPT‑6 avec GPT‑6 Sol et GPT‑6 Luna. GPT‑6 Astra a inauguré une nouvelle génération d’intelligence. Ces modèles contribuent à en diffuser les avantages en améliorant encore le rapport entre performances et coût. Nous avons entraîné GPT‑6 Sol et Luna avec des méthodes similaires à celles de GPT‑6 Astra, afin d’intégrer à des modèles plus rapides et abordables les avancées qui sous-tendent les performances de pointe d’Astra en matière de travail professionnel, d’exactitude factuelle, de programmation, d’utilisation d’un ordinateur et d’alignement.

Les modèles GPT‑6 dominent toute la courbe coût-intelligence, alliant des capacités exceptionnelles à chaque niveau à une infrastructure permettant de les fournir efficacement à grande échelle. Les améliorations de la mise en cache et de l’inférence nous permettent de proposer ces modèles à moindre coût. Nous répercutons directement ces économies sur les utilisateurs et les clients en réduisant de 50 % les tarifs API de Sol et Luna par rapport aux tarifs promotionnels de GPT‑5.6. Ensemble, ces améliorations rendent l’IA avancée utilisable à grande échelle pour davantage de tâches et d’applications quotidiennes.

Tarifs de l’API GPT‑6

Modèle

Entrée

Sortie

Réduction de prix

GPT‑6 Sol
par rapport à GPT‑5.6 Sol

4 $ → 2 $

20 $ → 10 $

50 % moins cher

GPT‑6 Luna
par rapport à GPT‑5.6 Luna

0,20 $ → 0,10 $

1,20 $ → 0,50 $

50 % moins cher

Les tarifs sont indiqués par million de tokens.

GPT‑6 Astra reste notre meilleur modèle dans tous les domaines. Choisissez-le pour obtenir les meilleurs résultats et une expérience sans compromis.

Une avancée pour toute la famille de modèles

GPT‑6 Sol et Luna améliorent l’intelligence et le rapport performances-coût des modèles que vous connaissez et utilisez déjà, dans les domaines les plus utiles pour accomplir des tâches complexes.

Travail professionnel

GPT‑6 Sol peut prendre en charge des tâches professionnelles difficiles tout en vous offrant davantage de latitude pour itérer grâce à des limites d’utilisation supérieures et à un coût moindre. Il offre plus d’intelligence et de meilleurs résultats que les modèles concurrents de prix similaire.

Dans AutomationBench, un test de processus métier couvrant plusieurs applications, GPT‑6 Sol avec un effort très élevé surpasse Claude Opus 5 avec un effort maximal, pour seulement 9 % du coût par tâche d’Opus 5. Avec un effort élevé, GPT‑6 Luna progresse de 5,4 points de pourcentage par rapport à son prédécesseur, avec un coût par tâche inférieur de 58 %.

Dans AutomationBench 1.0.6⁠(ouverture dans une nouvelle fenêtre), les agents d’IA sont testés sur des processus de bout en bout utilisant 47 outils dans les domaines de la vente, du marketing, des opérations, de l’assistance, de la finance et des ressources humaines. Le point de données de Claude Fable 5.1 sous-estime son coût réel, car il n’inclut pas le coût des recours à Opus 5, intervenus dans environ 40 % des tâches.

GPT‑6 Sol surpasse également Claude Fable 5.1 à un coût bien moindre, et fait même mieux que GPT‑6 Astra avec un faible effort.

Modèle (et effort)

Score

Coût par tâche

GPT‑6 Sol (très élevé)

33,2 %

0,27 $

GPT‑6 Astra (faible)

30,3 %

3,9 fois GPT‑6 Sol

Claude Opus 5 (Max)

26,9 %

11,1 fois GPT‑6 Sol

Claude Fable 5.1 avec recours à Opus 5 (Max)

31,4 %

>8,9 fois GPT‑6 Sol

(coût du recours non indiqué)

Dans Agents’ Last Exam, qui évalue les agents sur des processus professionnels complexes, GPT‑6 Sol avec un effort maximal obtient 56,4 %, dépassant le meilleur score de Claude Opus 5 dans l’évaluation, pour un coût par tâche inférieur de 60 %.

Dans Agents’ Last Exam V1⁠(ouverture dans une nouvelle fenêtre), les agents d’IA sont évalués sur des tâches de longue durée et à forte valeur économique, couvrant 55 sous-secteurs et la plupart des grands domaines du travail professionnel effectué sur ordinateur.

Exactitude factuelle

L’utilité d’une réponse dépend de l’exactitude des faits, et nous continuons à améliorer la fiabilité factuelle. Dans notre évaluation interne de l’exactitude factuelle, fondée sur des conversations réelles désidentifiées où des utilisateurs avaient signalé des erreurs de nos modèles, GPT‑6 Sol commet environ deux fois moins d’erreurs que son prédécesseur et se rapproche de la fiabilité d’Astra à un coût bien moindre. GPT‑6 Luna progresse lui aussi nettement : aux niveaux d’effort supérieurs, il égale GPT‑5.6 Sol pour environ un centième de son coût.

Nous évaluons ici l’exactitude factuelle à partir de conversations ChatGPT désidentifiées dans lesquelles des utilisateurs avaient signalé une erreur factuelle d’un modèle précédent. Ces conversations propices aux erreurs ne représentent pas une utilisation typique, où les erreurs factuelles sont plus rares. Les scores ne sont pas ajustés en fonction de la longueur ; toutefois, nos tests de verbosité n’ont montré pratiquement aucune dépendance à la longueur des réponses.

Programmation

Cette année, les agents de programmation ont commencé à s’attaquer à des tâches d’une complexité, d’une ampleur et d’une durée sans précédent. Chez OpenAI, notre utilisation interne a connu une croissance exponentielle. Valorisée aux tarifs de l’API, l’utilisation quotidienne de tokens a dépassé 600 $ pour le chercheur médian et 7 000 $ pour les chercheurs du 90e centile (Accélération de la recherche : les coulisses d’OpenAI⁠). À mesure que les agents de programmation prennent en charge des tâches plus longues et exigeantes, le coût d’une utilisation soutenue devient plus important. GPT‑6 Sol et Luna associent de solides performances en programmation à des tarifs API réduits, offrant aux développeurs plus de latitude pour itérer et aux équipes la confiance nécessaire pour confier des tâches plus ambitieuses à Codex.

Dans FrontierCode, qui évalue si les agents de programmation produisent des modifications prêtes à être fusionnées dans de véritables bases de code, GPT‑6 Sol progresse nettement par rapport à GPT‑5.6 Sol et égale Claude Fable 5.1 avec un effort très élevé, à un coût bien moindre.

Dans FrontierCode 1.1 Main⁠(ouverture dans une nouvelle fenêtre), les agents d’IA écrivent du code évalué non seulement sur son exactitude, mais aussi sur sa « fusionnabilité » : par exemple, la qualité des tests, le respect du périmètre, le style du code et la conformité aux normes de la base de code.

Dans DeepSWE v1.1, qui teste les performances sur des tâches complexes de génie logiciel dans de véritables bases de code, GPT‑6 Sol avec un effort maximal obtient 68,8 %, à 1,1 point de pourcentage du meilleur score de Claude Fable 5 dans l’évaluation — 69,9 % avec un effort très élevé — pour un coût par tâche inférieur d’environ 80 %.

GPT‑6 Luna avec un effort maximal obtient 66,6 %, un résultat comparable à ceux de Claude Opus 5 et Fable 5 avec un effort moyen. Dans ces comparaisons, Luna coûte 93 % de moins par tâche qu’Opus 5 et 96 % de moins que Fable 5.

Dans DeepSWE 1.1⁠(ouverture dans une nouvelle fenêtre), les agents d’IA accomplissent des tâches originales de génie logiciel de longue durée.

Utilisation d’un ordinateur

Si GPT‑6 Astra reste le meilleur modèle au monde pour l’utilisation d’un ordinateur, GPT‑6 Sol et Luna offrent de meilleures performances par rapport à leur coût que leurs prédécesseurs. Dans OSWorld 2.0 hors ligne, GPT‑6 Sol avec un effort très élevé obtient un score similaire à celui de Claude Opus 5 avec un effort moyen — 60,5 % contre 60,3 % — pour un coût par tâche inférieur d’environ 80 %. GPT‑6 Luna (Max) surpasse GPT‑5.6 Sol (Moyen) pour un dixième de son coût.

Dans OSWorld 2.0⁠(ouverture dans une nouvelle fenêtre), les agents d’IA tentent d’accomplir des processus de longue durée réalisés sur un ordinateur couvrant des tâches quotidiennes et professionnelles. Nous indiquons la récompense partielle obtenue sur l’ensemble hors ligne de la version v2026.08.08.

Style de collaboration

Nous avons également intégré à Sol et Luna le style de communication amélioré de GPT‑6 Astra, qui devrait être particulièrement perceptible dans les conversations techniques et de programmation. Attendez-vous à davantage de clarté, moins de jargon, moins de tournures étranges, moins de détails peu utiles et, globalement, des réponses légèrement plus courtes sans perte de substance.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Bien que le style soit subjectif, nous préférons ici la réponse de GPT‑6 Sol. Elle tire moins vite des conclusions, passe moins de temps à répéter des détails qui peuvent sembler évidents à l’auteur de la question (par exemple, que le site comporte quatre pages), emploie moins de formulations vagues (comme « ambiance bento » ou « remodeler… autour de ce système »), indique plus franchement ce qui a été vérifié ou non et ne communique pas inutilement des détails d’implémentation tels que le prompt de son outil d’image.

Amélioration de la mise en cache pour les agents et les longues conversations

Outre la baisse du prix des tokens, nous aidons les développeurs qui utilisent GPT‑6 à économiser davantage sur le contexte réutilisé par leurs applications. Nous avons amélioré la mise en cache des prompts pour GPT‑6 afin d’obtenir par défaut des taux d’accès au cache supérieurs, ce qui aide les agents à réutiliser davantage de contexte, à répondre plus vite et à bénéficier d’une réduction de 90 % sur la lecture des tokens d’entrée mis en cache.

Les développeurs disposent également de davantage de moyens pour mesurer et optimiser les performances de leur mise en cache :

GitHub indique qu’au cours des derniers mois, ces améliorations ont réduit de plus de 50 % la part des tokens de prompts nécessitant un nouveau traitement sur des milliards de requêtes adressées aux modèles OpenAI, aidant ainsi Copilot à répondre plus rapidement.

Poursuite de l’amélioration de l’alignement

GPT‑6 Sol et Luna s’appuient sur le travail d’alignement introduit avec Astra, notre modèle le mieux aligné à ce jour. Dans nos évaluations de l’alignement, Sol et Luna progressent tous deux par rapport à leurs équivalents GPT‑5.6, avec notamment moins d’affirmations trompeuses concernant leur travail de programmation.

Les évaluations ci-dessous testent délibérément des situations difficiles et ne mesurent pas les taux d’échec en utilisation typique. Consultez la fiche système⁠(ouverture dans une nouvelle fenêtre) pour connaître tous les résultats.

Disponibilité

GPT‑6 Sol et GPT‑6 Luna sont disponibles dès aujourd’hui dans ChatGPT Work et Codex pour tous les utilisateurs Plus, Pro, Business, Enterprise et Edu. Les utilisateurs Free et Go peuvent accéder à GPT‑6 Luna dans l’application de bureau. Ces modèles ne sont pas encore disponibles dans Chat. Dans l’API OpenAI, ils sont disponibles sous les noms gpt-6-sol et gpt-6-luna.

Afin de maintenir la stabilité du service pour tous, nous prévoyons de déployer progressivement ces modèles dans ChatGPT au cours de la journée. Si vous ne voyez pas les nouveaux modèles dans ChatGPT Work ou Codex, veuillez réessayer plus tard.


Les évaluations de GPT ont été réalisées dans notre environnement de recherche ou via notre API, dont les résultats peuvent différer légèrement de ceux de ChatGPT en production en raison de différences dans les prompts système, les outils disponibles, etc. Les évaluations des modèles concurrents proviennent de rapports accessibles au public. Les scores de Claude Fable 5 ont été indiqués lorsque ceux de Claude Fable 5.1 n’étaient pas disponibles.

Auteur

OpenAI