Passer au contenu principal
OpenAI

Présentation de GPT‑6 Sol et Luna

Plus de façons d’intégrer l’intelligence de pointe à votre travail quotidien.

Chargement…

Plus tôt ce mois-ci, nous avons lancé GPT‑6 Astra, le modèle le plus intelligent et le mieux aligné au monde. Bien que les projets les plus exigeants et importants nécessitent toujours toutes les capacités d’Astra, le travail s’effectue à différents niveaux, rythmes et budgets.

C’est pourquoi nous élargissons l’univers GPT‑6 avec GPT‑6 Sol et GPT‑6 Luna. GPT‑6 Astra a inauguré une nouvelle génération d’intelligence; ces modèles contribuent à en diffuser les avantages en repoussant les limites de la rentabilité. Nous avons entraîné GPT‑6 Sol et Luna au moyen de méthodes semblables à celles de GPT‑6 Astra, intégrant ainsi à des modèles plus rapides et abordables les avancées à l’origine des performances de pointe d’Astra en matière de travail professionnel, d’exactitude factuelle, de programmation, d’utilisation d’ordinateurs et d’alignement.

Les modèles GPT‑6 dominent toute la courbe coût–intelligence, combinant des capacités exceptionnelles à chaque niveau à une infrastructure qui les déploie efficacement à grande échelle. Les améliorations apportées à la mise en cache et à l’inférence nous permettent de servir ces modèles à moindre coût. Nous transmettons directement ces économies aux utilisateurs et aux clients en réduisant de 50 % les prix de l’API pour Sol et Luna par rapport à leurs tarifs promotionnels GPT‑5.6. Ensemble, ces améliorations rendent l’IA avancée pratique pour davantage de tâches quotidiennes et d’applications à grande échelle.

Tarification de l’API GPT‑6

Modèle

Entrée

Sortie

Réduction du prix

GPT‑6 Sol
comparé à GPT‑5.6 Sol

4 $ → 2 $

20 $ → 10 $

50 % moins cher

GPT‑6 Luna
comparé à GPT‑5.6 Luna

0,20 $ → 0,10 $

1,20 $ → 0,50 $

50 % moins cher

Les prix sont indiqués par million de tokens.

GPT‑6 Astra demeure notre meilleur modèle à tous points de vue. Choisissez-le pour obtenir les meilleurs résultats et une expérience sans compromis.

Un progrès dans toute la famille de modèles

GPT‑6 Sol et Luna apportent une intelligence accrue et une meilleure rentabilité aux modèles que vous connaissez et utilisez déjà, notamment pour les capacités les plus utiles à l’exécution de travaux complexes.

Travail professionnel

GPT‑6 Sol peut accomplir des tâches professionnelles difficiles tout en vous donnant plus de latitude pour itérer grâce à des limites d’utilisation supérieures et à un coût moindre. Il offre plus d’intelligence et de meilleurs résultats que les modèles concurrents de prix comparable.

Dans AutomationBench, un test de flux de travail professionnels dans diverses applications, GPT‑6 Sol avec un effort très élevé surpasse Claude Opus 5 avec un effort Max, à seulement 9 % du coût par tâche d’Opus 5. Avec un effort Élevé, GPT‑6 Luna surpasse son prédécesseur de 5,4 points de pourcentage, à un coût par tâche inférieur de 58 %.

Dans AutomationBench 1.0.6⁠(s'ouvre dans une nouvelle fenêtre), les agents d’IA sont testés sur des flux de travail de bout en bout utilisant 47 outils dans les domaines des ventes, du marketing, des opérations, du soutien, des finances et des RH. Le point de données de Claude Fable 5.1 sous-estime son coût réel, car il exclut le coût des replis sur Opus 5, qui sont survenus dans environ 40 % des tâches.

GPT‑6 Sol surpasse aussi Claude Fable 5.1 à un coût bien moindre, et fait même mieux que GPT‑6 Astra avec un faible effort.

Modèle (et effort)

Résultat

Coût par tâche

GPT‑6 Sol (très élevé)

33,2 %

0,27 $

GPT‑6 Astra (faible)

30,3 %

3,9 fois GPT‑6 Sol

Claude Opus 5 (Max)

26,9 %

11,1 fois GPT‑6 Sol

Claude Fable 5.1 avec repli sur Opus 5 (Max)

31,4 %

>8,9 fois GPT‑6 Sol

(coût du repli non indiqué)

Dans Agents’ Last Exam, qui évalue les agents sur des flux de travail professionnels complexes, GPT‑6 Sol avec un effort Max obtient 56,4 %, dépassant le meilleur résultat de Claude Opus 5 dans l’évaluation, à un coût par tâche inférieur de 60 %.

Dans Agents’ Last Exam V1⁠(s'ouvre dans une nouvelle fenêtre), les agents d’IA sont évalués sur des tâches de longue durée et à valeur économique couvrant 55 sous-secteurs et la plupart des grands domaines du travail professionnel effectué sur ordinateur.

Exactitude factuelle

L’utilité d’une réponse dépend de l’exactitude des faits, et nous continuons d’améliorer la fiabilité factuelle. Dans notre évaluation interne de l’exactitude factuelle, fondée sur des conversations réelles désidentifiées où les utilisateurs avaient signalé des erreurs de nos modèles, GPT‑6 Sol commet environ deux fois moins d’erreurs que son prédécesseur et se rapproche de la fiabilité d’Astra à un coût bien moindre. GPT‑6 Luna s’améliore aussi considérablement; à des niveaux d’effort supérieurs, il égale GPT‑5.6 Sol à environ un centième de son coût.

Ici, nous évaluons l’exactitude factuelle à partir de conversations ChatGPT désidentifiées où les utilisateurs avaient signalé une erreur factuelle commise par un modèle précédent. Ces conversations susceptibles d’induire des erreurs ne représentent pas une utilisation typique, où les erreurs factuelles sont plus rares. Les résultats ne sont pas normalisés selon la longueur; toutefois, nos essais de variation de la verbosité n’ont montré pratiquement aucune dépendance à la longueur des réponses.

Programmation

Cette année, les agents de programmation ont commencé à s’attaquer à des tâches plus complexes, vastes et longues que jamais. Chez OpenAI, notre utilisation interne a connu une croissance exponentielle. Évaluée aux tarifs de l’API, l’utilisation quotidienne de tokens a dépassé 600 $ pour le chercheur médian et 7 000 $ pour les chercheurs du 90e percentile (Accélération de la recherche : un aperçu de l’intérieur d’OpenAI⁠). À mesure que les agents de programmation prennent en charge des tâches plus longues et exigeantes, le coût d’une utilisation soutenue gagne en importance. GPT‑6 Sol et Luna combinent de solides performances en programmation à des prix d’API réduits, donnant aux développeurs plus de latitude pour itérer et aux équipes la confiance nécessaire pour confier à Codex des tâches plus ambitieuses.

Dans FrontierCode, qui évalue si les agents de programmation produisent des changements prêts à être fusionnés dans de véritables bases de code, GPT‑6 Sol s’améliore considérablement par rapport à GPT‑5.6 Sol et égale Claude Fable 5.1 avec un effort très élevé, à un coût bien moindre.

Dans FrontierCode 1.1 Main⁠(s'ouvre dans une nouvelle fenêtre), des agents d’IA écrivent du code évalué non seulement pour son exactitude, mais aussi pour sa « fusionnabilité » : p. ex., qualité des tests, respect de la portée, style du code et conformité aux normes de la base de code.

Dans DeepSWE v1.1, qui teste les performances sur des tâches complexes de génie logiciel dans de véritables bases de code, GPT‑6 Sol avec un effort Max obtient 68,8 %, soit à 1,1 point de pourcentage du meilleur résultat de Claude Fable 5 dans l’évaluation — 69,9 % avec un effort très élevé —, à un coût par tâche inférieur d’environ 80 %.

GPT‑6 Luna avec un effort Max obtient 66,6 %, un résultat comparable à ceux de Claude Opus 5 et Fable 5 avec un effort Moyen. Dans ces comparaisons, Luna coûte 93 % moins cher par tâche qu’Opus 5 et 96 % moins cher que Fable 5.

Dans DeepSWE 1.1⁠(s'ouvre dans une nouvelle fenêtre), les agents d’IA résolvent des tâches originales et de longue durée en génie logiciel.

Utilisation d’ordinateurs

Bien que GPT‑6 Astra demeure le meilleur modèle au monde pour l’utilisation d’ordinateurs, GPT‑6 Sol et Luna offrent des performances plus rentables que leurs prédécesseurs. Dans OSWorld 2.0 hors ligne, GPT‑6 Sol avec un effort très élevé obtient un résultat semblable à celui de Claude Opus 5 avec un effort Moyen — 60,5 % contre 60,3 % —, à un coût par tâche inférieur d’environ 80 %. GPT‑6 Luna (Max) surpasse GPT‑5.6 Sol (Moyen) à un dixième de son coût.

Dans OSWorld 2.0⁠(s'ouvre dans une nouvelle fenêtre), les agents d’IA tentent d’exécuter des flux de travail de longue durée sur ordinateur, couvrant des tâches quotidiennes et professionnelles. Nous présentons la récompense partielle obtenue sur l’ensemble hors ligne de la version v2026.08.08.

Style de collaboration

Nous avons aussi intégré à Sol et Luna le style de communication amélioré de GPT‑6 Astra, qui devrait être particulièrement perceptible dans les conversations techniques et de programmation. Attendez-vous à plus de clarté, moins de jargon, moins de tournures étranges, moins de détails peu utiles et des réponses globalement un peu plus courtes, sans perte de substance.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Bien que le style soit subjectif, nous préférons ici la réponse de GPT‑6 Sol. Elle tire moins vite des conclusions, répète moins de détails qui pourraient sembler évidents à la personne ayant posé la question (p. ex., que le site Web compte quatre pages), emploie moins de formulations vagues (p. ex., « allure bento », « remodeler… autour de ce système »), indique plus franchement ce qui a été vérifié ou non et ne communique pas inutilement de détails d’implémentation comme l’invite de son outil d’image.

Amélioration de la mise en cache pour les agents et les longues conversations

En plus de réduire le prix des tokens, nous aidons les développeurs qui créent des solutions avec GPT‑6 à économiser davantage sur le contexte réutilisé par leurs applications. Nous avons amélioré la mise en cache des invites pour GPT‑6 afin d’offrir par défaut des taux de succès plus élevés, ce qui aide les agents à réutiliser plus de contexte, à répondre plus rapidement et à profiter d’un rabais de 90 % sur les lectures de tokens d’entrée mis en cache.

Les développeurs disposent aussi de nouvelles façons de mesurer et d’optimiser les performances de mise en cache :

GitHub indique qu’au cours des derniers mois, ces améliorations ont réduit de plus de 50 % la proportion de tokens d’invite nécessitant un nouveau traitement, sur des milliards de requêtes adressées aux modèles OpenAI, ce qui aide Copilot à répondre plus rapidement.

Poursuite de l’amélioration de l’alignement

GPT‑6 Sol et Luna s’appuient sur les travaux d’alignement inaugurés avec Astra, notre modèle le mieux aligné à ce jour. Dans nos évaluations de l’alignement, Sol et Luna s’améliorent tous deux par rapport à leurs équivalents GPT‑5.6, notamment grâce à des taux plus faibles d’affirmations trompeuses sur leur travail de programmation.

Les évaluations ci-dessous testent délibérément des situations difficiles et ne mesurent pas les taux d’échec dans une utilisation typique. Consultez la fiche système⁠(s'ouvre dans une nouvelle fenêtre) pour voir les résultats complets.

Disponibilité

GPT‑6 Sol et GPT‑6 Luna sont offerts dès aujourd’hui dans ChatGPT Work et Codex à tous les utilisateurs Plus, Pro, Business, Enterprise et Edu. Les utilisateurs Free et Go peuvent accéder à GPT‑6 Luna dans l’application de bureau. Ces modèles ne sont pas encore offerts dans Chat. Dans l’API OpenAI, ils sont offerts sous les noms gpt-6-sol et gpt-6-luna.

Afin de maintenir la stabilité du service pour tous, nous prévoyons déployer progressivement ces modèles dans ChatGPT au cours de la journée. Si vous ne voyez pas les nouveaux modèles dans ChatGPT Work ou Codex, veuillez réessayer plus tard.


Les évaluations de GPT ont été effectuées dans notre environnement de recherche ou au moyen de notre API, qui peuvent produire des résultats légèrement différents de ceux de ChatGPT en production en raison de différences dans les invites système, les outils disponibles, etc. Les évaluations des modèles concurrents proviennent de rapports publics. Les résultats de Claude Fable 5 sont indiqués lorsque ceux de Claude Fable 5.1 n’étaient pas disponibles.

Auteur

OpenAI