Présentation de GPT‑6 Sol et Luna
Plus de façons d’intégrer l’intelligence de pointe à votre travail quotidien.
Plus tôt ce mois-ci, nous avons lancé GPT‑6 Astra, le modèle le plus intelligent et le mieux aligné au monde. Bien que les projets les plus exigeants et importants nécessitent toujours toutes les capacités d’Astra, le travail s’effectue à différents niveaux, rythmes et budgets.
C’est pourquoi nous élargissons l’univers GPT‑6 avec GPT‑6 Sol et GPT‑6 Luna. GPT‑6 Astra a inauguré une nouvelle génération d’intelligence; ces modèles contribuent à en diffuser les avantages en repoussant les limites de la rentabilité. Nous avons entraîné GPT‑6 Sol et Luna au moyen de méthodes semblables à celles de GPT‑6 Astra, intégrant ainsi à des modèles plus rapides et abordables les avancées à l’origine des performances de pointe d’Astra en matière de travail professionnel, d’exactitude factuelle, de programmation, d’utilisation d’ordinateurs et d’alignement.
Les modèles GPT‑6 dominent toute la courbe coût–intelligence, combinant des capacités exceptionnelles à chaque niveau à une infrastructure qui les déploie efficacement à grande échelle. Les améliorations apportées à la mise en cache et à l’inférence nous permettent de servir ces modèles à moindre coût. Nous transmettons directement ces économies aux utilisateurs et aux clients en réduisant de 50 % les prix de l’API pour Sol et Luna par rapport à leurs tarifs promotionnels GPT‑5.6. Ensemble, ces améliorations rendent l’IA avancée pratique pour davantage de tâches quotidiennes et d’applications à grande échelle.
Modèle | Entrée | Sortie | Réduction du prix |
GPT‑6 Sol | 4 $ → 2 $ | 20 $ → 10 $ | 50 % moins cher |
GPT‑6 Luna | 0,20 $ → 0,10 $ | 1,20 $ → 0,50 $ | 50 % moins cher |
Les prix sont indiqués par million de tokens.
GPT‑6 Astra demeure notre meilleur modèle à tous points de vue. Choisissez-le pour obtenir les meilleurs résultats et une expérience sans compromis.
GPT‑6 Sol et Luna apportent une intelligence accrue et une meilleure rentabilité aux modèles que vous connaissez et utilisez déjà, notamment pour les capacités les plus utiles à l’exécution de travaux complexes.
GPT‑6 Sol peut accomplir des tâches professionnelles difficiles tout en vous donnant plus de latitude pour itérer grâce à des limites d’utilisation supérieures et à un coût moindre. Il offre plus d’intelligence et de meilleurs résultats que les modèles concurrents de prix comparable.
Dans AutomationBench, un test de flux de travail professionnels dans diverses applications, GPT‑6 Sol avec un effort très élevé surpasse Claude Opus 5 avec un effort Max, à seulement 9 % du coût par tâche d’Opus 5. Avec un effort Élevé, GPT‑6 Luna surpasse son prédécesseur de 5,4 points de pourcentage, à un coût par tâche inférieur de 58 %.
Dans AutomationBench 1.0.6(s'ouvre dans une nouvelle fenêtre), les agents d’IA sont testés sur des flux de travail de bout en bout utilisant 47 outils dans les domaines des ventes, du marketing, des opérations, du soutien, des finances et des RH. Le point de données de Claude Fable 5.1 sous-estime son coût réel, car il exclut le coût des replis sur Opus 5, qui sont survenus dans environ 40 % des tâches.
GPT‑6 Sol surpasse aussi Claude Fable 5.1 à un coût bien moindre, et fait même mieux que GPT‑6 Astra avec un faible effort.
Modèle (et effort) | Résultat | Coût par tâche |
|---|---|---|
GPT‑6 Sol (très élevé) | 33,2 % | 0,27 $ |
GPT‑6 Astra (faible) | 30,3 % | 3,9 fois GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9 % | 11,1 fois GPT‑6 Sol |
Claude Fable 5.1 avec repli sur Opus 5 (Max) | 31,4 % | >8,9 fois GPT‑6 Sol (coût du repli non indiqué) |
Dans Agents’ Last Exam, qui évalue les agents sur des flux de travail professionnels complexes, GPT‑6 Sol avec un effort Max obtient 56,4 %, dépassant le meilleur résultat de Claude Opus 5 dans l’évaluation, à un coût par tâche inférieur de 60 %.
Dans Agents’ Last Exam V1(s'ouvre dans une nouvelle fenêtre), les agents d’IA sont évalués sur des tâches de longue durée et à valeur économique couvrant 55 sous-secteurs et la plupart des grands domaines du travail professionnel effectué sur ordinateur.
L’utilité d’une réponse dépend de l’exactitude des faits, et nous continuons d’améliorer la fiabilité factuelle. Dans notre évaluation interne de l’exactitude factuelle, fondée sur des conversations réelles désidentifiées où les utilisateurs avaient signalé des erreurs de nos modèles, GPT‑6 Sol commet environ deux fois moins d’erreurs que son prédécesseur et se rapproche de la fiabilité d’Astra à un coût bien moindre. GPT‑6 Luna s’améliore aussi considérablement; à des niveaux d’effort supérieurs, il égale GPT‑5.6 Sol à environ un centième de son coût.
Ici, nous évaluons l’exactitude factuelle à partir de conversations ChatGPT désidentifiées où les utilisateurs avaient signalé une erreur factuelle commise par un modèle précédent. Ces conversations susceptibles d’induire des erreurs ne représentent pas une utilisation typique, où les erreurs factuelles sont plus rares. Les résultats ne sont pas normalisés selon la longueur; toutefois, nos essais de variation de la verbosité n’ont montré pratiquement aucune dépendance à la longueur des réponses.
Cette année, les agents de programmation ont commencé à s’attaquer à des tâches plus complexes, vastes et longues que jamais. Chez OpenAI, notre utilisation interne a connu une croissance exponentielle. Évaluée aux tarifs de l’API, l’utilisation quotidienne de tokens a dépassé 600 $ pour le chercheur médian et 7 000 $ pour les chercheurs du 90e percentile (Accélération de la recherche : un aperçu de l’intérieur d’OpenAI). À mesure que les agents de programmation prennent en charge des tâches plus longues et exigeantes, le coût d’une utilisation soutenue gagne en importance. GPT‑6 Sol et Luna combinent de solides performances en programmation à des prix d’API réduits, donnant aux développeurs plus de latitude pour itérer et aux équipes la confiance nécessaire pour confier à Codex des tâches plus ambitieuses.
Dans FrontierCode, qui évalue si les agents de programmation produisent des changements prêts à être fusionnés dans de véritables bases de code, GPT‑6 Sol s’améliore considérablement par rapport à GPT‑5.6 Sol et égale Claude Fable 5.1 avec un effort très élevé, à un coût bien moindre.
Dans FrontierCode 1.1 Main(s'ouvre dans une nouvelle fenêtre), des agents d’IA écrivent du code évalué non seulement pour son exactitude, mais aussi pour sa « fusionnabilité » : p. ex., qualité des tests, respect de la portée, style du code et conformité aux normes de la base de code.
Dans DeepSWE v1.1, qui teste les performances sur des tâches complexes de génie logiciel dans de véritables bases de code, GPT‑6 Sol avec un effort Max obtient 68,8 %, soit à 1,1 point de pourcentage du meilleur résultat de Claude Fable 5 dans l’évaluation — 69,9 % avec un effort très élevé —, à un coût par tâche inférieur d’environ 80 %.
GPT‑6 Luna avec un effort Max obtient 66,6 %, un résultat comparable à ceux de Claude Opus 5 et Fable 5 avec un effort Moyen. Dans ces comparaisons, Luna coûte 93 % moins cher par tâche qu’Opus 5 et 96 % moins cher que Fable 5.
Dans DeepSWE 1.1(s'ouvre dans une nouvelle fenêtre), les agents d’IA résolvent des tâches originales et de longue durée en génie logiciel.
Bien que GPT‑6 Astra demeure le meilleur modèle au monde pour l’utilisation d’ordinateurs, GPT‑6 Sol et Luna offrent des performances plus rentables que leurs prédécesseurs. Dans OSWorld 2.0 hors ligne, GPT‑6 Sol avec un effort très élevé obtient un résultat semblable à celui de Claude Opus 5 avec un effort Moyen — 60,5 % contre 60,3 % —, à un coût par tâche inférieur d’environ 80 %. GPT‑6 Luna (Max) surpasse GPT‑5.6 Sol (Moyen) à un dixième de son coût.
Dans OSWorld 2.0(s'ouvre dans une nouvelle fenêtre), les agents d’IA tentent d’exécuter des flux de travail de longue durée sur ordinateur, couvrant des tâches quotidiennes et professionnelles. Nous présentons la récompense partielle obtenue sur l’ensemble hors ligne de la version v2026.08.08.
Nous avons aussi intégré à Sol et Luna le style de communication amélioré de GPT‑6 Astra, qui devrait être particulièrement perceptible dans les conversations techniques et de programmation. Attendez-vous à plus de clarté, moins de jargon, moins de tournures étranges, moins de détails peu utiles et des réponses globalement un peu plus courtes, sans perte de substance.
Bien que le style soit subjectif, nous préférons ici la réponse de GPT‑6 Sol. Elle tire moins vite des conclusions, répète moins de détails qui pourraient sembler évidents à la personne ayant posé la question (p. ex., que le site Web compte quatre pages), emploie moins de formulations vagues (p. ex., « allure bento », « remodeler… autour de ce système »), indique plus franchement ce qui a été vérifié ou non et ne communique pas inutilement de détails d’implémentation comme l’invite de son outil d’image.
En plus de réduire le prix des tokens, nous aidons les développeurs qui créent des solutions avec GPT‑6 à économiser davantage sur le contexte réutilisé par leurs applications. Nous avons amélioré la mise en cache des invites pour GPT‑6 afin d’offrir par défaut des taux de succès plus élevés, ce qui aide les agents à réutiliser plus de contexte, à répondre plus rapidement et à profiter d’un rabais de 90 % sur les lectures de tokens d’entrée mis en cache.
Les développeurs disposent aussi de nouvelles façons de mesurer et d’optimiser les performances de mise en cache :
Surveiller et diagnostiquer. Le tableau de bord de mise en cache des invites(s'ouvre dans une nouvelle fenêtre) indique la quantité de données d’entrée mise en cache et son évolution au fil du temps. L’outil de diagnostic(s'ouvre dans une nouvelle fenêtre) aide à expliquer les occasions manquées de mise en cache et les correctifs à apporter.
Ajuster l’effort de raisonnement et la disponibilité des outils sans invalider le cache. Augmentez l’effort de raisonnement(s'ouvre dans une nouvelle fenêtre) pour les tâches difficiles ou réduisez-le pour les suivis simples, puis activez ou désactivez des outils(s'ouvre dans une nouvelle fenêtre) selon l’évolution des besoins de votre agent. Ces deux contrôles préservent maintenant le contexte antérieur pour sa réutilisation en cache.
Optimiser les préfixes mis en cache. Des points d’arrêt explicites permettent aux développeurs de choisir où se terminent les préfixes d’invite mis en cache. Les développeurs contrôlent ainsi mieux la réutilisation du cache et peuvent améliorer les performances.
GitHub indique qu’au cours des derniers mois, ces améliorations ont réduit de plus de 50 % la proportion de tokens d’invite nécessitant un nouveau traitement, sur des milliards de requêtes adressées aux modèles OpenAI, ce qui aide Copilot à répondre plus rapidement.
GPT‑6 Sol et Luna s’appuient sur les travaux d’alignement inaugurés avec Astra, notre modèle le mieux aligné à ce jour. Dans nos évaluations de l’alignement, Sol et Luna s’améliorent tous deux par rapport à leurs équivalents GPT‑5.6, notamment grâce à des taux plus faibles d’affirmations trompeuses sur leur travail de programmation.
Les évaluations ci-dessous testent délibérément des situations difficiles et ne mesurent pas les taux d’échec dans une utilisation typique. Consultez la fiche système(s'ouvre dans une nouvelle fenêtre) pour voir les résultats complets.
GPT‑6 Sol et GPT‑6 Luna sont offerts dès aujourd’hui dans ChatGPT Work et Codex à tous les utilisateurs Plus, Pro, Business, Enterprise et Edu. Les utilisateurs Free et Go peuvent accéder à GPT‑6 Luna dans l’application de bureau. Ces modèles ne sont pas encore offerts dans Chat. Dans l’API OpenAI, ils sont offerts sous les noms gpt-6-sol et gpt-6-luna.
Afin de maintenir la stabilité du service pour tous, nous prévoyons déployer progressivement ces modèles dans ChatGPT au cours de la journée. Si vous ne voyez pas les nouveaux modèles dans ChatGPT Work ou Codex, veuillez réessayer plus tard.
Les évaluations de GPT ont été effectuées dans notre environnement de recherche ou au moyen de notre API, qui peuvent produire des résultats légèrement différents de ceux de ChatGPT en production en raison de différences dans les invites système, les outils disponibles, etc. Les évaluations des modèles concurrents proviennent de rapports publics. Les résultats de Claude Fable 5 sont indiqués lorsque ceux de Claude Fable 5.1 n’étaient pas disponibles.


