Présentation de GPT‑6 Sol et Luna
Davantage de moyens d’intégrer l’intelligence de pointe à votre travail quotidien.
Au début du mois, nous avons lancé GPT‑6 Astra, le modèle le plus intelligent et le mieux aligné au monde. Si les projets les plus exigeants et importants nécessitent toujours toute la profondeur du raisonnement d’Astra, le travail s’effectue à différentes échelles, à différents rythmes et avec différents budgets.
C’est pourquoi nous enrichissons l’univers GPT‑6 avec GPT‑6 Sol et GPT‑6 Luna. GPT‑6 Astra a inauguré une nouvelle génération d’intelligence. Ces modèles contribuent à en diffuser les avantages en améliorant encore le rapport entre performances et coût. Nous avons entraîné GPT‑6 Sol et Luna avec des méthodes similaires à celles de GPT‑6 Astra, afin d’intégrer à des modèles plus rapides et abordables les avancées qui sous-tendent les performances de pointe d’Astra en matière de travail professionnel, d’exactitude factuelle, de programmation, d’utilisation d’un ordinateur et d’alignement.
Les modèles GPT‑6 dominent toute la courbe coût-intelligence, alliant des capacités exceptionnelles à chaque niveau à une infrastructure permettant de les fournir efficacement à grande échelle. Les améliorations de la mise en cache et de l’inférence nous permettent de proposer ces modèles à moindre coût. Nous répercutons directement ces économies sur les utilisateurs et les clients en réduisant de 50 % les tarifs API de Sol et Luna par rapport aux tarifs promotionnels de GPT‑5.6. Ensemble, ces améliorations rendent l’IA avancée utilisable à grande échelle pour davantage de tâches et d’applications quotidiennes.
Modèle | Entrée | Sortie | Réduction de prix |
GPT‑6 Sol | 4 $ → 2 $ | 20 $ → 10 $ | 50 % moins cher |
GPT‑6 Luna | 0,20 $ → 0,10 $ | 1,20 $ → 0,50 $ | 50 % moins cher |
Les tarifs sont indiqués par million de tokens.
GPT‑6 Astra reste notre meilleur modèle dans tous les domaines. Choisissez-le pour obtenir les meilleurs résultats et une expérience sans compromis.
GPT‑6 Sol et Luna améliorent l’intelligence et le rapport performances-coût des modèles que vous connaissez et utilisez déjà, dans les domaines les plus utiles pour accomplir des tâches complexes.
GPT‑6 Sol peut prendre en charge des tâches professionnelles difficiles tout en vous offrant davantage de latitude pour itérer grâce à des limites d’utilisation supérieures et à un coût moindre. Il offre plus d’intelligence et de meilleurs résultats que les modèles concurrents de prix similaire.
Dans AutomationBench, un test de processus métier couvrant plusieurs applications, GPT‑6 Sol avec un effort très élevé surpasse Claude Opus 5 avec un effort maximal, pour seulement 9 % du coût par tâche d’Opus 5. Avec un effort élevé, GPT‑6 Luna progresse de 5,4 points de pourcentage par rapport à son prédécesseur, avec un coût par tâche inférieur de 58 %.
Dans AutomationBench 1.0.6(ouverture dans une nouvelle fenêtre), les agents d’IA sont testés sur des processus de bout en bout utilisant 47 outils dans les domaines de la vente, du marketing, des opérations, de l’assistance, de la finance et des ressources humaines. Le point de données de Claude Fable 5.1 sous-estime son coût réel, car il n’inclut pas le coût des recours à Opus 5, intervenus dans environ 40 % des tâches.
GPT‑6 Sol surpasse également Claude Fable 5.1 à un coût bien moindre, et fait même mieux que GPT‑6 Astra avec un faible effort.
Modèle (et effort) | Score | Coût par tâche |
|---|---|---|
GPT‑6 Sol (très élevé) | 33,2 % | 0,27 $ |
GPT‑6 Astra (faible) | 30,3 % | 3,9 fois GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9 % | 11,1 fois GPT‑6 Sol |
Claude Fable 5.1 avec recours à Opus 5 (Max) | 31,4 % | >8,9 fois GPT‑6 Sol (coût du recours non indiqué) |
Dans Agents’ Last Exam, qui évalue les agents sur des processus professionnels complexes, GPT‑6 Sol avec un effort maximal obtient 56,4 %, dépassant le meilleur score de Claude Opus 5 dans l’évaluation, pour un coût par tâche inférieur de 60 %.
Dans Agents’ Last Exam V1(ouverture dans une nouvelle fenêtre), les agents d’IA sont évalués sur des tâches de longue durée et à forte valeur économique, couvrant 55 sous-secteurs et la plupart des grands domaines du travail professionnel effectué sur ordinateur.
L’utilité d’une réponse dépend de l’exactitude des faits, et nous continuons à améliorer la fiabilité factuelle. Dans notre évaluation interne de l’exactitude factuelle, fondée sur des conversations réelles désidentifiées où des utilisateurs avaient signalé des erreurs de nos modèles, GPT‑6 Sol commet environ deux fois moins d’erreurs que son prédécesseur et se rapproche de la fiabilité d’Astra à un coût bien moindre. GPT‑6 Luna progresse lui aussi nettement : aux niveaux d’effort supérieurs, il égale GPT‑5.6 Sol pour environ un centième de son coût.
Nous évaluons ici l’exactitude factuelle à partir de conversations ChatGPT désidentifiées dans lesquelles des utilisateurs avaient signalé une erreur factuelle d’un modèle précédent. Ces conversations propices aux erreurs ne représentent pas une utilisation typique, où les erreurs factuelles sont plus rares. Les scores ne sont pas ajustés en fonction de la longueur ; toutefois, nos tests de verbosité n’ont montré pratiquement aucune dépendance à la longueur des réponses.
Cette année, les agents de programmation ont commencé à s’attaquer à des tâches d’une complexité, d’une ampleur et d’une durée sans précédent. Chez OpenAI, notre utilisation interne a connu une croissance exponentielle. Valorisée aux tarifs de l’API, l’utilisation quotidienne de tokens a dépassé 600 $ pour le chercheur médian et 7 000 $ pour les chercheurs du 90e centile (Accélération de la recherche : les coulisses d’OpenAI). À mesure que les agents de programmation prennent en charge des tâches plus longues et exigeantes, le coût d’une utilisation soutenue devient plus important. GPT‑6 Sol et Luna associent de solides performances en programmation à des tarifs API réduits, offrant aux développeurs plus de latitude pour itérer et aux équipes la confiance nécessaire pour confier des tâches plus ambitieuses à Codex.
Dans FrontierCode, qui évalue si les agents de programmation produisent des modifications prêtes à être fusionnées dans de véritables bases de code, GPT‑6 Sol progresse nettement par rapport à GPT‑5.6 Sol et égale Claude Fable 5.1 avec un effort très élevé, à un coût bien moindre.
Dans FrontierCode 1.1 Main(ouverture dans une nouvelle fenêtre), les agents d’IA écrivent du code évalué non seulement sur son exactitude, mais aussi sur sa « fusionnabilité » : par exemple, la qualité des tests, le respect du périmètre, le style du code et la conformité aux normes de la base de code.
Dans DeepSWE v1.1, qui teste les performances sur des tâches complexes de génie logiciel dans de véritables bases de code, GPT‑6 Sol avec un effort maximal obtient 68,8 %, à 1,1 point de pourcentage du meilleur score de Claude Fable 5 dans l’évaluation — 69,9 % avec un effort très élevé — pour un coût par tâche inférieur d’environ 80 %.
GPT‑6 Luna avec un effort maximal obtient 66,6 %, un résultat comparable à ceux de Claude Opus 5 et Fable 5 avec un effort moyen. Dans ces comparaisons, Luna coûte 93 % de moins par tâche qu’Opus 5 et 96 % de moins que Fable 5.
Dans DeepSWE 1.1(ouverture dans une nouvelle fenêtre), les agents d’IA accomplissent des tâches originales de génie logiciel de longue durée.
Si GPT‑6 Astra reste le meilleur modèle au monde pour l’utilisation d’un ordinateur, GPT‑6 Sol et Luna offrent de meilleures performances par rapport à leur coût que leurs prédécesseurs. Dans OSWorld 2.0 hors ligne, GPT‑6 Sol avec un effort très élevé obtient un score similaire à celui de Claude Opus 5 avec un effort moyen — 60,5 % contre 60,3 % — pour un coût par tâche inférieur d’environ 80 %. GPT‑6 Luna (Max) surpasse GPT‑5.6 Sol (Moyen) pour un dixième de son coût.
Dans OSWorld 2.0(ouverture dans une nouvelle fenêtre), les agents d’IA tentent d’accomplir des processus de longue durée réalisés sur un ordinateur couvrant des tâches quotidiennes et professionnelles. Nous indiquons la récompense partielle obtenue sur l’ensemble hors ligne de la version v2026.08.08.
Nous avons également intégré à Sol et Luna le style de communication amélioré de GPT‑6 Astra, qui devrait être particulièrement perceptible dans les conversations techniques et de programmation. Attendez-vous à davantage de clarté, moins de jargon, moins de tournures étranges, moins de détails peu utiles et, globalement, des réponses légèrement plus courtes sans perte de substance.
Bien que le style soit subjectif, nous préférons ici la réponse de GPT‑6 Sol. Elle tire moins vite des conclusions, passe moins de temps à répéter des détails qui peuvent sembler évidents à l’auteur de la question (par exemple, que le site comporte quatre pages), emploie moins de formulations vagues (comme « ambiance bento » ou « remodeler… autour de ce système »), indique plus franchement ce qui a été vérifié ou non et ne communique pas inutilement des détails d’implémentation tels que le prompt de son outil d’image.
Outre la baisse du prix des tokens, nous aidons les développeurs qui utilisent GPT‑6 à économiser davantage sur le contexte réutilisé par leurs applications. Nous avons amélioré la mise en cache des prompts pour GPT‑6 afin d’obtenir par défaut des taux d’accès au cache supérieurs, ce qui aide les agents à réutiliser davantage de contexte, à répondre plus vite et à bénéficier d’une réduction de 90 % sur la lecture des tokens d’entrée mis en cache.
Les développeurs disposent également de davantage de moyens pour mesurer et optimiser les performances de leur mise en cache :
Surveiller et diagnostiquer. Le tableau de bord de mise en cache des prompts(ouverture dans une nouvelle fenêtre) indique la quantité d’entrées mises en cache et son évolution dans le temps. L’outil de diagnostic(ouverture dans une nouvelle fenêtre) aide à expliquer les occasions manquées de mise en cache et les corrections à apporter.
Ajuster l’effort de raisonnement et la disponibilité des outils sans invalider le cache. Augmentez l’effort de raisonnement(ouverture dans une nouvelle fenêtre) pour les tâches difficiles ou réduisez-le pour les demandes suivantes plus simples, et activez ou désactivez des outils(ouverture dans une nouvelle fenêtre) selon l’évolution des besoins de votre agent. Ces deux réglages préservent désormais le contexte antérieur afin de le réutiliser depuis le cache.
Optimiser les préfixes mis en cache. Des points d’arrêt explicites de mise en cache permettent aux développeurs de choisir où se terminent les préfixes de prompts mis en cache. Les développeurs contrôlent ainsi mieux la réutilisation du cache, ce qui peut améliorer les performances.
GitHub indique qu’au cours des derniers mois, ces améliorations ont réduit de plus de 50 % la part des tokens de prompts nécessitant un nouveau traitement sur des milliards de requêtes adressées aux modèles OpenAI, aidant ainsi Copilot à répondre plus rapidement.
GPT‑6 Sol et Luna s’appuient sur le travail d’alignement introduit avec Astra, notre modèle le mieux aligné à ce jour. Dans nos évaluations de l’alignement, Sol et Luna progressent tous deux par rapport à leurs équivalents GPT‑5.6, avec notamment moins d’affirmations trompeuses concernant leur travail de programmation.
Les évaluations ci-dessous testent délibérément des situations difficiles et ne mesurent pas les taux d’échec en utilisation typique. Consultez la fiche système(ouverture dans une nouvelle fenêtre) pour connaître tous les résultats.
GPT‑6 Sol et GPT‑6 Luna sont disponibles dès aujourd’hui dans ChatGPT Work et Codex pour tous les utilisateurs Plus, Pro, Business, Enterprise et Edu. Les utilisateurs Free et Go peuvent accéder à GPT‑6 Luna dans l’application de bureau. Ces modèles ne sont pas encore disponibles dans Chat. Dans l’API OpenAI, ils sont disponibles sous les noms gpt-6-sol et gpt-6-luna.
Afin de maintenir la stabilité du service pour tous, nous prévoyons de déployer progressivement ces modèles dans ChatGPT au cours de la journée. Si vous ne voyez pas les nouveaux modèles dans ChatGPT Work ou Codex, veuillez réessayer plus tard.
Les évaluations de GPT ont été réalisées dans notre environnement de recherche ou via notre API, dont les résultats peuvent différer légèrement de ceux de ChatGPT en production en raison de différences dans les prompts système, les outils disponibles, etc. Les évaluations des modèles concurrents proviennent de rapports accessibles au public. Les scores de Claude Fable 5 ont été indiqués lorsque ceux de Claude Fable 5.1 n’étaient pas disponibles.


