Passer au contenu principal
OpenAI

GPT-6.1Sol

Une intelligence proche d’Astra à un cinquième du prix, pour des performances de pointe durables

Nous lançons GPT‑6.1 Sol, une version améliorée de GPT‑6 Sol aux performances exceptionnelles en programmation agentique, ainsi qu’en utilisation de l’ordinateur et en travail professionnel. Il rapproche Sol de GPT‑6 Astra sur les tâches exigeantes, à un cinquième des tarifs standard d’Astra pour les tokens d’entrée et de sortie, offrant aux développeurs plus de latitude pour créer et exécuter des agents performants à budget égal.

GPT‑6.1 Sol offre des performances proches d’Astra aux tarifs de Sol, ce qui en fait le modèle au meilleur rapport performances-coût disponible aujourd’hui. L’entrée en cache ne coûte que 0,10 $ par million de tokens, soit une réduction de 95 % par rapport au tarif d’entrée standard, rendant plus abordables les charges de travail agentiques qui réutilisent le contexte au fil de requêtes répétées.

GPT‑6 Astra reste notre modèle de pointe le plus performant dans l’ensemble. GPT‑6.1 Sol offre un nouvel équilibre entre capacités et coût pour les tâches importantes que les utilisateurs souhaitent accomplir plus souvent, ainsi que pour les clients de l’API qui créent et exécutent des applications à grande échelle.

Trois fiches de modèles : GPT-6 Astra, notre modèle le plus intelligent pour les meilleurs résultats, 10 $ en entrée, 50 $ en sortie et 1 $ en entrée en cache ; GPT-6.1 Sol, une intelligence proche d’Astra à un cinquième du prix, 2 $ en entrée, 10 $ en sortie et 0,10 $ en entrée en cache ; GPT-6 Luna, un travail quotidien rapide et efficace à grande échelle, 0,10 $ en entrée, 0,50 $ en sortie et 0,01 $ en entrée en cache.

Un Sol plus performant sur toutes les tâches

GPT‑6.1 Sol apporte des améliorations majeures par rapport à GPT‑6 Sol dans le travail professionnel complexe, de l’écriture et du débogage de code à la compréhension de documents et à l’exécution de workflows métier en plusieurs étapes. Sur plusieurs de ces évaluations, il approche les performances de GPT‑6 Astra à un coût nettement inférieur.

Programmation

Sur DeepSWE v1.1, qui évalue des tâches complexes d’ingénierie logicielle dans des bases de code réelles, GPT‑6.1 Sol égale GPT‑6 Astra pour environ un cinquième du coût, tout en dépassant le meilleur score de GPT‑6 Sol de 6,4 points de pourcentage, avec un effort de raisonnement et un coût inférieurs.

Dans DeepSWE 1.1⁠⁠(ouverture dans une nouvelle fenêtre), les agents d’IA accomplissent des tâches inédites et de longue haleine en ingénierie logicielle.

Travail professionnel

Sur GDP.pdf, qui mesure la précision des réponses des modèles à des questions professionnelles à partir de PDF complexes comportant tableaux, graphiques, schémas et mentions en petits caractères, GPT‑6.1 Sol dépasse Opus 5.5 avec solutions de repli à moins de la moitié du coût par tâche, sur l’ensemble des réglages de raisonnement testés. Il approche aussi les performances de référence de GPT‑6 Astra pour environ un cinquième du coût par tâche.

Dans GDP.pdf⁠(ouverture dans une nouvelle fenêtre), les modèles doivent répondre à des requêtes réelles portant sur des PDF complexes issus de processus de travail dans la finance, la santé, le droit et sept autres domaines professionnels.

Sur AutomationBench, qui mesure si les agents exécutent correctement des workflows métier en plusieurs étapes, GPT‑6.1 Sol dépasse Opus 5.5 de 2,2 points de pourcentage avec un effort de raisonnement moyen, pour environ un tiers du coût. Ce score dépasse également celui de GPT‑6 Sol de 4,8 points de pourcentage avec le même réglage.

In AutomationBench 1.0.6⁠⁠(ouverture dans une nouvelle fenêtre), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Utilisation de l’ordinateur

GPT‑6.1 Sol progresse aussi nettement sur les tâches nécessitant d’interagir avec des applications informatiques. Sur le jeu hors ligne d’OSWorld 2.0, qui évalue les agents sur des workflows exigeants d’utilisation de l’ordinateur, GPT‑6.1 Sol dépasse GPT‑6 Sol de sept points de pourcentage avec un effort de raisonnement maximal, à moins de la moitié du coût. Il se situe à 2,1 points de pourcentage du score d’Astra avec un effort de raisonnement maximal, pour environ un septième du coût par tâche.

In OSWorld 2.0⁠⁠(ouverture dans une nouvelle fenêtre), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Recherche scientifique

Sur Terminal-Bench Science 0.1, qui évalue des workflows scientifiques comprenant l’analyse de données, la simulation et la démonstration de théorèmes, GPT‑6.1 Sol fait plus que doubler le score de GPT‑6 Sol avec un effort de raisonnement maximal, à moins de la moitié du coût par tâche. Avec un effort maximal, GPT‑6.1 Sol coûte en moyenne 5,47 $ par tâche, contre 23,21 $ pour Opus 5.5 et 23,80 $ pour Astra, offrant de solides capacités scientifiques à un coût inférieur de plus de 75 % à celui de chacun de ces modèles.

GPT‑6 Astra conserve le meilleur score parmi les modèles testés, à 68,1 %, et reste à privilégier pour les tâches de recherche scientifique les plus difficiles.

Dans Terminal-Bench Science 0.1⁠(ouverture dans une nouvelle fenêtre), les agents mènent à bien des processus de recherche scientifique à l’aide de code et d’outils en ligne de commande, notamment pour analyser des données, exécuter des simulations et ajuster des modèles.

Exactitude factuelle

GPT‑6.1 Sol améliore également l’exactitude factuelle sur les prompts difficiles. Avec un effort de raisonnement très élevé, son taux d’erreurs factuelles est de 4,1 %, contre 4,5 % pour GPT‑6 Sol, et se rapproche des 4,0 % d’Astra avec le même réglage, tout en coûtant environ 83 % de moins par tâche qu’Astra.

Cette évaluation mesure la part de réponses contenant au moins une erreur factuelle dans des conversations dé-identifiées où les utilisateurs avaient signalé une erreur d’un modèle antérieur. Ces prompts délibérément difficiles ne sont pas représentatifs de l’usage courant.

Nous évaluons l’exactitude factuelle sur des conversations ChatGPT dé-identifiées dans lesquelles les utilisateurs avaient signalé une erreur factuelle d’un modèle antérieur. Ces conversations propices aux erreurs ne sont pas représentatives de l’usage courant, où les erreurs factuelles sont plus rares.

Déployer GPT‑6.1 Sol en toute sécurité

GPT‑6.1 Sol progresse nettement par rapport à GPT‑6 Sol dans nos évaluations d’alignement, se rapprochant ainsi de GPT‑6 Astra.

GPT‑6.1 Sol est plus transparent sur ses limites et plus fiable dans le respect de l’intention de l’utilisateur et des contraintes de sécurité. Dans des évaluations exigeantes, il affiche des taux d’échec inférieurs à GPT‑6 Sol sur la transparence concernant les outils de recherche défaillants, le respect des restrictions explicites et la prévention des résultats non autorisés lors de tâches agentiques. Nous n’avons observé aucune tentative de contournement d’un système de contrôle de sécurité automatisé, comme pour GPT‑6 Astra et GPT‑6 Sol.

Les évaluations ci-dessous testent délibérément des situations difficiles et ne mesurent pas les taux d’échec en usage courant.

Tarifs et disponibilité

GPT‑6.1 Sol est disponible dès aujourd’hui pour tous les utilisateurs Plus, Pro, Business, Enterprise et Edu dans ChatGPT Work et Codex. Ces modèles ne sont pas encore disponibles dans Chat. Les développeurs peuvent également y accéder via l’API OpenAI sous le nom gpt-6.1-sol. Ses tarifs API standard sont de 2 $ par million de tokens d’entrée, 0,10 $ par million de tokens d’entrée en cache et 10 $ par million de tokens de sortie.

En parallèle, nous lançons GPT‑6 Astra Ultrafast, le modèle de pointe le plus rapide au monde, jusqu’à 8 fois plus rapide que GPT‑6 Astra, ainsi que GPT‑6.1 Sol Ultrafast. Ils sont disponibles dans l’API ainsi que dans ChatGPT Work et Codex pour les utilisateurs de notre nouveau palier Pro à 500 $/mois, qui offre nos limites d’utilisation les plus élevées. Avec GPT‑6.1 Sol Ultrafast, les développeurs bénéficient d’une intelligence proche d’Astra à une vitesse jusqu’à 8 fois supérieure, pour un coût API à peu près équivalent à celui de GPT‑6 Astra auparavant.

Auteur

OpenAI

Les évaluations de GPT ont été effectuées dans notre environnement de recherche ou via notre API, qui peuvent produire des résultats légèrement différents de ceux de ChatGPT en production en raison de différences dans les prompts système, les outils disponibles, les niveaux d’effort, etc. Les évaluations des modèles concurrents proviennent de rapports publics.