GPT-6.1Sol
Near-Astra intelligence for a fifth of the price
Nous présentons GPT‑6.1 Sol, une version améliorée de GPT‑6 Sol aux performances exceptionnelles en programmation agentique, en utilisation de l’ordinateur et en travail professionnel. Il rapproche Sol de GPT‑6 Astra sur les tâches exigeantes, à un cinquième des tarifs standard d’Astra pour les tokens d’entrée et de sortie, offrant aux développeurs plus de latitude pour créer et exécuter des agents performants avec le même budget.
GPT‑6.1 Sol offre des performances proches d’Astra aux tarifs de Sol, ce qui en fait le modèle au meilleur rapport performance-prix disponible aujourd’hui. Les entrées mises en cache ne coûtent que 0,10 $ par million de tokens, soit une réduction de 95 % par rapport au tarif standard des entrées. Le modèle est ainsi plus abordable pour les charges de travail agentiques qui doivent réutiliser le contexte d’une requête à l’autre.
GPT‑6 Astra reste globalement notre modèle de pointe le plus performant. GPT‑6.1 Sol offre un nouvel équilibre entre capacités et coût pour les tâches importantes que les utilisateurs souhaitent accomplir plus souvent et pour les clients de l’API qui créent et exécutent des applications à grande échelle.

GPT‑6.1 Sol apporte des améliorations importantes par rapport à GPT‑6 Sol pour le travail professionnel complexe, de l’écriture et du débogage de code à la compréhension de documents et à l’exécution de flux de travail d’entreprise en plusieurs étapes. Dans plusieurs de ces évaluations, il se rapproche des performances de GPT‑6 Astra à un coût nettement inférieur.
Sur DeepSWE v1.1, qui évalue des tâches complexes de génie logiciel dans de véritables bases de code, GPT‑6.1 Sol égale GPT‑6 Astra à environ un cinquième du coût, tout en dépassant le meilleur score de GPT‑6 Sol de 6,4 points de pourcentage avec un effort de raisonnement et un coût moindres.
Dans DeepSWE 1.1(s'ouvre dans une nouvelle fenêtre), les agents d’IA accomplissent des tâches inédites de génie logiciel de longue haleine.
Sur GDP.pdf, qui mesure la précision avec laquelle les modèles répondent à des questions professionnelles à l’aide de documents PDF complexes comprenant des tableaux, des graphiques, des diagrammes et des détails en petits caractères, GPT‑6.1 Sol surpasse Opus 5.5 avec modèles de repli à moins de la moitié du coût par tâche pour les réglages de raisonnement testés. Il se rapproche aussi des performances de pointe de GPT‑6 Astra à environ un cinquième du coût par tâche.
Dans GDP.pdf(s'ouvre dans une nouvelle fenêtre), les modèles doivent répondre à des requêtes réelles portant sur des PDF complexes issus de processus de travail professionnels en finance, en santé, en droit et dans sept autres domaines professionnels.
Sur AutomationBench, qui mesure si les agents accomplissent correctement des flux de travail d’entreprise en plusieurs étapes, GPT‑6.1 Sol dépasse Opus 5.5 de 2,2 points de pourcentage avec un effort de raisonnement moyen, à environ un tiers du coût. Ce score dépasse aussi de 4,8 points de pourcentage celui de GPT‑6 Sol au même réglage.
In AutomationBench 1.0.6(s'ouvre dans une nouvelle fenêtre), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol progresse aussi considérablement dans les tâches qui nécessitent d’interagir avec des applications informatiques. Sur l’ensemble hors ligne d’OSWorld 2.0, qui évalue les agents dans des flux de travail exigeants sur ordinateur, GPT‑6.1 Sol dépasse GPT‑6 Sol de sept points de pourcentage avec un effort de raisonnement maximal, à moins de la moitié du coût. Il se situe à 2,1 points de pourcentage du score d’Astra avec un effort de raisonnement maximal, à environ un septième du coût par tâche.
In OSWorld 2.0(s'ouvre dans une nouvelle fenêtre), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Sur Terminal-Bench Science 0.1, qui évalue des flux de travail scientifiques comprenant l’analyse de données, la simulation et la démonstration de théorèmes, GPT‑6.1 Sol obtient plus du double du score de GPT‑6 Sol avec un effort de raisonnement maximal, à moins de la moitié du coût par tâche. Avec un effort maximal, GPT‑6.1 Sol coûte en moyenne 5,47 $ par tâche, contre 23,21 $ pour Opus 5.5 et 23,80 $ pour Astra, offrant de solides capacités scientifiques à un coût inférieur de plus de 75 % à celui de chacun de ces modèles.
GPT‑6 Astra obtient toujours le meilleur score parmi les modèles testés, à 68,1 %, et devrait être utilisé pour les tâches de recherche scientifique les plus difficiles.
Dans Terminal-Bench Science 0.1(s'ouvre dans une nouvelle fenêtre), les agents exécutent des processus de recherche scientifique à l’aide de code et d’outils de terminal, notamment pour analyser des données, lancer des simulations et ajuster des modèles.
GPT‑6.1 Sol améliore aussi l’exactitude factuelle pour les requêtes difficiles. Avec un effort de raisonnement très élevé, son taux d’erreurs factuelles est de 4,1 %, en baisse par rapport aux 4,5 % de GPT‑6 Sol et plus proche des 4,0 % d’Astra au même réglage, tout en coûtant environ 83 % de moins par tâche qu’Astra.
Cette évaluation mesure la proportion de réponses contenant au moins une erreur factuelle dans des conversations dépersonnalisées où les utilisateurs ont signalé une erreur d’un modèle précédent. Ces requêtes délibérément difficiles ne sont pas représentatives de l’utilisation habituelle.
Nous évaluons l’exactitude factuelle à partir de conversations ChatGPT dépersonnalisées dans lesquelles les utilisateurs avaient signalé une erreur factuelle d’un modèle précédent. Ces conversations propices aux erreurs ne sont pas représentatives de l’utilisation habituelle, où les erreurs factuelles sont plus rares.
GPT‑6.1 Sol affiche des améliorations importantes par rapport à GPT‑6 Sol dans nos évaluations d’alignement, ce qui le rapproche de GPT‑6 Astra.
GPT‑6.1 Sol est plus transparent quant à ses limites et plus fiable dans le respect de l’intention de l’utilisateur et des contraintes de sécurité. Dans des évaluations exigeantes, il affiche des taux d’échec inférieurs à ceux de GPT‑6 Sol en matière de transparence sur les outils de recherche défectueux, de respect des restrictions explicites et de prévention des résultats non autorisés lors de tâches agentiques. Nous n’avons observé aucune tentative de contournement d’un contrôleur de sécurité automatisé, comme pour GPT‑6 Astra et GPT‑6 Sol.
Les évaluations ci-dessous testent délibérément des situations difficiles et ne mesurent pas les taux d’échec en utilisation habituelle.
GPT‑6.1 Sol est disponible dès aujourd’hui pour tous les utilisateurs Plus, Pro, Business, Enterprise et Edu dans ChatGPT Work et Codex. Ces modèles ne sont pas encore disponibles dans Chat. Les développeurs peuvent aussi y accéder au moyen de l’API OpenAI sous le nom gpt-6.1-sol. Ses tarifs API standard sont de 2 $ par million de tokens d’entrée, de 0,10 $ par million de tokens d’entrée mis en cache et de 10 $ par million de tokens de sortie.
En parallèle, nous lançons GPT‑6 Astra Ultrafast, le modèle de pointe le plus rapide au monde, jusqu’à 8 fois plus rapide que GPT‑6 Astra, ainsi que GPT‑6.1 Sol Ultrafast. Ils sont disponibles dans l’API ainsi que dans ChatGPT Work et Codex pour les utilisateurs de notre nouveau niveau Pro à 500 $/mois, qui offre les limites d’utilisation les plus élevées. Avec GPT‑6.1 Sol Ultrafast, les développeurs peuvent obtenir une intelligence proche d’Astra à une vitesse jusqu’à 8 fois supérieure, pour des dépenses API à peu près équivalentes à celles de GPT‑6 Astra auparavant.
Auteur
Les évaluations de GPT ont été réalisées dans notre environnement de recherche ou au moyen de notre API, ce qui peut produire des réponses légèrement différentes de celles de ChatGPT en production en raison de différences dans les instructions système, les outils disponibles, les niveaux d’effort, etc. Les évaluations des modèles concurrents proviennent de rapports publics.

