GPT-6.1Sol
Intelligentie op bijna Astra-niveau voor een vijfde van de prijs, voor aanhoudend grensverleggende prestaties
We introduceren GPT‑6.1 Sol, een upgrade van GPT‑6 Sol met uitzonderlijk sterke prestaties bij agentic programmeren, computergebruik en professioneel werk. Hiermee komt Sol bij veeleisende taken dichter bij GPT‑6 Astra, voor een vijfde van Astra's standaardprijzen voor invoer- en uitvoertokens. Zo krijgen ontwikkelaars meer ruimte om binnen hetzelfde budget krachtige agents te bouwen en te laten draaien.
GPT‑6.1 Sol biedt prestaties op bijna Astra-niveau voor de prijs van Sol en is daarmee het model met de beste prijs-prestatieverhouding dat vandaag beschikbaar is. Gecachete invoer kost slechts $ 0,10 per miljoen tokens, een korting van 95% op het standaardtarief voor invoer. Dat maakt het model betaalbaarder voor agentic workloads die bij herhaalde verzoeken dezelfde context moeten gebruiken.
GPT‑6 Astra blijft over het geheel genomen ons krachtigste grensverleggende model. GPT‑6.1 Sol biedt een nieuwe balans tussen mogelijkheden en kosten voor belangrijk werk dat gebruikers vaker willen uitvoeren en voor API-klanten die op grote schaal applicaties bouwen en laten draaien.

GPT‑6.1 Sol biedt aanzienlijke verbeteringen ten opzichte van GPT‑6 Sol bij complex professioneel werk, van code schrijven en debuggen tot documenten begrijpen en zakelijke workflows met meerdere stappen uitvoeren. Bij verschillende van deze evaluaties benadert het de prestaties van GPT‑6 Astra tegen aanzienlijk lagere kosten.
Op DeepSWE v1.1, dat complexe softwareontwikkelingstaken in echte codebases evalueert, evenaart GPT‑6.1 Sol GPT‑6 Astra voor ongeveer een vijfde van de kosten. Tegelijk overtreft het de beste score van GPT‑6 Sol met 6,4 procentpunt, met minder inspanning voor redenering en tegen lagere kosten.
In DeepSWE 1.1(opent in een nieuw venster) voeren AI-agents originele softwareontwikkelingstaken uit die een langdurige aanpak vereisen.
GDP.pdf meet hoe nauwkeurig modellen professionele vragen beantwoorden met behulp van complexe pdf-documenten, inclusief tabellen, grafieken, diagrammen en kleine lettertjes. GPT‑6.1 Sol scoort hier hoger dan Opus 5.5 met terugvalopties, voor minder dan de helft van de kosten per taak bij alle geteste instellingen voor redenering. Het benadert ook de toonaangevende prestaties van GPT‑6 Astra voor ongeveer een vijfde van de kosten per taak.
In GDP.pdf(opent in een nieuw venster) moeten modellen reageren op prompts uit de praktijk over complexe pdf's uit professionele workflows in de financiële sector, de gezondheidszorg, de juridische sector en zeven andere vakgebieden.
Op AutomationBench, dat meet of agents zakelijke workflows met meerdere stappen correct voltooien, scoort GPT‑6.1 Sol 2,2 procentpunt hoger dan Opus 5.5 met de inspanning voor redenering op Gemiddeld, voor ongeveer een derde van de kosten. Die score ligt ook 4,8 procentpunt hoger dan die van GPT‑6 Sol bij dezelfde instelling.
In AutomationBench 1.0.6(opent in een nieuw venster), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol boekt ook aanzienlijke vooruitgang bij taken waarvoor interactie met computerapplicaties nodig is. Op de offline dataset van OSWorld 2.0, die agents evalueert op veeleisende workflows voor computergebruik, scoort GPT‑6.1 Sol zeven procentpunt hoger dan GPT‑6 Sol bij maximale inspanning voor redenering, voor minder dan de helft van de kosten. Het komt tot op 2,1 procentpunt van Astra's score bij maximale inspanning voor redenering, voor ongeveer een zevende van de kosten per taak.
In OSWorld 2.0(opent in een nieuw venster), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Op Terminal-Bench Science 0.1, dat wetenschappelijke workflows evalueert zoals data-analyse, simulatie en het bewijzen van stellingen, haalt GPT‑6.1 Sol bij maximale inspanning voor redenering meer dan het dubbele van de score van GPT‑6 Sol, voor minder dan de helft van de kosten per taak. Bij maximale inspanning kost GPT‑6.1 Sol gemiddeld $ 5,47 per taak, tegenover $ 23,21 voor Opus 5.5 en $ 23,80 voor Astra. Daarmee biedt het sterke wetenschappelijke capaciteiten tegen ruim 75% lagere kosten dan beide modellen.
GPT‑6 Astra behaalt met 68,1% nog steeds de hoogste score van de geteste modellen en is de aangewezen keuze voor de moeilijkste wetenschappelijke onderzoekstaken.
In Terminal-Bench Science 0.1(opent in een nieuw venster) voeren agents wetenschappelijke onderzoeksworkflows uit met behulp van code en terminaltools, waaronder data-analyse, het uitvoeren van simulaties en het fitten van modellen.
GPT‑6.1 Sol verbetert ook de feitelijke nauwkeurigheid bij moeilijke prompts. Bij extra hoge inspanning voor redenering bedraagt het percentage feitelijke fouten 4,1%, tegenover 4,5% voor GPT‑6 Sol. Daarmee komt het dichter bij Astra's 4,0% bij dezelfde instelling, terwijl het per taak ongeveer 83% minder kost dan Astra.
Deze evaluatie meet het aandeel antwoorden met minstens één feitelijke fout in gesprekken waaruit identificerende gegevens zijn verwijderd en waarin gebruikers een fout van een eerder model hadden gemeld. Deze bewust moeilijke prompts zijn niet representatief voor normaal gebruik.
We evalueren de feitelijke juistheid aan de hand van ChatGPT‑gesprekken waaruit identificerende gegevens zijn verwijderd en waarin gebruikers een feitelijke fout van een eerder model hadden gemeld. Deze gesprekken die fouten uitlokken zijn niet representatief voor normaal gebruik, waarbij feitelijke fouten minder vaak voorkomen.
GPT‑6.1 Sol laat in onze evaluaties van afstemming op menselijke bedoelingen en waarden aanzienlijke verbeteringen zien ten opzichte van GPT‑6 Sol en komt daarmee dichter bij GPT‑6 Astra.
GPT‑6.1 Sol is transparanter over zijn beperkingen en houdt zich betrouwbaarder aan de bedoeling van de gebruiker en de veiligheidsvoorwaarden. In uitdagende evaluaties maakt het minder fouten dan GPT‑6 Sol als het gaat om openheid over defecte zoektools, het naleven van expliciete beperkingen en het vermijden van ongeautoriseerde uitkomsten tijdens agentic taken. We zagen geen pogingen om een geautomatiseerde veiligheidsbeoordelaar te omzeilen, net als bij GPT‑6 Astra en GPT‑6 Sol.
De onderstaande evaluaties testen bewust uitdagende situaties en meten geen foutpercentages bij normaal gebruik.
GPT‑6.1 Sol is vanaf vandaag beschikbaar in ChatGPT Work en Codex voor alle gebruikers met Plus, Pro, Business, Enterprise en Edu. Deze modellen zijn nog niet beschikbaar in Chat. Ontwikkelaars kunnen het ook via de OpenAI API gebruiken als gpt-6.1-sol. De standaard API-prijzen zijn $ 2 per miljoen invoertokens, $ 0,10 per miljoen gecachete invoertokens en $ 10 per miljoen uitvoertokens.
Daarnaast lanceren we GPT‑6 Astra Ultrafast, het snelste grensverleggende model ter wereld dat tot 8 keer zo snel is als GPT‑6 Astra, en GPT‑6.1 Sol Ultrafast. Deze zijn beschikbaar via de API en in ChatGPT Work en Codex voor gebruikers van onze nieuwe Pro-variant met de hoogste gebruikslimieten, voor $ 500 per maand. Met GPT‑6.1 Sol Ultrafast krijgen ontwikkelaars intelligentie op bijna Astra-niveau met tot 8 keer de snelheid, voor ongeveer dezelfde API-kosten als voorheen bij GPT‑6 Astra.
Auteurs
Evaluations of GPT were performed in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, efforts, etc. Evaluations of competitor models were taken from publicly available reports.

