GPT-6.1Sol
Intelligens nära Astra-nivå till en femtedel av priset
Vi presenterar GPT‑6.1 Sol, en uppgradering av GPT‑6 Sol med exceptionellt stark prestanda inom agentbaserad kodning, datoranvändning och professionellt arbete. Den för Sol närmare GPT‑6 Astra på krävande uppgifter, till en femtedel av Astras ordinarie priser för in- och utdatatoken. Det ger utvecklare större utrymme att bygga och köra kapabla agenter inom samma budget.
GPT‑6.1 Sol ger prestanda nära Astras till Sols priser och är därmed den mest kostnadseffektiva modellen sett till prestanda som finns i dag. Cachade indata kostar bara 0,10 USD per miljon token – 95 % lägre än ordinarie indatapris. Det gör modellen mer prisvärd för agentbaserade arbetsbelastningar som behöver återanvända kontext i upprepade anrop.
GPT‑6 Astra är fortfarande vår mest kapabla banbrytande modell sett till helheten. GPT‑6.1 Sol erbjuder en ny balans mellan kapacitet och kostnad för viktiga uppgifter som användare vill utföra oftare, och för API-kunder som bygger och kör applikationer i stor skala.

GPT‑6.1 Sol ger betydande förbättringar jämfört med GPT‑6 Sol inom komplext professionellt arbete, från att skriva och felsöka kod till att förstå dokument och genomföra affärsarbetsflöden i flera steg. I flera av dessa utvärderingar närmar den sig GPT‑6 Astras prestanda till en betydligt lägre kostnad.
På DeepSWE v1.1, som utvärderar komplexa mjukvaruutvecklingsuppgifter i verkliga kodbaser, matchar GPT‑6.1 Sol GPT‑6 Astra till ungefär en femtedel av kostnaden. Samtidigt överträffar den GPT‑6 Sols bästa resultat med 6,4 procentenheter, med lägre resonemangsnivå och kostnad.
I DeepSWE 1.1(öppnas i ett nytt fönster) löser AI-agenter nya uppgifter inom programvaruutveckling som kräver arbete i många steg.
På GDP.pdf, som mäter hur korrekt modeller besvarar yrkesrelaterade frågor med hjälp av komplexa PDF-dokument med tabeller, grafer, diagram och finstilt information, får GPT‑6.1 Sol högre poäng än Opus 5.5 med reservlösningar till mindre än halva kostnaden per uppgift vid de testade resonemangsinställningarna. Den närmar sig också GPT‑6 Astras topprestanda till ungefär en femtedel av kostnaden per uppgift.
I GDP.pdf(öppnas i ett nytt fönster) måste modeller besvara verklighetsbaserade promptar om komplexa PDF-dokument hämtade från arbetsflöden inom finans, hälso- och sjukvård, juridik och sju andra yrkesområden.
På AutomationBench, som mäter om agenter slutför affärsarbetsflöden i flera steg korrekt, får GPT‑6.1 Sol 2,2 procentenheter högre poäng än Opus 5.5 med resonemangsnivån Balanserad, till ungefär en tredjedel av kostnaden. Det resultatet är också 4,8 procentenheter högre än GPT‑6 Sols med samma inställning.
I AutomationBench 1.0.6(öppnas i ett nytt fönster) testas AI-agenter på kompletta arbetsflöden med 47 verktyg inom försäljning, marknadsföring, drift, support, ekonomi och HR. Datapunkten för Claude Fable 5.1 visar en lägre kostnad än den faktiska, eftersom kostnaden för reservmodeller inte ingår. Dessa användes i cirka 40 % av uppgifterna.
GPT‑6.1 Sol gör också stora framsteg på uppgifter som kräver interaktion med datorprogram. På offlinedatasetet i OSWorld 2.0, som utvärderar agenter på krävande arbetsflöden med datoranvändning, överträffar GPT‑6.1 Sol GPT‑6 Sol med sju procentenheter vid maximal resonemangsnivå, till mindre än halva kostnaden. Den ligger bara 2,1 procentenheter under Astras resultat vid maximal resonemangsnivå, till ungefär en sjundedel av kostnaden per uppgift.
I OSWorld 2.0(öppnas i ett nytt fönster) försöker AI-agenter genomföra långa arbetsflöden på datorn som omfattar både vardags- och arbetsuppgifter. Vi redovisar delbelöningen för offlinedatasetet från version v2026.08.08.
På Terminal-Bench Science 0.1, som utvärderar vetenskapliga arbetsflöden som dataanalys, simulering och teorembevisning, får GPT‑6.1 Sol mer än dubbelt så höga poäng som GPT‑6 Sol vid maximal resonemangsnivå, till mindre än halva kostnaden per uppgift. Vid maximal resonemangsnivå kostar GPT‑6.1 Sol i genomsnitt 5,47 USD per uppgift, jämfört med 23,21 USD för Opus 5.5 och 23,80 USD för Astra. Den erbjuder därmed stor vetenskaplig kapacitet till över 75 % lägre kostnad än båda dessa modeller.
GPT‑6 Astra får fortfarande högst poäng bland de testade modellerna med 68,1 % och bör användas för de svåraste vetenskapliga forskningsuppgifterna.
I Terminal-Bench Science 0.1(öppnas i ett nytt fönster) genomför agenter arbetsflöden inom vetenskaplig forskning med hjälp av kod och terminalverktyg, bland annat genom att analysera data, köra simuleringar och anpassa modeller.
GPT‑6.1 Sol ger också mer faktamässigt korrekta svar på svåra promptar. Vid extra hög resonemangsnivå är andelen faktafel 4,1 %, ned från 4,5 % för GPT‑6 Sol och närmare Astras 4,0 % med samma inställning. Samtidigt är kostnaden per uppgift cirka 83 % lägre än för Astra.
Den här utvärderingen mäter andelen svar som innehåller minst ett faktafel i avidentifierade konversationer där användare har påtalat ett fel från en tidigare modell. Dessa avsiktligt svåra promptar är inte representativa för typisk användning.
Vi utvärderar faktakorrekthet utifrån avidentifierade ChatGPT‑konversationer där användare har påtalat ett faktafel från en tidigare modell. Dessa konversationer som framkallar fel är inte representativa för typisk användning, där faktafel är mer sällsynta.
GPT‑6.1 Sol visar betydande förbättringar jämfört med GPT‑6 Sol i våra utvärderingar av följsamhet till mänskliga avsikter och säkerhetskrav, och närmar sig därmed GPT‑6 Astra.
GPT‑6.1 Sol är öppnare med sina begränsningar och mer tillförlitlig när det gäller att respektera användarens avsikt och säkerhetsbegränsningar. I krävande utvärderingar misslyckas den mer sällan än GPT‑6 Sol med att informera om trasiga sökverktyg, respektera uttryckliga begränsningar och undvika obehöriga utfall under agentbaserade uppgifter. Vi observerade inga försök att kringgå en automatiserad säkerhetsgranskare, precis som för GPT‑6 Astra och GPT‑6 Sol.
Utvärderingarna nedan testar avsiktligt krävande situationer och mäter inte felfrekvensen vid typisk användning.
GPT‑6.1 Sol är tillgänglig från och med i dag för alla Plus-, Pro-, Business-, Enterprise- och Edu-användare i ChatGPT Work och Codex. Dessa modeller är ännu inte tillgängliga i Chat. Utvecklare kan också använda den via OpenAI:s API som gpt-6.1-sol. De ordinarie API-priserna är 2 USD per miljon indatatoken, 0,10 USD per miljon cachade indatatoken och 10 USD per miljon utdatatoken.
Samtidigt lanserar vi GPT‑6 Astra Ultrafast, världens snabbaste banbrytande modell med upp till 8 gånger högre hastighet än GPT‑6 Astra, samt GPT‑6.1 Sol Ultrafast. De är tillgängliga i API:et samt i ChatGPT Work och Codex för användare på vår nya Pro-nivå med de högsta användningsgränserna, för 500 USD per månad. Med GPT‑6.1 Sol Ultrafast kan utvecklare få intelligens nära Astras med upp till 8 gånger högre hastighet, till ungefär samma API-kostnad som tidigare för GPT‑6 Astra.
Författare
Utvärderingarna av GPT genomfördes i vår forskningsmiljö eller via vårt API. Resultaten kan skilja sig något från dem i produktionsversionen av ChatGPT på grund av skillnader i systempromptar, tillgängliga verktyg, resonemangsnivåer med mera. Utvärderingar av konkurrerande modeller hämtades från offentligt tillgängliga rapporter.

