GPT-6.1Sol
Intelligens nær Astra-nivå til en femtedel av prisen, med vedvarende banebrytende ytelse
Vi introduserer GPT‑6.1 Sol, en oppgradering av GPT‑6 Sol med svært sterk ytelse innen agentisk koding, datamaskinbruk og profesjonelt arbeid. Den bringer Sol nærmere GPT‑6 Astra på krevende oppgaver, til en femtedel av Astras standardpriser for inndata- og utdatatoken. Det gir utviklere større handlingsrom til å bygge og kjøre kapable agenter innenfor samme budsjett.
GPT‑6.1 Sol leverer ytelse nær Astra-nivå til Sol-priser og er dermed den mest kostnadseffektive modellen på dette ytelsesnivået som er tilgjengelig i dag. Hurtigbufrede inndata koster bare 0,10 USD per million token – en rabatt på 95 % på standardprisen for inndata. Det gjør modellen rimeligere for agentiske arbeidsoppgaver der kontekst må gjenbrukes på tvers av gjentatte forespørsler.
GPT‑6 Astra er fortsatt vår mest kapable banebrytende modell totalt sett. GPT‑6.1 Sol gir en ny balanse mellom kapasitet og kostnad, både for viktig arbeid brukerne ønsker å gjøre oftere, og for API-kunder som bygger og kjører applikasjoner i stor skala.

GPT‑6.1 Sol gir betydelige forbedringer sammenlignet med GPT‑6 Sol innen komplekst profesjonelt arbeid, fra å skrive og feilsøke kode til å forstå dokumenter og gjennomføre arbeidsflyter med flere trinn i virksomheter. I flere av disse evalueringene nærmer den seg ytelsen til GPT‑6 Astra til en vesentlig lavere kostnad.
På DeepSWE v1.1, som evaluerer komplekse programvareutviklingsoppgaver i reelle kodebaser, matcher GPT‑6.1 Sol GPT‑6 Astra til omtrent en femtedel av kostnaden. Samtidig overgår den GPT‑6 Sols beste resultat med 6,4 prosentpoeng, med lavere resonneringsinnsats og kostnad.
I DeepSWE 1.1(åpnes i et nytt vindu) løser KI-agenter nye oppgaver innen programvareutvikling som krever arbeid over mange trinn.
På GDP.pdf, som måler hvor presist modeller besvarer faglige spørsmål ved hjelp av komplekse PDF-dokumenter med blant annet tabeller, grafer, diagrammer og detaljer i liten skrift, skårer GPT‑6.1 Sol høyere enn Opus 5.5 med reserveløsninger, til under halvparten av kostnaden per oppgave på tvers av de testede resonneringsinnstillingene. Den nærmer seg også den toppmoderne ytelsen til GPT‑6 Astra til omtrent en femtedel av kostnaden per oppgave.
I GDP.pdf(åpnes i et nytt vindu) må modeller svare på virkelige forespørsler om komplekse PDF-filer hentet fra arbeidsprosesser innen finans, helse, jus og sju andre fagområder.
På AutomationBench, som måler om agenter fullfører arbeidsflyter med flere trinn i virksomheter på riktig måte, skårer GPT‑6.1 Sol 2,2 prosentpoeng høyere enn Opus 5.5 ved middels resonneringsinnsats, til omtrent en tredjedel av kostnaden. Resultatet er også 4,8 prosentpoeng høyere enn for GPT‑6 Sol med samme innstilling.
In AutomationBench 1.0.6(åpnes i et nytt vindu), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol gjør også betydelige fremskritt på oppgaver som krever samhandling med dataprogrammer. På det frakoblede datasettet i OSWorld 2.0, som evaluerer agenter på krevende arbeidsflyter med datamaskinbruk, overgår GPT‑6.1 Sol GPT‑6 Sol med sju prosentpoeng ved maksimal resonneringsinnsats, til under halvparten av kostnaden. Den kommer innenfor 2,1 prosentpoeng av Astras resultat ved maksimal resonneringsinnsats, til omtrent en sjuendedel av kostnaden per oppgave.
In OSWorld 2.0(åpnes i et nytt vindu), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
På Terminal-Bench Science 0.1, som evaluerer vitenskapelige arbeidsflyter innen blant annet dataanalyse, simulering og teorembevis, mer enn dobler GPT‑6.1 Sol resultatet til GPT‑6 Sol ved maksimal resonneringsinnsats, til under halvparten av kostnaden per oppgave. Ved maksimal innsats koster GPT‑6.1 Sol i gjennomsnitt 5,47 USD per oppgave, sammenlignet med 23,21 USD for Opus 5.5 og 23,80 USD for Astra. Den leverer dermed sterke vitenskapelige ferdigheter til over 75 % lavere kostnad enn begge modellene.
GPT‑6 Astra oppnår fortsatt det høyeste resultatet blant de testede modellene, med 68,1 %, og bør brukes til de vanskeligste vitenskapelige forskningsoppgavene.
I Terminal-Bench Science 0.1(åpnes i et nytt vindu) gjennomfører agenter vitenskapelige forskningsprosesser ved hjelp av kode og terminalverktøy, blant annet dataanalyse, simuleringer og modelltilpasning.
GPT‑6.1 Sol gir også bedre faktapresisjon ved vanskelige prompter. Ved ekstra høy resonneringsinnsats er andelen faktafeil 4,1 %, ned fra 4,5 % for GPT‑6 Sol og nærmere Astras 4,0 % med samme innstilling, samtidig som kostnaden per oppgave er omtrent 83 % lavere enn for Astra.
Denne evalueringen måler andelen svar som inneholder minst én faktafeil, basert på avidentifiserte samtaler der brukere rapporterte en feil fra en tidligere modell. Disse bevisst vanskelige promptene er ikke representative for vanlig bruk.
Vi evaluerer faktapresisjon på avidentifiserte ChatGPT‑samtaler der brukere hadde rapportert en faktafeil fra en tidligere modell. Disse samtalene, som fremkalte feil, er ikke representative for vanlig bruk, der faktafeil forekommer sjeldnere.
GPT‑6.1 Sol viser betydelige forbedringer sammenlignet med GPT‑6 Sol i våre av samsvarsevalueringer, og nærmer seg dermed GPT‑6 Astra.
GPT‑6.1 Sol er mer åpen om egne begrensninger og respekterer brukerens intensjon og sikkerhetskrav mer pålitelig. I krevende evalueringer har den lavere feilrater enn GPT‑6 Sol når det gjelder å opplyse om søkeverktøy som ikke fungerer, respektere uttrykkelige begrensninger og unngå uautoriserte utfall under agentiske oppgaver. Vi observerte ingen forsøk på å omgå en automatisert sikkerhetskontroll, i likhet med GPT‑6 Astra og GPT‑6 Sol.
Evalueringene nedenfor tester bevisst krevende situasjoner og måler ikke feilrater ved vanlig bruk.
GPT‑6.1 Sol er tilgjengelig fra i dag for alle Plus-, Pro-, Business-, Enterprise- og Edu-brukere i ChatGPT Work og Codex. Disse modellene er ennå ikke tilgjengelige i Chat. Utviklere kan også få tilgang via OpenAI API som gpt-6.1-sol. Standardprisene i API-et er 2 USD per million inndatatoken, 0,10 USD per million hurtigbufrede inndatatoken og 10 USD per million utdatatoken.
Samtidig lanserer vi GPT‑6 Astra Ultrafast, verdens raskeste banebrytende modell med opptil 8 ganger hastigheten til GPT‑6 Astra, samt GPT‑6.1 Sol Ultrafast. Disse er tilgjengelige i API-et og i ChatGPT Work og Codex for brukere på vårt nye Pro-nivå med de høyeste bruksgrensene, til 500 USD per måned. Med GPT‑6.1 Sol Ultrafast kan utviklere få intelligens nær Astra-nivå med opptil 8 ganger hastigheten, til omtrent samme API-kostnad som tidligere for GPT‑6 Astra.
Forfatter
Evalueringene av GPT ble utført i forskningsmiljøet vårt eller via API-et vårt. Resultatene kan avvike noe fra ChatGPT i produksjon på grunn av forskjeller i systemprompter, tilgjengelige verktøy, innsatsnivåer osv. Evalueringene av konkurrerende modeller er hentet fra offentlig tilgjengelige rapporter.

