Gå til hovedindhold
OpenAI

GPT-6.1Sol

Near-Astra intelligence for a fifth of the price

Vi lancerer GPT‑6.1 Sol, en opgradering af GPT‑6 Sol med usædvanligt stærke resultater inden for agentisk kodning, computerbrug og professionelt arbejde. Den bringer Sol tættere på GPT‑6 Astra i krævende opgaver til en femtedel af Astras standardpriser for input- og outputtoken. Det giver udviklere mere råderum til at bygge og køre kompetente agenter inden for samme budget.

GPT‑6.1 Sol leverer ydeevne tæt på Astra til Sol-priser og er dermed den model på markedet i dag, der giver mest ydeevne for pengene. Cachelagret input koster kun 0,10 USD pr. million token – 95 % mindre end standardprisen for input. Det gør den mere økonomisk til agentiske arbejdsbelastninger, hvor kontekst skal genbruges på tværs af gentagne forespørgsler.

GPT‑6 Astra er fortsat vores samlet set mest kompetente banebrydende model. GPT‑6.1 Sol giver en ny balance mellem kapacitet og pris til vigtige opgaver, som brugere ønsker at udføre oftere, og til API-kunder, der bygger og kører applikationer i stor skala.

Tre modelkort: GPT-6 Astra, vores mest intelligente model til de bedste resultater, 10 USD for input, 50 USD for output og 1 USD for cachelagret input; GPT-6.1 Sol, intelligens tæt på Astra til en femtedel af prisen, 2 USD for input, 10 USD for output og 0,10 USD for cachelagret input; GPT-6 Luna, hurtigt og effektivt hverdagsarbejde i stor skala, 0,10 USD for input, 0,50 USD for output og 0,01 USD for cachelagret input.

En mere kompetent Sol på tværs af opgaver

GPT‑6.1 Sol leverer markante forbedringer i forhold til GPT‑6 Sol på tværs af komplekse professionelle opgaver, fra at skrive og fejlrette kode til at forstå dokumenter og udføre forretningsprocesser med flere trin. I flere af disse evalueringer nærmer den sig GPT‑6 Astras resultater til en væsentligt lavere pris.

Kodning

På DeepSWE v1.1, som evaluerer komplekse softwareudviklingsopgaver i rigtige kodebaser, matcher GPT‑6.1 Sol GPT‑6 Astra til omtrent en femtedel af prisen. Samtidig overgår den GPT‑6 Sols bedste score med 6,4 procentpoint med lavere ræsonneringsindsats og pris.

I DeepSWE 1.1⁠⁠(åbner i et nyt vindue) løser AI-agenter originale softwareudviklingsopgaver, der kræver mange trin.

Professionelt arbejde

På GDP.pdf, som måler, hvor præcist modeller besvarer faglige spørgsmål ved hjælp af komplekse PDF-dokumenter med tabeller, grafer, diagrammer og detaljer med småt, scorer GPT‑6.1 Sol højere end Opus 5.5 med reserveløsninger til under halvdelen af prisen pr. opgave på tværs af de testede indstillinger for ræsonnering. Den nærmer sig også GPT‑6 Astras førende resultater til omtrent en femtedel af prisen pr. opgave.

I GDP.pdf⁠(åbner i et nyt vindue) skal modeller besvare virkelige forespørgsler om komplekse PDF-filer fra professionelle arbejdsgange inden for finans, sundhed, jura og syv andre fagområder.

På AutomationBench, som måler, om agenter udfører forretningsprocesser med flere trin korrekt, scorer GPT‑6.1 Sol 2,2 procentpoint højere end Opus 5.5 med ræsonneringsindsatsen sat til Mellem, til omtrent en tredjedel af prisen. Denne score er også 4,8 procentpoint højere end GPT‑6 Sols med samme indstilling.

In AutomationBench 1.0.6⁠⁠(åbner i et nyt vindue), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.

Computerbrug

GPT‑6.1 Sol gør også markante fremskridt i opgaver, der kræver interaktion med computerprogrammer. På offlinedatasættet i OSWorld 2.0, som evaluerer agenter på krævende arbejdsgange med computerbrug, overgår GPT‑6.1 Sol GPT‑6 Sol med syv procentpoint ved maksimal ræsonneringsindsats til under halvdelen af prisen. Den når op på blot 2,1 procentpoint under Astras score ved maksimal ræsonneringsindsats til omtrent en syvendedel af prisen pr. opgave.

In OSWorld 2.0⁠⁠(åbner i et nyt vindue), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.

Videnskabelig forskning

På Terminal-Bench Science 0.1, som evaluerer videnskabelige arbejdsgange, herunder dataanalyse, simulering og bevisførelse for matematiske sætninger, opnår GPT‑6.1 Sol mere end det dobbelte af GPT‑6 Sols score ved maksimal ræsonneringsindsats til under halvdelen af prisen pr. opgave. Ved maksimal indsats koster GPT‑6.1 Sol i gennemsnit 5,47 USD pr. opgave mod 23,21 USD for Opus 5.5 og 23,80 USD for Astra. Den leverer dermed stærke videnskabelige evner til en pris, der er over 75 % lavere end for begge modeller.

GPT‑6 Astra opnår stadig den højeste score blandt de testede modeller med 68,1 % og bør bruges til de sværeste videnskabelige forskningsopgaver.

I Terminal-Bench Science 0.1⁠(åbner i et nyt vindue) gennemfører agenter videnskabelige forskningsforløb ved hjælp af kode og terminalværktøjer, herunder dataanalyse, simuleringer og modeltilpasning.

Faktuel korrekthed

GPT‑6.1 Sol forbedrer også den faktuelle korrekthed ved svære prompter. Ved ekstra høj ræsonneringsindsats er dens faktuelle fejlrate 4,1 %, et fald fra 4,5 % for GPT‑6 Sol og tættere på Astras 4,0 % med samme indstilling. Samtidig koster den cirka 83 % mindre pr. opgave end Astra.

Denne evaluering måler andelen af svar med mindst én faktuel fejl i samtaler, hvor identificerende oplysninger er fjernet, og hvor brugere markerede en fejl fra en tidligere model. Disse bevidst svære prompter er ikke repræsentative for typisk brug.

Vi evaluerer faktuel korrekthed på ChatGPT‑samtaler, hvor identificerende oplysninger er fjernet, og hvor brugere havde markeret en faktuel fejl fra en tidligere model. Disse samtaler, som fremkalder fejl, er ikke repræsentative for typisk brug, hvor faktuelle fejl er sjældnere.

Sikker udrulning af GPT‑6.1 Sol

GPT‑6.1 Sol viser markante forbedringer i forhold til GPT‑6 Sol i vores evalueringer af overensstemmelse med brugerhensigt og sikkerhedskrav og nærmer sig dermed GPT‑6 Astra.

GPT‑6.1 Sol er mere åben om sine begrænsninger og mere pålidelig, når det gælder om at respektere brugerens hensigt og sikkerhedskrav. I krævende evalueringer har den lavere fejlrater end GPT‑6 Sol, når det gælder om at oplyse om defekte søgeværktøjer, respektere udtrykkelige begrænsninger og undgå uautoriserede resultater under agentiske opgaver. Vi observerede ingen forsøg på at omgå en automatisk sikkerhedskontrol, ligesom for GPT‑6 Astra og GPT‑6 Sol.

Evalueringerne nedenfor tester bevidst udfordrende situationer og måler ikke fejlrater ved typisk brug.

Priser og tilgængelighed

GPT‑6.1 Sol er fra i dag tilgængelig for alle Plus-, Pro-, Business-, Enterprise- og Edu-brugere i ChatGPT Work og Codex. Disse modeller er endnu ikke tilgængelige i Chat. Udviklere kan også få adgang til den via OpenAI API som gpt-6.1-sol. Standardpriserne i API'et er 2 USD pr. million inputtoken, 0,10 USD pr. million cachelagrede inputtoken og 10 USD pr. million outputtoken.

Samtidig lancerer vi GPT‑6 Astra Ultrafast, verdens hurtigste banebrydende model med op til 8 gange så høj hastighed som GPT‑6 Astra, samt GPT‑6.1 Sol Ultrafast. De er tilgængelige i API'et samt i ChatGPT Work og Codex for brugere på vores nye Pro-niveau med de højeste forbrugsgrænser til 500 USD om måneden. Med GPT‑6.1 Sol Ultrafast kan udviklere få intelligens tæt på Astra med op til 8 gange så høj hastighed for omtrent samme API-udgift som tidligere for GPT‑6 Astra.

Forfatter

OpenAI

Evalueringer af GPT blev udført i vores forskningsmiljø eller via vores API, som kan give lidt andre svar end den tilgængelige version af ChatGPT på grund af forskelle i systemprompter, tilgængelige værktøjer, indsatsniveauer osv. Evalueringer af konkurrerende modeller er hentet fra offentligt tilgængelige rapporter.