Vi presenterer GPT‑6 Sol og Luna
Flere måter å ta i bruk banebrytende intelligens i det daglige arbeidet.
Tidligere denne måneden lanserte vi GPT‑6 Astra, verdens mest intelligente og mest samkjørte modell. Selv om de mest krevende og viktige prosjektene fortsatt trenger hele kapasiteten til Astra, utføres arbeid i ulike skalaer, tempoer og budsjetter.
Derfor utvider vi GPT‑6‑universet med GPT‑6 Sol og GPT‑6 Luna. GPT‑6 Astra introduserte en ny generasjon intelligens. Disse modellene gjør fordelene ved denne intelligensen mer tilgjengelige ved å flytte grensene for kostnadseffektivitet. Vi trente GPT‑6 Sol og Luna med lignende metoder som GPT‑6 Astra. Dermed får raskere og rimeligere modeller fremskrittene bak Astras banebrytende ytelse innen profesjonelt arbeid, faktapresisjon, koding, datamaskinbruk og samkjøring.
GPT‑6-modellene leder gjennom hele kurven for kostnad og intelligens, med enestående kapasitet på hvert nivå og infrastruktur som leverer den effektivt i stor skala. Forbedringer i caching og inferens gjør at vi kan levere disse modellene til lavere kostnad. Vi lar brukere og kunder få hele besparelsen ved å redusere API-prisene for Sol og Luna med 50 % sammenlignet med introduksjonsprisene for GPT‑5.6. Samlet gjør disse forbedringene avansert KI praktisk for flere daglige oppgaver og anvendelser i stor skala.
Modell | Inndata | Utdata | Prisreduksjon |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50 % billigere |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50 % billigere |
Prisene er per 1 million tokener.
GPT‑6 Astra er fortsatt vår beste modell på alle områder. Velg den når du vil ha de beste resultatene uten kompromisser.
GPT‑6 Sol og Luna gir modellene du allerede kjenner og bruker, bedre intelligens og kostnadseffektivitet på områdene som betyr mest for å få utført komplekst arbeid.
GPT‑6 Sol kan håndtere vanskelige arbeidsoppgaver og gir samtidig mer rom for gjentatte forbedringer gjennom høyere bruksgrenser og lavere kostnader. Den gir mer intelligens og bedre resultater enn konkurrerende modeller i samme prisklasse.
På AutomationBench, en test av forretningsprosesser på tvers av apper, gjør GPT‑6 Sol med xhigh-innsats det bedre enn Claude Opus 5 med Max-innsats, til bare 9 % av kostnaden per oppgave for Opus 5. Med Høy innsats forbedrer GPT‑6 Luna resultatet til forgjengeren med 5,4 prosentpoeng, til 58 % lavere kostnad per oppgave.
I AutomationBench 1.0.6(åpnes i et nytt vindu) testes KI-agenter på komplette arbeidsprosesser med 47 verktøy innen salg, markedsføring, drift, kundestøtte, økonomi og HR. Datapunktet for Claude Fable 5.1 undervurderer den faktiske kostnaden, siden det ikke inkluderer kostnaden ved reservekjøringene med Opus 5, som forekom i rundt 40 % av oppgavene.
GPT‑6 Sol overgår også Claude Fable 5.1 til langt lavere kostnad, og slår til og med GPT‑6 Astra med lav innsats.
Modell (og innsats) | Resultat | Kostnad per oppgave |
|---|---|---|
GPT‑6 Sol (xhigh) | 33,2 % | $0.27 |
GPT‑6 Astra (lav) | 30,3 % | 3,9x GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9 % | 11,1x GPT‑6 Sol |
Claude Fable 5.1 med reserve til Opus 5 (Max) | 31,4 % | >8,9x GPT‑6 Sol (reservekostnad ikke rapportert) |
På Agents’ Last Exam, som evaluerer agenter i komplekse profesjonelle arbeidsprosesser, oppnår GPT‑6 Sol med Max-innsats 56,4 %. Det er høyere enn Claude Opus 5s beste resultat i evalueringen, til 60 % lavere kostnad per oppgave.
I Agents’ Last Exam V1(åpnes i et nytt vindu) evalueres KI-agenter på langvarige, økonomisk verdifulle oppgaver i 55 underbransjer. Disse dekker de fleste viktige former for profesjonelt arbeid som utføres på en datamaskin.
Nytten av et svar avhenger av at faktaene stemmer, og vi fortsetter å forbedre den faktamessige påliteligheten. I vår interne evaluering av faktapresisjon, basert på avidentifiserte samtaler fra den virkelige verden der brukere markerte feil fra modellene våre, gjør GPT‑6 Sol omtrent halvparten så mange feil som forgjengeren. Påliteligheten nærmer seg Astra-nivå, til langt lavere kostnad. GPT‑6 Luna forbedres også betydelig. Ved høyere innsatsnivåer matcher den GPT‑5.6 Sol til rundt en hundredel av kostnaden.
Her evaluerer vi faktapresisjon i avidentifiserte ChatGPT‑samtaler der brukerne hadde markert en faktafeil fra en tidligere modell. Disse samtalene, som fremkaller feil, er ikke representative for vanlig bruk, der faktafeil forekommer sjeldnere. Resultatene er ikke kontrollert for lengde, men testene våre med ulik detaljgrad viste nesten ingen sammenheng med svarlengden.
I år har kodeagenter begynt å løse oppgaver med større kompleksitet, omfang og varighet enn noen gang før. Hos OpenAI har den interne bruken vår vokst eksponentielt. Verdsatt etter API-priser har det daglige tokenforbruket passert 600 dollar for medianforskeren og 7000 dollar for forskere i 90-persentilen (Raskere forskning: Et innblikk i OpenAI). Når kodeagenter tar på seg lengre og mer krevende oppgaver, blir kostnaden ved vedvarende bruk viktigere. GPT‑6 Sol og Luna kombinerer sterk kodeytelse med lavere API-priser. Det gir utviklere mer rom for gjentatte forbedringer og team større trygghet til å være ambisiøse med oppgavene de gir Codex.
På FrontierCode, som evaluerer om kodeagenter lager endringer som er klare til å flettes inn i reelle kodebaser, forbedrer GPT‑6 Sol seg betydelig fra GPT‑5.6 Sol og matcher Claude Fable 5.1 med xhigh-innsats til langt lavere kostnad.
I FrontierCode 1.1 Main(åpnes i et nytt vindu) skriver KI-agenter kode som ikke bare vurderes ut fra korrekthet, men også hvor klar den er til å flettes inn, for eksempel testkvalitet, disiplinert omfang, kodestil og etterlevelse av kodebasens standarder.
På DeepSWE v1.1, som tester ytelse på komplekse programvareutviklingsoppgaver i reelle kodebaser, oppnår GPT‑6 Sol med Max-innsats 68,8 %. Det er 1,1 prosentpoeng bak Claude Fable 5s beste resultat i evalueringen – 69,9 % med xhigh-innsats – til omtrent 80 % lavere kostnad per oppgave.
GPT‑6 Luna oppnår 66,6 % med Max-innsats, på nivå med Claude Opus 5 og Fable 5 med Middels innsats. I disse sammenligningene koster Luna 93 % mindre per oppgave enn Opus 5 og 96 % mindre enn Fable 5.
I DeepSWE 1.1(åpnes i et nytt vindu) løser KI-agenter originale, langvarige programvareutviklingsoppgaver.
GPT‑6 Astra er fortsatt verdens beste modell for datamaskinbruk, men GPT‑6 Sol og Luna gir mer kostnadseffektiv ytelse enn forgjengerne. På OSWorld 2.0 offline oppnår GPT‑6 Sol med xhigh-innsats omtrent samme resultat som Claude Opus 5 med Middels innsats – 60,5 % mot 60,3 % – til rundt 80 % lavere kostnad per oppgave. GPT‑6 Luna (Max) overgår GPT‑5.6 Sol (Middels) til en tidel av kostnaden.
I OSWorld 2.0(åpnes i et nytt vindu) forsøker KI-agenter å gjennomføre langvarige arbeidsprosesser på datamaskin, på tvers av daglige og profesjonelle oppgaver. Vi rapporterer den delvise belønningen for det frakoblede datasettet fra v2026.08.08-utgivelsen.
Vi har også gitt Sol og Luna den forbedrede kommunikasjonsstilen fra GPT‑6 Astra. Vi tror den vil merkes spesielt godt i tekniske samtaler og samtaler om koding. Du kan forvente tydeligere svar, mindre fagsjargong, færre underlige formuleringer, færre detaljer med liten verdi og generelt litt kortere svar – uten tap av innhold.
Selv om stil er subjektivt, foretrekker vi svaret fra GPT‑6 Sol her. Det trekker ikke konklusjoner like raskt, bruker mindre tid på å gjenta detaljer som kan være åpenbare for den som spør (for eksempel at nettstedet har fire sider), bruker mindre vagt språk (for eksempel «bento-preg» og «omforme … rundt dette systemet»), er tydeligere om hva det har og ikke har kontrollert, og deler ikke unødvendige implementeringsdetaljer som prompten til bildeverktøyet.
I tillegg til lavere tokenpriser hjelper vi utviklere som bygger med GPT‑6, med å spare mer på konteksten applikasjonene deres bruker om igjen. Vi har forbedret promptcaching for GPT‑6 slik at treffprosenten i cachen blir høyere som standard. Det hjelper agenter med å gjenbruke mer kontekst, svare raskere og få 90 % rabatt på lesing av cachede inndatatokener.
Utviklere får også flere måter å måle og optimalisere cachingytelsen på:
Overvåk og diagnostiser. Kontrollpanelet for promptcaching(åpnes i et nytt vindu) viser hvor mye av inndataene som er cachet, og hvordan dette endrer seg over tid. Diagnostikkverktøyet(åpnes i et nytt vindu) forklarer tapte muligheter for caching og hva som bør rettes.
Juster resonneringsinnsats og verktøytilgang uten å bryte cachen. Øk resonneringsinnsatsen(åpnes i et nytt vindu) for vanskeligere oppgaver, eller reduser den for enklere oppfølgingsspørsmål. Du kan også aktivere eller deaktivere verktøy(åpnes i et nytt vindu) etter hvert som agentens behov endrer seg. Begge kontrollene bevarer nå tidligere kontekst slik at den kan gjenbrukes fra cachen.
Optimaliser hvilke prefikser som caches. Eksplisitte bruddpunkter lar utviklere velge hvor cachede promptprefikser skal slutte. Dette gir utviklere større kontroll over gjenbruk fra cachen og kan forbedre ytelsen.
GitHub rapporterer at disse forbedringene de siste månedene har redusert andelen prompttokener som må behandles på nytt, med mer enn 50 % på tvers av milliarder av forespørsler til OpenAI-modeller. Det hjelper Copilot med å svare raskere.
GPT‑6 Sol og Luna bygger videre på samkjøringsarbeidet som ble introdusert med Astra, vår hittil mest samkjørte modell. I evalueringene våre av samkjøring viser både Sol og Luna forbedringer fra sine GPT‑5.6-motstykker, blant annet færre villedende påstander om eget kodearbeid.
Evalueringene nedenfor tester bevisst krevende situasjoner og måler ikke feilrater ved vanlig bruk. Se systemkortet(åpnes i et nytt vindu) for fullstendige resultater.
GPT‑6 Sol og GPT‑6 Luna er tilgjengelige i ChatGPT Work og Codex fra og med i dag for alle brukere med Plus, Pro, Business, Enterprise og Edu. Brukere med Free og Go får tilgang til GPT‑6 Luna i skrivebordsappen. Disse modellene er foreløpig ikke tilgjengelige i Chat. I OpenAI API er de tilgjengelige som gpt-6-sol og gpt-6-luna.
For å holde tjenesten stabil for alle planlegger vi å rulle ut disse modellene gradvis i ChatGPT gjennom dagen. Hvis du ikke ser de nye modellene i ChatGPT Work eller Codex, kan du prøve igjen senere.
Evalueringene av GPT ble utført i forskningsmiljøet vårt eller via API-et vårt. På grunn av forskjeller i systemprompter, tilgjengelige verktøy og lignende kan dette gi litt andre resultater enn ChatGPT i produksjon. Evalueringene av konkurrerende modeller er hentet fra offentlig tilgjengelige rapporter. Resultater for Claude Fable 5 ble brukt når resultater for Claude Fable 5.1 ikke var tilgjengelige.


