Hopp til hovedinnhold
OpenAI

Vi presenterer GPT‑6 Sol og Luna

Flere måter å ta i bruk banebrytende intelligens i det daglige arbeidet.

Laster inn …

Tidligere denne måneden lanserte vi GPT‑6 Astra, verdens mest intelligente og mest samkjørte modell. Selv om de mest krevende og viktige prosjektene fortsatt trenger hele kapasiteten til Astra, utføres arbeid i ulike skalaer, tempoer og budsjetter.

Derfor utvider vi GPT‑6‑universet med GPT‑6 Sol og GPT‑6 Luna. GPT‑6 Astra introduserte en ny generasjon intelligens. Disse modellene gjør fordelene ved denne intelligensen mer tilgjengelige ved å flytte grensene for kostnadseffektivitet. Vi trente GPT‑6 Sol og Luna med lignende metoder som GPT‑6 Astra. Dermed får raskere og rimeligere modeller fremskrittene bak Astras banebrytende ytelse innen profesjonelt arbeid, faktapresisjon, koding, datamaskinbruk og samkjøring.

GPT‑6-modellene leder gjennom hele kurven for kostnad og intelligens, med enestående kapasitet på hvert nivå og infrastruktur som leverer den effektivt i stor skala. Forbedringer i caching og inferens gjør at vi kan levere disse modellene til lavere kostnad. Vi lar brukere og kunder få hele besparelsen ved å redusere API-prisene for Sol og Luna med 50 % sammenlignet med introduksjonsprisene for GPT‑5.6. Samlet gjør disse forbedringene avansert KI praktisk for flere daglige oppgaver og anvendelser i stor skala.

API-priser for GPT‑6

Modell

Inndata

Utdata

Prisreduksjon

GPT‑6 Sol
mot GPT‑5.6 Sol

$4 → $2

$20 → $10

50 % billigere

GPT‑6 Luna
mot GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

50 % billigere

Prisene er per 1 million tokener.

GPT‑6 Astra er fortsatt vår beste modell på alle områder. Velg den når du vil ha de beste resultatene uten kompromisser.

Et løft for hele modellfamilien

GPT‑6 Sol og Luna gir modellene du allerede kjenner og bruker, bedre intelligens og kostnadseffektivitet på områdene som betyr mest for å få utført komplekst arbeid.

Profesjonelt arbeid

GPT‑6 Sol kan håndtere vanskelige arbeidsoppgaver og gir samtidig mer rom for gjentatte forbedringer gjennom høyere bruksgrenser og lavere kostnader. Den gir mer intelligens og bedre resultater enn konkurrerende modeller i samme prisklasse.

På AutomationBench, en test av forretningsprosesser på tvers av apper, gjør GPT‑6 Sol med xhigh-innsats det bedre enn Claude Opus 5 med Max-innsats, til bare 9 % av kostnaden per oppgave for Opus 5. Med Høy innsats forbedrer GPT‑6 Luna resultatet til forgjengeren med 5,4 prosentpoeng, til 58 % lavere kostnad per oppgave.

I AutomationBench 1.0.6⁠(åpnes i et nytt vindu) testes KI-agenter på komplette arbeidsprosesser med 47 verktøy innen salg, markedsføring, drift, kundestøtte, økonomi og HR. Datapunktet for Claude Fable 5.1 undervurderer den faktiske kostnaden, siden det ikke inkluderer kostnaden ved reservekjøringene med Opus 5, som forekom i rundt 40 % av oppgavene.

GPT‑6 Sol overgår også Claude Fable 5.1 til langt lavere kostnad, og slår til og med GPT‑6 Astra med lav innsats.

Modell (og innsats)

Resultat

Kostnad per oppgave

GPT‑6 Sol (xhigh)

33,2 %

$0.27

GPT‑6 Astra (lav)

30,3 %

3,9x GPT‑6 Sol

Claude Opus 5 (Max)

26,9 %

11,1x GPT‑6 Sol

Claude Fable 5.1 med reserve til Opus 5 (Max)

31,4 %

>8,9x GPT‑6 Sol

(reservekostnad ikke rapportert)

På Agents’ Last Exam, som evaluerer agenter i komplekse profesjonelle arbeidsprosesser, oppnår GPT‑6 Sol med Max-innsats 56,4 %. Det er høyere enn Claude Opus 5s beste resultat i evalueringen, til 60 % lavere kostnad per oppgave.

I Agents’ Last Exam V1⁠(åpnes i et nytt vindu) evalueres KI-agenter på langvarige, økonomisk verdifulle oppgaver i 55 underbransjer. Disse dekker de fleste viktige former for profesjonelt arbeid som utføres på en datamaskin.

Faktapresisjon

Nytten av et svar avhenger av at faktaene stemmer, og vi fortsetter å forbedre den faktamessige påliteligheten. I vår interne evaluering av faktapresisjon, basert på avidentifiserte samtaler fra den virkelige verden der brukere markerte feil fra modellene våre, gjør GPT‑6 Sol omtrent halvparten så mange feil som forgjengeren. Påliteligheten nærmer seg Astra-nivå, til langt lavere kostnad. GPT‑6 Luna forbedres også betydelig. Ved høyere innsatsnivåer matcher den GPT‑5.6 Sol til rundt en hundredel av kostnaden.

Her evaluerer vi faktapresisjon i avidentifiserte ChatGPT‑samtaler der brukerne hadde markert en faktafeil fra en tidligere modell. Disse samtalene, som fremkaller feil, er ikke representative for vanlig bruk, der faktafeil forekommer sjeldnere. Resultatene er ikke kontrollert for lengde, men testene våre med ulik detaljgrad viste nesten ingen sammenheng med svarlengden.

Koding

I år har kodeagenter begynt å løse oppgaver med større kompleksitet, omfang og varighet enn noen gang før. Hos OpenAI har den interne bruken vår vokst eksponentielt. Verdsatt etter API-priser har det daglige tokenforbruket passert 600 dollar for medianforskeren og 7000 dollar for forskere i 90-persentilen (Raskere forskning: Et innblikk i OpenAI⁠). Når kodeagenter tar på seg lengre og mer krevende oppgaver, blir kostnaden ved vedvarende bruk viktigere. GPT‑6 Sol og Luna kombinerer sterk kodeytelse med lavere API-priser. Det gir utviklere mer rom for gjentatte forbedringer og team større trygghet til å være ambisiøse med oppgavene de gir Codex.

På FrontierCode, som evaluerer om kodeagenter lager endringer som er klare til å flettes inn i reelle kodebaser, forbedrer GPT‑6 Sol seg betydelig fra GPT‑5.6 Sol og matcher Claude Fable 5.1 med xhigh-innsats til langt lavere kostnad.

I FrontierCode 1.1 Main⁠(åpnes i et nytt vindu) skriver KI-agenter kode som ikke bare vurderes ut fra korrekthet, men også hvor klar den er til å flettes inn, for eksempel testkvalitet, disiplinert omfang, kodestil og etterlevelse av kodebasens standarder.

På DeepSWE v1.1, som tester ytelse på komplekse programvareutviklingsoppgaver i reelle kodebaser, oppnår GPT‑6 Sol med Max-innsats 68,8 %. Det er 1,1 prosentpoeng bak Claude Fable 5s beste resultat i evalueringen – 69,9 % med xhigh-innsats – til omtrent 80 % lavere kostnad per oppgave.

GPT‑6 Luna oppnår 66,6 % med Max-innsats, på nivå med Claude Opus 5 og Fable 5 med Middels innsats. I disse sammenligningene koster Luna 93 % mindre per oppgave enn Opus 5 og 96 % mindre enn Fable 5.

I DeepSWE 1.1⁠(åpnes i et nytt vindu) løser KI-agenter originale, langvarige programvareutviklingsoppgaver.

Datamaskinbruk

GPT‑6 Astra er fortsatt verdens beste modell for datamaskinbruk, men GPT‑6 Sol og Luna gir mer kostnadseffektiv ytelse enn forgjengerne. På OSWorld 2.0 offline oppnår GPT‑6 Sol med xhigh-innsats omtrent samme resultat som Claude Opus 5 med Middels innsats – 60,5 % mot 60,3 % – til rundt 80 % lavere kostnad per oppgave. GPT‑6 Luna (Max) overgår GPT‑5.6 Sol (Middels) til en tidel av kostnaden.

I OSWorld 2.0⁠(åpnes i et nytt vindu) forsøker KI-agenter å gjennomføre langvarige arbeidsprosesser på datamaskin, på tvers av daglige og profesjonelle oppgaver. Vi rapporterer den delvise belønningen for det frakoblede datasettet fra v2026.08.08-utgivelsen.

Samarbeidsstil

Vi har også gitt Sol og Luna den forbedrede kommunikasjonsstilen fra GPT‑6 Astra. Vi tror den vil merkes spesielt godt i tekniske samtaler og samtaler om koding. Du kan forvente tydeligere svar, mindre fagsjargong, færre underlige formuleringer, færre detaljer med liten verdi og generelt litt kortere svar – uten tap av innhold.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Selv om stil er subjektivt, foretrekker vi svaret fra GPT‑6 Sol her. Det trekker ikke konklusjoner like raskt, bruker mindre tid på å gjenta detaljer som kan være åpenbare for den som spør (for eksempel at nettstedet har fire sider), bruker mindre vagt språk (for eksempel «bento-preg» og «omforme … rundt dette systemet»), er tydeligere om hva det har og ikke har kontrollert, og deler ikke unødvendige implementeringsdetaljer som prompten til bildeverktøyet.

Bedre caching for agenter og lange samtaler

I tillegg til lavere tokenpriser hjelper vi utviklere som bygger med GPT‑6, med å spare mer på konteksten applikasjonene deres bruker om igjen. Vi har forbedret promptcaching for GPT‑6 slik at treffprosenten i cachen blir høyere som standard. Det hjelper agenter med å gjenbruke mer kontekst, svare raskere og få 90 % rabatt på lesing av cachede inndatatokener.

Utviklere får også flere måter å måle og optimalisere cachingytelsen på:

GitHub rapporterer at disse forbedringene de siste månedene har redusert andelen prompttokener som må behandles på nytt, med mer enn 50 % på tvers av milliarder av forespørsler til OpenAI-modeller. Det hjelper Copilot med å svare raskere.

Fortsatt forbedring av samkjøring

GPT‑6 Sol og Luna bygger videre på samkjøringsarbeidet som ble introdusert med Astra, vår hittil mest samkjørte modell. I evalueringene våre av samkjøring viser både Sol og Luna forbedringer fra sine GPT‑5.6-motstykker, blant annet færre villedende påstander om eget kodearbeid.

Evalueringene nedenfor tester bevisst krevende situasjoner og måler ikke feilrater ved vanlig bruk. Se systemkortet⁠(åpnes i et nytt vindu) for fullstendige resultater.

Tilgjengelighet

GPT‑6 Sol og GPT‑6 Luna er tilgjengelige i ChatGPT Work og Codex fra og med i dag for alle brukere med Plus, Pro, Business, Enterprise og Edu. Brukere med Free og Go får tilgang til GPT‑6 Luna i skrivebordsappen. Disse modellene er foreløpig ikke tilgjengelige i Chat. I OpenAI API er de tilgjengelige som gpt-6-sol og gpt-6-luna.

For å holde tjenesten stabil for alle planlegger vi å rulle ut disse modellene gradvis i ChatGPT gjennom dagen. Hvis du ikke ser de nye modellene i ChatGPT Work eller Codex, kan du prøve igjen senere.


Evalueringene av GPT ble utført i forskningsmiljøet vårt eller via API-et vårt. På grunn av forskjeller i systemprompter, tilgjengelige verktøy og lignende kan dette gi litt andre resultater enn ChatGPT i produksjon. Evalueringene av konkurrerende modeller er hentet fra offentlig tilgjengelige rapporter. Resultater for Claude Fable 5 ble brukt når resultater for Claude Fable 5.1 ikke var tilgjengelige.

Forfatter

OpenAI