Gå til hovedindhold
OpenAI

Vi præsenterer GPT‑6 Sol og Luna

Flere måder at bringe banebrydende intelligens ind i dit daglige arbejde.

Indlæser ...

Tidligere på måneden lancerede vi GPT‑6 Astra, verdens mest intelligente og bedst tilpassede model. Selvom de mest krævende og vigtige projekter stadig kræver Astras fulde dybde, udføres arbejde i forskellige skalaer, tempi og budgetter.

Derfor udvider vi GPT‑6‑universet med GPT‑6 Sol og GPT‑6 Luna. GPT‑6 Astra introducerede en ny generation af intelligens – disse modeller gør fordelene ved denne intelligens mere tilgængelige ved at flytte grænsen for omkostningseffektivitet. Vi trænede GPT‑6 Sol og Luna med metoder, der minder om dem, vi brugte til GPT‑6 Astra. Dermed overfører vi fremskridtene bag Astras førende resultater inden for professionelt arbejde, faktuel korrekthed, kodning, computerbrug og tilpasning til hurtigere og billigere modeller.

GPT‑6-modellerne er førende på tværs af forholdet mellem pris og intelligens og kombinerer enestående egenskaber på alle niveauer med en infrastruktur, der leverer dem effektivt i stor skala. Forbedringer af caching og inferens gør det muligt at levere disse modeller billigere, og vi giver besparelserne direkte videre til brugere og kunder ved at sænke API-priserne for Sol og Luna med 50 % sammenlignet med introduktionspriserne for GPT‑5.6. Tilsammen gør forbedringerne avanceret AI praktisk til flere daglige opgaver og anvendelser i stor skala.

API-priser for GPT‑6

Model

Input

Output

Prisreduktion

GPT‑6 Sol
mod GPT‑5.6 Sol

4 USD → 2 USD

20 USD → 10 USD

50 % billigere

GPT‑6 Luna
mod GPT‑5.6 Luna

0,20 USD → 0,10 USD

1,20 USD → 0,50 USD

50 % billigere

Priserne er pr. 1 million tokens.

GPT‑6 Astra er fortsat vores bedste model på alle områder. Vælg den, når du vil have de bedste resultater og en kompromisløs oplevelse.

Et løft til hele modelfamilien

GPT‑6 Sol og Luna giver de modeller, du allerede kender og bruger, bedre intelligens og omkostningseffektivitet på de områder, der er vigtigst for at løse komplekst arbejde.

Professionelt arbejde

GPT‑6 Sol kan håndtere krævende arbejdsopgaver og giver samtidig mere plads til at gentage og forbedre arbejdet takket være højere brugsgrænser og lavere omkostninger. Den leverer mere intelligens og bedre resultater end konkurrerende modeller i samme prisklasse.

I AutomationBench, som tester forretningsprocesser på tværs af apps, klarer GPT‑6 Sol med ekstra høj indsats sig bedre end Claude Opus 5 med maksimal indsats til blot 9 % af Opus 5's pris pr. opgave. Med høj indsats forbedrer GPT‑6 Luna resultatet fra sin forgænger med 5,4 procentpoint til en 58 % lavere pris pr. opgave.

I AutomationBench 1.0.6⁠(åbner i et nyt vindue) testes AI-agenter på komplette arbejdsgange med 47 værktøjer inden for salg, marketing, drift, support, økonomi og HR. Datapunktet for Claude Fable 5.1 undervurderer modellens faktiske omkostninger, fordi prisen på brugen af Opus 5 som reserve, hvilket skete i ca. 40 % af opgaverne, ikke er medregnet.

GPT‑6 Sol overgår også Claude Fable 5.1 til en langt lavere pris og klarer sig endda bedre end GPT‑6 Astra med lav indsats.

Model (og indsats)

Resultat

Pris pr. opgave

GPT‑6 Sol (ekstra høj)

33,2 %

0,27 USD

GPT‑6 Astra (lav)

30,3 %

3,9 × GPT‑6 Sol

Claude Opus 5 (maks.)

26,9 %

11,1 × GPT‑6 Sol

Claude Fable 5.1 med Opus 5 som reserve (maks.)

31,4 %

>8,9 × GPT‑6 Sol

(prisen for reserven er ikke oplyst)

I Agents’ Last Exam, som evaluerer agenter på komplekse professionelle arbejdsgange, opnår GPT‑6 Sol med maksimal indsats 56,4 %, hvilket er højere end Claude Opus 5's bedste resultat i evalueringen, og det til en 60 % lavere pris pr. opgave.

I Agents’ Last Exam V1⁠(åbner i et nyt vindue) evalueres AI-agenter på langvarige opgaver med økonomisk værdi inden for 55 delbrancher, som dækker de fleste større områder af professionelt arbejde, der udføres på en computer.

Faktuel korrekthed

Et svars nytteværdi afhænger af, at fakta er korrekte, og vi fortsætter med at forbedre den faktuelle pålidelighed. I vores interne evaluering af faktuel korrekthed, der bygger på afidentificerede samtaler fra den virkelige verden, hvor brugere har markeret fejl fra vores modeller, laver GPT‑6 Sol omkring halvt så mange fejl som sin forgænger og nærmer sig Astras pålidelighed til en langt lavere pris. GPT‑6 Luna er også væsentligt forbedret. Ved højere indsatsniveauer matcher den GPT‑5.6 Sol til omkring en hundrededel af prisen.

Her evaluerer vi faktuel korrekthed i afidentificerede ChatGPT‑samtaler, hvor brugere havde markeret en faktuel fejl fra en tidligere model. Disse samtaler, der fremkalder fejl, er ikke repræsentative for typisk brug, hvor faktuelle fejl er sjældnere. Resultaterne er ikke korrigeret for længde, men vores test på tværs af forskellige svarlængder viste næsten ingen sammenhæng med svarets længde.

Kodning

I år er kodningsagenter begyndt at håndtere opgaver med større kompleksitet, omfang og varighed end nogensinde før. Hos OpenAI er vores interne brug vokset eksponentielt. Opgjort efter API-priser har det daglige tokenforbrug oversteget 600 USD for medianforskeren og 7.000 USD for forskere i den 90. percentil (Hurtigere forskning: Et indblik i OpenAI⁠). Efterhånden som kodningsagenter påtager sig længere og mere krævende opgaver, får prisen på vedvarende brug større betydning. GPT‑6 Sol og Luna kombinerer stærke kodningsresultater med lavere API-priser. Det giver udviklere mere plads til at gentage og forbedre deres arbejde og teams større tryghed ved at lade Codex håndtere mere ambitiøse opgaver.

I FrontierCode, som evaluerer, om kodningsagenter producerer ændringer, der er klar til at blive flettet ind i rigtige kodebaser, forbedrer GPT‑6 Sol sig markant i forhold til GPT‑5.6 Sol og matcher Claude Fable 5.1 med ekstra høj indsats til en langt lavere pris.

I FrontierCode 1.1 Main⁠(åbner i et nyt vindue) skriver AI-agenter kode, der ikke kun bedømmes på korrekthed, men også på, om den kan flettes ind: f.eks. testkvalitet, disciplin i omfanget, kodestil og overholdelse af kodebasens standarder.

I DeepSWE v1.1, som tester resultater på komplekse softwareudviklingsopgaver i rigtige kodebaser, opnår GPT‑6 Sol med maksimal indsats 68,8 %. Det er inden for 1,1 procentpoint af Claude Fable 5's bedste resultat i evalueringen – 69,9 % med ekstra høj indsats – til en cirka 80 % lavere pris pr. opgave.

GPT‑6 Luna opnår 66,6 % med maksimal indsats, hvilket er på niveau med Claude Opus 5 og Fable 5 med mellem indsats. I disse sammenligninger koster Luna 93 % mindre pr. opgave end Opus 5 og 96 % mindre end Fable 5.

I DeepSWE 1.1⁠(åbner i et nyt vindue) løser AI-agenter originale, langvarige softwareudviklingsopgaver.

Computerbrug

Selvom GPT‑6 Astra fortsat er verdens bedste model til computerbrug, leverer GPT‑6 Sol og Luna bedre resultater i forhold til prisen end deres forgængere. I OSWorld 2.0 offline opnår GPT‑6 Sol med ekstra høj indsats næsten samme resultat som Claude Opus 5 med mellem indsats – 60,5 % mod 60,3 % – til en cirka 80 % lavere pris pr. opgave. GPT‑6 Luna (maks.) overgår GPT‑5.6 Sol (mellem) til en tiendedel af prisen.

I OSWorld 2.0⁠(åbner i et nyt vindue) forsøger AI-agenter at gennemføre langvarige arbejdsgange med computerbrug, der spænder over daglige og professionelle opgaver. Vi rapporterer den delvise belønning for offlinedatasættet fra v2026.08.08-udgivelsen.

Samarbejdsstil

Vi har også overført GPT‑6 Astras forbedrede kommunikationsstil til Sol og Luna, og vi tror, at det især vil kunne mærkes i tekniske samtaler og samtaler om kodning. Forvent større klarhed, mindre fagsprog, færre mærkelige formuleringer, færre detaljer med begrænset værdi og generelt lidt kortere svar – uden at miste substans.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Selvom stil er subjektiv, foretrækker vi GPT‑6 Sols svar her. Det drager ikke lige så hurtigt konklusioner, bruger mindre tid på at gentage detaljer, der kan være indlysende for spørgeren (f.eks. at webstedet har fire sider), bruger færre vage formuleringer (f.eks. »bento-præg« og »omforme … omkring det system«), er mere åbent om, hvad det har og ikke har kontrolleret, og deler ikke unødigt implementeringsdetaljer såsom prompten til billedværktøjet.

Bedre caching til agenter og lange samtaler

Ud over lavere tokenpriser hjælper vi udviklere, der bygger på GPT‑6, med at spare mere på den kontekst, deres applikationer genbruger. Vi har forbedret prompt caching for GPT‑6, så cachetræfraten som standard er højere. Det hjælper agenter med at genbruge mere kontekst, svare hurtigere og få 90 % rabat på læsning af cachede inputtokens.

Udviklere har også fået flere muligheder for at måle og optimere cachingens ydeevne:

GitHub oplyser, at disse forbedringer gennem de seneste måneder har reduceret andelen af prompttokens, der kræver ny behandling, med mere end 50 % på tværs af milliarder af forespørgsler til OpenAI-modeller, hvilket hjælper Copilot med at svare hurtigere.

Fortsatte forbedringer af tilpasningen

GPT‑6 Sol og Luna bygger videre på arbejdet med tilpasning, som blev introduceret med Astra, vores hidtil bedst tilpassede model. I vores evalueringer af tilpasning viser både Sol og Luna forbedringer i forhold til deres GPT‑5.6-modstykker, herunder færre vildledende påstande om deres kodningsarbejde.

Evalueringerne nedenfor tester bevidst udfordrende situationer og måler ikke fejlrater ved typisk brug. Se systemkortet⁠(åbner i et nyt vindue) for de fulde resultater.

Tilgængelighed

GPT‑6 Sol og GPT‑6 Luna er fra i dag tilgængelige i ChatGPT Work og Codex for alle Plus-, Pro-, Business-, Enterprise- og Edu-brugere. Free- og Go-brugere kan få adgang til GPT‑6 Luna i desktopappen. Disse modeller er endnu ikke tilgængelige i Chat. I OpenAI API er de tilgængelige som gpt-6-sol og gpt-6-luna.

For at holde tjenesten stabil for alle planlægger vi at udrulle modellerne gradvist i ChatGPT i løbet af dagen. Hvis du ikke kan se de nye modeller i ChatGPT Work eller Codex, kan du prøve igen senere.


Evalueringer af GPT blev udført i vores forskningsmiljø eller via vores API, som på grund af forskelle i systemprompts, tilgængelige værktøjer osv. kan give lidt andre resultater end ChatGPT i produktion. Evalueringer af konkurrerende modeller blev hentet fra offentligt tilgængelige rapporter. Resultater for Claude Fable 5 blev anvendt, når resultater for Claude Fable 5.1 ikke var tilgængelige.

Forfatter

OpenAI