Vi præsenterer GPT‑6 Sol og Luna
Flere måder at bringe banebrydende intelligens ind i dit daglige arbejde.
Tidligere på måneden lancerede vi GPT‑6 Astra, verdens mest intelligente og bedst tilpassede model. Selvom de mest krævende og vigtige projekter stadig kræver Astras fulde dybde, udføres arbejde i forskellige skalaer, tempi og budgetter.
Derfor udvider vi GPT‑6‑universet med GPT‑6 Sol og GPT‑6 Luna. GPT‑6 Astra introducerede en ny generation af intelligens – disse modeller gør fordelene ved denne intelligens mere tilgængelige ved at flytte grænsen for omkostningseffektivitet. Vi trænede GPT‑6 Sol og Luna med metoder, der minder om dem, vi brugte til GPT‑6 Astra. Dermed overfører vi fremskridtene bag Astras førende resultater inden for professionelt arbejde, faktuel korrekthed, kodning, computerbrug og tilpasning til hurtigere og billigere modeller.
GPT‑6-modellerne er førende på tværs af forholdet mellem pris og intelligens og kombinerer enestående egenskaber på alle niveauer med en infrastruktur, der leverer dem effektivt i stor skala. Forbedringer af caching og inferens gør det muligt at levere disse modeller billigere, og vi giver besparelserne direkte videre til brugere og kunder ved at sænke API-priserne for Sol og Luna med 50 % sammenlignet med introduktionspriserne for GPT‑5.6. Tilsammen gør forbedringerne avanceret AI praktisk til flere daglige opgaver og anvendelser i stor skala.
Model | Input | Output | Prisreduktion |
GPT‑6 Sol | 4 USD → 2 USD | 20 USD → 10 USD | 50 % billigere |
GPT‑6 Luna | 0,20 USD → 0,10 USD | 1,20 USD → 0,50 USD | 50 % billigere |
Priserne er pr. 1 million tokens.
GPT‑6 Astra er fortsat vores bedste model på alle områder. Vælg den, når du vil have de bedste resultater og en kompromisløs oplevelse.
GPT‑6 Sol og Luna giver de modeller, du allerede kender og bruger, bedre intelligens og omkostningseffektivitet på de områder, der er vigtigst for at løse komplekst arbejde.
GPT‑6 Sol kan håndtere krævende arbejdsopgaver og giver samtidig mere plads til at gentage og forbedre arbejdet takket være højere brugsgrænser og lavere omkostninger. Den leverer mere intelligens og bedre resultater end konkurrerende modeller i samme prisklasse.
I AutomationBench, som tester forretningsprocesser på tværs af apps, klarer GPT‑6 Sol med ekstra høj indsats sig bedre end Claude Opus 5 med maksimal indsats til blot 9 % af Opus 5's pris pr. opgave. Med høj indsats forbedrer GPT‑6 Luna resultatet fra sin forgænger med 5,4 procentpoint til en 58 % lavere pris pr. opgave.
I AutomationBench 1.0.6(åbner i et nyt vindue) testes AI-agenter på komplette arbejdsgange med 47 værktøjer inden for salg, marketing, drift, support, økonomi og HR. Datapunktet for Claude Fable 5.1 undervurderer modellens faktiske omkostninger, fordi prisen på brugen af Opus 5 som reserve, hvilket skete i ca. 40 % af opgaverne, ikke er medregnet.
GPT‑6 Sol overgår også Claude Fable 5.1 til en langt lavere pris og klarer sig endda bedre end GPT‑6 Astra med lav indsats.
Model (og indsats) | Resultat | Pris pr. opgave |
|---|---|---|
GPT‑6 Sol (ekstra høj) | 33,2 % | 0,27 USD |
GPT‑6 Astra (lav) | 30,3 % | 3,9 × GPT‑6 Sol |
Claude Opus 5 (maks.) | 26,9 % | 11,1 × GPT‑6 Sol |
Claude Fable 5.1 med Opus 5 som reserve (maks.) | 31,4 % | >8,9 × GPT‑6 Sol (prisen for reserven er ikke oplyst) |
I Agents’ Last Exam, som evaluerer agenter på komplekse professionelle arbejdsgange, opnår GPT‑6 Sol med maksimal indsats 56,4 %, hvilket er højere end Claude Opus 5's bedste resultat i evalueringen, og det til en 60 % lavere pris pr. opgave.
I Agents’ Last Exam V1(åbner i et nyt vindue) evalueres AI-agenter på langvarige opgaver med økonomisk værdi inden for 55 delbrancher, som dækker de fleste større områder af professionelt arbejde, der udføres på en computer.
Et svars nytteværdi afhænger af, at fakta er korrekte, og vi fortsætter med at forbedre den faktuelle pålidelighed. I vores interne evaluering af faktuel korrekthed, der bygger på afidentificerede samtaler fra den virkelige verden, hvor brugere har markeret fejl fra vores modeller, laver GPT‑6 Sol omkring halvt så mange fejl som sin forgænger og nærmer sig Astras pålidelighed til en langt lavere pris. GPT‑6 Luna er også væsentligt forbedret. Ved højere indsatsniveauer matcher den GPT‑5.6 Sol til omkring en hundrededel af prisen.
Her evaluerer vi faktuel korrekthed i afidentificerede ChatGPT‑samtaler, hvor brugere havde markeret en faktuel fejl fra en tidligere model. Disse samtaler, der fremkalder fejl, er ikke repræsentative for typisk brug, hvor faktuelle fejl er sjældnere. Resultaterne er ikke korrigeret for længde, men vores test på tværs af forskellige svarlængder viste næsten ingen sammenhæng med svarets længde.
I år er kodningsagenter begyndt at håndtere opgaver med større kompleksitet, omfang og varighed end nogensinde før. Hos OpenAI er vores interne brug vokset eksponentielt. Opgjort efter API-priser har det daglige tokenforbrug oversteget 600 USD for medianforskeren og 7.000 USD for forskere i den 90. percentil (Hurtigere forskning: Et indblik i OpenAI). Efterhånden som kodningsagenter påtager sig længere og mere krævende opgaver, får prisen på vedvarende brug større betydning. GPT‑6 Sol og Luna kombinerer stærke kodningsresultater med lavere API-priser. Det giver udviklere mere plads til at gentage og forbedre deres arbejde og teams større tryghed ved at lade Codex håndtere mere ambitiøse opgaver.
I FrontierCode, som evaluerer, om kodningsagenter producerer ændringer, der er klar til at blive flettet ind i rigtige kodebaser, forbedrer GPT‑6 Sol sig markant i forhold til GPT‑5.6 Sol og matcher Claude Fable 5.1 med ekstra høj indsats til en langt lavere pris.
I FrontierCode 1.1 Main(åbner i et nyt vindue) skriver AI-agenter kode, der ikke kun bedømmes på korrekthed, men også på, om den kan flettes ind: f.eks. testkvalitet, disciplin i omfanget, kodestil og overholdelse af kodebasens standarder.
I DeepSWE v1.1, som tester resultater på komplekse softwareudviklingsopgaver i rigtige kodebaser, opnår GPT‑6 Sol med maksimal indsats 68,8 %. Det er inden for 1,1 procentpoint af Claude Fable 5's bedste resultat i evalueringen – 69,9 % med ekstra høj indsats – til en cirka 80 % lavere pris pr. opgave.
GPT‑6 Luna opnår 66,6 % med maksimal indsats, hvilket er på niveau med Claude Opus 5 og Fable 5 med mellem indsats. I disse sammenligninger koster Luna 93 % mindre pr. opgave end Opus 5 og 96 % mindre end Fable 5.
I DeepSWE 1.1(åbner i et nyt vindue) løser AI-agenter originale, langvarige softwareudviklingsopgaver.
Selvom GPT‑6 Astra fortsat er verdens bedste model til computerbrug, leverer GPT‑6 Sol og Luna bedre resultater i forhold til prisen end deres forgængere. I OSWorld 2.0 offline opnår GPT‑6 Sol med ekstra høj indsats næsten samme resultat som Claude Opus 5 med mellem indsats – 60,5 % mod 60,3 % – til en cirka 80 % lavere pris pr. opgave. GPT‑6 Luna (maks.) overgår GPT‑5.6 Sol (mellem) til en tiendedel af prisen.
I OSWorld 2.0(åbner i et nyt vindue) forsøger AI-agenter at gennemføre langvarige arbejdsgange med computerbrug, der spænder over daglige og professionelle opgaver. Vi rapporterer den delvise belønning for offlinedatasættet fra v2026.08.08-udgivelsen.
Vi har også overført GPT‑6 Astras forbedrede kommunikationsstil til Sol og Luna, og vi tror, at det især vil kunne mærkes i tekniske samtaler og samtaler om kodning. Forvent større klarhed, mindre fagsprog, færre mærkelige formuleringer, færre detaljer med begrænset værdi og generelt lidt kortere svar – uden at miste substans.
Selvom stil er subjektiv, foretrækker vi GPT‑6 Sols svar her. Det drager ikke lige så hurtigt konklusioner, bruger mindre tid på at gentage detaljer, der kan være indlysende for spørgeren (f.eks. at webstedet har fire sider), bruger færre vage formuleringer (f.eks. »bento-præg« og »omforme … omkring det system«), er mere åbent om, hvad det har og ikke har kontrolleret, og deler ikke unødigt implementeringsdetaljer såsom prompten til billedværktøjet.
Ud over lavere tokenpriser hjælper vi udviklere, der bygger på GPT‑6, med at spare mere på den kontekst, deres applikationer genbruger. Vi har forbedret prompt caching for GPT‑6, så cachetræfraten som standard er højere. Det hjælper agenter med at genbruge mere kontekst, svare hurtigere og få 90 % rabat på læsning af cachede inputtokens.
Udviklere har også fået flere muligheder for at måle og optimere cachingens ydeevne:
Overvåg og diagnosticér. Kontrolpanelet til prompt caching(åbner i et nyt vindue) viser, hvor meget input der caches, og hvordan det ændrer sig over tid. Diagnosticeringsværktøjet(åbner i et nyt vindue) hjælper med at forklare oversete muligheder for caching, og hvad der skal rettes.
Juster ræsonneringsindsats og værktøjers tilgængelighed uden at bryde cachen. Øg ræsonneringsindsatsen(åbner i et nyt vindue) ved sværere opgaver, eller sænk den ved enklere opfølgninger, og aktivér eller deaktiver værktøjer(åbner i et nyt vindue), efterhånden som din agents behov ændrer sig. Begge indstillinger bevarer nu tidligere kontekst, så den kan genbruges fra cachen.
Optimér, hvilke præfikser der caches. Eksplicitte brudpunkter lader udviklere vælge, hvor cachede promptpræfikser slutter. Det giver udviklere større kontrol over genbrug af cachen og kan forbedre ydeevnen.
GitHub oplyser, at disse forbedringer gennem de seneste måneder har reduceret andelen af prompttokens, der kræver ny behandling, med mere end 50 % på tværs af milliarder af forespørgsler til OpenAI-modeller, hvilket hjælper Copilot med at svare hurtigere.
GPT‑6 Sol og Luna bygger videre på arbejdet med tilpasning, som blev introduceret med Astra, vores hidtil bedst tilpassede model. I vores evalueringer af tilpasning viser både Sol og Luna forbedringer i forhold til deres GPT‑5.6-modstykker, herunder færre vildledende påstande om deres kodningsarbejde.
Evalueringerne nedenfor tester bevidst udfordrende situationer og måler ikke fejlrater ved typisk brug. Se systemkortet(åbner i et nyt vindue) for de fulde resultater.
GPT‑6 Sol og GPT‑6 Luna er fra i dag tilgængelige i ChatGPT Work og Codex for alle Plus-, Pro-, Business-, Enterprise- og Edu-brugere. Free- og Go-brugere kan få adgang til GPT‑6 Luna i desktopappen. Disse modeller er endnu ikke tilgængelige i Chat. I OpenAI API er de tilgængelige som gpt-6-sol og gpt-6-luna.
For at holde tjenesten stabil for alle planlægger vi at udrulle modellerne gradvist i ChatGPT i løbet af dagen. Hvis du ikke kan se de nye modeller i ChatGPT Work eller Codex, kan du prøve igen senere.
Evalueringer af GPT blev udført i vores forskningsmiljø eller via vores API, som på grund af forskelle i systemprompts, tilgængelige værktøjer osv. kan give lidt andre resultater end ChatGPT i produktion. Evalueringer af konkurrerende modeller blev hentet fra offentligt tilgængelige rapporter. Resultater for Claude Fable 5 blev anvendt, når resultater for Claude Fable 5.1 ikke var tilgængelige.


