Gå direkt till huvudinnehåll
OpenAI

Vi presenterar GPT‑6 Sol och Luna

Fler sätt att använda banbrytande intelligens i ditt dagliga arbete.

Laddar …

Tidigare den här månaden lanserade vi GPT‑6 Astra, världens mest intelligenta och samstämmiga modell. De mest krävande och viktiga projekten behöver fortfarande Astras fulla djup, men arbete sker i olika omfattning, tempo och budget.

Därför utökar vi GPT‑6‑familjen med GPT‑6 Sol och GPT‑6 Luna. GPT‑6 Astra introducerade en ny generation av intelligens – de här modellerna gör nyttan av intelligensen mer tillgänglig genom att flytta fram gränsen för kostnadseffektivitet. Vi tränade GPT‑6 Sol och Luna med liknande metoder som GPT‑6 Astra, så att framstegen bakom Astras marknadsledande prestanda inom professionellt arbete, faktakorrekthet, kodning, datoranvändning och samstämmighet nu finns i snabbare och mer prisvärda modeller.

GPT‑6-modellerna är ledande längs hela kurvan för kostnad och intelligens. De kombinerar enastående kapacitet på varje nivå med infrastruktur som levererar den effektivt i stor skala. Förbättringar av cachning och inferens gör att vi kan tillhandahålla modellerna till lägre kostnad. Besparingarna förs direkt vidare till användare och kunder genom att vi sänker API-priserna för Sol och Luna med 50 % jämfört med kampanjpriserna för GPT‑5.6. Tillsammans gör förbättringarna avancerad AI praktiskt användbar för fler vardagliga uppgifter och storskaliga tillämpningar.

API-priser för GPT‑6

Modell

Indata

Utdata

Prissänkning

GPT‑6 Sol
jämfört med GPT‑5.6 Sol

4 $ → 2 $

20 $ → 10 $

50 % billigare

GPT‑6 Luna
jämfört med GPT‑5.6 Luna

0,20 $ → 0,10 $

1,20 $ → 0,50 $

50 % billigare

Priserna gäller per 1 miljon token.

GPT‑6 Astra är fortfarande vår bästa modell överlag. Välj den när du vill ha bästa möjliga resultat utan kompromisser.

Ett lyft för hela modellfamiljen

GPT‑6 Sol och Luna ger modellerna du redan känner till och använder högre intelligens och bättre kostnadseffektivitet inom de funktioner som är mest användbara för komplicerat arbete.

Professionellt arbete

GPT‑6 Sol kan hantera svåra arbetsuppgifter och ger samtidigt mer utrymme att iterera tack vare högre användningsgränser och lägre kostnader. Modellen erbjuder mer intelligens och bättre resultat än konkurrentmodeller i samma prisklass.

I AutomationBench, ett test av verksamhetsflöden mellan appar, överträffar GPT‑6 Sol med extra hög ansträngning Claude Opus 5 med maximal ansträngning, till endast 9 % av Opus 5:s kostnad per uppgift. Med hög ansträngning förbättrar GPT‑6 Luna föregångarens resultat med 5,4 procentenheter, till 58 % lägre kostnad per uppgift.

I AutomationBench 1.0.6⁠(öppnas i ett nytt fönster) testas AI-agenter på kompletta arbetsflöden med 47 verktyg inom försäljning, marknadsföring, drift, support, ekonomi och HR. Datapunkten för Claude Fable 5.1 underskattar den faktiska kostnaden eftersom den inte omfattar kostnaden för reservlösningarna i Opus 5, som användes för cirka 40 % av uppgifterna.

GPT‑6 Sol överträffar även Claude Fable 5.1 till en betydligt lägre kostnad och slår till och med GPT‑6 Astra med låg ansträngning.

Modell (och ansträngning)

Resultat

Kostnad per uppgift

GPT‑6 Sol (extra hög)

33,2 %

0,27 $

GPT‑6 Astra (låg)

30,3 %

3,9× GPT‑6 Sol

Claude Opus 5 (Max)

26,9 %

11,1× GPT‑6 Sol

Claude Fable 5.1 med reservlösning i Opus 5 (Max)

31,4 %

>8,9× GPT‑6 Sol

(kostnaden för reservlösningen har inte redovisats)

I Agents’ Last Exam, som utvärderar agenter i komplexa professionella arbetsflöden, får GPT‑6 Sol med maximal ansträngning 56,4 %, vilket är högre än Claude Opus 5:s bästa resultat i utvärderingen, till 60 % lägre kostnad per uppgift.

I Agents’ Last Exam V1⁠(öppnas i ett nytt fönster) utvärderas AI-agenter på långvariga, ekonomiskt värdefulla uppgifter inom 55 delbranscher, som omfattar de flesta större områden av professionellt arbete som utförs på en dator.

Faktakorrekthet

Ett användbart svar måste ha rätt fakta, och vi fortsätter att förbättra den faktamässiga tillförlitligheten. I vår interna utvärdering av faktakorrekthet, som bygger på avidentifierade verkliga konversationer där användare har flaggat fel från våra modeller, gör GPT‑6 Sol ungefär hälften så många fel som sin föregångare. Tillförlitligheten närmar sig Astras, men till betydligt lägre kostnad. Även GPT‑6 Luna förbättras avsevärt. Vid högre ansträngningsnivåer matchar den GPT‑5.6 Sol till ungefär en hundradel av kostnaden.

Här utvärderar vi faktakorrekthet i avidentifierade ChatGPT‑konversationer där användare hade flaggat ett faktafel från en tidigare modell. Dessa konversationer, som är avsedda att framkalla fel, är inte representativa för normal användning, där faktafel är mer sällsynta. Resultaten har inte justerats för längd, men våra tester med olika utförlighetsnivåer visade nästan inget samband med svarslängden.

Kodning

I år har kodningsagenter börjat ta sig an uppgifter med större komplexitet, omfattning och varaktighet än någonsin tidigare. På OpenAI har vår interna användning ökat exponentiellt. Beräknat enligt API-priser har den dagliga tokenanvändningen överstigit 600 dollar för medianforskaren och 7 000 dollar för forskare i den 90:e percentilen (Snabbare forskning: en inblick i OpenAI⁠). När kodningsagenter tar sig an längre och mer krävande uppgifter blir kostnaden för kontinuerlig användning allt viktigare. GPT‑6 Sol och Luna kombinerar stark kodningsprestanda med lägre API-priser. Det ger utvecklare mer utrymme att iterera och team större trygghet att vara ambitiösa med uppgifterna de ger Codex.

I FrontierCode, som utvärderar om kodningsagenter skapar ändringar som är redo att sammanfogas med verkliga kodbaser, förbättras GPT‑6 Sol avsevärt jämfört med GPT‑5.6 Sol och matchar Claude Fable 5.1 med extra hög ansträngning till betydligt lägre kostnad.

I FrontierCode 1.1 Main⁠(öppnas i ett nytt fönster) skriver AI-agenter kod som bedöms inte bara utifrån korrekthet utan även utifrån möjligheten att sammanfoga den, exempelvis testkvalitet, avgränsning, kodstil och efterlevnad av kodbasens standarder.

I DeepSWE v1.1, som testar prestanda på komplexa programvarutekniska uppgifter i verkliga kodbaser, får GPT‑6 Sol med maximal ansträngning 68,8 %. Det är 1,1 procentenheter från Claude Fable 5:s högsta resultat i utvärderingen – 69,9 % med extra hög ansträngning – till cirka 80 % lägre kostnad per uppgift.

GPT‑6 Luna med maximal ansträngning får 66,6 %, vilket är jämförbart med Claude Opus 5 och Fable 5 med balanserad ansträngning. I dessa jämförelser kostar Luna 93 % mindre per uppgift än Opus 5 och 96 % mindre än Fable 5.

I DeepSWE 1.1⁠(öppnas i ett nytt fönster) löser AI-agenter nyskapade, långvariga programvarutekniska uppgifter.

Datoranvändning

GPT‑6 Astra är fortfarande världens bästa modell för datoranvändning, men GPT‑6 Sol och Luna ger mer kostnadseffektiv prestanda än sina föregångare. I OSWorld 2.0 offline får GPT‑6 Sol med extra hög ansträngning ett resultat i nivå med Claude Opus 5 med balanserad ansträngning – 60,5 % jämfört med 60,3 % – till cirka 80 % lägre kostnad per uppgift. GPT‑6 Luna (Max) överträffar GPT‑5.6 Sol (Balanserad) till en tiondel av kostnaden.

I OSWorld 2.0⁠(öppnas i ett nytt fönster) försöker AI-agenter genomföra långvariga arbetsflöden på datorer för både vardagliga och professionella uppgifter. Vi redovisar delpoängen för offlineuppsättningen i version v2026.08.08.

Samarbetsstil

Vi har även fört över GPT‑6 Astras förbättrade kommunikationsstil till Sol och Luna, vilket vi tror märks särskilt tydligt i tekniska samtal och kodningssamtal. Du kan förvänta dig tydligare språk, mindre jargong, färre märkliga formuleringar, färre oväsentliga detaljer och överlag något kortare svar utan att innehållet tunnas ut.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Även om stil är subjektivt föredrar vi GPT‑6 Sols svar här. Det drar inte slutsatser lika snabbt, ägnar mindre tid åt att upprepa detaljer som kan vara uppenbara för frågeställaren (t.ex. att webbplatsen har fyra sidor), använder mindre vaga formuleringar (t.ex. ”bento-känsla”, ”omformar … kring det systemet”), redovisar tydligare vad det kontrollerade och inte kontrollerade och delar inte i onödan implementeringsdetaljer som prompten till bildverktyget.

Förbättrad cachning för agenter och långa konversationer

Utöver lägre tokenpriser hjälper vi utvecklare som bygger med GPT‑6 att spara mer på det sammanhang som deras appar återanvänder. Vi har förbättrat promptcachningen för GPT‑6 så att den som standard ger fler cacheträffar. Det hjälper agenter att återanvända mer sammanhang, svara snabbare och få 90 % rabatt på läsning av cachade indatatoken.

Utvecklare får också fler sätt att mäta och optimera cachningsprestandan:

GitHub uppger att förbättringarna under de senaste månaderna har minskat andelen prompttoken som måste behandlas på nytt med mer än 50 % i miljarder förfrågningar till OpenAI-modeller, vilket hjälper Copilot att svara snabbare.

Fortsatta förbättringar av samstämmigheten

GPT‑6 Sol och Luna bygger vidare på arbetet med samstämmighet som introducerades med Astra, vår hittills mest samstämmiga modell. I våra utvärderingar av samstämmighet visar både Sol och Luna förbättringar jämfört med motsvarande GPT‑5.6-modeller, bland annat en lägre andel vilseledande påståenden om det egna kodningsarbetet.

Utvärderingarna nedan testar avsiktligt svåra situationer och mäter inte felfrekvensen vid normal användning. Se systemkortet⁠(öppnas i ett nytt fönster) för fullständiga resultat.

Tillgänglighet

GPT‑6 Sol och GPT‑6 Luna finns från och med i dag i ChatGPT Work och Codex för alla användare med Plus, Pro, Business, Enterprise och Edu. Användare med Free och Go kan använda GPT‑6 Luna i datorappen. Modellerna är ännu inte tillgängliga i Chat. I OpenAI API är de tillgängliga som gpt-6-sol och gpt-6-luna.

För att tjänsten ska förbli stabil för alla planerar vi att lansera modellerna stegvis i ChatGPT under dagen. Om du inte ser de nya modellerna i ChatGPT Work eller Codex kan du försöka igen senare.


Utvärderingarna av GPT utfördes i vår forskningsmiljö eller via vårt API, som kan ge något annorlunda utdata än ChatGPT i produktion på grund av skillnader i systemprompter, tillgängliga verktyg med mera. Utvärderingar av konkurrenternas modeller hämtades från offentligt tillgängliga rapporter. Resultat för Claude Fable 5 redovisades när resultat för Claude Fable 5.1 saknades.

Författare

OpenAI