Vi presenterar GPT‑6 Sol och Luna
Fler sätt att använda banbrytande intelligens i ditt dagliga arbete.
Tidigare den här månaden lanserade vi GPT‑6 Astra, världens mest intelligenta och samstämmiga modell. De mest krävande och viktiga projekten behöver fortfarande Astras fulla djup, men arbete sker i olika omfattning, tempo och budget.
Därför utökar vi GPT‑6‑familjen med GPT‑6 Sol och GPT‑6 Luna. GPT‑6 Astra introducerade en ny generation av intelligens – de här modellerna gör nyttan av intelligensen mer tillgänglig genom att flytta fram gränsen för kostnadseffektivitet. Vi tränade GPT‑6 Sol och Luna med liknande metoder som GPT‑6 Astra, så att framstegen bakom Astras marknadsledande prestanda inom professionellt arbete, faktakorrekthet, kodning, datoranvändning och samstämmighet nu finns i snabbare och mer prisvärda modeller.
GPT‑6-modellerna är ledande längs hela kurvan för kostnad och intelligens. De kombinerar enastående kapacitet på varje nivå med infrastruktur som levererar den effektivt i stor skala. Förbättringar av cachning och inferens gör att vi kan tillhandahålla modellerna till lägre kostnad. Besparingarna förs direkt vidare till användare och kunder genom att vi sänker API-priserna för Sol och Luna med 50 % jämfört med kampanjpriserna för GPT‑5.6. Tillsammans gör förbättringarna avancerad AI praktiskt användbar för fler vardagliga uppgifter och storskaliga tillämpningar.
Modell | Indata | Utdata | Prissänkning |
GPT‑6 Sol | 4 $ → 2 $ | 20 $ → 10 $ | 50 % billigare |
GPT‑6 Luna | 0,20 $ → 0,10 $ | 1,20 $ → 0,50 $ | 50 % billigare |
Priserna gäller per 1 miljon token.
GPT‑6 Astra är fortfarande vår bästa modell överlag. Välj den när du vill ha bästa möjliga resultat utan kompromisser.
GPT‑6 Sol och Luna ger modellerna du redan känner till och använder högre intelligens och bättre kostnadseffektivitet inom de funktioner som är mest användbara för komplicerat arbete.
GPT‑6 Sol kan hantera svåra arbetsuppgifter och ger samtidigt mer utrymme att iterera tack vare högre användningsgränser och lägre kostnader. Modellen erbjuder mer intelligens och bättre resultat än konkurrentmodeller i samma prisklass.
I AutomationBench, ett test av verksamhetsflöden mellan appar, överträffar GPT‑6 Sol med extra hög ansträngning Claude Opus 5 med maximal ansträngning, till endast 9 % av Opus 5:s kostnad per uppgift. Med hög ansträngning förbättrar GPT‑6 Luna föregångarens resultat med 5,4 procentenheter, till 58 % lägre kostnad per uppgift.
I AutomationBench 1.0.6(öppnas i ett nytt fönster) testas AI-agenter på kompletta arbetsflöden med 47 verktyg inom försäljning, marknadsföring, drift, support, ekonomi och HR. Datapunkten för Claude Fable 5.1 underskattar den faktiska kostnaden eftersom den inte omfattar kostnaden för reservlösningarna i Opus 5, som användes för cirka 40 % av uppgifterna.
GPT‑6 Sol överträffar även Claude Fable 5.1 till en betydligt lägre kostnad och slår till och med GPT‑6 Astra med låg ansträngning.
Modell (och ansträngning) | Resultat | Kostnad per uppgift |
|---|---|---|
GPT‑6 Sol (extra hög) | 33,2 % | 0,27 $ |
GPT‑6 Astra (låg) | 30,3 % | 3,9× GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9 % | 11,1× GPT‑6 Sol |
Claude Fable 5.1 med reservlösning i Opus 5 (Max) | 31,4 % | >8,9× GPT‑6 Sol (kostnaden för reservlösningen har inte redovisats) |
I Agents’ Last Exam, som utvärderar agenter i komplexa professionella arbetsflöden, får GPT‑6 Sol med maximal ansträngning 56,4 %, vilket är högre än Claude Opus 5:s bästa resultat i utvärderingen, till 60 % lägre kostnad per uppgift.
I Agents’ Last Exam V1(öppnas i ett nytt fönster) utvärderas AI-agenter på långvariga, ekonomiskt värdefulla uppgifter inom 55 delbranscher, som omfattar de flesta större områden av professionellt arbete som utförs på en dator.
Ett användbart svar måste ha rätt fakta, och vi fortsätter att förbättra den faktamässiga tillförlitligheten. I vår interna utvärdering av faktakorrekthet, som bygger på avidentifierade verkliga konversationer där användare har flaggat fel från våra modeller, gör GPT‑6 Sol ungefär hälften så många fel som sin föregångare. Tillförlitligheten närmar sig Astras, men till betydligt lägre kostnad. Även GPT‑6 Luna förbättras avsevärt. Vid högre ansträngningsnivåer matchar den GPT‑5.6 Sol till ungefär en hundradel av kostnaden.
Här utvärderar vi faktakorrekthet i avidentifierade ChatGPT‑konversationer där användare hade flaggat ett faktafel från en tidigare modell. Dessa konversationer, som är avsedda att framkalla fel, är inte representativa för normal användning, där faktafel är mer sällsynta. Resultaten har inte justerats för längd, men våra tester med olika utförlighetsnivåer visade nästan inget samband med svarslängden.
I år har kodningsagenter börjat ta sig an uppgifter med större komplexitet, omfattning och varaktighet än någonsin tidigare. På OpenAI har vår interna användning ökat exponentiellt. Beräknat enligt API-priser har den dagliga tokenanvändningen överstigit 600 dollar för medianforskaren och 7 000 dollar för forskare i den 90:e percentilen (Snabbare forskning: en inblick i OpenAI). När kodningsagenter tar sig an längre och mer krävande uppgifter blir kostnaden för kontinuerlig användning allt viktigare. GPT‑6 Sol och Luna kombinerar stark kodningsprestanda med lägre API-priser. Det ger utvecklare mer utrymme att iterera och team större trygghet att vara ambitiösa med uppgifterna de ger Codex.
I FrontierCode, som utvärderar om kodningsagenter skapar ändringar som är redo att sammanfogas med verkliga kodbaser, förbättras GPT‑6 Sol avsevärt jämfört med GPT‑5.6 Sol och matchar Claude Fable 5.1 med extra hög ansträngning till betydligt lägre kostnad.
I FrontierCode 1.1 Main(öppnas i ett nytt fönster) skriver AI-agenter kod som bedöms inte bara utifrån korrekthet utan även utifrån möjligheten att sammanfoga den, exempelvis testkvalitet, avgränsning, kodstil och efterlevnad av kodbasens standarder.
I DeepSWE v1.1, som testar prestanda på komplexa programvarutekniska uppgifter i verkliga kodbaser, får GPT‑6 Sol med maximal ansträngning 68,8 %. Det är 1,1 procentenheter från Claude Fable 5:s högsta resultat i utvärderingen – 69,9 % med extra hög ansträngning – till cirka 80 % lägre kostnad per uppgift.
GPT‑6 Luna med maximal ansträngning får 66,6 %, vilket är jämförbart med Claude Opus 5 och Fable 5 med balanserad ansträngning. I dessa jämförelser kostar Luna 93 % mindre per uppgift än Opus 5 och 96 % mindre än Fable 5.
I DeepSWE 1.1(öppnas i ett nytt fönster) löser AI-agenter nyskapade, långvariga programvarutekniska uppgifter.
GPT‑6 Astra är fortfarande världens bästa modell för datoranvändning, men GPT‑6 Sol och Luna ger mer kostnadseffektiv prestanda än sina föregångare. I OSWorld 2.0 offline får GPT‑6 Sol med extra hög ansträngning ett resultat i nivå med Claude Opus 5 med balanserad ansträngning – 60,5 % jämfört med 60,3 % – till cirka 80 % lägre kostnad per uppgift. GPT‑6 Luna (Max) överträffar GPT‑5.6 Sol (Balanserad) till en tiondel av kostnaden.
I OSWorld 2.0(öppnas i ett nytt fönster) försöker AI-agenter genomföra långvariga arbetsflöden på datorer för både vardagliga och professionella uppgifter. Vi redovisar delpoängen för offlineuppsättningen i version v2026.08.08.
Vi har även fört över GPT‑6 Astras förbättrade kommunikationsstil till Sol och Luna, vilket vi tror märks särskilt tydligt i tekniska samtal och kodningssamtal. Du kan förvänta dig tydligare språk, mindre jargong, färre märkliga formuleringar, färre oväsentliga detaljer och överlag något kortare svar utan att innehållet tunnas ut.
Även om stil är subjektivt föredrar vi GPT‑6 Sols svar här. Det drar inte slutsatser lika snabbt, ägnar mindre tid åt att upprepa detaljer som kan vara uppenbara för frågeställaren (t.ex. att webbplatsen har fyra sidor), använder mindre vaga formuleringar (t.ex. ”bento-känsla”, ”omformar … kring det systemet”), redovisar tydligare vad det kontrollerade och inte kontrollerade och delar inte i onödan implementeringsdetaljer som prompten till bildverktyget.
Utöver lägre tokenpriser hjälper vi utvecklare som bygger med GPT‑6 att spara mer på det sammanhang som deras appar återanvänder. Vi har förbättrat promptcachningen för GPT‑6 så att den som standard ger fler cacheträffar. Det hjälper agenter att återanvända mer sammanhang, svara snabbare och få 90 % rabatt på läsning av cachade indatatoken.
Utvecklare får också fler sätt att mäta och optimera cachningsprestandan:
Övervaka och diagnostisera. Kontrollpanelen för promptcachning(öppnas i ett nytt fönster) visar hur stor del av indata som cachas och hur detta förändras över tid. Diagnostikverktyget(öppnas i ett nytt fönster) förklarar missade möjligheter till cachning och vad som behöver åtgärdas.
Justera ansträngningen för resonemang och tillgången till verktyg utan att bryta cachen. Öka ansträngningen för resonemang(öppnas i ett nytt fönster) vid svårare uppgifter eller sänk den vid enklare följdfrågor, och aktivera eller inaktivera verktyg(öppnas i ett nytt fönster) när agentens behov förändras. Båda reglagen bevarar nu tidigare sammanhang så att cachen kan återanvändas.
Optimera vilka prefix som cachas. Med uttryckliga brytpunkter kan utvecklare välja var cachade promptprefix ska sluta. Det ger utvecklare större kontroll över cacheåteranvändningen och kan förbättra prestandan.
GitHub uppger att förbättringarna under de senaste månaderna har minskat andelen prompttoken som måste behandlas på nytt med mer än 50 % i miljarder förfrågningar till OpenAI-modeller, vilket hjälper Copilot att svara snabbare.
GPT‑6 Sol och Luna bygger vidare på arbetet med samstämmighet som introducerades med Astra, vår hittills mest samstämmiga modell. I våra utvärderingar av samstämmighet visar både Sol och Luna förbättringar jämfört med motsvarande GPT‑5.6-modeller, bland annat en lägre andel vilseledande påståenden om det egna kodningsarbetet.
Utvärderingarna nedan testar avsiktligt svåra situationer och mäter inte felfrekvensen vid normal användning. Se systemkortet(öppnas i ett nytt fönster) för fullständiga resultat.
GPT‑6 Sol och GPT‑6 Luna finns från och med i dag i ChatGPT Work och Codex för alla användare med Plus, Pro, Business, Enterprise och Edu. Användare med Free och Go kan använda GPT‑6 Luna i datorappen. Modellerna är ännu inte tillgängliga i Chat. I OpenAI API är de tillgängliga som gpt-6-sol och gpt-6-luna.
För att tjänsten ska förbli stabil för alla planerar vi att lansera modellerna stegvis i ChatGPT under dagen. Om du inte ser de nya modellerna i ChatGPT Work eller Codex kan du försöka igen senare.
Utvärderingarna av GPT utfördes i vår forskningsmiljö eller via vårt API, som kan ge något annorlunda utdata än ChatGPT i produktion på grund av skillnader i systemprompter, tillgängliga verktyg med mera. Utvärderingar av konkurrenternas modeller hämtades från offentligt tillgängliga rapporter. Resultat för Claude Fable 5 redovisades när resultat för Claude Fable 5.1 saknades.


