Maak kennis met GPT‑6 Sol en Luna
Meer manieren om grensverleggende intelligentie toe te passen in je dagelijkse werk.
Eerder deze maand introduceerden we GPT‑6 Astra, het intelligentste en best afgestemde model ter wereld. Hoewel de veeleisendste en belangrijkste projecten nog steeds om de volledige capaciteiten van Astra vragen, vindt werk plaats op verschillende schaalniveaus, in verschillende tempo's en met verschillende budgetten.
Daarom breiden we het GPT‑6‑universum uit met GPT‑6 Sol en GPT‑6 Luna. GPT‑6 Astra luidde een nieuwe generatie intelligentie in. Deze modellen maken de voordelen daarvan breder beschikbaar door de grens van kostenefficiëntie te verleggen. We hebben GPT‑6 Sol en Luna getraind met vergelijkbare methoden als GPT‑6 Astra. Zo brengen we de innovaties achter Astra's toonaangevende prestaties bij professioneel werk, feitelijkheid, programmeren, computergebruik en afstemming naar snellere, betaalbaardere modellen.
De GPT‑6-modellen lopen voorop over de hele kosten-intelligentiecurve, met uitzonderlijke capaciteiten op elk niveau en een infrastructuur die deze efficiënt en op grote schaal beschikbaar maakt. Dankzij verbeteringen in caching en inferentie kunnen we deze modellen tegen lagere kosten aanbieden. Die besparingen geven we rechtstreeks door aan gebruikers en klanten door de API-prijzen voor Sol en Luna met 50% te verlagen ten opzichte van hun actietarieven voor GPT‑5.6. Samen maken deze verbeteringen geavanceerde AI praktisch inzetbaar voor meer alledaagse taken en toepassingen op grote schaal.
Model | Input | Output | Prijsverlaging |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50% goedkoper |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% goedkoper |
Prijzen gelden per 1 miljoen tokens.
GPT‑6 Astra blijft over de hele linie ons beste model. Kies dit model als je de beste resultaten en een compromisloze ervaring wilt.
GPT‑6 Sol en Luna bieden intelligentere en kostenefficiëntere versies van de modellen die je al kent en gebruikt, met verbeteringen in de capaciteiten die het belangrijkst zijn om complex werk uit te voeren.
GPT‑6 Sol kan moeilijke werktaken uitvoeren en biedt dankzij hogere gebruikslimieten en lagere kosten meer ruimte om te itereren. Het levert meer intelligentie en betere resultaten dan concurrerende modellen met een vergelijkbare prijs.
In AutomationBench, een test van bedrijfsworkflows in verschillende apps, presteert GPT‑6 Sol met xhigh-inspanning beter dan Claude Opus 5 met maximale inspanning, tegen slechts 9% van de kosten per taak van Opus 5. Met hoge inspanning presteert GPT‑6 Luna 5,4 procentpunt beter dan zijn voorganger, tegen 58% lagere kosten per taak.
In AutomationBench 1.0.6(opent in een nieuw venster) worden AI-agents getest op volledige workflows met 47 tools voor verkoop, marketing, bedrijfsvoering, ondersteuning, financiën en HR. Het datapunt voor Claude Fable 5.1 onderschat de werkelijke kosten, omdat de kosten van terugval op Opus 5 niet zijn meegerekend. Die terugval vond plaats bij ongeveer 40% van de taken.
GPT‑6 Sol overtreft ook Claude Fable 5.1 tegen veel lagere kosten en presteert zelfs beter dan GPT‑6 Astra met lage inspanning.
Model (en inspanning) | Score | Kosten per taak |
|---|---|---|
GPT‑6 Sol (xhigh) | 33,2% | $0.27 |
GPT‑6 Astra (Laag) | 30,3% | 3,9× GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9% | 11,1× GPT‑6 Sol |
Claude Fable 5.1 met terugval op Opus 5 (Max) | 31,4% | >8,9× GPT‑6 Sol (kosten van terugval niet gerapporteerd) |
In Agents' Last Exam, waarin agents worden beoordeeld op complexe professionele workflows, behaalt GPT‑6 Sol met maximale inspanning een score van 56,4%. Daarmee overtreft het de hoogste score van Claude Opus 5 in deze evaluatie, tegen 60% lagere kosten per taak.
In Agents' Last Exam V1(opent in een nieuw venster) worden AI-agents beoordeeld op economisch waardevolle taken met een lange looptijd in 55 subsectoren. Deze omvatten de meeste belangrijke vakgebieden waarin professioneel werk op een computer wordt uitgevoerd.
Het nut van een antwoord hangt af van de juistheid van de feiten. Daarom blijven we werken aan een grotere feitelijke betrouwbaarheid. In onze interne evaluatie van feitelijkheid, gebaseerd op geanonimiseerde gesprekken uit de praktijk waarin gebruikers fouten van onze modellen meldden, maakt GPT‑6 Sol ongeveer half zoveel fouten als zijn voorganger. Daarmee benadert het tegen veel lagere kosten de betrouwbaarheid van Astra. Ook GPT‑6 Luna gaat er sterk op vooruit: bij hogere inspanningsniveaus evenaart het GPT‑5.6 Sol tegen ongeveer een honderdste van de kosten.
Hier beoordelen we de feitelijkheid aan de hand van geanonimiseerde ChatGPT‑gesprekken waarin gebruikers een feitelijke fout van een eerder model hadden gemeld. Deze gesprekken, die fouten uitlokken, zijn niet representatief voor normaal gebruik, waarbij feitelijke fouten zeldzamer zijn. De scores zijn niet gecorrigeerd voor lengte. Onze tests met verschillende antwoordlengtes lieten echter vrijwel geen verband met de antwoordlengte zien.
Dit jaar zijn programmeeragents begonnen aan taken met meer complexiteit, een grotere reikwijdte en een langere looptijd dan ooit tevoren. Binnen OpenAI is ons interne gebruik exponentieel gegroeid. Uitgedrukt in API-prijzen is het dagelijkse tokengebruik opgelopen tot ruim $600 voor de doorsnee onderzoeker en $7.000 voor onderzoekers in het 90e percentiel (Onderzoek versnellen: een kijkje binnen OpenAI). Nu programmeeragents langere en veeleisendere taken uitvoeren, worden de kosten van langdurig gebruik belangrijker. GPT‑6 Sol en Luna combineren sterke programmeerprestaties met lagere API-prijzen. Hierdoor hebben ontwikkelaars meer ruimte om te itereren en kunnen teams Codex met vertrouwen ambitieuzere opdrachten geven.
In FrontierCode, waarin wordt beoordeeld of programmeeragents wijzigingen opleveren die direct in echte codebases kunnen worden samengevoegd, presteert GPT‑6 Sol aanzienlijk beter dan GPT‑5.6 Sol. Het evenaart Claude Fable 5.1 met xhigh-inspanning tegen veel lagere kosten.
In FrontierCode 1.1 Main(opent in een nieuw venster) schrijven AI-agents code die niet alleen op juistheid wordt beoordeeld, maar ook op de mate waarin deze kan worden samengevoegd, zoals de kwaliteit van tests, het bewaken van de reikwijdte, de codestijl en de naleving van codebasestandaarden.
In DeepSWE v1.1, dat prestaties bij complexe software-engineeringtaken in echte codebases test, behaalt GPT‑6 Sol met maximale inspanning 68,8%. Dat ligt 1,1 procentpunt onder de hoogste score van Claude Fable 5 in de evaluatie—69,9% met xhigh-inspanning—tegen ongeveer 80% lagere kosten per taak.
GPT‑6 Luna behaalt met maximale inspanning 66,6%, vergelijkbaar met Claude Opus 5 en Fable 5 met gemiddelde inspanning. In deze vergelijkingen kost Luna per taak 93% minder dan Opus 5 en 96% minder dan Fable 5.
In DeepSWE 1.1(opent in een nieuw venster) lossen AI-agents originele software-engineeringtaken met een lange looptijd op.
Hoewel GPT‑6 Astra het beste model ter wereld blijft voor computergebruik, bieden GPT‑6 Sol en Luna kostenefficiëntere prestaties dan hun voorgangers. In OSWorld 2.0 offline behaalt GPT‑6 Sol met xhigh-inspanning een vergelijkbare score als Claude Opus 5 met gemiddelde inspanning—60,5% tegenover 60,3%—tegen ongeveer 80% lagere kosten per taak. GPT‑6 Luna (Max) overtreft GPT‑5.6 Sol (Gemiddeld) tegen een tiende van de kosten.
In OSWorld 2.0(opent in een nieuw venster) proberen AI-agents langdurige workflows voor computergebruik uit te voeren, variërend van alledaagse tot professionele taken. We rapporteren de gedeeltelijke beloning voor de offline set uit release v2026.08.08.
We hebben de verbeterde communicatiestijl van GPT‑6 Astra ook naar Sol en Luna gebracht. We verwachten dat dit vooral merkbaar zal zijn in technische gesprekken en gesprekken over programmeren. Verwacht meer duidelijkheid, minder jargon, minder vreemde formuleringen, minder details met weinig toegevoegde waarde en over het algemeen iets kortere antwoorden, zonder inhoud te verliezen.
Hoewel stijl subjectief is, geven we hier de voorkeur aan het antwoord van GPT‑6 Sol. Het trekt minder snel conclusies, besteedt minder tijd aan het herhalen van details die voor de vraagsteller misschien vanzelfsprekend zijn (bijvoorbeeld dat de website vier pagina's heeft), gebruikt minder vage formuleringen (zoals "bento-uitstraling" en "daaromheen opnieuw vormgeven"), is duidelijker over wat wel en niet is gecontroleerd en deelt niet onnodig implementatiedetails, zoals de prompt voor de afbeeldingstool.
Naast lagere tokenprijzen helpen we ontwikkelaars die met GPT‑6 bouwen om meer te besparen op de context die hun toepassingen hergebruiken. We hebben promptcaching voor GPT‑6 verbeterd, zodat standaard meer cachehits worden behaald. Hierdoor kunnen agents meer context hergebruiken, sneller reageren en profiteren van 90% korting bij het lezen van gecachte inputtokens.
Ontwikkelaars krijgen ook meer mogelijkheden om de prestaties van hun caching te meten en optimaliseren:
Monitoren en diagnosticeren. Het dashboard voor promptcaching(opent in een nieuw venster) laat zien hoeveel input wordt gecacht en hoe dit in de loop van de tijd verandert. De diagnostische tool(opent in een nieuw venster) helpt verklaren waar cachingkansen worden gemist en wat je moet aanpassen.
Pas de redeneerinspanning en beschikbaarheid van tools aan zonder de cache te onderbreken. Verhoog de redeneerinspanning(opent in een nieuw venster) voor moeilijkere taken of verlaag deze voor eenvoudigere vervolgvragen. Je kunt ook tools in- of uitschakelen(opent in een nieuw venster) wanneer de behoeften van je agent veranderen. Bij beide instellingen blijft eerdere context nu beschikbaar voor hergebruik vanuit de cache.
Optimaliseer welke voorvoegsels worden gecacht. Met expliciete onderbrekingspunten kunnen ontwikkelaars bepalen waar gecachte promptvoorvoegsels eindigen. Dit geeft ontwikkelaars meer controle over hergebruik vanuit de cache en kan de prestaties verbeteren.
GitHub meldt dat deze verbeteringen de afgelopen maanden het aandeel prompttokens dat opnieuw moest worden verwerkt met meer dan 50% hebben verminderd, verspreid over miljarden verzoeken aan OpenAI-modellen. Hierdoor kan Copilot sneller reageren.
GPT‑6 Sol en Luna bouwen voort op de afstemming die met Astra is geïntroduceerd, ons best afgestemde model tot nu toe. In onze evaluaties van afstemming laten zowel Sol als Luna verbeteringen zien ten opzichte van hun GPT‑5.6-tegenhangers, waaronder minder misleidende beweringen over hun programmeerwerk.
De onderstaande evaluaties testen bewust moeilijke situaties en meten niet hoe vaak fouten bij normaal gebruik voorkomen. Bekijk de systeemkaart(opent in een nieuw venster) voor de volledige resultaten.
GPT‑6 Sol en GPT‑6 Luna zijn vanaf vandaag beschikbaar in ChatGPT Work en Codex voor alle gebruikers van Plus, Pro, Business, Enterprise en Edu. Gebruikers van Free en Go hebben toegang tot GPT‑6 Luna in de desktopapp. Deze modellen zijn nog niet beschikbaar in Chat. In de OpenAI API zijn ze beschikbaar als gpt-6-sol en gpt-6-luna.
Om de service voor iedereen stabiel te houden, zijn we van plan deze modellen gedurende de dag geleidelijk in ChatGPT uit te rollen. Zie je de nieuwe modellen niet in ChatGPT Work of Codex, probeer het dan later opnieuw.
Evaluaties van GPT zijn uitgevoerd in onze onderzoeksomgeving of via onze API. Door verschillen in systeemprompts, beschikbare tools en andere factoren kan de output enigszins afwijken van die van ChatGPT in productie. Evaluaties van concurrerende modellen zijn overgenomen uit openbaar beschikbare rapporten. Wanneer er geen scores voor Claude Fable 5.1 beschikbaar waren, zijn de scores voor Claude Fable 5 vermeld.


