Overslaan naar hoofdinhoud
OpenAI

Maak kennis met GPT‑6 Sol en Luna

Meer manieren om grensverleggende intelligentie toe te passen in je dagelijkse werk.

Bezig met laden...

Eerder deze maand introduceerden we GPT‑6 Astra, het intelligentste en best afgestemde model ter wereld. Hoewel de veeleisendste en belangrijkste projecten nog steeds om de volledige capaciteiten van Astra vragen, vindt werk plaats op verschillende schaalniveaus, in verschillende tempo's en met verschillende budgetten.

Daarom breiden we het GPT‑6‑universum uit met GPT‑6 Sol en GPT‑6 Luna. GPT‑6 Astra luidde een nieuwe generatie intelligentie in. Deze modellen maken de voordelen daarvan breder beschikbaar door de grens van kostenefficiëntie te verleggen. We hebben GPT‑6 Sol en Luna getraind met vergelijkbare methoden als GPT‑6 Astra. Zo brengen we de innovaties achter Astra's toonaangevende prestaties bij professioneel werk, feitelijkheid, programmeren, computergebruik en afstemming naar snellere, betaalbaardere modellen.

De GPT‑6-modellen lopen voorop over de hele kosten-intelligentiecurve, met uitzonderlijke capaciteiten op elk niveau en een infrastructuur die deze efficiënt en op grote schaal beschikbaar maakt. Dankzij verbeteringen in caching en inferentie kunnen we deze modellen tegen lagere kosten aanbieden. Die besparingen geven we rechtstreeks door aan gebruikers en klanten door de API-prijzen voor Sol en Luna met 50% te verlagen ten opzichte van hun actietarieven voor GPT‑5.6. Samen maken deze verbeteringen geavanceerde AI praktisch inzetbaar voor meer alledaagse taken en toepassingen op grote schaal.

API-prijzen voor GPT‑6

Model

Input

Output

Prijsverlaging

GPT‑6 Sol
vs. GPT‑5.6 Sol

$4 → $2

$20 → $10

50% goedkoper

GPT‑6 Luna
vs. GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

50% goedkoper

Prijzen gelden per 1 miljoen tokens.

GPT‑6 Astra blijft over de hele linie ons beste model. Kies dit model als je de beste resultaten en een compromisloze ervaring wilt.

Een stap vooruit voor de hele modelfamilie

GPT‑6 Sol en Luna bieden intelligentere en kostenefficiëntere versies van de modellen die je al kent en gebruikt, met verbeteringen in de capaciteiten die het belangrijkst zijn om complex werk uit te voeren.

Professioneel werk

GPT‑6 Sol kan moeilijke werktaken uitvoeren en biedt dankzij hogere gebruikslimieten en lagere kosten meer ruimte om te itereren. Het levert meer intelligentie en betere resultaten dan concurrerende modellen met een vergelijkbare prijs.

In AutomationBench, een test van bedrijfsworkflows in verschillende apps, presteert GPT‑6 Sol met xhigh-inspanning beter dan Claude Opus 5 met maximale inspanning, tegen slechts 9% van de kosten per taak van Opus 5. Met hoge inspanning presteert GPT‑6 Luna 5,4 procentpunt beter dan zijn voorganger, tegen 58% lagere kosten per taak.

In AutomationBench 1.0.6⁠(opent in een nieuw venster) worden AI-agents getest op volledige workflows met 47 tools voor verkoop, marketing, bedrijfsvoering, ondersteuning, financiën en HR. Het datapunt voor Claude Fable 5.1 onderschat de werkelijke kosten, omdat de kosten van terugval op Opus 5 niet zijn meegerekend. Die terugval vond plaats bij ongeveer 40% van de taken.

GPT‑6 Sol overtreft ook Claude Fable 5.1 tegen veel lagere kosten en presteert zelfs beter dan GPT‑6 Astra met lage inspanning.

Model (en inspanning)

Score

Kosten per taak

GPT‑6 Sol (xhigh)

33,2%

$0.27

GPT‑6 Astra (Laag)

30,3%

3,9× GPT‑6 Sol

Claude Opus 5 (Max)

26,9%

11,1× GPT‑6 Sol

Claude Fable 5.1 met terugval op Opus 5 (Max)

31,4%

>8,9× GPT‑6 Sol

(kosten van terugval niet gerapporteerd)

In Agents' Last Exam, waarin agents worden beoordeeld op complexe professionele workflows, behaalt GPT‑6 Sol met maximale inspanning een score van 56,4%. Daarmee overtreft het de hoogste score van Claude Opus 5 in deze evaluatie, tegen 60% lagere kosten per taak.

In Agents' Last Exam V1⁠(opent in een nieuw venster) worden AI-agents beoordeeld op economisch waardevolle taken met een lange looptijd in 55 subsectoren. Deze omvatten de meeste belangrijke vakgebieden waarin professioneel werk op een computer wordt uitgevoerd.

Feitelijkheid

Het nut van een antwoord hangt af van de juistheid van de feiten. Daarom blijven we werken aan een grotere feitelijke betrouwbaarheid. In onze interne evaluatie van feitelijkheid, gebaseerd op geanonimiseerde gesprekken uit de praktijk waarin gebruikers fouten van onze modellen meldden, maakt GPT‑6 Sol ongeveer half zoveel fouten als zijn voorganger. Daarmee benadert het tegen veel lagere kosten de betrouwbaarheid van Astra. Ook GPT‑6 Luna gaat er sterk op vooruit: bij hogere inspanningsniveaus evenaart het GPT‑5.6 Sol tegen ongeveer een honderdste van de kosten.

Hier beoordelen we de feitelijkheid aan de hand van geanonimiseerde ChatGPT‑gesprekken waarin gebruikers een feitelijke fout van een eerder model hadden gemeld. Deze gesprekken, die fouten uitlokken, zijn niet representatief voor normaal gebruik, waarbij feitelijke fouten zeldzamer zijn. De scores zijn niet gecorrigeerd voor lengte. Onze tests met verschillende antwoordlengtes lieten echter vrijwel geen verband met de antwoordlengte zien.

Programmeren

Dit jaar zijn programmeeragents begonnen aan taken met meer complexiteit, een grotere reikwijdte en een langere looptijd dan ooit tevoren. Binnen OpenAI is ons interne gebruik exponentieel gegroeid. Uitgedrukt in API-prijzen is het dagelijkse tokengebruik opgelopen tot ruim $600 voor de doorsnee onderzoeker en $7.000 voor onderzoekers in het 90e percentiel (Onderzoek versnellen: een kijkje binnen OpenAI⁠). Nu programmeeragents langere en veeleisendere taken uitvoeren, worden de kosten van langdurig gebruik belangrijker. GPT‑6 Sol en Luna combineren sterke programmeerprestaties met lagere API-prijzen. Hierdoor hebben ontwikkelaars meer ruimte om te itereren en kunnen teams Codex met vertrouwen ambitieuzere opdrachten geven.

In FrontierCode, waarin wordt beoordeeld of programmeeragents wijzigingen opleveren die direct in echte codebases kunnen worden samengevoegd, presteert GPT‑6 Sol aanzienlijk beter dan GPT‑5.6 Sol. Het evenaart Claude Fable 5.1 met xhigh-inspanning tegen veel lagere kosten.

In FrontierCode 1.1 Main⁠(opent in een nieuw venster) schrijven AI-agents code die niet alleen op juistheid wordt beoordeeld, maar ook op de mate waarin deze kan worden samengevoegd, zoals de kwaliteit van tests, het bewaken van de reikwijdte, de codestijl en de naleving van codebasestandaarden.

In DeepSWE v1.1, dat prestaties bij complexe software-engineeringtaken in echte codebases test, behaalt GPT‑6 Sol met maximale inspanning 68,8%. Dat ligt 1,1 procentpunt onder de hoogste score van Claude Fable 5 in de evaluatie—69,9% met xhigh-inspanning—tegen ongeveer 80% lagere kosten per taak.

GPT‑6 Luna behaalt met maximale inspanning 66,6%, vergelijkbaar met Claude Opus 5 en Fable 5 met gemiddelde inspanning. In deze vergelijkingen kost Luna per taak 93% minder dan Opus 5 en 96% minder dan Fable 5.

In DeepSWE 1.1⁠(opent in een nieuw venster) lossen AI-agents originele software-engineeringtaken met een lange looptijd op.

Computergebruik

Hoewel GPT‑6 Astra het beste model ter wereld blijft voor computergebruik, bieden GPT‑6 Sol en Luna kostenefficiëntere prestaties dan hun voorgangers. In OSWorld 2.0 offline behaalt GPT‑6 Sol met xhigh-inspanning een vergelijkbare score als Claude Opus 5 met gemiddelde inspanning—60,5% tegenover 60,3%—tegen ongeveer 80% lagere kosten per taak. GPT‑6 Luna (Max) overtreft GPT‑5.6 Sol (Gemiddeld) tegen een tiende van de kosten.

In OSWorld 2.0⁠(opent in een nieuw venster) proberen AI-agents langdurige workflows voor computergebruik uit te voeren, variërend van alledaagse tot professionele taken. We rapporteren de gedeeltelijke beloning voor de offline set uit release v2026.08.08.

Samenwerkingsstijl

We hebben de verbeterde communicatiestijl van GPT‑6 Astra ook naar Sol en Luna gebracht. We verwachten dat dit vooral merkbaar zal zijn in technische gesprekken en gesprekken over programmeren. Verwacht meer duidelijkheid, minder jargon, minder vreemde formuleringen, minder details met weinig toegevoegde waarde en over het algemeen iets kortere antwoorden, zonder inhoud te verliezen.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Hoewel stijl subjectief is, geven we hier de voorkeur aan het antwoord van GPT‑6 Sol. Het trekt minder snel conclusies, besteedt minder tijd aan het herhalen van details die voor de vraagsteller misschien vanzelfsprekend zijn (bijvoorbeeld dat de website vier pagina's heeft), gebruikt minder vage formuleringen (zoals "bento-uitstraling" en "daaromheen opnieuw vormgeven"), is duidelijker over wat wel en niet is gecontroleerd en deelt niet onnodig implementatiedetails, zoals de prompt voor de afbeeldingstool.

Betere caching voor agents en lange gesprekken

Naast lagere tokenprijzen helpen we ontwikkelaars die met GPT‑6 bouwen om meer te besparen op de context die hun toepassingen hergebruiken. We hebben promptcaching voor GPT‑6 verbeterd, zodat standaard meer cachehits worden behaald. Hierdoor kunnen agents meer context hergebruiken, sneller reageren en profiteren van 90% korting bij het lezen van gecachte inputtokens.

Ontwikkelaars krijgen ook meer mogelijkheden om de prestaties van hun caching te meten en optimaliseren:

GitHub meldt dat deze verbeteringen de afgelopen maanden het aandeel prompttokens dat opnieuw moest worden verwerkt met meer dan 50% hebben verminderd, verspreid over miljarden verzoeken aan OpenAI-modellen. Hierdoor kan Copilot sneller reageren.

Verdere verbetering van de afstemming

GPT‑6 Sol en Luna bouwen voort op de afstemming die met Astra is geïntroduceerd, ons best afgestemde model tot nu toe. In onze evaluaties van afstemming laten zowel Sol als Luna verbeteringen zien ten opzichte van hun GPT‑5.6-tegenhangers, waaronder minder misleidende beweringen over hun programmeerwerk.

De onderstaande evaluaties testen bewust moeilijke situaties en meten niet hoe vaak fouten bij normaal gebruik voorkomen. Bekijk de systeemkaart⁠(opent in een nieuw venster) voor de volledige resultaten.

Beschikbaarheid

GPT‑6 Sol en GPT‑6 Luna zijn vanaf vandaag beschikbaar in ChatGPT Work en Codex voor alle gebruikers van Plus, Pro, Business, Enterprise en Edu. Gebruikers van Free en Go hebben toegang tot GPT‑6 Luna in de desktopapp. Deze modellen zijn nog niet beschikbaar in Chat. In de OpenAI API zijn ze beschikbaar als gpt-6-sol en gpt-6-luna.

Om de service voor iedereen stabiel te houden, zijn we van plan deze modellen gedurende de dag geleidelijk in ChatGPT uit te rollen. Zie je de nieuwe modellen niet in ChatGPT Work of Codex, probeer het dan later opnieuw.


Evaluaties van GPT zijn uitgevoerd in onze onderzoeksomgeving of via onze API. Door verschillen in systeemprompts, beschikbare tools en andere factoren kan de output enigszins afwijken van die van ChatGPT in productie. Evaluaties van concurrerende modellen zijn overgenomen uit openbaar beschikbare rapporten. Wanneer er geen scores voor Claude Fable 5.1 beschikbaar waren, zijn de scores voor Claude Fable 5 vermeld.

Auteurs

OpenAI