Hoe twee instellingen onze score op de ARC-AGI-3-benchmark verdrievoudigden
Een versnelde video waarin GPT‑5.6 Sol puzzels uit de ARC-AGI-3-benchmark probeert op te lossen met de officiële harness (links) en onze Responses API-harness (rechts), die redenering behoudt en compaction inschakelt. Op het klassement voor deze game(opent in een nieuw venster) lost geen enkel grensverleggend model een level na het eerste op. Met onze harness lost GPT‑5.6 Sol ze alle zes op.
Toen we voor het eerst de lage scores van GPT‑5.6 Sol op de ARC-AGI-3(opent in een nieuw venster)-benchmark zagen, waren we verbaasd.
GPT‑5.6 Sol heeft lang bestaande open wiskundige problemen opgelost, zoals het cycle double cover-vermoeden(opent in een nieuw venster), en games als Pokémon FireRed uitgespeeld. Maar op ARC-AGI-3, een benchmark met 2D-puzzelgames, behaalde GPT‑5.6 Sol slechts 7,8%. GPT‑5.5 kon de games nauwelijks spelen en kwam niet verder dan een schamele 0,4%.
Waren 2D-puzzelgames ongewoon moeilijk voor onze modellen? Of speelde er iets anders?
Benchmarks meten AI-modellen zelden los van hun omgeving. Ze meten ook minder zichtbare keuzes rond API-instellingen, het ontwerp van de harness en prompting. Bij ARC-AGI-3 ontdekten we dat het inschakelen van twee API-instellingen die we in ChatGPT en Codex gebruiken—behoud van redenering en compaction—de scores op de openbare takenset verdrievoudigde en het aantal uitvoertokens met een factor zes verminderde.
Met de officiële harness behaalde GPT‑5.6 Sol 13,3% op de openbare set van ARC-AGI-3. Met behoud van redenering en compaction behaalde het 38,3%. De scores meten de Relative Human Action Efficiency (RHAE(opent in een nieuw venster))—een maatstaf die modelprestaties vergelijkt met een menselijke uitgangswaarde. Op basis van officiële gamelogs(opent in een nieuw venster) schatten we dat de gemiddelde menselijke tester 48% behaalde. Modellen weten niet hoe ze worden beoordeeld en kunnen hun score tussentijds niet zien—acties geven alleen een tekstweergave van elk frame en het huidige level terug.
ARC-AGI-3 is een benchmark die meet hoe goed AI-agenten leren en redeneren. Agenten verkennen onbekende 2D-games en leiden zonder expliciete instructies af hoe ze werken. Je kunt 25 demogames spelen op arcprize.org/tasks(opent in een nieuw venster).
ARC-AGI-3 gebruikt bewust een generieke harness, zonder tools of speciale functies. ARC redeneerde dat een eenvoudige harness tekortkomingen van modellen beter zichtbaar en modelvergelijkingen eerlijker maakt. Commerciële ontwikkelaars optimaliseren harnesses daarentegen voor de functies en eigenaardigheden van elk model.
Op gamegebied heeft GPT‑5.6 Sol Pokémon FireRed uitgespeeld met een harness die uitsluitend visuele input gebruikt (gestreamd door GPT_Plays_Pokemon(opent in een nieuw venster)), Slay the Spire met computergebruik via Codex (gestreamd door EpochAI(opent in een nieuw venster)) en de eerste levels van Baba Is You (gedeeld door Piotr Migdał & Piotr Grabowski(opent in een nieuw venster)). Wat maakte ARC-AGI-3 zo anders?

Ethan Mollick laat zien(opent in een nieuw venster) hoe GPT‑5.6 Sol in Codex een willekeurig samengestelde dagelijkse uitdaging in Slay the Spire 2 verslaat, een game die na de kennisgrens van GPT‑5.6 Sol is uitgebracht.
Geïnspireerd door ARCs analyse van de tekortkomingen van GPT‑5.5(opent in een nieuw venster) onderzochten we enkele pogingen van GPT‑5.6 Sol. Net als ARC zagen we dat het model niet bepaald slim overkwam. Het bleef lang bij elke actie stilstaan en boekte moeizaam vooruitgang.
Maar toen we dieper groeven, ontdekten we dat veel van de verwarring niet inherent was aan het model zelf, maar werd veroorzaakt door instellingen in de harness.
Ten eerste merkten we dat na elke gameactie alle interne redenering werd weggegooid. Daardoor moest GPT‑5.6 Sol bij elke actie opnieuw uitzoeken hoe de game werkte, zonder zich eerdere gedachten te kunnen herinneren. Het model kon nog wel een overzicht van eerdere zetten en korte bijbehorende notities zien, maar niet de plannen, inzichten of gedachten die daartoe hadden geleid.
Ten tweede zagen we dat de harness een voortschuivend afkappingsvenster gebruikte, waardoor oudere acties uit beeld verdwenen naarmate de geschiedenis groeide. GPT‑5.6 Sol kon dus niet alleen zijn eerdere gedachten niet onthouden, maar verloor ook zijn eerdere acties uit het geheugen.
Samen verklaarden deze twee eigenschappen van de harness—het weggooien van redenering en voortschrijdende afkapping—waarom GPT‑5.6 Sol zo moeizaam leerde naarmate de tijd verstreek.
Onze modellen zijn getraind om eerst na te denken in interne redeneringsberichten en daarna pas antwoorden of toolaanroepen te genereren. Deze interne denkberichten blijven bewaard als onderdeel van de gespreksgeschiedenis. Als een gesprek te lang wordt, vatten we het samen en gaan we verder.
Zo worden onze modellen getraind en ook ingezet in ChatGPT en Codex. Om onze productieomgeving beter te benaderen, implementeerden we de ARC-AGI-3-harness met onze Responses API(opent in een nieuw venster). Onze API maakt contextbeheer eenvoudig: bij GPT‑5.6 zorgt het doorgeven van de vorige respons-ID er automatisch voor dat redenering tussen toolaanroepen en gespreksbeurten behouden blijft.
Toen we de redenering behielden, zagen we twee grote veranderingen. Ten eerste dacht GPT‑5.6 Sol vóór elke actie minder lang na, omdat het de game niet meer bij elke beurt opnieuw hoefde te doorgronden. Ten tweede leerde GPT‑5.6 Sol na verloop van tijd veel beter en paste het samenhangende strategieën toe wanneer het eerdere gedachten kon onthouden.
De volgende verbetering kwam door voortschrijdende afkapping te vervangen door compaction(opent in een nieuw venster), een andere instelling in de Responses API.
De ARC-AGI-3-harness vangt contextlimieten op met voortschrijdende afkapping. Zodra de gesprekscontext langer is dan 175.000 tekens, worden de oudste berichten weggegooid.
Voortschrijdende afkapping heeft twee nadelen. Ten eerste verliest het model eerdere observaties en acties. Ten tweede werkt het tijdens een groot deel van de taken met een voller contextvenster, wat de prestaties enigszins kan verminderen.
Toen we compaction inschakelden voor ARC-AGI-3, kon GPT‑5.6 Sol tijdens langere runs beter vasthouden wat het over elke game had geleerd en behaalde het een hogere score met minder uitvoertokens.
Om het effect van behoud van redenering en ingeschakelde compaction te illustreren, laat deze animatie zien hoe GPT‑5.6 Sol met elke harness zijn contextvenster van 175K gebruikt terwijl het een reeks ARC-AGI-3-puzzels oplost.
De twee middelste kolommen tonen hoe elke harness het contextvenster van het model anders gebruikt. Doordat GPT‑5.6 Sol eerdere gebeurtenissen beter onthoudt, denkt het per actie minder lang na en gaat het veel sneller vooruit. Opmerking: onze implementatie hanteert een limiet van 175.000 tokens in plaats van tekens. In de praktijk komt dit vrijwel op hetzelfde neer, omdat de overgrote meerderheid van de tekst uit actierasters bestaat die onze tokenizer in een verhouding van 1:1 tokeniseert.
Samen zorgen behoud van redenering en compaction ervoor dat GPT‑5.6 Sol (Max) een ongeveer driemaal zo hoge score behaalt met zesmaal minder uitvoertokens.
We hopen dat deze experimenten eraan herinneren dat evaluaties modellen zelden los van hun omgeving meten—ze meten ook een pakket minder zichtbare keuzes rond API-instellingen, het ontwerp van de harness en prompting. Het is niet de eerste keer dat lage scores op een openbare benchmark ons verrasten en we vervolgens ontdekten dat het evaluatieprogramma een generieke harness gebruikte die redeneringsberichten verwijderde.
API-ontwikkelaars die de prestaties willen maximaliseren, raden we aan dezelfde instellingen te gebruiken die we in onze eigen producten toepassen:
- Gebruik onze Responses API, niet onze verouderde Chat Completions-API
- Behoud redenering
- Gebruik compaction
En als je modellen vergelijkt, raden we aan evaluaties te gebruiken met de bovenstaande instellingen, omdat die het beste aansluiten bij praktijkgebruik in ChatGPT en Codex.
We zijn ARC dankbaar voor hun jarenlange creatieve werk aan de evaluatie van AGI en voor hun analyse, die ons inspireerde om dit nader te onderzoeken.
Wil je je eigen vaardigheden meten met die van grensverleggende modellen? Probeer dan zelf de openbare games op arcprize.org/tasks(opent in een nieuw venster).


