Gå til hovedindhold
OpenAI

29. juli 2026

ResearchPublikation

Sådan tredoblede to aktiverede indstillinger vores score i ARC-AGI-3-benchmarken

Indlæser ...

En video i højt tempo af GPT‑5.6 Sol, der forsøger at løse puslespil i ARC-AGI-3-benchmarken med den officielle harness (til venstre) og vores Responses API-harness (til højre), som bevarer ræsonnering og aktiverer komprimering. På ranglisten for dette spil(åbner i et nyt vindue) løser ingen banebrydende model nogen bane efter den første. Med vores harness løser GPT‑5.6 Sol alle seks.

Da vi først så GPT‑5.6 Sols lave score i ARC-AGI-3(åbner i et nyt vindue)-benchmarken, undrede det os.

GPT‑5.6 Sol har løst mangeårige uløste matematiske problemer som formodningen om dobbelt cykeldækning(åbner i et nyt vindue) og gennemført spil som Pokémon FireRed. Men i ARC-AGI-3, en benchmark med 2D-puslespil, opnåede GPT‑5.6 Sol blot 7,8 %, mens GPT‑5.5 knap nok kunne spille spillene og kun opnåede sølle 0,4 %.

Var 2D-puslespil usædvanligt svære for vores modeller? Eller var der noget andet på spil?

Benchmarks måler sjældent AI-modeller isoleret. De måler også mindre synlige valg af API-indstillinger, harnessdesign og prompts. For ARC-AGI-3 opdagede vi, at aktivering af to API-indstillinger, som vi bruger i ChatGPT og Codex – bevaret ræsonnering og komprimering – tredoblede scoren og reducerede antallet af outputtokens til en sjettedel på det offentlige opgavesæt.

Med den officielle harness opnåede GPT‑5.6 Sol 13,3 % på det offentlige ARC-AGI-3-sæt. Med bevaret ræsonnering og komprimering opnåede den 38,3 %. Scoren måler Relative Human Action Efficiency (RHAE(åbner i et nyt vindue))et mål, der sammenligner modellens præstation med menneskers. Ud fra officielle spillogfiler(åbner i et nyt vindue) anslår vi, at den gennemsnitlige menneskelige tester opnåede 48 %. Modellerne får ikke at vide, hvordan de bedømmes, og kan ikke se deres score undervejs-handlinger returnerer kun en tekstrepræsentation af hvert billede og angiver, hvilken bane de befinder sig på.

ARC-AGI-3

ARC-AGI-3 er en benchmark, der måler, hvor godt AI-agenter lærer og ræsonnerer. Agenterne udforsker ukendte 2D-spil og udleder uden direkte instruktioner, hvordan de fungerer. Du kan spille 25 demospil på arcprize.org/tasks(åbner i et nyt vindue).

ARC-AGI-3 bruger bevidst en generisk harness uden værktøjer eller særlige funktioner. ARC's begrundelse var, at en enkel harness gør modellernes mangler mere synlige og sammenligninger mellem modeller mere retfærdige. Kommercielle udviklere optimerer derimod harnesses efter den enkelte models funktioner og særpræg.

Inden for spil har GPT‑5.6 Sol gennemført Pokémon FireRed med en harness, der udelukkende bruger syn (streamet af GPT_Plays_Pokemon(åbner i et nyt vindue)), Slay the Spire via Codex' computerbrug (streamet af EpochAI(åbner i et nyt vindue)) og de første baner i Baba Is You (delt af Piotr Migdał & Piotr Grabowski(åbner i et nyt vindue)). Hvad var så anderledes ved ARC-AGI-3?

GPT-5.6 Sol i Codex gennemfører en tilfældig daglig udfordring i Slay the Spire 2.

Ethan Mollick viser(åbner i et nyt vindue) GPT‑5.6 Sol i Codex gennemføre en tilfældig daglig udfordring i Slay the Spire 2, et spil udgivet efter skæringsdatoen for GPT‑5.6 Sols viden.

Inspireret af ARC's analyse af GPT‑5.5's mangler(åbner i et nyt vindue) undersøgte vi nogle af GPT‑5.6 Sols forsøg. Ligesom ARC så vi, at modellen ikke virkede særlig skarp. Den brugte lang tid på hver handling og havde svært ved at komme videre.

Men da vi gik i dybden, opdagede vi, at en stor del af modellens forvirring ikke skyldtes selve modellen, men indstillinger i harnessen.

Først bemærkede vi, at al privat ræsonnering blev kasseret efter hver handling i spillet. Det betød, at GPT‑5.6 Sol ved hver handling skulle regne spillet ud på ny uden at kunne huske sine tidligere overvejelser. Modellen kunne stadig se en log over tidligere træk og korte tilhørende noter, men ikke de planer, indsigter eller tanker, der lå bag dem.

Dernæst så vi, at harnessen brugte et rullende afkortningsvindue, så ældre handlinger forsvandt, efterhånden som historikken voksede. GPT‑5.6 Sol kunne altså ikke blot huske sine tidligere overvejelser, men mistede også hukommelsen om sine tidligere handlinger.

Tilsammen var disse to egenskaber ved harnessen—kassering af ræsonnering og rullende afkortning—med til at forklare, hvorfor GPT‑5.6 Sol havde svært ved at lære over tid.

Agenter klarer sig bedst, når de husker, hvad de har gjort

Vores modeller er trænet til at tænke med private ræsonneringsmeddelelser, før de genererer svar eller værktøjskald. Disse private tankemeddelelser bevares som en del af samtalehistorikken. Hvis en samtale bliver for lang, opsummerer vi den og fortsætter.

Diagram, der viser, hvordan modellens ræsonnering, værktøjskald, samtalehistorik og kontekstkomprimering arbejder sammen gennem en længerevarende opgave.

Sådan trænes vores modeller, og sådan anvendes de også i ChatGPT og Codex. For bedre at afspejle vores produktionsmiljø implementerede vi ARC-AGI-3-harnessen med vores Responses API(åbner i et nyt vindue). Vores API gør det nemt at administrere kontekst: For GPT‑5.6 bevares ræsonneringen automatisk på tværs af værktøjskald og samtalerunder, når ID'et for det forrige svar medsendes.

Da ræsonneringen blev bevaret, bemærkede vi to store ændringer. For det første brugte GPT‑5.6 Sol mindre tid på at tænke før hver handling, fordi den ikke længere skulle fortolke spillet helt fra bunden i hver runde. For det andet blev GPT‑5.6 Sol langt bedre til at lære over tid og følge sammenhængende strategier, når den kunne huske sine tidligere tanker.

Den næste forbedring kom, da vi erstattede rullende afkortning med komprimering(åbner i et nyt vindue), som er en anden indstilling i Responses API.

ARC-AGI-3-harnessen håndterer kontekstgrænser med rullende afkortning. Når samtalekonteksten overstiger 175.000 tegn, kasseres de ældste meddelelser.

Rullende afkortning har to ulemper. For det første mister modellen tidligere observationer og handlinger. For det andet løser den en stor del af opgaverne med et mere fyldt kontekstvindue, hvilket kan forringe ydeevnen en smule.

Da vi aktiverede komprimering på ARC-AGI-3, kunne GPT‑5.6 Sol bedre bevare sin viden om hvert spil gennem længere forløb og opnåede en højere score med færre outputtokens.

For at illustrere effekten af bevaret ræsonnering og aktiveret komprimering viser denne animation GPT‑5.6 Sols kontekstvindue på 175K, mens modellen løser en række ARC-AGI-3-puslespil med hver harness.

De to midterste kolonner viser, hvordan modellens kontekstvindue bruges forskelligt af de to harnesses. Med bedre hukommelse om fortiden tænker GPT‑5.6 Sol mindre for hver handling og kommer langt hurtigere frem. Bemærk: Vores implementering bruger en grænse på 175.000 tokens i stedet for tegn, men i praksis er det næsten det samme, da langt størstedelen af teksten består af handlingsgitre, som vores tokenizer opdeler i tokens i forholdet 1:1.

Tilsammen gør bevaret ræsonnering og komprimering det muligt for GPT‑5.6 Sol (Max) at opnå omtrent tre gange så høj en score med seks gange færre outputtokens.

Konklusion og anbefalinger

Vi håber, at disse eksperimenter minder om, at evalueringer sjældent måler modeller isoleret—de måler også en række mindre synlige valg af API-indstillinger, harnessdesign og prompts. Det er ikke første gang, vi er blevet overrasket over lave resultater i en offentlig benchmark og derefter har opdaget, at evalueringsværktøjet brugte en generisk harness, som kasserede ræsonneringsmeddelelser.

Hvis du er API-udvikler og vil maksimere ydeevnen, anbefaler vi de samme indstillinger, som vi bruger i vores egne produkter:

  • Brug vores Responses API, ikke vores ældre Chat Completions API
  • Bevar ræsonneringen
  • Brug komprimering

Hvis du sammenligner modeller, anbefaler vi desuden evalueringer, der bruger ovenstående indstillinger, fordi de bedst afspejler den faktiske brug i ChatGPT og Codex.

Vi er taknemmelige for ARC's mangeårige kreative arbejde med evaluering af AGI og for deres analyse, som inspirerede os til at se nærmere på dette.

Hvis du vil prøve kræfter med banebrydende modeller, kan du selv spille de offentlige spil på arcprize.org/tasks(åbner i et nyt vindue).

Skrevet af

Ilan Bigio og Ted Sanders