Gå direkt till huvudinnehåll
OpenAI

Så tredubblade två aktiverade inställningar våra poäng i ARC-AGI-3

Laddar …

En uppsnabbad video där GPT‑5.6 Sol försöker lösa pussel i referenstestet ARC-AGI-3 med den officiella körmiljön (vänster) och vår körmiljö för Responses API (höger), som bevarar resonemang och aktiverar komprimering. På topplistan för det här spelet(öppnas i ett nytt fönster) klarar ingen banbrytande modell någon nivå efter den första. Med vår körmiljö klarar GPT‑5.6 Sol alla sex.

När vi först såg GPT‑5.6 Sols låga poäng i referenstestet ARC-AGI-3(öppnas i ett nytt fönster) blev vi förbryllade.

GPT‑5.6 Sol har löst sedan länge olösta matematiska problem, som förmodan om dubbla cykelövertäckningar(öppnas i ett nytt fönster), och klarat spel som Pokémon FireRed. Men i ARC-AGI-3, ett referenstest med 2D-pusselspel, fick GPT‑5.6 Sol bara 7,8 %, medan GPT‑5.5 knappt kunde spela spelen alls och fick ynka 0,4 %.

Var 2D-pusselspel ovanligt svåra för våra modeller? Eller var det något annat som pågick?

Referenstester mäter sällan AI-modeller isolerat. De mäter också mindre synliga val kring API-inställningar, körmiljöns utformning och promptning. För ARC-AGI-3 upptäckte vi att två API-inställningar som vi använder i ChatGPT och Codex – bevarat resonemang och komprimering – tredubblade poängen och minskade antalet utdatatoken sex gånger på den offentliga uppgiftsuppsättningen.

Med den officiella körmiljön fick GPT‑5.6 Sol 13,3 % på den offentliga ARC-AGI-3-uppsättningen. Med bevarat resonemang och komprimering fick den 38,3 %. Poängen mäter relativ mänsklig handlingseffektivitet (RHAE(öppnas i ett nytt fönster))ett mått som jämför modellens prestanda med en mänsklig referensnivå. Utifrån officiella spelloggar(öppnas i ett nytt fönster) uppskattar vi att den genomsnittliga mänskliga testaren fick 48 %. Modellerna får inte veta hur de poängsätts och kan inte se sina poäng under spelets gångåtgärder returnerar bara en textrepresentation av varje bildruta och vilken nivå de befinner sig på.

ARC-AGI-3

ARC-AGI-3 är ett referenstest som mäter hur väl AI-agenter lär sig och resonerar. Agenterna utforskar obekanta 2D-spel och drar slutsatser om hur de fungerar utan uttryckliga instruktioner. Du kan spela 25 demospel på arcprize.org/tasks(öppnas i ett nytt fönster).

ARC-AGI-3 använder avsiktligt en generisk körmiljö utan verktyg eller specialfunktioner. ARC:s tanke var att en enkel körmiljö gör modellernas brister tydligare och jämförelserna mellan dem rättvisare. Kommersiella utvecklare optimerar däremot körmiljöerna efter varje modells funktioner och egenheter.

När det gäller spel har GPT‑5.6 Sol klarat Pokémon FireRed med en körmijö som enbart använder visuell information (streamat av GPT_Plays_Pokemon(öppnas i ett nytt fönster)), Slay the Spire med Codex datoranvändning (streamat av EpochAI(öppnas i ett nytt fönster)) och de första nivåerna i Baba Is You (delat av Piotr Migdał & Piotr Grabowski(öppnas i ett nytt fönster)). Vad var det som gjorde ARC-AGI-3 så annorlunda?

GPT-5.6 Sol i Codex klarar en slumpgenererad daglig utmaning i Slay the Spire 2.

Ethan Mollick visar(öppnas i ett nytt fönster) hur GPT‑5.6 Sol i Codex klarar en slumpgenererad daglig utmaning i Slay the Spire 2, ett spel som släpptes efter kunskapsgränsen för GPT‑5.6 Sol.

Med inspiration från ARC:s analys av bristerna hos GPT‑5.5(öppnas i ett nytt fönster) granskade vi några av GPT‑5.6 Sols försök. Precis som ARC såg vi att modellen inte verkade särskilt smart. Den ägnade lång tid åt varje handling och hade svårt att komma vidare.

Men när vi tittade närmare upptäckte vi att en stor del av modellens förvirring inte berodde på modellen i sig, utan på inställningarna i körmiljön.

Först såg vi att allt privat resonemang raderades efter varje handling i spelet. Det innebar att GPT‑5.6 Sol vid varje handling tvingades lista ut spelet på nytt, utan att kunna minnas sina tidigare tankar. Modellen kunde fortfarande se tidigare drag och korta tillhörande anteckningar, men inte de planer, insikter eller tankar som hade lett fram till dem.

Sedan såg vi att körmiljön använde ett rullande trunkeringsfönster, vilket gjorde att äldre handlingar blev osynliga när historiken växte. GPT‑5.6 Sol kunde alltså inte bara inte minnas sina tidigare tankar, utan förlorade också minnet av sina tidigare handlingar.

Tillsammans bidrog dessa två egenskaper hos körmiljön – raderat resonemang och rullande trunkering – till att förklara varför GPT‑5.6 Sol hade svårt att lära sig över tid.

Agenter presterar bäst när de minns vad de har gjort

Våra modeller tränas att tänka med privata resonemangsmeddelanden innan de genererar svar eller verktygsanrop. Dessa privata resonemangsmeddelanden bevaras som en del av konversationshistoriken. Om en konversation blir för lång sammanfattar vi den och fortsätter.

Diagram som visar hur modellresonemang, verktygsanrop, konversationshistorik och kontextkomprimering samverkar under en långvarig uppgift.

Det är så våra modeller tränas och driftsätts i ChatGPT och Codex. För att bättre efterlikna vår produktionsmiljö implementerade vi körmiljön för ARC-AGI-3 med vårt Responses API(öppnas i ett nytt fönster). Vårt API gör det enkelt att hantera kontext: för GPT‑5.6 bevaras resonemang automatiskt mellan verktygsanrop och interaktioner när föregående svars-ID skickas med.

När resonemanget bevarades såg vi två stora förändringar. För det första ägnade GPT‑5.6 Sol mindre tid åt att tänka inför varje handling, eftersom den inte längre behövde tolka spelet från grunden varje gång. För det andra blev GPT‑5.6 Sol mycket bättre på att lära sig över tid och använda sammanhängande strategier när den kunde minnas sina tidigare tankar.

Nästa förbättring kom när vi ersatte rullande trunkering med komprimering(öppnas i ett nytt fönster), en annan inställning i Responses API.

Körmiljön för ARC-AGI-3 hanterar kontextgränser med rullande trunkering. När konversationskontexten överstiger 175 000 tecken raderas de äldsta meddelandena.

Rullande trunkering har två nackdelar. För det första förlorar modellen tidigare observationer och handlingar. För det andra utför den en stor del av uppgiften med ett mer fyllt kontextfönster, vilket kan försämra prestandan något.

När vi aktiverade komprimering i ARC-AGI-3 kunde GPT‑5.6 Sol bättre bevara vad den hade lärt sig om varje spel under längre körningar och uppnådde högre poäng med färre utdatatoken.

För att illustrera effekten av bevarat resonemang och aktiverad komprimering visar den här animeringen hur GPT‑5.6 Sols kontextfönster på 175 000 används när modellen löser en serie ARC-AGI-3-pussel med respektive körmiljö.

De två mittkolumnerna visar hur modellens kontextfönster används på olika sätt av respektive körmiljö. Med bättre minne av tidigare händelser tänker GPT‑5.6 Sol mindre inför varje handling och går framåt betydligt snabbare. Obs! Vår implementering använder en gräns på 175 000 token i stället för tecken, men resultatet blir ganska likartat eftersom den stora merparten av texten består av rutnät som beskriver handlingar och som vår tokeniserare delar upp i förhållandet 1:1.

Tillsammans gör bevarat resonemang och komprimering att GPT‑5.6 Sol (Max) får ungefär tre gånger högre poäng med sex gånger färre utdatatoken.

Slutsatser och rekommendationer

Vi hoppas att experimenten påminner om att utvärderingar sällan mäter modeller isolerat – de mäter också en uppsättning mindre synliga val kring API-inställningar, körmiljöns utformning och promptning. Det här är inte första gången vi har överraskats av låga poäng i ett offentligt referenstest och sedan upptäckt att utvärderingsverktyget använde en generisk körmiljö som utelämnade resonemangsmeddelanden.

Om du är API-utvecklare och vill maximera prestandan rekommenderar vi samma inställningar som vi använder i våra egna produkter:

  • Använd vårt Responses API, inte vårt äldre API för slutförda chattar.
  • Bevara resonemang
  • Använd komprimering

Om du jämför modeller rekommenderar vi dessutom utvärderingar som använder inställningarna ovan, eftersom de bäst motsvarar verklig användning i ChatGPT och Codex.

Vi är tacksamma mot ARC för deras mångåriga, kreativa arbete med utvärdering av AGI och för analysen som inspirerade oss att titta närmare på detta.

Om du vill mäta dina egna förmågor mot banbrytande modeller kan du själv prova de offentliga spelen på arcprize.org/tasks(öppnas i ett nytt fönster).

Författare

Ilan Bigio, Ted Sanders