Ako dve nastavenia strojnásobili naše skóre v benchmarku ARC-AGI-3
Zrýchlené video pokusov modelu GPT‑5.6 Sol vyriešiť úlohy benchmarku ARC-AGI-3 s oficiálnym harnessom (vľavo) a naším harnessom využívajúcim Responses API (vpravo), ktorý zachováva uvažovanie a zapína kompakciu. V rebríčku tejto hry(otvorí sa v novom okne) žiadny prelomový model nevyrieši úroveň nasledujúcu po prvej. S naším harnessom vyrieši GPT‑5.6 Sol všetkých šesť.
Keď sme prvýkrát videli nízke skóre modelu GPT‑5.6 Sol v benchmarku ARC-AGI-3(otvorí sa v novom okne), nechápali sme prečo.
GPT‑5.6 Sol vyriešil dlhoročné otvorené matematické problémy, ako je domnienka o dvojitom pokrytí cyklami(otvorí sa v novom okne), a zdolal hry ako Pokémon FireRed. V benchmarku 2D logických hier ARC-AGI-3 však GPT‑5.6 Sol dosiahol iba 7,8 % a GPT‑5.5 hry takmer vôbec nedokázal hrať — získal len úbohých 0,4 %.
Boli 2D logické hry pre naše modely nezvyčajne náročné? Alebo za tým bolo niečo iné?
Benchmarky zriedka merajú modely AI izolovane. Merajú aj menej viditeľné rozhodnutia týkajúce sa nastavení API, návrhu harnessu a tvorby pokynov. V prípade ARC-AGI-3 sme zistili, že zapnutie dvoch nastavení API, ktoré používame v ChatGPT a Codex — zachovania uvažovania a kompakcie — strojnásobilo skóre a znížilo počet výstupných tokenov na verejnej množine úloh na šestinu.
S oficiálnym harnessom dosiahol GPT‑5.6 Sol vo verejnej množine ARC-AGI-3 skóre 13,3 %. So zachovaným uvažovaním a kompakciou dosiahol 38,3 %. Skóre vyjadruje relatívnu efektívnosť ľudských činností (RHAE(otvorí sa v novom okne))—metriku porovnávajúcu výkon modelu s ľudskou referenčnou úrovňou. Na základe oficiálnych záznamov z hrania(otvorí sa v novom okne) odhadujeme, že priemerný ľudský tester dosiahol 48 %. Modely nevedia, ako sa budú hodnotiť, a počas hrania nevidia svoje skóre—po každej akcii dostanú iba textovú reprezentáciu snímky a informáciu o aktuálnej úrovni.
ARC-AGI-3 je benchmark navrhnutý na meranie toho, ako dobre sa agenti AI učia a uvažujú. Agenti skúmajú neznáme 2D hry a bez výslovných pokynov zisťujú, ako fungujú. Na stránke arcprize.org/tasks(otvorí sa v novom okne) si môžete zahrať 25 ukážkových hier.
ARC-AGI-3 zámerne používa všeobecný harness bez nástrojov či špeciálnych funkcií. ARC vychádzal z toho, že jednoduchý harness lepšie odhalí nedostatky modelov a umožní ich spravodlivejšie porovnávať. Komerční vývojári naopak optimalizujú harnessy podľa funkcií a osobitostí jednotlivých modelov.
V oblasti hier GPT‑5.6 Sol zdolal Pokémon FireRed s harnessom využívajúcim iba obrazový vstup (prenos od GPT_Plays_Pokemon(otvorí sa v novom okne)), Slay the Spire pomocou ovládania počítača cez Codex (prenos od EpochAI(otvorí sa v novom okne)) aj prvé úrovne hry Baba Is You (podľa príspevku od Piotra Migdała a Piotra Grabowského(otvorí sa v novom okne)). Čím bol ARC-AGI-3 taký odlišný?

Ethan Mollick ukazuje(otvorí sa v novom okne), ako GPT‑5.6 Sol v Codex zdoláva náhodne vygenerovanú dennú výzvu v hre Slay the Spire 2, ktorá vyšla až po dátume ukončenia znalostí modelu GPT‑5.6 Sol.
Inšpirovaní analýzou nedostatkov GPT‑5.5 od ARC(otvorí sa v novom okne) sme preskúmali niektoré pokusy modelu GPT‑5.6 Sol. Rovnako ako ARC sme videli, že model nepôsobil príliš bystro. Nad každou akciou dlho premýšľal a len ťažko napredoval.
Pri podrobnejšom skúmaní sme však zistili, že veľká časť zmätku nevyplývala zo samotného modelu, ale z nastavení harnessu.
Najprv sme si všimli, že po každej hernej akcii sa zahodilo celé súkromné uvažovanie. Pri každej akcii tak musel GPT‑5.6 Sol hru pochopiť odznova bez možnosti spomenúť si na svoje predchádzajúce úvahy. Model naďalej videl záznam predchádzajúcich ťahov a stručné sprievodné poznámky, no nevidel plány, postrehy ani myšlienky, ktoré k nim viedli.
Potom sme zistili, že harness používal priebežné skracovanie, takže s pribúdajúcou históriou sa staršie akcie prestávali zobrazovať. GPT‑5.6 Sol si teda nielenže nedokázal zapamätať svoje predchádzajúce úvahy, ale strácal aj spomienky na minulé akcie.
Tieto dve vlastnosti harnessu — zahadzovanie uvažovania a priebežné skracovanie — spoločne vysvetľovali, prečo mal GPT‑5.6 Sol problém postupne sa učiť.
Naše modely sú trénované tak, aby pred vytvorením odpovede alebo volaním nástroja premýšľali prostredníctvom súkromných správ uvažovania. Tieto súkromné správy uvažovania zostávajú zachované ako súčasť histórie konverzácie. Ak je konverzácia príliš dlhá, zhrnieme ju a pokračujeme.
Takto naše modely trénujeme a takto ich nasadzujeme aj v ChatGPT a Codex. Aby sme sa viac priblížili nášmu produkčnému prostrediu, implementovali sme harness ARC-AGI-3 pomocou nášho Responses API(otvorí sa v novom okne). Naše API uľahčuje správu kontextu: pri GPT‑5.6 odovzdanie ID predchádzajúcej odpovede automaticky zachováva uvažovanie medzi volaniami nástrojov aj jednotlivými kolami.
Po zachovaní uvažovania sme si všimli dve veľké zmeny. Po prvé, GPT‑5.6 Sol pred každou akciou premýšľal kratšie, pretože už nemusel v každom kole interpretovať hru odznova. Po druhé, keď si GPT‑5.6 Sol dokázal pamätať predchádzajúce úvahy, oveľa lepšie sa postupne učil a používal ucelené stratégie.
Ďalšie zlepšenie prinieslo nahradenie priebežného skracovania kompakciou(otvorí sa v novom okne), ďalším nastavením v Responses API.
Harness ARC-AGI-3 rieši obmedzenia kontextu priebežným skracovaním. Keď kontext konverzácie prekročí 175 000 znakov, najstaršie správy sa zahodia.
Priebežné skracovanie má dve nevýhody. Po prvé, model stráca skoršie pozorovania a akcie. Po druhé, značnú časť úloh vykonáva s plnším kontextovým oknom, čo môže mierne zhoršiť jeho výkon.
Keď sme v ARC-AGI-3 zapli kompakciu, GPT‑5.6 Sol si počas dlhších behov dokázal lepšie uchovať poznatky o jednotlivých hrách a dosiahol vyššie skóre s menším počtom výstupných tokenov.
Účinok zachovania uvažovania a zapnutia kompakcie ilustruje táto animácia 175-tisícového kontextového okna modelu GPT‑5.6 Sol pri riešení série úloh ARC-AGI-3 s oboma harnessmi.
Dva stredné stĺpce znázorňujú, ako jednotlivé harnessy odlišne využívajú kontextové okno modelu. Vďaka lepšej pamäti predchádzajúcich udalostí GPT‑5.6 Sol pri každej akcii premýšľa kratšie a postupuje oveľa rýchlejšie. Poznámka: naša implementácia používa limit 175 000 tokenov namiesto znakov, no výsledok je veľmi podobný, pretože prevažnú väčšinu textu tvoria mriežky akcií, ktoré náš tokenizátor tokenizuje v pomere 1 : 1.
Zachovanie uvažovania a kompakcia spoločne umožňujú modelu GPT‑5.6 Sol (Maximálna) dosiahnuť približne trojnásobné skóre so šestinovým počtom výstupných tokenov.
Dúfame, že tieto experimenty pripomenú, že hodnotenia zriedka merajú modely izolovane — merajú aj súbor menej viditeľných rozhodnutí týkajúcich sa nastavení API, návrhu harnessu a tvorby pokynov. Nie je to prvýkrát, čo nás prekvapilo nízke skóre vo verejnom benchmarku a následne sme zistili, že systém na spúšťanie hodnotenia používal všeobecný harness, ktorý zahadzoval správy uvažovania.
Ak vyvíjate riešenie využívajúce API a chcete maximalizovať výkon, odporúčame použiť rovnaké nastavenia, aké nasadzujeme vo vlastných produktoch:
- Používajte naše Responses API, nie staršie API na dokončovanie četu
- Zachovávajte uvažovanie
- Používajte kompakciu
Ak porovnávate modely, odporúčame vychádzať z hodnotení, ktoré používajú uvedené nastavenia, pretože najlepšie zodpovedajú reálnemu používaniu v ChatGPT a Codex.
Ďakujeme ARC za dlhoročnú tvorivú prácu na hodnotení AGI aj za analýzu, ktorá nás podnietila preskúmať túto problematiku podrobnejšie.
Ak si chcete zmerať sily s prelomovými modelmi, vyskúšajte si verejné hry na stránke arcprize.org/tasks(otvorí sa v novom okne).


