Přeskoč na hlavní obsah
OpenAI

29. července 2026

VýzkumPublikace

Jak nám zapnutí dvou nastavení ztrojnásobilo skóre v benchmarku ARC-AGI-3

Načítání…

Zrychlené video, na němž se GPT‑5.6 Sol pokouší řešit úlohy benchmarku ARC-AGI-3 s oficiálním harnessem (vlevo) a naším harnessem Responses API (vpravo), který uchovává uvažování a používá kompaktaci. V žebříčku této hry(otevře se v novém okně) žádný průkopnický model nevyřeší žádnou úroveň po té první. S naším harnessem GPT‑5.6 Sol vyřeší všech šest.

Když jsme poprvé viděli nízké skóre GPT‑5.6 Sol v benchmarku ARC-AGI-3(otevře se v novém okně), byli jsme zmatení.

GPT‑5.6 Sol vyřešil dlouho nevyřešené matematické problémy, jako je hypotéza dvojího pokrytí cykly(otevře se v novém okně), a překonal i hry jako Pokémon FireRed. V benchmarku 2D logických her ARC-AGI-3 však GPT‑5.6 Sol dosáhl jen 7,8 % a GPT‑5.5 tyto hry téměř nedokázal hrát: získal pouhých 0,4 %.

Byly 2D logické hry pro naše modely nezvykle obtížné? Nebo za tím bylo něco jiného?

Benchmarky jen zřídka měří modely AI izolovaně. Měří také méně viditelná rozhodnutí týkající se nastavení API, návrhu harnessu a promptování. U ARC-AGI-3 jsme zjistili, že zapnutí dvou nastavení API, která používáme v ChatGPT a Codexu – uchovávání uvažování a kompaktace – ztrojnásobilo skóre ve veřejné sadě úloh a snížilo počet výstupních tokenů na šestinu.

S oficiálním harnessem dosáhl GPT‑5.6 Sol ve veřejné sadě ARC-AGI-3 skóre 13,3 %. Při uchovávání uvažování a kompaktaci získal 38,3 %. Skóre měří relativní efektivitu lidských akcí (Relative Human Action EfficiencyRHAE(otevře se v novém okně))metriku, která porovnává výkon modelu s lidskou referenční hodnotou. Na základě oficiálních záznamů ze hry(otevře se v novém okně) odhadujeme, že průměrné skóre lidských testerů bylo 48 %. Modely nevědí, jak budou hodnoceny, a během hry své skóre nevidíakce vracejí pouze textovou reprezentaci každého snímku a informaci o aktuální úrovni.

ARC-AGI-3

ARC-AGI-3 je benchmark navržený k měření toho, jak dobře se agenti AI učí a uvažují. Agenti prozkoumávají neznámé 2D hry a bez výslovných pokynů odvozují, jak fungují. Na stránce arcprize.org/tasks(otevře se v novém okně) si můžete zahrát 25 ukázkových her.

ARC-AGI-3 záměrně používá obecný harness bez nástrojů a speciálních funkcí. ARC vycházelo z předpokladu, že jednoduchý harness lépe odhalí nedostatky modelů a umožní jejich spravedlivější porovnání. Komerční vývojáři naproti tomu optimalizují harnessy podle funkcí a zvláštností jednotlivých modelů.

Ve hrách GPT‑5.6 Sol překonal Pokémon FireRed s harnessem využívajícím pouze obrazový vstup (streamoval GPT_Plays_Pokemon(otevře se v novém okně)), Slay the Spire pomocí ovládání počítače v Codexu (streamoval EpochAI(otevře se v novém okně)) a první úrovně Baba Is You (výsledky zveřejnili Piotr Migdał a Piotr Grabowski(otevře se v novém okně)). V čem byl tedy ARC-AGI-3 tak odlišný?

GPT-5.6 Sol v Codexu dokončuje náhodně vygenerovanou denní výzvu ve hře Slay the Spire 2.

Ethan Mollick ukazuje(otevře se v novém okně), jak GPT‑5.6 Sol v Codexu překonává náhodně vygenerovanou denní výzvu ve hře Slay the Spire 2, která vyšla až po datu znalostní uzávěrky GPT‑5.6 Sol.

Inspirováni analýzou nedostatků GPT‑5.5 od ARC(otevře se v novém okně) jsme prozkoumali některé pokusy GPT‑5.6 Sol. Stejně jako ARC jsme zjistili, že model nepůsobil příliš chytře. Nad každou akcí dlouho váhal a postupoval jen obtížně.

Při podrobnějším zkoumání jsme však zjistili, že velká část jeho zmatení nebyla vlastní samotnému modelu, ale vyplývala z nastavení harnessu.

Nejprve jsme si všimli, že se po každé herní akci bylo zapomenuto veškeré soukromé uvažování. GPT‑5.6 Sol tak musel po každé akci znovu přijít na to, jak hra funguje, protože si nepamatoval své předchozí úvahy. Model stále viděl záznam předchozích tahů a stručné doprovodné poznámky, ale neviděl plány, poznatky ani myšlenky, které k nim vedly.

Dále jsme zjistili, že harness používal okno s průběžným ořezáváním, takže starší akce s narůstající historií přestávaly být viditelné. GPT‑5.6 Sol si tedy nejen nepamatoval své předchozí úvahy, ale ztrácel i vzpomínky na dřívější akce.

Tyto dvě vlastnosti harnessu – zahazování uvažování a průběžné ořezávání – společně pomohly vysvětlit, proč se GPT‑5.6 Sol nedokázal v průběhu času učit.

Agenti si vedou nejlépe, když si pamatují, co udělali

Naše modely jsou trénovány tak, aby před vygenerováním odpovědi nebo voláním nástroje přemýšlely pomocí soukromých zpráv s uvažováním. Tyto soukromé zprávy s úvahami se uchovávají jako součást historie konverzace. Pokud se konverzace příliš prodlouží, shrneme ji a pokračujeme.

Schéma znázorňující, jak při dlouhotrvající úloze spolupracují uvažování modelu, volání nástrojů, historie konverzace a kompakce kontextu.

Takto naše modely trénujeme a stejným způsobem je nasazujeme v ChatGPT a Codexu. Abychom se více přiblížili produkčnímu prostředí, implementovali jsme harness ARC-AGI-3 pomocí našeho rozhraní Responses API(otevře se v novém okně). Naše API usnadňuje správu kontextu: u GPT‑5.6 stačí předat ID předchozí odpovědi a uvažování se automaticky uchová mezi voláními nástrojů i jednotlivými tahy.

Po zapnutí uchovávání uvažování jsme zaznamenali dvě zásadní změny. Zaprvé GPT‑5.6 Sol před každou akcí přemýšlel kratší dobu, protože už nemusel při každém tahu znovu od začátku zjišťovat, jak hra funguje. Zadruhé, když si GPT‑5.6 Sol mohl pamatovat své předchozí úvahy, dokázal se v průběhu času mnohem lépe učit a používat ucelené strategie.

Dalšího zlepšení jsme dosáhli nahrazením průběžného ořezávání kompaktací(otevře se v novém okně), dalším nastavením v Responses API.

Harness ARC-AGI-3 řeší omezení kontextu průběžným ořezáváním. Když kontext konverzace překročí 175 000 znaků, nejstarší zprávy se zahodí.

Průběžné ořezávání má dvě nevýhody. Zaprvé model ztrácí dřívější pozorování a akce. Zadruhé během velké části úloh pracuje s plnějším kontextovým oknem, což může mírně zhoršit výkon.

Když jsme v ARC-AGI-3 zapnuli kompaktaci, GPT‑5.6 Sol dokázal během delších běhů lépe uchovávat poznatky o jednotlivých hrách a dosáhl vyššího skóre s menším počtem výstupních tokenů.

Účinek uchovávání uvažování a kompakce ilustruje následující animace. Ukazuje kontextové okno GPT‑5.6 Sol o velikosti 175 tisíc při řešení série úloh ARC-AGI-3 s oběma harnessy.

Dva prostřední sloupce znázorňují, jak každý harness odlišně využívá kontextové okno modelu. Díky lepší paměti předchozího dění GPT‑5.6 Sol nad každou akcí méně přemýšlí a postupuje mnohem rychleji. Poznámka: naše implementace používá limit 175 000 tokenů namísto znaků. Výsledek je však velmi podobný, protože převážnou většinu textu tvoří mřížky akcí, které náš tokenizátor tokenizuje v poměru 1:1.

Uchovávání uvažování a kompakce společně umožňují GPT‑5.6 Sol (Max) dosáhnout přibližně trojnásobného skóre se šestkrát menším počtem výstupních tokenů.

Závěr a doporučení

Doufáme, že tyto experimenty připomenou, že evaluační testy jen zřídka měří modely izolovaně – hodnotí také soubor méně viditelných rozhodnutí o nastavení API, návrhu harnessu a promptování. Není to poprvé, kdy nás překvapilo nízké skóre ve veřejném benchmarku a následně jsme zjistili, že nástroj pro spuštění evaluace používá obecný harness, který zahazuje zprávy s uvažováním.

Pokud vyvíjíte s API a snažíte se maximalizovat výkon, doporučujeme používat stejná nastavení, která nasazujeme ve vlastních produktech:

  • Používejte naše Responses API, nikoli zastaralé Chat Completions API
  • Uchovávejte uvažování
  • Používejte kompaktaci

Pokud porovnáváte modely, doporučujeme vycházet z evaluací, které používají výše uvedená nastavení a nejlépe tak odpovídají reálnému používání v ChatGPT a Codexu.

Děkujeme ARC za dlouholetou tvůrčí práci na hodnocení AGI a za analýzu, která nás inspirovala k podrobnějšímu prozkoumání této otázky.

Chcete-li poměřit své schopnosti s průkopnickými modely, vyzkoušejte si veřejné hry na stránce arcprize.org/tasks(otevře se v novém okně).

Autor

Ilan Bigio, Ted Sanders