Preskočite na glavni sadržaj
OpenAI

29. srpnja 2026.

IstraživanjePublikacija

Kako smo dvjema postavkama utrostručili rezultate na testu ARC-AGI-3

Učitavanje…

Ubrzana snimka modela GPT‑5.6 Sol koji pokušava riješiti zagonetke referentnog testa ARC-AGI-3 sa službenim testnim sklopom (lijevo) i našim testnim sklopom Responses API-ja (desno), koji zadržava rasuđivanje i omogućuje sažimanje. Na ljestvici rezultata za ovu igru(otvara se u novom prozoru) nijedan granični model ne rješava nijednu razinu nakon prve. Uz naš testni sklop GPT‑5.6 Sol rješava svih šest.

Kad smo prvi put vidjeli niske rezultate modela GPT‑5.6 Sol na referentnom testu ARC-AGI-3(otvara se u novom prozoru), ostali smo zbunjeni.

GPT‑5.6 Sol riješio je dugogodišnje otvorene matematičke probleme poput hipoteze o dvostrukom pokrivanju ciklusima(otvara se u novom prozoru) i pobijedio u igrama poput Pokémon FireRed. No na ARC-AGI-3, referentnom testu sastavljenom od 2D logičkih igara, GPT‑5.6 Sol ostvario je samo 7,8 %, dok GPT‑5.5 gotovo uopće nije mogao igrati te je ostvario mizernih 0,4 %.

Jesu li 2D logičke igre bile neuobičajeno teške za naše modele? Ili se događalo nešto drugo?

Referentni testovi rijetko mjere AI modele neovisno o svemu ostalom. Mjere i manje vidljive odluke o postavkama API-ja, dizajnu testnog sklopa i oblikovanju upita. U slučaju ARC-AGI-3 otkrili smo da su dvije postavke API-ja koje upotrebljavamo u proizvodima ChatGPT i Codex—zadržavanje rasuđivanja i sažimanje—utrostručile rezultate i šest puta smanjile broj izlaznih tokena na javnom skupu zadataka.

Sa službenim testnim sklopom GPT‑5.6 Sol ostvario je 13,3 % na javnom skupu ARC-AGI-3. Uz zadržano rasuđivanje i sažimanje ostvario je 38,3 %. Rezultati mjere relativnu učinkovitost ljudskih radnji (RHAE(otvara se u novom prozoru))metrikom koja uspoređuje rezultate modela s ljudskom referentnom vrijednošću. Na temelju službenih zapisa igranja(otvara se u novom prozoru) procjenjujemo da je prosječni ljudski ispitanik ostvario 48 %. Modelima se ne govori kako će biti ocijenjeni i tijekom rada ne mogu vidjeti svoj rezultatradnje vraćaju samo tekstualni prikaz svakog kadra i razinu na kojoj se nalaze.

ARC-AGI-3

ARC-AGI-3 referentni je test osmišljen za mjerenje sposobnosti AI agenata da uče i rasuđuju. Agenti istražuju nepoznate 2D igre i bez izričitih uputa zaključuju kako one funkcioniraju. Možete odigrati 25 demonstracijskih igara na arcprize.org/tasks(otvara se u novom prozoru).

ARC-AGI-3 namjerno upotrebljava generički testni sklop bez alata i posebnih značajki. ARC je smatrao da jednostavan testni sklop jasnije otkriva nedostatke modela i omogućuje pravedniju usporedbu modela. Komercijalni razvojni programeri, nasuprot tome, optimiziraju testne sklopove prema značajkama i posebnostima svakog modela.

Kad je riječ o igrama, GPT‑5.6 Sol pobijedio je Pokémon FireRed s testnim sklopom koji se oslanja samo na vid (uz prijenos kanala GPT_Plays_Pokemon(otvara se u novom prozoru)), Slay the Spire služeći se računalom putem Codexa (uz prijenos organizacije EpochAI(otvara se u novom prozoru)) te prve razine igre Baba Is You (što su podijelili Piotr Migdał & Piotr Grabowski(otvara se u novom prozoru)). Po čemu je ARC-AGI-3 bio toliko drukčiji?

GPT-5.6 Sol u Codexu dovršava nasumični dnevni izazov u igri Slay the Spire 2.

Ethan Mollick prikazuje(otvara se u novom prozoru) kako GPT‑5.6 Sol u Codexu svladava nasumični dnevni izazov u igri Slay the Spire 2, objavljenoj nakon krajnjeg datuma znanja modela GPT‑5.6 Sol.

Potaknuti ARC-ovom analizom nedostataka modela GPT‑5.5(otvara se u novom prozoru), proučili smo neke pokušaje modela GPT‑5.6 Sol. Kao i ARC, primijetili smo da model nije djelovao pretjerano bistro. Dugo se zadržavao na svakoj radnji i teško je napredovao.

No detaljnijom analizom otkrili smo da velik dio zbunjenosti nije proizlazio iz samog modela, nego iz postavki testnog sklopa.

Prvo smo primijetili da se nakon svake radnje u igri odbacuje cjelokupno privatno rasuđivanje. Zbog toga je GPT‑5.6 Sol pri svakoj radnji morao iznova shvatiti igru jer se nije mogao sjetiti prethodnog razmišljanja. Model je i dalje mogao vidjeti zapis prethodnih poteza i kratke popratne bilješke, ali ne i planove, uvide ili misli koji su do njih doveli.

Drugo, vidjeli smo da testni sklop upotrebljava klizni prozor skraćivanja, zbog čega starije radnje prestaju biti vidljive kako povijest raste. GPT‑5.6 Sol stoga ne samo da se nije mogao sjetiti prethodnog razmišljanja nego je gubio i sjećanje na prethodne radnje.

Te dvije značajke testnog sklopa—odbacivanje rasuđivanja i klizno skraćivanje—zajedno su pomogle objasniti zašto je GPT‑5.6 Sol s vremenom teško učio.

Agenti su najuspješniji kada pamte što su učinili

Naši su modeli uvježbani da prije odgovora ili poziva alata razmišljaju putem privatnih poruka rasuđivanja. Te se privatne poruke razmišljanja čuvaju kao dio povijesti razgovora. Ako razgovor postane predug, sažimamo ga i nastavljamo.

Dijagram koji prikazuje kako rasuđivanje modela, pozivi alata, povijest razgovora i sažimanje konteksta zajedno funkcioniraju tijekom dugotrajnog zadatka.

Tako su naši modeli uvježbani, a tako se i primjenjuju u proizvodima ChatGPT i Codex. Kako bismo se bolje uskladili s produkcijskim okruženjem, testni sklop ARC-AGI-3 implementirali smo uz naš Responses API(otvara se u novom prozoru). Naš API olakšava upravljanje kontekstom: za GPT‑5.6 prosljeđivanje ID-ja prethodnog odgovora automatski zadržava rasuđivanje kroz pozive alata i krugove razgovora.

Kad smo zadržali rasuđivanje, primijetili smo dvije velike promjene. Prvo, GPT‑5.6 Sol kraće je razmišljao prije svake radnje jer više nije morao pri svakom potezu tumačiti igru ispočetka. Drugo, kad se mogao sjetiti prethodnih misli, GPT‑5.6 Sol mnogo je bolje učio tijekom vremena i primjenjivao dosljedne strategije.

Sljedeće poboljšanje ostvarili smo zamjenom kliznog skraćivanja sažimanjem(otvara se u novom prozoru), još jednom postavkom Responses API-ja.

Testni sklop ARC-AGI-3 rješava ograničenja konteksta kliznim skraćivanjem. Kad kontekst razgovora premaši 175.000 znakova, najstarije se poruke odbacuju.

Klizno skraćivanje ima dva nedostatka. Prvo, model gubi ranija opažanja i radnje. Drugo, tijekom velikog dijela zadataka radi s punijim kontekstnim prozorom, što može neznatno pogoršati rezultate.

Kad smo na ARC-AGI-3 omogućili sažimanje, GPT‑5.6 Sol mogao je tijekom duljih izvođenja bolje sačuvati ono što je naučio o svakoj igri te je ostvario viši rezultat uz manje izlaznih tokena.

Kako bismo prikazali učinak zadržavanja rasuđivanja i omogućivanja sažimanja, slijedi animacija kontekstnog prozora od 175 tisuća tokena modela GPT‑5.6 Sol dok sa svakim testnim sklopom rješava niz zagonetki ARC-AGI-3.

Dva središnja stupca prikazuju kako svaki testni sklop drukčije upotrebljava kontekstni prozor modela. Zahvaljujući boljem pamćenju prethodnih radnji, GPT‑5.6 Sol kraće razmišlja o svakoj radnji i mnogo brže napreduje. Napomena: naša implementacija ima ograničenje od 175.000 tokena umjesto znakova, no rezultat je vrlo sličan jer veliku većinu teksta čine mreže radnji koje naš tokenizator tokenizira u omjeru 1 : 1.

Zadržavanje rasuđivanja i sažimanje zajedno omogućuju modelu GPT‑5.6 Sol (Max) približno trostruko bolji rezultat uz šest puta manje izlaznih tokena.

Zaključak i preporuke

Nadamo se da će ovi eksperimenti poslužiti kao podsjetnik da evaluacije rijetko mjere samo modele—mjere i skup manje vidljivih odluka o postavkama API-ja, dizajnu testnog sklopa i oblikovanju upita. Ovo nije prvi put da su nas iznenadili niski rezultati na javnom referentnom testu, nakon čega smo otkrili da alat za pokretanje evaluacije upotrebljava generički testni sklop koji odbacuje poruke rasuđivanja.

Ako ste razvojni programer koji se služi API-jem i želite postići najbolje rezultate, preporučujemo iste postavke koje primjenjujemo u vlastitim proizvodima:

  • Upotrebljavajte naš Responses API, a ne zastarjeli API za dovršavanje razgovora
  • Zadržavajte rasuđivanje
  • Upotrebljavajte sažimanje

Ako uspoređujete modele, preporučujemo da se oslonite na evaluacije koje primjenjuju navedene postavke jer one najbolje odgovaraju stvarnoj uporabi u proizvodima ChatGPT i Codex.

Zahvalni smo ARC-u na dugogodišnjem kreativnom radu na evaluaciji AGI-ja i na analizi koja nas je potaknula da ovo detaljnije proučimo.

Ako želite iskušati svoje sposobnosti protiv graničnih modela, sami isprobajte javne igre na arcprize.org/tasks(otvara se u novom prozoru).

Autor

Ilan Bigio i Ted Sanders