Paano pinatris ng dalawang setting ang aming mga marka sa ARC-AGI-3 benchmark
Pinabilis na video ng GPT‑5.6 Sol habang sinusubukang lutasin ang mga puzzle sa ARC-AGI-3 benchmark, gamit ang opisyal na harness (kaliwa) at ang aming Responses API harness (kanan), na nagpapanatili ng pangangatwiran at nag-e-enable ng compaction. Sa leaderboard para sa larong ito(magbubukas sa bagong window), walang frontier na modelo ang nakalulutas ng anumang level lampas sa una. Gamit ang aming harness, nalulutas ng GPT‑5.6 Sol ang lahat ng anim.
Nang una naming makita ang mababang mga marka ng GPT‑5.6 Sol sa benchmark na ARC-AGI-3(magbubukas sa bagong window), nagtaka kami.
Nalutas ng GPT‑5.6 Sol ang matatagal nang bukas na problema sa matematika, gaya ng cycle double cover conjecture(magbubukas sa bagong window), at natalo nito ang mga larong gaya ng Pokémon FireRed. Ngunit sa ARC-AGI-3, isang benchmark ng mga 2D puzzle game, 7.8% lang ang nakuha ng GPT‑5.6 Sol, at halos hindi makapaglaro ang GPT‑5.5, na nakakuha lamang ng 0.4%.
Sadyang napakahirap ba para sa aming mga modelo ang mga 2D puzzle game? O may iba pang nangyayari?
Bihirang sukatin ng mga benchmark ang mga AI modelo nang hiwalay. Sinusukat din ng mga ito ang hindi gaanong nakikitang mga pasiya tungkol sa mga setting ng API, disenyo ng harness, at prompting. Sa ARC-AGI-3, natuklasan naming ang pag-on sa dalawang setting ng API na ginagamit namin sa ChatGPT at Codex—pinananatiling pangangatwiran at compaction—ay nagpatris sa mga marka at nagpababa nang 6x sa mga output token sa pampublikong set ng gawain.
Gamit ang opisyal na harness, nakakuha ang GPT‑5.6 Sol ng 13.3% sa pampublikong set ng ARC-AGI-3. Sa pinananatiling pangangatwiran at compaction, nakakuha ito ng 38.3%. Sinusukat ng mga marka ang Relative Human Action Efficiency (RHAE(magbubukas sa bagong window))—isang sukatan na naghahambing sa pagganap ng modelo sa batayang pagganap ng tao. Batay sa mga opisyal na tala ng gameplay(magbubukas sa bagong window), tinataya naming 48% ang karaniwang marka ng mga human tester. Hindi sinasabi sa mga modelo kung paano sila mamarkahan, at hindi nila nakikita ang kanilang marka habang naglalaro—text na representasyon lang ng bawat frame at ang kasalukuyan nilang level ang ibinabalik ng mga aksiyon.
Ang ARC-AGI-3 ay isang benchmark na idinisenyo upang sukatin kung gaano kahusay matuto at mangatwiran ang mga AI agent. Sinisiyasat ng mga agent ang mga di-pamilyar na 2D game at inaalam kung paano gumagana ang mga ito nang walang tahasang tagubilin. Maaari kang maglaro ng 25 demo game sa arcprize.org/tasks(magbubukas sa bagong window).
Gumagamit ang ARC-AGI-3 ng sadyang generic na harness, nang walang mga tool o espesyal na feature. Ang pangangatwiran ng ARC ay mas nakikita sa simpleng harness ang mga kahinaan ng modelo at nagiging mas patas ang paghahambing ng mga modelo. Sa kabilang banda, ino-optimize ng mga komersiyal na developer ang mga harness para sa mga feature at kakaibang katangian ng bawat modelo.
Sa paglalaro, tinalo ng GPT‑5.6 Sol ang Pokémon FireRed gamit ang vision-only na harness (gaya ng ini-stream ng GPT_Plays_Pokemon(magbubukas sa bagong window)), ang Slay the Spire gamit ang computer use ng Codex (gaya ng ini-stream ng EpochAI(magbubukas sa bagong window)), at ang mga unang stage ng Baba Is You (gaya ng ibinahagi nina Piotr Migdał & Piotr Grabowski(magbubukas sa bagong window)). Ano ang lubhang naiiba sa ARC-AGI-3?

Ipinapakita ni Ethan Mollick kung paano(magbubukas sa bagong window) tinalo ng GPT‑5.6 Sol sa Codex ang isang randomized na pang-araw-araw na challenge sa Slay the Spire 2, isang larong inilabas matapos ang knowledge cutoff ng GPT‑5.6 Sol.
Dahil sa inspirasyon mula sa pagsusuri ng ARC sa mga kahinaan ng GPT‑5.5(magbubukas sa bagong window), sinuri namin ang ilan sa mga pagtatangka ng GPT‑5.6 Sol. Gaya ng ARC, napansin naming tila hindi gaanong matalino ang modelo. Matagal itong nag-isip sa bawat aksiyon at nahirapang umusad.
Ngunit nang mas masusi naming suriin, natuklasan naming ang malaking bahagi ng pagkalito ng modelo ay hindi likas sa modelo, kundi dulot ng mga setting sa harness.
Una, napansin naming pagkatapos ng bawat aksiyon sa laro, itinatapon ang lahat ng pribadong pangangatwiran. Ibig sabihin, sa bawat aksiyon ay kailangang muling alamin ng GPT‑5.6 Sol ang laro mula sa simula, dahil hindi nito maalala ang dati nitong pag-iisip. Nakikita pa rin ng modelo ang tala ng mga nakaraang galaw at maiikling kalakip na nota, ngunit hindi nito nakikita ang mga plano, kabatiran, o kaisipang humantong sa mga iyon.
Ikalawa, nakita naming gumagamit ang harness ng rolling truncation window, kaya hindi na nakikita ang mga mas lumang aksiyon habang humahaba ang history. Kaya bukod sa hindi maalala ng GPT‑5.6 Sol ang dati nitong pag-iisip, nawawala rin ang alaala nito sa mga nakaraang aksiyon.
Kapag pinagsama, nakatulong ang dalawang feature na ito ng harness—pagtatapon ng pangangatwiran at rolling truncation—upang ipaliwanag kung bakit nahihirapang matuto ang GPT‑5.6 Sol sa paglipas ng panahon.
Sinanay ang aming mga modelo na mag-isip gamit ang mga pribadong mensahe ng pangangatwiran bago mag-output ng mga tugon o tool call. Pinananatili ang mga pribadong mensaheng ito ng pag-iisip bilang bahagi ng history ng pag-uusap. Kapag masyadong humaba ang pag-uusap, binubuod namin ito at nagpapatuloy.
Ganito sinasanay ang aming mga modelo, at ganito rin ginagamit ang mga ito sa ChatGPT at Codex. Upang mas tumugma sa aming production setup, ipinatupad namin ang ARC-AGI-3 harness gamit ang aming Responses API(magbubukas sa bagong window). Pinapadali ng aming API ang pamamahala ng konteksto: para sa GPT‑5.6, awtomatikong napapanatili sa mga tool call at turn ang pangangatwiran kapag ipinasa ang ID ng nakaraang tugon.
Nang mapanatili ang pangangatwiran, napansin namin ang dalawang malaking pagbabago. Una, mas kaunting oras ang ginugol ng GPT‑5.6 Sol sa pag-iisip bago ang bawat aksiyon dahil hindi na nito kailangang unawain muli ang laro mula sa simula sa bawat turn. Ikalawa, nang maalaala nito ang mga dati nitong iniisip, mas mahusay nang natuto ang GPT‑5.6 Sol sa paglipas ng panahon at gumamit ng magkakaugnay na mga estratehiya.
Ang sumunod na pagpapahusay ay nagmula sa pagpapalit ng rolling truncation ng compaction(magbubukas sa bagong window), isa pang setting sa Responses API.
Tinutugunan ng ARC-AGI-3 harness ang mga limitasyon sa konteksto sa pamamagitan ng rolling truncation. Kapag lumampas sa 175,000 character ang konteksto ng pag-uusap, itinatapon ang mga pinakalumang mensahe.
May dalawang kahinaan ang rolling truncation. Una, nawawala sa modelo ang mga naunang obserbasyon at aksiyon. Ikalawa, isinasagawa nito ang malaking bahagi ng mga gawain gamit ang mas punong context window, na maaaring bahagyang makasama sa pagganap.
Nang i-enable namin ang compaction sa ARC-AGI-3, mas napanatili ng GPT‑5.6 Sol ang mga natutuhan nito tungkol sa bawat laro sa mas mahahabang run, at nakakuha ito ng mas mataas na marka gamit ang mas kaunting output token.
Upang ipakita ang epekto ng pagpapanatili ng pangangatwiran at pag-enable ng compaction, narito ang animation ng 175K context window ng GPT‑5.6 Sol habang nilulutas nito ang sunod-sunod na puzzle ng ARC-AGI-3 gamit ang bawat harness.
Inilalarawan ng dalawang gitnang column kung paano naiiba ang paggamit ng bawat harness sa context window ng modelo. Dahil mas mahusay nitong naaalala ang nakaraan, mas kaunti ang pag-iisip ng GPT‑5.6 Sol sa bawat aksiyon at mas mabilis itong umuusad. Paalala: gumagamit ang aming implementasyon ng limitasyong 175,000 token sa halip na mga character, ngunit halos magkapareho lang ang kinalalabasan dahil ang karamihan ng text ay mga action grid na tina-tokenize ng aming tokenizer sa ratio na 1:1.
Kapag pinagsama, binibigyang-daan ng pinananatiling pangangatwiran at compaction ang GPT‑5.6 Sol (max) na makakuha ng humigit-kumulang 3x na marka gamit ang 6x na mas kaunting output token.
Umaasa kaming magsisilbing paalala ang mga eksperimentong ito na bihirang sukatin ng mga eval ang mga modelo nang hiwalay—sinusukat din ng mga ito ang kalipunan ng hindi gaanong nakikitang mga pasiya tungkol sa mga setting ng API, disenyo ng harness, at prompting. Hindi ito ang unang pagkakataong nagulat kami sa mababang mga marka sa isang pampublikong benchmark at pagkatapos ay natuklasang gumagamit ang eval runner ng generic na harness na nagtatapon ng mga mensahe ng pangangatwiran.
Kung isa kang API developer na naglalayong i-maximize ang pagganap, inirerekomenda naming gamitin ang parehong mga setting na ginagamit namin sa sarili naming mga produkto:
- Gamitin ang aming Responses API, hindi ang lumang chat completions API
- Panatilihin ang pangangatwiran
- Gumamit ng compaction
At kung naghahambing ka ng mga modelo, inirerekomenda naming umasa sa mga eval na gumagamit ng mga setting sa itaas, na pinakamalapit sa aktuwal na paggamit sa ChatGPT at Codex.
Nagpapasalamat kami sa ARC para sa maraming taon ng malikhaing gawain nito sa pagsusuri ng AGI, at sa pagsusuring nagbigay sa amin ng inspirasyong siyasatin ito nang mas mabuti.
Kung gusto mong subukan ang sarili mong galing laban sa mga frontier na modelo, laruin ang mga pampublikong laro sa arcprize.org/tasks(magbubukas sa bagong window).


