Video sing dicepetake nalika GPT‑5.6 Sol nyoba ngrampungake teka-teki ing tolok ukur ARC-AGI-3, nganggo kerangka uji resmi (kiwa) lan kerangka uji Responses API kita (tengen), sing nyimpen nalar lan nguripake pemadhetan. Ing papan peringkat game iki(mbukak ing jendhela anyar), ora ana model tercanggih sing bisa ngrampungake tataran sawisé tataran kapisan. Kanthi kerangka uji kita, GPT‑5.6 Sol ngrampungake kabèh enem tataran.
Nalika sepisanan ndeleng skor GPT‑5.6 Sol sing asor ing tolok ukur ARC-AGI-3(mbukak ing jendhela anyar), kita padha bingung.
GPT‑5.6 Sol wis ngrampungake masalah matematika sing suwé durung kawangsulan, kayata konjektur cycle double cover(mbukak ing jendhela anyar), lan ngalahake game kayata Pokémon FireRed. Nanging ing ARC-AGI-3, tolok ukur game teka-teki 2D, GPT‑5.6 Sol mung nggayuh skor 7,8%, dene GPT‑5.5 meh ora bisa main babar pisan lan skore mung 0,4%.
Apa game teka-teki 2D pancèn angel banget kanggo model kita? Utawa ana prekara liya?
Tolok ukur arang ngukur model AI kanthi kapisah. Tolok ukur uga ngukur pilihan sing ora pati katon babagan setelan API, rancangan kerangka uji, lan cara menehi pituduh. Ing ARC-AGI-3, kita nemokake yen nguripake rong setelan API sing digunakake ing ChatGPT lan Codex—nalar sing disimpen lan pemadhetan—bisa ngundhakake skor ping telu lan nyuda token output nganti ping enem ing set tugas publik.
Kanthi kerangka uji resmi, GPT‑5.6 Sol nggayuh skor 13,3% ing set publik ARC-AGI-3. Kanthi nalar sing disimpen lan pemadhetan, skore dadi 38,3%. Skor ngukur Efisiensi Tumindak Manungsa Relatif (RHAE(mbukak ing jendhela anyar))—metrik sing mbandhingake kinerja model karo patokan manungsa. Adhedhasar cathetan dolanan resmi(mbukak ing jendhela anyar), kira-kira skor rata-rata panguji manungsa yaiku 48%. Model ora dikandhani cara pambiji lan ora bisa ndeleng skore sajrone proses—saben tumindak mung ngasilake representasi teks saka saben pigura lan tataran sing lagi dimainake.
ARC-AGI-3 yaiku tolok ukur sing dirancang kanggo ngukur kaprigelané agen AI sinau lan nggunakake nalar. Agen njlajah game 2D sing durung dikenal lan nyimpulake cara kerjane tanpa pituduh cetha. Sampeyan bisa main 25 game demo ing arcprize.org/tasks(mbukak ing jendhela anyar).
ARC-AGI-3 sengaja nggunakake kerangka uji umum tanpa alat utawa fitur khusus. Miturut pertimbangan ARC, kerangka uji sing prasaja luwih nuduhake kakurangan model lan nggawe pambandhingan antarane model luwih adil. Kosok baline, pangembang komersial ngoptimalake kerangka uji miturut fitur lan ciri khas saben model.
Ing babagan game, GPT‑5.6 Sol wis ngalahake Pokémon FireRed nganggo kerangka uji sing mung ngandelake sesanti (kaya sing disiarake dening GPT_Plays_Pokemon(mbukak ing jendhela anyar)), Slay the Spire nganggo fitur panggunaan komputer Codex (kaya sing disiarake dening EpochAI(mbukak ing jendhela anyar)), lan tataran wiwitan Baba Is You (kaya sing dibagekake dening Piotr Migdał & Piotr Grabowski(mbukak ing jendhela anyar)). Apa sing béda banget saka ARC-AGI-3?

Ethan Mollick nuduhake(mbukak ing jendhela anyar) GPT‑5.6 Sol ing Codex ngrampungake tantangan saben dina kanthi acak ing Slay the Spire 2, game sing dirilis sawisé wates wektu kawruh GPT‑5.6 Sol.
Kawiwitan saka analisis ARC babagan kakurangan GPT‑5.5(mbukak ing jendhela anyar), kita nliti sawetara upaya GPT‑5.6 Sol. Kaya ARC, kita uga weruh yen model kasebut katon ora pati pinter. Model mikir suwé banget kanggo saben tumindak lan kangèlan maju.
Nanging sawisé ditliti luwih jero, kita nemokake yen akèh kebingungan model dudu amarga sipat model kasebut, nanging amarga setelan ing kerangka uji.
Kapisan, kita weruh yen sawisé saben tumindak ing game, kabèh nalar pribadhi dibuwang. Akibate, ing saben tumindak GPT‑5.6 Sol kudu mangertèni game saka awal maneh tanpa bisa ngélingi pamikiran sadurungé. Model isih bisa ndeleng cathetan tumindak sadurungé lan katrangan cekak sing ngiringi, nanging ora bisa ndeleng rencana, wawasan, utawa pamikiran sing ndhasari tumindak kasebut.
Kapindho, kita weruh yen kerangka uji nggunakake jendhela pamotongan bergulir, mula tumindak lawas dadi ora katon nalika riwayat saya dawa. Dadi, GPT‑5.6 Sol ora mung ora bisa ngélingi pamikiran sadurungé, nanging uga kelangan memori tumindak sing wis ditindakake.
Rong fitur kerangka uji iki—mbuwang nalar lan pamotongan bergulir—bebarengan njlentrehake sebabe GPT‑5.6 Sol kangèlan sinau saya suwé.
Model kita dilatih supaya mikir nganggo pesen nalar pribadhi sadurungé ngasilake wangsulan utawa panggilan alat. Pesen pamikiran pribadhi iki disimpen minangka bagéan saka riwayat pacelathon. Yen pacelathon saya dawa banget, kita ngringkes banjur nerusake.
Mangkono cara model kita dilatih lan uga diterapake ing ChatGPT lan Codex. Supaya luwih cocog karo konfigurasi produksi kita, kerangka uji ARC-AGI-3 diterapake nganggo Responses API(mbukak ing jendhela anyar). API kita nggampangake pangelolaan konteks: kanggo GPT‑5.6, ngirim ID respons sadurungé kanthi otomatis nyimpen nalar ing saben panggilan alat lan giliran.
Nalika nalar disimpen, kita weruh rong owah-owahan gedhé. Kapisan, GPT‑5.6 Sol ora perlu mikir suwé sadurungé saben tumindak, amarga ora perlu mangertèni game saka awal ing saben giliran. Kapindho, nalika bisa ngélingi pamikiran sadurungé, GPT‑5.6 Sol dadi luwih pinter sinau saya suwé lan ngetrapake strategi sing runtut.
Panyampurnan sabanjuré yaiku ngganti pamotongan bergulir nganggo pemadhetan(mbukak ing jendhela anyar), setelan liya ing Responses API.
Kerangka uji ARC-AGI-3 ngatasi wates konteks nganggo pamotongan bergulir. Nalika konteks pacelathon ngluwihi 175.000 karakter, pesen sing paling lawas dibuwang.
Pamotongan bergulir nduwèni rong kekurangan. Kapisan, model kelangan pengamatan lan tumindak sadurungé. Kapindho, sajrone akèh bagéan tugas, model makarya kanthi jendhela konteks sing luwih kebak, sing bisa rada nyuda kinerja.
Nalika pemadhetan diuripake ing ARC-AGI-3, GPT‑5.6 Sol luwih bisa njaga apa sing wis disinaoni babagan saben game sajrone proses sing luwih dawa, lan nggayuh skor luwih dhuwur kanthi token output luwih sithik.
Kanggo nggambarake pengaruh saka nyimpen nalar lan nguripake pemadhetan, iki animasi sing nuduhake jendhela konteks 175K GPT‑5.6 Sol nalika ngrampungake rerangkening teka-teki ARC-AGI-3 nganggo saben kerangka uji.
Rong kolom tengah nggambarake bedane cara saben kerangka uji nggunakake jendhela konteks model. Amarga luwih bisa ngélingi tumindak sadurungé, GPT‑5.6 Sol ora perlu mikir suwé kanggo saben tumindak lan bisa maju luwih cepet. Cathetan: implementasi kita nggunakake wates 175.000 token, dudu karakter, nanging asile meh padha amarga akèh-akèhé teks arupa kothak tumindak sing ditokenisasi dening tokenizer kita kanthi rasio 1:1.
Kanthi bebarengan, nalar sing disimpen lan pemadhetan ndadekake GPT‑5.6 Sol (Dipikir Maksimal) nggayuh skor kira-kira ping telu kanthi token output ping enem luwih sithik.
Muga-muga eksperimen iki bisa dadi pangéling yen evaluasi arang ngukur model kanthi kapisah—evaluasi uga ngukur sakumpulan pilihan sing ora pati katon babagan setelan API, rancangan kerangka uji, lan cara menehi pituduh. Iki dudu sepisanan kita kaget amarga skor asor ing tolok ukur publik, banjur nemokake yen piranti evaluasine nggunakake kerangka uji umum sing mbuwang pesen nalar.
Yen sampeyan pangembang API sing ngupaya ngoptimalake kinerja, kita nyaranake nggunakake setelan sing padha karo sing digunakake ing produk kita:
- Gunakake Responses API, dudu chat completions API lawas
- Simpen nalar
- Gunakake pemadhetan
Lan yen sampeyan mbandhingake model, kita nyaranake nggunakake evaluasi kanthi setelan ing ndhuwur, amarga paling cocog karo panggunaan nyata ing ChatGPT lan Codex.
Kita matur nuwun marang ARC kanggo karya kreatife sajrone pirang-pirang taun ing evaluasi AGI, uga kanggo analisis sing nyurung kita supaya nliti perkara iki luwih jero.
Yen kepengin nguji kabisanmu nglawan model tercanggih, cobanen game publike ing arcprize.org/tasks(mbukak ing jendhela anyar).


