Kiirendatud video, kus GPT‑5.6 Sol püüab lahendada ARC-AGI-3 võrdlustesti mõistatusi ametlikus täitmiskeskkonnas (vasakul) ja meie Responses API täitmiskeskkonnas (paremal), mis säilitab arutluse ja lubab tihendamise. Selle mängu(avaneb uues aknas) edetabelis ei lahenda ükski tipptasemel mudel esimesest tasemest kaugemale. Meie täitmiskeskkonnaga lahendab GPT‑5.6 Sol kõik kuus taset.
Kui nägime esimest korda GPT‑5.6 Soli madalaid tulemusi võrdlustestis ARC-AGI-3(avaneb uues aknas), olime hämmeldunud.
GPT‑5.6 Sol on lahendanud pikaajalisi lahtisi matemaatikaprobleeme, nagu tsüklilise kahekordse katte hüpotees(avaneb uues aknas), ja läbinud selliseid mänge nagu Pokémon FireRed. Kuid 2D-mõistatusmängude võrdlustestis ARC-AGI-3 sai GPT‑5.6 Sol tulemuseks vaid 7,8% ning GPT‑5.5 suutis neid mänge vaevu mängida, saades kõigest 0,4%.
Kas 2D-mõistatusmängud olid meie mudelitele ebatavaliselt rasked? Või oli põhjus milleski muus?
Võrdlustestid mõõdavad harva üksnes AI-mudelite võimekust. Need mõõdavad ka vähem nähtavaid valikuid API seadete, täitmiskeskkonna kujunduse ja viipade kohta. ARC-AGI-3 puhul avastasime, et kahe ChatGPT‑s ja Codexis kasutatava API seade – arutluse säilitamise ja tihendamise – sisselülitamine kolmekordistas avaliku ülesandekogumi tulemusi ning vähendas väljundtokenite arvu kuus korda.
Ametlikus täitmiskeskkonnas sai GPT‑5.6 Sol ARC-AGI-3 avalikul andmestikul tulemuseks 13,3%. Säilitatud arutluse ja tihendamisega sai see 38,3%. Tulemused mõõdavad inimese suhtelist tegevustõhusust (RHAE(avaneb uues aknas))—mõõdikut, mis võrdleb mudeli sooritust inimese lähtetasemega. Ametlike mängulogide(avaneb uues aknas) põhjal sai keskmine inimtestija hinnanguliselt 48%. Mudelitele ei öelda, kuidas neid hinnatakse, ja nad ei näe jooksvalt oma tulemust—tegevused tagastavad ainult iga kaadri tekstkujutise ja teabe selle kohta, millisel tasemel nad on.
ARC-AGI-3 on võrdlustest, mille eesmärk on mõõta, kui hästi AI-agendid õpivad ja arutlevad. Agendid uurivad tundmatuid 2D-mänge ja järeldavad ilma otseste juhisteta, kuidas need toimivad. 25 demomängu saab mängida aadressil arcprize.org/tasks(avaneb uues aknas).
ARC-AGI-3 kasutab tahtlikult üldist, tööriistade ja erifunktsioonideta täitmiskeskkonda. ARC leidis, et lihtne täitmiskeskkond toob mudelite puudused paremini esile ja muudab mudelite võrdlemise õiglasemaks. Äriarendajad seevastu optimeerivad täitmiskeskkondi iga mudeli funktsioonide ja eripärade järgi.
Mängudes on GPT‑5.6 Sol läbinud Pokémon FireRedi ainult nägemist kasutava täitmiskeskkonnaga (ülekande tegi GPT_Plays_Pokemon(avaneb uues aknas)), Slay the Spire’i Codexi arvutikasutusega (ülekande tegi EpochAI(avaneb uues aknas)) ja Baba Is You esimesed tasemed (tulemust jagasid Piotr Migdał & Piotr Grabowski(avaneb uues aknas)). Mis oli ARC-AGI-3 puhul nii teistsugune?

Ethan Mollick näitab(avaneb uues aknas), kuidas GPT‑5.6 Sol Codexis läbib mängu Slay the Spire 2 juhusliku päevaväljakutse. Mäng ilmus pärast GPT‑5.6 Soli teadmiste ajalist piiri.
Inspireerituna ARC analüüsist GPT‑5.5 puuduste kohta(avaneb uues aknas) uurisime mõnda GPT‑5.6 Soli katset. Nagu ARC, nägime ka meie, et mudel ei paistnud kuigi taibukas. See mõtles iga tegevuse üle pikalt ega suutnud hästi edasi liikuda.
Lähemal uurimisel avastasime aga, et suur osa mudeli segadusest ei tulenenud mudelist endast, vaid täitmiskeskkonna seadetest.
Esmalt märkasime, et pärast iga mängutoimingut kustutati kogu privaatne arutlus. Seetõttu pidi GPT‑5.6 Sol iga tegevuse puhul mängust uuesti aru saama ega saanud oma varasemat mõttekäiku mäletada. Mudel nägi endiselt varasemate käikude kirjet ja nende lühikesi märkmeid, kuid mitte nendeni viinud plaane, taipamisi ega mõtteid.
Teiseks nägime, et täitmiskeskkond kasutas libisevat kärpimisakent, mille tõttu muutusid vanemad tegevused ajaloo kasvades nähtamatuks. Seega ei suutnud GPT‑5.6 Sol mitte ainult varasemat mõttekäiku mäletada, vaid kaotas ka mälestuse oma varasematest tegevustest.
Need kaks täitmiskeskkonna omadust – arutluse kustutamine ja libisev kärpimine – aitasid selgitada, miks oli GPT‑5.6 Solil raske aja jooksul õppida.
Meie mudelid on treenitud enne vastuste või tööriistakutsete väljastamist privaatsete arutlussõnumite abil mõtlema. Need privaatsed mõtlemissõnumid säilitatakse vestlusajaloo osana. Kui vestlus muutub liiga pikaks, teeme sellest kokkuvõtte ja jätkame.
Nii on meie mudelid treenitud ning nii kasutatakse neid ka ChatGPT‑s ja Codexis. Et meie tootmiskeskkonda paremini jäljendada, rakendasime ARC-AGI-3 täitmiskeskkonna oma Responses API(avaneb uues aknas) abil. Meie API muudab konteksti haldamise lihtsaks: GPT‑5.6 puhul säilitab eelmise vastuse ID edastamine arutluse automaatselt nii tööriistakutsete kui ka vestlusvoorude vahel.
Arutluse säilitamisel märkasime kaht suurt muutust. Esiteks kulutas GPT‑5.6 Sol enne iga tegevust mõtlemisele vähem aega, sest ei pidanud enam igas voorus mängu algusest peale tõlgendama. Teiseks õppis GPT‑5.6 Sol aja jooksul palju paremini ja rakendas sidusaid strateegiaid, kui suutis varasemaid mõtteid mäletada.
Järgmise edusammu tõi libiseva kärpimise asendamine tihendamisega(avaneb uues aknas), mis on veel üks Responses API seade.
ARC-AGI-3 täitmiskeskkond lahendab kontekstipiirangud libiseva kärpimisega. Kui vestluse kontekst ületab 175 000 tähemärki, kustutatakse vanimad sõnumid.
Libiseval kärpimisel on kaks puudust. Esiteks kaotab mudel varasemad tähelepanekud ja tegevused. Teiseks töötab mudel suure osa ülesande ajast täidlasema kontekstivaatega, mis võib sooritust veidi halvendada.
Kui lubasime ARC-AGI-3-s tihendamise, suutis GPT‑5.6 Sol pikemate käituste jooksul iga mängu kohta õpitut paremini säilitada ning saavutas vähemate väljundtokenitega parema tulemuse.
Arutluse säilitamise ja tihendamise mõju näitlikustab animatsioon GPT‑5.6 Soli 175K kontekstivaatest, kui see lahendab kummaski täitmiskeskkonnas järjest ARC-AGI-3 mõistatusi.
Kaks keskmist veergu kujutavad, kuidas kumbki täitmiskeskkond kasutab mudeli kontekstivaadet erinevalt. Tänu varasema paremale mäletamisele mõtleb GPT‑5.6 Sol iga tegevuse üle vähem ja liigub palju kiiremini edasi. Märkus: meie lahendus kasutab 175 000 tähemärgi asemel 175 000 tokeni piiri, kuid tulemus on üsna sarnane, sest valdava osa tekstist moodustavad tegevusruudustikud, mille meie tokeniseerija tokeniseerib suhtega 1 : 1.
Arutluse säilitamine ja tihendamine võimaldavad GPT‑5.6 Solil (Max) saada ligikaudu kolm korda parema tulemuse kuus korda vähemate väljundtokenitega.
Loodame, et need katsed tuletavad meelde: hindamised mõõdavad harva üksnes mudelite võimekust, vaid ka hulka vähem nähtavaid valikuid API seadete, täitmiskeskkonna kujunduse ja viipade kohta. See pole esimene kord, kui avaliku võrdlustesti madalad tulemused meid üllatavad ja seejärel selgub, et hindamiskäitur kasutas üldist täitmiskeskkonda, mis jättis arutlussõnumid kõrvale.
Kui olete API-arendaja ja soovite jõudlust maksimeerida, soovitame kasutada samu seadeid, mida rakendame oma toodetes:
- Kasutage pärand-vestluse lõpetamise API asemel meie Responses API-t
- Säilitage arutlus
- Kasutage tihendamist
Mudelite võrdlemisel soovitame tugineda hindamistele, mis kasutavad ülaltoodud seadeid ja vastavad seega kõige paremini ChatGPT ja Codexi tegelikule kasutusele.
Oleme ARC-ile tänulikud aastatepikkuse loomingulise töö eest AGI hindamisel ning analüüsi eest, mis innustas meid seda küsimust lähemalt uurima.
Kui soovite oma võimeid tipptasemel mudelitega võrrelda, proovige avalikke mänge aadressil arcprize.org/tasks(avaneb uues aknas).


