Kaip įjungę dvi nuostatas patrigubinome ARC-AGI-3 testo rezultatus
Pagreitintas vaizdo įrašas, kuriame „GPT‑5.6 Sol“ bando išspręsti ARC-AGI-3 testo galvosūkius: kairėje naudojama oficialioji infrastruktūra, o dešinėje – mūsų „Responses API“ infrastruktūra, kuri išsaugo protavimą ir taiko tankinimą. Šio žaidimo(atsidaro naujame lange) rezultatų lentelėje nė vienas priešakinis modelis neįveikia daugiau nei pirmo lygio. Naudodamas mūsų infrastruktūrą, „GPT‑5.6 Sol“ įveikia visus šešis.
Pirmą kartą pamatę žemus „GPT‑5.6 Sol“ rezultatus atliekant ARC-AGI-3(atsidaro naujame lange) testą, sutrikome.
„GPT‑5.6 Sol“ išsprendė seniai neišspręstų matematikos problemų, pavyzdžiui, dvigubo ciklų padengimo hipotezę(atsidaro naujame lange), ir įveikė tokius žaidimus kaip „Pokémon FireRed“. Tačiau ARC-AGI-3 – 2D galvosūkių žaidimų teste – „GPT‑5.6 Sol“ surinko vos 7,8 proc., o GPT‑5.5 beveik nepajėgė žaisti ir tesurinko menkus 0,4 proc.
Gal 2D galvosūkių žaidimai mūsų modeliams buvo neįprastai sunkūs? O gal priežastis buvo kita?
Testai retai vertina DI modelius atskirai nuo jų aplinkos. Jie taip pat atspindi mažiau pastebimus sprendimus dėl API nuostatų, infrastruktūros sandaros ir užklausų formulavimo. Tirdami ARC-AGI-3 nustatėme, kad įjungus dvi „ChatGPT“ ir „Codex“ naudojamas API nuostatas – protavimo išsaugojimą ir tankinimą – viešajame užduočių rinkinyje rezultatai patrigubėjo, o išvesties žetonų prireikė šešiskart mažiau.
Naudojant oficialiąją infrastruktūrą, „GPT‑5.6 Sol“ viešajame ARC-AGI-3 rinkinyje surinko 13,3 %. Išsaugant protavimą ir taikant tankinimą, rezultatas siekė 38,3 %. Rezultatai vertinami pagal santykinį žmogaus veiksmų efektyvumą (RHAE(atsidaro naujame lange)) – rodiklį, kuriuo modelio veikimas lyginamas su žmogaus atskaitos tašku. Remdamiesi oficialiais žaidimo žurnalais(atsidaro naujame lange), apskaičiavome, kad žmogus testuotojas vidutiniškai surinko 48 %. Modeliams nepasakoma, kaip jie bus vertinami, o vykdydami užduotį jie nemato savo rezultato – po kiekvieno veiksmo grąžinamas tik tekstinis kadro ir pasiekto lygio aprašas.
ARC-AGI-3 – tai testas, skirtas įvertinti, kaip gerai DI agentai mokosi ir protauja. Agentai tyrinėja nepažįstamus 2D žaidimus ir be aiškių instrukcijų nustato, kaip jie veikia. Svetainėje arcprize.org/tasks(atsidaro naujame lange) galite išbandyti 25 demonstracinius žaidimus.
ARC-AGI-3 sąmoningai naudojama universali infrastruktūra be įrankių ar specialių funkcijų. ARC teigimu, paprasta infrastruktūra aiškiau atskleidžia modelių trūkumus ir leidžia juos sąžiningiau palyginti. Komercinių produktų kūrėjai, priešingai, infrastruktūrą optimizuoja pagal kiekvieno modelio funkcijas ir ypatumus.
Žaidimų srityje „GPT‑5.6 Sol“ įveikė „Pokémon FireRed“ naudodamas vien vaizdu pagrįstą infrastruktūrą (transliavo GPT_Plays_Pokemon(atsidaro naujame lange)), „Slay the Spire“ – per „Codex“ valdydamas kompiuterį (transliavo EpochAI(atsidaro naujame lange)), o pirmuosius „Baba Is You“ etapus (rezultatais pasidalijo Piotr Migdał ir Piotr Grabowski(atsidaro naujame lange)). Kuo ARC-AGI-3 taip skyrėsi?

Ethan Mollick parodo(atsidaro naujame lange), kaip „GPT‑5.6 Sol“ programoje „Codex“ įveikia atsitiktinai parinktą dienos iššūkį žaidime „Slay the Spire 2“, kuris buvo išleistas po „GPT‑5.6 Sol“ žinių atskaitos datos.
Paskatinti ARC atliktos GPT‑5.5 trūkumų analizės(atsidaro naujame lange), išnagrinėjome kai kuriuos „GPT‑5.6 Sol“ bandymus. Kaip ir ARC, matėme, kad modelis neatrodė itin sumanus. Prieš kiekvieną veiksmą jis ilgai svarstė ir sunkiai judėjo pirmyn.
Tačiau įsigilinę nustatėme, kad modelio sumaištį daugiausia lėmė ne pats modelis, o infrastruktūros nuostatos.
Pirmiausia pastebėjome, kad po kiekvieno žaidimo veiksmo visas privatus protavimas būdavo panaikinamas. Todėl prieš kiekvieną veiksmą „GPT‑5.6 Sol“ turėjo iš naujo perprasti žaidimą, nes negalėjo prisiminti ankstesnių minčių. Modelis vis dar matė ankstesnių ėjimų įrašus ir trumpas pastabas, tačiau nematė juos nulėmusių planų, įžvalgų ar minčių.
Antra, infrastruktūroje buvo naudojamas slankusis trumpinimo langas, todėl ilgėjant istorijai senesni veiksmai tapdavo nebematomi. Taigi „GPT‑5.6 Sol“ ne tik neprisiminė ankstesnių minčių, bet ir pamažu prarasdavo informaciją apie ankstesnius veiksmus.
Šios dvi infrastruktūros ypatybės – protavimo panaikinimas ir slankusis trumpinimas – padėjo paaiškinti, kodėl „GPT‑5.6 Sol“ ilgainiui sunkiai sekėsi mokytis.
Mūsų modeliai išmokyti prieš pateikdami atsakymus ar iškviesdami įrankius mąstyti pasitelkiant privačius protavimo pranešimus. Šie privatūs mąstymo pranešimai išsaugomi pokalbio istorijoje. Jei pokalbis tampa per ilgas, jį apibendriname ir tęsiame.
Taip mūsų modeliai mokomi ir diegiami „ChatGPT“ bei „Codex“. Kad tiksliau atkartotume savo gamybinę aplinką, ARC-AGI-3 infrastruktūrą įdiegėme naudodami mūsų Responses API(atsidaro naujame lange). Mūsų API supaprastina konteksto valdymą: naudojant GPT‑5.6 ir perduodant ankstesnio atsakymo ID, protavimas automatiškai išsaugomas tarp įrankių iškvietų ir pokalbio eilių.
Išsaugoję protavimą pastebėjome du didelius pokyčius. Pirma, „GPT‑5.6 Sol“ prieš kiekvieną veiksmą trumpiau mąstė, nes nebereikėjo kaskart iš naujo perprasti žaidimo. Antra, galėdamas prisiminti ankstesnes mintis, „GPT‑5.6 Sol“ ilgainiui daug geriau mokėsi ir taikė nuoseklias strategijas.
Kitas patobulinimas buvo slankiojo trumpinimo pakeitimas tankinimu(atsidaro naujame lange) – kita „Responses API“ nuostata.
ARC-AGI-3 infrastruktūroje konteksto ribos valdomos slankiuoju trumpinimu. Kai pokalbio kontekstas viršija 175 000 ženklų, seniausi pranešimai panaikinami.
Slankusis trumpinimas turi du trūkumus. Pirma, modelis praranda ankstesnius stebėjimus ir veiksmus. Antra, didelę užduoties dalį jis vykdo naudodamas pilnesnį konteksto langą, o tai gali šiek tiek pabloginti veikimą.
ARC-AGI-3 įjungus tankinimą, „GPT‑5.6 Sol“ per ilgesnes vykdymo sesijas geriau išsaugojo tai, ką išmoko apie kiekvieną žaidimą, ir pasiekė aukštesnį rezultatą naudodamas mažiau išvesties žetonų.
Kad parodytume protavimo išsaugojimo ir tankinimo poveikį, pateikiame animaciją, kurioje matyti, kaip „GPT‑5.6 Sol“ 175 tūkst. atpažinimo ženklų konteksto langas naudojamas sprendžiant ARC-AGI-3 galvosūkių seką su kiekviena infrastruktūra.
Dviejuose viduriniuose stulpeliuose parodyta, kaip kiekviena infrastruktūra skirtingai naudoja modelio konteksto langą. Geriau prisimindamas ankstesnius veiksmus, „GPT‑5.6 Sol“ prieš kiekvieną veiksmą mąsto trumpiau ir juda pirmyn daug sparčiau. Pastaba: mūsų realizacijoje taikoma 175 tūkst. žetonų, o ne simbolių riba, tačiau rezultatas gana panašus, nes didžiąją teksto dalį sudaro veiksmų tinkleliai, kuriuos mūsų atpažinimo ženklų skaidytuvas skaido santykiu 1:1.
Kartu protavimo išsaugojimas ir tankinimas leidžia „GPT‑5.6 Sol“ (Maksimalus) pasiekti maždaug triskart aukštesnį rezultatą naudojant šešiskart mažiau išvesties žetonų.
Tikimės, kad šie eksperimentai primins: vertinimai retai matuoja modelius atskirai nuo jų aplinkos – jie taip pat atspindi visumą mažiau pastebimų sprendimų dėl API nuostatų, infrastruktūros sandaros ir užklausų formulavimo. Tai ne pirmas kartas, kai mus nustebino žemi viešo testo rezultatai, o vėliau paaiškėjo, kad vertinimo vykdyklė naudojo universalią infrastruktūrą, kuri pašalindavo protavimo pranešimus.
Jei esate API kūrėjas ir siekiate kuo geresnio veikimo, rekomenduojame naudoti tas pačias nuostatas, kurias taikome savo produktuose:
- Naudokite mūsų „Responses API“, o ne pasenusią pokalbių užbaigimo API
- Išsaugokite protavimą
- Naudokite tankinimą
O jei lyginate modelius, rekomenduojame remtis vertinimais, kuriuose naudojamos pirmiau nurodytos nuostatos, nes jos tiksliausiai atitinka realų naudojimą „ChatGPT“ ir „Codex“.
Dėkojame ARC už ilgametį kūrybišką darbą vertinant AGI ir už analizę, paskatinusią mus atidžiau išnagrinėti šį klausimą.
Jei norite išmėginti savo jėgas prieš priešakinius modelius, patys išbandykite viešus žaidimus svetainėje arcprize.org/tasks(atsidaro naujame lange).


