Pospešeni videoposnetek modela GPT‑5.6 Sol, ki poskuša rešiti uganke preizkusa ARC-AGI-3 z uradnim ogrodjem (levo) in našim ogrodjem API-ja Responses (desno), ki ohranja sklepanje in omogoča kompaktiranje. Na lestvici za to igro(odpre se v novem oknu) noben prelomni model ne reši nobene ravni po prvi. Z našim ogrodjem GPT‑5.6 Sol reši vseh šest.
Ko smo prvič videli nizke rezultate modela GPT‑5.6 Sol na preizkusu ARC-AGI-3(odpre se v novem oknu), smo bili osupli.
GPT‑5.6 Sol je rešil dolgoletne odprte matematične probleme, kot je domneva o dvojnem cikličnem pokritju(odpre se v novem oknu), ter premagal igre, kot je Pokémon FireRed. Toda na ARC-AGI-3, preizkusu z 2D-ugankarskimi igrami, je GPT‑5.6 Sol dosegel le 7,8 %, GPT‑5.5 pa iger skorajda ni zmogel igrati in je dosegel pičlih 0,4 %.
So bile 2D-ugankarske igre za naše modele nenavadno zahtevne? Ali pa je šlo za nekaj drugega?
Preizkusi redko merijo modele umetne inteligence povsem ločeno od drugih dejavnikov. Merijo tudi manj opazne odločitve glede nastavitev API-ja, zasnove ogrodja in oblikovanja pozivov. Pri ARC-AGI-3 smo ugotovili, da sta nastavitvi API-ja, ki ju uporabljamo v ChatGPT in Codexu—ohranjeno sklepanje in kompaktiranje—potrojili rezultate ter na javnem naboru nalog šestkrat zmanjšali število izhodnih žetonov.
Z uradnim ogrodjem je GPT‑5.6 Sol na javnem naboru ARC-AGI-3 dosegel 13,3 %. Z ohranjenim sklepanjem in kompaktiranjem je dosegel 38,3 %. Rezultati merijo relativno učinkovitost človeških dejanj (RHAE(odpre se v novem oknu))—metriko, ki primerja uspešnost modela z izhodiščno uspešnostjo človeka. Na podlagi uradnih dnevnikov igranja(odpre se v novem oknu) ocenjujemo, da je povprečni človeški preizkuševalec dosegel 48 %. Modelom ni pojasnjeno, kako bodo ocenjeni, svojega rezultata pa med igranjem ne vidijo—dejanja vrnejo le besedilni prikaz posamezne slike in podatek o trenutni ravni.
ARC-AGI-3 je preizkus, namenjen merjenju sposobnosti agentov umetne inteligence za učenje in sklepanje. Agenti raziskujejo neznane 2D-igre in brez izrecnih navodil ugotavljajo, kako delujejo. Na strani arcprize.org/tasks(odpre se v novem oknu) lahko igrate 25 predstavitvenih iger.
ARC-AGI-3 uporablja namenoma splošno ogrodje brez orodij ali posebnih funkcij. Pri ARC so menili, da preprosto ogrodje jasneje pokaže pomanjkljivosti modelov in omogoča pravičnejšo primerjavo med njimi. Komercialni razvijalci pa ogrodja prilagodijo funkcijam in posebnostim posameznega modela.
Na področju igranja iger je GPT‑5.6 Sol z ogrodjem, ki uporablja le vid, premagal Pokémon FireRed (prenos je pripravil GPT_Plays_Pokemon(odpre se v novem oknu)), z računalniško uporabo v Codexu igro Slay the Spire (prenos je pripravil EpochAI(odpre se v novem oknu)) in prve stopnje igre Baba Is You (kot sta prikazala Piotr Migdał & Piotr Grabowski(odpre se v novem oknu)). Zakaj je bil ARC-AGI-3 tako drugačen?

Ethan Mollick prikazuje(odpre se v novem oknu), kako GPT‑5.6 Sol v Codexu premaga naključni dnevni izziv v igri Slay the Spire 2, ki je izšla po presečnem datumu znanja modela GPT‑5.6 Sol.
Po navdihu ARC-ove analize pomanjkljivosti modela GPT‑5.5(odpre se v novem oknu) smo preučili nekaj poskusov modela GPT‑5.6 Sol. Tako kot pri ARC smo opazili, da model ni deloval posebno bister. Pri vsakem dejanju se je dolgo obotavljal in le stežka napredoval.
Ob podrobnejšem pregledu pa smo ugotovili, da zmedenost večinoma ni bila lastnost modela, temveč posledica nastavitev ogrodja.
Najprej smo opazili, da je bilo po vsakem dejanju v igri zavrženo vse zasebno sklepanje. To je pomenilo, da je moral GPT‑5.6 Sol pri vsakem dejanju igro razumeti znova, saj se svojega prejšnjega razmišljanja ni mogel spomniti. Model je še vedno videl zapis prejšnjih potez in kratke spremne opombe, ne pa tudi načrtov, spoznanj ali misli, ki so pripeljali do njih.
Nato smo ugotovili, da ogrodje uporablja drseče okno krajšanja, zaradi katerega starejša dejanja z rastjo zgodovine postanejo nevidna. GPT‑5.6 Sol se torej ni le nehal spominjati prejšnjega razmišljanja, temveč je izgubljal tudi spomin na pretekla dejanja.
Ti dve lastnosti ogrodja—zavračanje sklepanja in drseče krajšanje—sta skupaj pojasnili, zakaj se je GPT‑5.6 Sol sčasoma tako težko učil.
Naši modeli so naučeni, da pred odgovori ali klici orodij razmišljajo z zasebnimi sporočili sklepanja. Ta zasebna sporočila razmišljanja se ohranijo kot del zgodovine pogovora. Če pogovor postane predolg, ga povzamemo in nadaljujemo.
Tako so naši modeli naučeni in tako jih uporabljamo tudi v ChatGPT in Codexu. Da bi se bolje približali produkcijskemu okolju, smo ogrodje ARC-AGI-3 uvedli z našim API-jem Responses(odpre se v novem oknu). Naš API poenostavi upravljanje konteksta: pri GPT‑5.6 posredovanje ID-ja prejšnjega odgovora samodejno ohrani sklepanje med klici orodij in posameznimi koraki pogovora.
Ko smo ohranili sklepanje, smo opazili dve veliki spremembi. Prvič, GPT‑5.6 Sol je pred vsakim dejanjem porabil manj časa za razmišljanje, saj mu igre ob vsaki potezi ni bilo več treba razlagati od začetka. Drugič, ko se je lahko spomnil prejšnjih misli, se je GPT‑5.6 Sol sčasoma veliko bolje učil in uporabljal skladne strategije.
Naslednjo izboljšavo je prinesla zamenjava drsečega krajšanja s kompaktiranjem(odpre se v novem oknu), še eno nastavitvijo API-ja Responses.
Ogrodje ARC-AGI-3 omejitve konteksta obravnava z drsečim krajšanjem. Ko kontekst pogovora preseže 175.000 znakov, se najstarejša sporočila zavržejo.
Drseče krajšanje ima dve pomanjkljivosti. Prvič, model izgubi prejšnja opažanja in dejanja. Drugič, velik del naloge opravlja z bolj zapolnjenim kontekstnim oknom, kar lahko nekoliko poslabša uspešnost.
Ko smo pri ARC-AGI-3 omogočili kompaktiranje, je GPT‑5.6 Sol pri daljših izvajanjih bolje ohranil naučeno o posamezni igri ter z manj izhodnimi žetoni dosegel višji rezultat.
Učinek ohranjanja sklepanja in omogočanja kompaktiranja ponazarja animacija 175-tisočžetonskega kontekstnega okna modela GPT‑5.6 Sol, ko z vsakim od ogrodij rešuje niz ugank ARC-AGI-3.
Osrednja stolpca prikazujeta, kako posamezno ogrodje drugače uporablja kontekstno okno modela. Ker si GPT‑5.6 Sol bolje zapomni preteklo dogajanje, pri posameznem dejanju razmišlja manj in napreduje veliko hitreje. Opomba: naša izvedba namesto omejitve 175.000 znakov uporablja omejitev 175.000 žetonov, vendar je rezultat precej podoben, saj veliko večino besedila sestavljajo mreže dejanj, ki jih naš razčlenjevalnik pretvori v žetone v razmerju 1 : 1.
Ohranjanje sklepanja in kompaktiranje skupaj omogočata modelu GPT‑5.6 Sol (Najvišje), da doseže približno trikrat boljši rezultat s šestkrat manj izhodnimi žetoni.
Upamo, da bodo ti poskusi opomnik, da vrednotenja redko merijo modele povsem ločeno od drugih dejavnikov—merijo tudi sklop manj opaznih odločitev glede nastavitev API-ja, zasnove ogrodja in oblikovanja pozivov. Ni se nam prvič zgodilo, da so nas presenetili nizki rezultati na javnem preizkusu, nato pa smo ugotovili, da izvajalnik vrednotenja uporablja splošno ogrodje, ki zavrže sporočila sklepanja.
Če kot razvijalec API-ja poskušate čim bolj izboljšati delovanje, priporočamo iste nastavitve, ki jih uporabljamo v svojih izdelkih:
- Uporabite naš API Responses, ne starejšega API-ja za dopolnitve klepeta
- Ohranite sklepanje
- Uporabite kompaktiranje
Če primerjate modele, priporočamo vrednotenja, ki uporabljajo zgornje nastavitve, saj te najbolje ustrezajo dejanski uporabi v ChatGPT in Codexu.
ARC-u smo hvaležni za dolgoletno ustvarjalno delo pri vrednotenju SUI in za analizo, ki nas je spodbudila k podrobnejšemu pregledu.
Če želite svoje sposobnosti preizkusiti proti prelomnim modelom, javne igre odigrajte na strani arcprize.org/tasks(odpre se v novem oknu).


