Preskočite na glavni sadržaj
OpenAI

Kako smo uključivanjem dvije postavke utrostručili rezultat na testu ARC-AGI-3

Učitavanje…

Ubrzani video pokušaja modela GPT‑5.6 Sol da riješi zagonetke u testu ARC-AGI-3, sa službenim harnessom (lijevo) i našim harnessom za Responses API (desno), koji zadržava rezonovanje i uključuje kompakciju. Na rang-listi za ovu igru(otvara se u novom prozoru) nijedan granični model ne uspijeva riješiti nivoe nakon prvog. Uz naš harness, GPT‑5.6 Sol rješava svih šest.

Kada smo prvi put vidjeli niske rezultate modela GPT‑5.6 Sol na testu ARC-AGI-3(otvara se u novom prozoru), bili smo zbunjeni.

GPT‑5.6 Sol riješio je dugogodišnje otvorene matematičke probleme poput hipoteze o dvostrukom pokrivanju ciklusima(otvara se u novom prozoru) i savladao igre poput Pokémon FireRed. Međutim, na ARC-AGI-3, testu sastavljenom od 2D logičkih igara, GPT‑5.6 Sol ostvario je samo 7,8%, dok je GPT‑5.5 jedva uspijevao igrati i ostvario skromnih 0,4%.

Jesu li 2D logičke igre bile neobično teške za naše modele? Ili se dešavalo nešto drugo?

Testovi rijetko mjere AI modele zasebno od svega ostalog. Oni mjere i manje vidljive odluke o postavkama API-ja, dizajnu harnessa i formulisanju upita. U slučaju ARC-AGI-3 otkrili smo da su dvije API postavke koje koristimo u proizvodima ChatGPT i Codex—zadržano rezonovanje i kompakcija—utrostručile rezultate i šest puta smanjile broj izlaznih tokena na javnom skupu zadataka.

Uz službeni harness, GPT‑5.6 Sol ostvario je 13,3% na javnom skupu ARC-AGI-3. Uz zadržano rezonovanje i kompakciju ostvario je 38,3%. Rezultati mjere relativnu efikasnost ljudskih radnji (RHAE(otvara se u novom prozoru))metrikom koja poredi performanse modela s ljudskim referentnim rezultatom. Na osnovu službenih zapisa igranja(otvara se u novom prozoru) procjenjujemo da su ispitanici u prosjeku ostvarili 48%. Modelima nije rečeno kako će se bodovati i tokom igre ne mogu vidjeti svoj rezultatradnje vraćaju samo tekstualni prikaz svakog kadra i nivoa na kojem se nalaze.

ARC-AGI-3

ARC-AGI-3 je test osmišljen za mjerenje sposobnosti AI agenata da uče i rezonuju. Agenti istražuju nepoznate 2D igre i bez izričitih uputa zaključuju kako one funkcionišu. Možete odigrati 25 demonstracijskih igara na arcprize.org/tasks(otvara se u novom prozoru).

ARC-AGI-3 namjerno koristi generički harness, bez alata ili posebnih funkcija. ARC je smatrao da jednostavan harness jasnije otkriva nedostatke modela i omogućava pravednije poređenje modela. Komercijalni programeri, nasuprot tome, optimizuju harnesse prema funkcijama i posebnostima svakog modela.

Kada je riječ o igrama, GPT‑5.6 Sol savladao je Pokémon FireRed uz harness koji koristi samo vizuelne podatke (prijenos kanala GPT_Plays_Pokemon(otvara se u novom prozoru)), Slay the Spire koristeći Codex za upravljanje računarom (prijenos kanala EpochAI(otvara se u novom prozoru)) i prve nivoe igre Baba Is You (što su objavili Piotr Migdał & Piotr Grabowski(otvara se u novom prozoru)). Po čemu je ARC-AGI-3 bio toliko drugačiji?

GPT-5.6 Sol u Codexu završava nasumično generisani dnevni izazov u igri Slay the Spire 2.

Ethan Mollick prikazuje(otvara se u novom prozoru) kako GPT‑5.6 Sol u Codexu savladava nasumično generisani dnevni izazov u igri Slay the Spire 2, objavljenoj nakon krajnjeg datuma znanja modela GPT‑5.6 Sol.

Potaknuti ARC-ovom analizom nedostataka modela GPT‑5.5(otvara se u novom prozoru), pregledali smo neke od pokušaja modela GPT‑5.6 Sol. Kao i ARC, primijetili smo da model nije djelovao naročito sposobno. Dugo je razmatrao svaku radnju i teško je napredovao.

Međutim, detaljnijim pregledom otkrili smo da velik dio njegove zbunjenosti nije bio svojstven samom modelu, nego je proizlazio iz postavki harnessa.

Prvo smo primijetili da se nakon svake radnje u igri odbacuje cjelokupno privatno rezonovanje. To je značilo da je GPT‑5.6 Sol nakon svake radnje morao iznova shvatati igru, bez mogućnosti da se prisjeti prethodnog razmišljanja. Model je i dalje mogao vidjeti zapis prethodnih poteza i kratke prateće bilješke, ali ne i planove, uvide ili misli koji su do njih doveli.

Drugo, vidjeli smo da harness koristi klizni prozor za skraćivanje, zbog kojeg starije radnje postaju nevidljive kako historija raste. Dakle, GPT‑5.6 Sol ne samo da se nije mogao prisjetiti prethodnog razmišljanja nego je gubio i sjećanje na ranije radnje.

Te dvije karakteristike harnessa—odbacivanje rezonovanja i klizno skraćivanje—zajedno su objasnile zašto je GPT‑5.6 Sol teško učio tokom vremena.

Agenti su najuspješniji kada pamte šta su uradili

Naši modeli obučeni su da koriste privatne poruke rezonovanja prije nego što generišu odgovore ili pozive alata. Te privatne poruke razmišljanja zadržavaju se kao dio historije razgovora. Ako razgovor postane predug, sažimamo ga i nastavljamo.

Dijagram koji prikazuje kako rezonovanje modela, pozivi alata, historija razgovora i kompakcija zajedno funkcionišu tokom dugotrajnog zadatka.

Naši modeli se tako obučavaju, a tako su i implementirani u proizvodima ChatGPT i Codex. Kako bismo se bolje uskladili s produkcijskim okruženjem, implementirali smo harness za ARC-AGI-3 pomoću našeg Responses API-ja(otvara se u novom prozoru). Naš API olakšava upravljanje kontekstom: za GPT‑5.6 prosljeđivanje ID-a prethodnog odgovora automatski zadržava rezonovanje između poziva alata i krugova razgovora.

Kada smo zadržali rezonovanje, primijetili smo dvije velike promjene. Prvo, GPT‑5.6 Sol je prije svake radnje trošio manje vremena na razmišljanje jer više nije morao u svakom krugu iznova tumačiti igru. Drugo, kada je mogao pamtiti prethodne misli, GPT‑5.6 Sol je s vremenom mnogo bolje učio i primjenjivao dosljedne strategije.

Sljedeće poboljšanje postigli smo zamjenom kliznog skraćivanja kompakcijom(otvara se u novom prozoru), još jednom postavkom u Responses API-ju.

Harness za ARC-AGI-3 ograničenja konteksta rješava kliznim skraćivanjem. Kada kontekst razgovora premaši 175.000 znakova, najstarije poruke se odbacuju.

Klizno skraćivanje ima dva nedostatka. Prvo, model gubi ranija zapažanja i radnje. Drugo, velik dio zadatka izvršava s punijim kontekstnim prozorom, što može blago umanjiti performanse.

Kada smo uključili kompakciju na ARC-AGI-3, GPT‑5.6 Sol je tokom dužih izvođenja bolje čuvao ono što je naučio o svakoj igri te je ostvario bolji rezultat uz manje izlaznih tokena.

Kako bismo prikazali učinak zadržavanja rezonovanja i uključivanja kompakcije, slijedi animacija kontekstnog prozora od 175K modela GPT‑5.6 Sol dok pomoću svakog harnessa rješava niz zagonetki ARC-AGI-3.

Dvije središnje kolone prikazuju kako svaki harness drugačije koristi kontekstni prozor modela. Zahvaljujući boljem pamćenju prethodnih radnji, GPT‑5.6 Sol kraće razmišlja o svakoj radnji i napreduje mnogo brže. Napomena: naša implementacija koristi ograničenje od 175.000 tokena umjesto znakova, ali rezultat je vrlo sličan jer veliku većinu teksta čine mreže radnji, koje naš tokenizator tokenizira u omjeru 1:1.

Zadržavanje rezonovanja i kompakcija zajedno omogućavaju modelu GPT‑5.6 Sol (Max) da ostvari približno tri puta bolji rezultat uz šest puta manje izlaznih tokena.

Zaključak i preporuke

Nadamo se da će ovi eksperimenti poslužiti kao podsjetnik da evaluacije rijetko mjere modele zasebno od svega ostalog—one mjere i skup manje vidljivih odluka o postavkama API-ja, dizajnu harnessa i formulisanju upita. Ovo nije prvi put da su nas iznenadili niski rezultati na javnom testu, nakon čega smo otkrili da program za evaluaciju koristi generički harness koji odbacuje poruke rezonovanja.

Ako ste API programer i želite maksimalne performanse, preporučujemo iste postavke koje koristimo u vlastitim proizvodima:

  • Koristite naš Responses API, a ne naslijeđeni API za dovršavanje razgovora
  • Zadržite rezonovanje
  • Koristite kompakciju

Ako poredite modele, preporučujemo da se oslonite na evaluacije koje koriste navedene postavke jer one najbolje odgovaraju stvarnoj upotrebi u proizvodima ChatGPT i Codex.

Zahvalni smo ARC-u na dugogodišnjem kreativnom radu na evaluaciji AGI-ja i na analizi koja nas je potaknula da ovo detaljnije istražimo.

Ako želite odmjeriti vlastite sposobnosti s graničnim modelima, isprobajte javne igre na arcprize.org/tasks(otvara se u novom prozoru).

Autor

Ilan Bigio i Ted Sanders