Pāriet uz galveno saturu
OpenAI

2026. gada 29. jūlijs

IzpētePublikācija

Kā divu iestatījumu ieslēgšana trīskāršoja mūsu rezultātu ARC-AGI-3 etalonā

Notiek ielāde…

Paātrināts video, kurā GPT‑5.6 Sol mēģina atrisināt ARC-AGI-3 etalona mīklas ar oficiālo izpildes ietvaru (pa kreisi) un mūsu Responses API izpildes ietvaru (pa labi), kas saglabā spriestspēju un iespējo konteksta saspiešanu. Šīs spēles(atveras jaunā logā) rezultātu tabulā neviens robežšķirtnes modelis netiek tālāk par pirmo līmeni. Ar mūsu izpildes ietvaru GPT‑5.6 Sol atrisina visus sešus līmeņus.

Kad pirmoreiz ieraudzījām GPT‑5.6 Sol zemos rezultātus ARC-AGI-3(atveras jaunā logā) etalonā, bijām neizpratnē.

GPT‑5.6 Sol ir atrisinājis tādas ilgstoši neatrisinātas matemātikas problēmas kā ciklu dubultā pārklājuma hipotēze(atveras jaunā logā) un pieveicis tādas spēles kā Pokémon FireRed. Taču 2D mīklu spēļu etalonā ARC-AGI-3 GPT‑5.6 Sol ieguva tikai 7,8%, bet GPT‑5.5 tikpat kā nespēja spēlēt un ieguva nieka 0,4%.

Vai 2D mīklu spēles mūsu modeļiem bija neparasti sarežģītas? Vai arī iemesls bija cits?

Etaloni reti mēra MI modeļus izolēti. Tie mēra arī mazāk pamanāmas izvēles saistībā ar API iestatījumiem, izpildes ietvara uzbūvi un uzvednēm. ARC-AGI-3 gadījumā atklājām, ka divu ChatGPT un Codex izmantotu API iestatījumu—saglabātas spriestspējas un konteksta saspiešanas—ieslēgšana publiskajā uzdevumu kopā trīskāršoja rezultātu un sešas reizes samazināja izvades marķieru skaitu.

Ar oficiālo izpildes ietvaru GPT‑5.6 Sol ARC-AGI-3 publiskajā kopā ieguva 13,3%. Saglabājot spriestspēju un izmantojot konteksta saspiešanu, tas ieguva 38,3%. Rezultātus mēra pēc relatīvās cilvēka darbību efektivitātes (RHAE(atveras jaunā logā))metrikas, kas modeļa veiktspēju salīdzina ar cilvēka atskaites līmeni. Pamatojoties uz oficiālajiem spēļu žurnāliem(atveras jaunā logā), lēšam, ka cilvēki testos vidēji ieguva 48%. Modeļiem netiek izpausts, kā tos vērtēs, un tie procesa gaitā neredz savu rezultātupēc katras darbības tie saņem tikai kadra teksta attēlojumu un pašreizējā līmeņa numuru.

ARC-AGI-3

ARC-AGI-3 ir etalons, kas paredzēts MI aģentu mācīšanās un spriestspējas novērtēšanai. Aģenti bez skaidriem norādījumiem izpēta nepazīstamas 2D spēles un izsecina to darbības principus. Vietnē arcprize.org/tasks(atveras jaunā logā) varat izmēģināt 25 demonstrācijas spēles.

ARC-AGI-3 apzināti izmanto universālu izpildes ietvaru bez rīkiem un īpašām funkcijām. ARC uzskatīja, ka vienkāršs izpildes ietvars skaidrāk atklāj modeļu trūkumus un ļauj tos salīdzināt taisnīgāk. Savukārt komerciālie izstrādātāji izpildes ietvarus optimizē katra modeļa funkcijām un īpatnībām.

Spēļu jomā GPT‑5.6 Sol ir pieveicis Pokémon FireRed, izmantojot tikai redzi apstrādājošu izpildes ietvaru (kā straumēja GPT_Plays_Pokemon(atveras jaunā logā)), Slay the Spire, izmantojot Codex datora vadību (kā straumēja EpochAI(atveras jaunā logā)), un Baba Is You pirmos posmus (kā parādīja Pjotrs Migdaļs un Pjotrs Grabovskis(atveras jaunā logā)). Ar ko ARC-AGI-3 tik ļoti atšķīrās?

GPT-5.6 Sol platformā Codex izpilda nejaušinātu dienas izaicinājumu spēlē Slay the Spire 2.

Ītans Moliks demonstrē(atveras jaunā logā), kā GPT‑5.6 Sol platformā Codex pieveic nejaušinātu dienas izaicinājumu spēlē Slay the Spire 2, kas izlaista pēc GPT‑5.6 Sol zināšanu robeždatuma.

Iedvesmojoties no ARC veiktās GPT‑5.5 trūkumu analīzes(atveras jaunā logā), mēs izpētījām dažus GPT‑5.6 Sol mēģinājumus. Tāpat kā ARC, arī mēs redzējām, ka modelis nešķita īpaši attapīgs. Tas ilgi kavējās pie katras darbības un ar grūtībām virzījās uz priekšu.

Taču, izpētot situāciju dziļāk, atklājām, ka lielu daļu modeļa apjukuma izraisīja nevis pats modelis, bet izpildes ietvara iestatījumi.

Vispirms ievērojām, ka pēc katras spēles darbības visa privātā spriestspēja tika atmesta. Tādēļ pēc katras darbības GPT‑5.6 Sol spēle bija jāizprot no jauna, jo tas nespēja atcerēties iepriekšējo domāšanas gaitu. Modelis joprojām redzēja iepriekšējo gājienu ierakstu un īsas piezīmes, taču neredzēja plānus, atziņas vai domas, kas pie tiem bija novedušas.

Otrkārt, redzējām, ka izpildes ietvars izmantoja slīdošu slīdošu logu, kura dēļ, vēsturei augot, senākās darbības vairs nebija redzamas. Tādējādi GPT‑5.6 Sol ne vien nespēja atcerēties iepriekšējo domāšanas gaitu, bet arī zaudēja atmiņas par savām iepriekšējām darbībām.

Šīs abas izpildes ietvara īpašības—spriestspējas atmešana un slīdošā saīsināšana—kopā palīdzēja izskaidrot, kāpēc GPT‑5.6 Sol laika gaitā bija grūti mācīties.

Aģenti darbojas vislabāk, ja atceras paveikto

Mūsu modeļi ir apmācīti pirms atbilžu vai rīku izsaukumu izvades domāt, izmantojot privātus spriestspējas ziņojumus. Šie privātās domāšanas ziņojumi tiek saglabāti sarunas vēsturē. Ja saruna kļūst pārāk gara, mēs to apkopojam un turpinām.

Shēma, kurā parādīts, kā ilgstoša uzdevuma gaitā mijiedarbojas modeļa spriestspēja, rīku izsaukumi, sarunas vēsture un konteksta saspiešana.

Šādi mūsu modeļi tiek gan apmācīti, gan izmantoti ChatGPT un Codex. Lai precīzāk atspoguļotu mūsu produkcijas vides konfigurāciju, ARC-AGI-3 izpildes ietvaru ieviesām ar mūsu Responses API(atveras jaunā logā). Mūsu API atvieglo konteksta pārvaldību: GPT‑5.6 gadījumā iepriekšējās atbildes ID nodošana automātiski saglabā spriestspēju starp rīku izsaukumiem un sarunas kārtām.

Saglabājot spriestspēju, pamanījām divas būtiskas pārmaiņas. Pirmkārt, GPT‑5.6 Sol pirms katras darbības domāja īsāku laiku, jo tam vairs nevajadzēja katrā gājienā spēli izprast no jauna. Otrkārt, spējot atcerēties iepriekšējās domas, GPT‑5.6 Sol laika gaitā mācījās daudz labāk un izmantoja saskaņotas stratēģijas.

Nākamo uzlabojumu panācām, slīdošo saīsināšanu aizstājot ar konteksta saspiešanu(atveras jaunā logā)—vēl vienu Responses API iestatījumu.

ARC-AGI-3 izpildes ietvars konteksta ierobežojumus risina ar slīdošo saīsināšanu. Kad sarunas konteksts pārsniedz 175 000 rakstzīmju, senākie ziņojumi tiek atmesti.

Slīdošajai saīsināšanai ir divi trūkumi. Pirmkārt, modelis zaudē agrākos novērojumus un darbības. Otrkārt, lielu uzdevuma daļu tas veic ar vairāk aizpildītu konteksta logu, kas var nedaudz pasliktināt veiktspēju.

Kad ARC-AGI-3 iespējojām konteksta saspiešanu, GPT‑5.6 Sol ilgākās izpildēs labāk saglabāja par katru spēli apgūto un sasniedza augstāku rezultātu ar mazāku izvades marķieru skaitu.

Lai ilustrētu saglabātas spriestspējas un konteksta saspiešanas ietekmi, piedāvājam animāciju, kurā redzams GPT‑5.6 Sol 175 tūkst. marķieru konteksta logs, tam ar katru izpildes ietvaru risinot virkni ARC-AGI-3 mīklu.

Abās centrālajās slejās parādīts, kā katrs izpildes ietvars atšķirīgi izmanto modeļa konteksta logu. Labāk atceroties iepriekš notikušo, GPT‑5.6 Sol pirms katras darbības domā mazāk un virzās uz priekšu daudz ātrāk. Piezīme: mūsu risinājumā rakstzīmju vietā izmantots 175 000 marķieru ierobežojums, taču praksē tie ir visai līdzīgi, jo lielāko teksta daļu veido darbību režģi, kurus mūsu marķierizētājs sadala marķieros attiecībā 1:1.

Saglabāta spriestspēja kopā ar konteksta saspiešanu ļauj GPT‑5.6 Sol (Max) sasniegt aptuveni trīsreiz augstāku rezultātu ar sešreiz mazāk izvades marķieriem.

Secinājumi un ieteikumi

Ceram, ka šie eksperimenti atgādinās: novērtējumi reti mēra modeļus izolēti—tie mēra arī mazāk pamanāmu izvēļu kopumu, kas saistīts ar API iestatījumiem, izpildes ietvara uzbūvi un uzvednēm. Šī nav pirmā reize, kad mūs pārsteiguši zemi rezultāti publiskā etalonā un pēc tam esam atklājuši, ka novērtēšanas rīks izmanto universālu izpildes ietvaru, kurš atmet spriestspējas ziņojumus.

Ja esat API izstrādātājs un vēlaties maksimālu veiktspēju, iesakām izmantot tos pašus iestatījumus, kurus lietojam savos produktos:

  • Izmantojiet mūsu Responses API, nevis mantoto tērzēšanas pabeigšanas API
  • Saglabājiet spriestspēju
  • Izmantojiet konteksta saspiešanu

Ja salīdzināt modeļus, iesakām paļauties uz novērtējumiem, kuros izmantoti iepriekš minētie iestatījumi, jo tie visprecīzāk atbilst reālajam lietojumam ChatGPT un Codex.

Pateicamies ARC par daudzu gadu radošo darbu AGI novērtēšanas jomā un par analīzi, kas mūs pamudināja šo jautājumu izpētīt rūpīgāk.

Ja vēlaties pārbaudīt savas spējas salīdzinājumā ar robežšķirtnes modeļiem, izmēģiniet publiskās spēles vietnē arcprize.org/tasks(atveras jaunā logā).

Autors

Ilan Bigio un Ted Sanders