Sari la conținutul principal
OpenAI

29 iulie 2026

CercetarePublicare

Cum ne-a triplat scorurile activarea a două setări în testul de performanță ARC-AGI-3

Se încarcă…

Înregistrare accelerată în care GPT‑5.6 Sol încearcă să rezolve puzzle-uri din testul de performanță ARC-AGI-3 folosind cadrul de testare oficial (stânga) și cadrul nostru bazat pe Responses API (dreapta), care păstrează raționamentul și activează compactarea. În clasamentul pentru acest joc(se deschide într-o fereastră nouă), niciun model de vârf nu mai rezolvă vreun nivel după primul. Cu cadrul nostru de testare, GPT‑5.6 Sol le rezolvă pe toate șase.

Când am văzut prima dată scorurile mici obținute de GPT‑5.6 Sol în testul de performanță ARC-AGI-3(se deschide într-o fereastră nouă), am fost nedumeriți.

GPT‑5.6 Sol a rezolvat probleme deschise de mult timp în matematică, precum conjectura acoperirii duble cu cicluri(se deschide într-o fereastră nouă), și a finalizat jocuri precum Pokémon FireRed. Dar în ARC-AGI-3, un test de performanță alcătuit din jocuri de logică 2D, GPT‑5.6 Sol a obținut doar 7,8%, iar GPT‑5.5 abia a reușit să joace, obținând un scor infim de 0,4%.

Au fost jocurile de logică 2D neobișnuit de dificile pentru modelele noastre? Sau a fost vorba despre altceva?

Testele de performanță rareori măsoară modelele IA în mod izolat. Ele măsoară și opțiuni mai puțin vizibile privind setările API-ului, proiectarea cadrului de testare și formularea solicitărilor. În cazul ARC-AGI-3, am descoperit că activarea a două setări API folosite în ChatGPT și Codex—păstrarea raționamentului și compactarea—a triplat scorurile și a redus de șase ori numărul tokenurilor de ieșire pe setul public de sarcini.

Cu cadrul de testare oficial, GPT‑5.6 Sol a obținut 13,3% pe setul public ARC-AGI-3. Cu păstrarea raționamentului și compactare, a obținut 38,3%. Scorurile măsoară Eficiența relativă a acțiunilor umane (RHAE(se deschide într-o fereastră nouă))un indicator care compară performanța modelului cu un reper uman. Pe baza jurnalelor oficiale de joc(se deschide într-o fereastră nouă), estimăm că testerul uman mediu a obținut 48%. Modelelor nu li se spune cum vor fi evaluate și nu își pot vedea scorul pe parcursacțiunile returnează doar o reprezentare textuală a fiecărui cadru și nivelul la care se află.

ARC-AGI-3

ARC-AGI-3 este un test de performanță conceput să măsoare cât de bine învață și raționează agenții IA. Agenții explorează jocuri 2D necunoscute și deduc cum funcționează fără instrucțiuni explicite. Poți juca 25 de jocuri demo la arcprize.org/tasks(se deschide într-o fereastră nouă).

ARC-AGI-3 folosește intenționat un cadru de testare generic, fără instrumente sau funcții speciale. Motivația ARC a fost că un cadru de testare simplu face deficiențele modelelor mai vizibile și comparațiile dintre modele mai echitabile. În schimb, dezvoltatorii comerciali optimizează cadrele de testare pentru funcțiile și particularitățile fiecărui model.

În jocuri, GPT‑5.6 Sol a învins Pokémon FireRed cu un cadru de testare bazat exclusiv pe vedere (în transmisiunea GPT_Plays_Pokemon(se deschide într-o fereastră nouă)), Slay the Spire folosind controlul computerului prin Codex (în transmisiunea EpochAI(se deschide într-o fereastră nouă)) și primele etape din Baba Is You (după cum au arătat Piotr Migdał & Piotr Grabowski(se deschide într-o fereastră nouă)). Ce a fost atât de diferit la ARC-AGI-3?

GPT-5.6 Sol în Codex finalizând o provocare zilnică aleatorie în Slay the Spire 2.

Ethan Mollick arată(se deschide într-o fereastră nouă) cum GPT‑5.6 Sol în Codex învinge o provocare zilnică aleatorie în Slay the Spire 2, un joc lansat după data-limită a cunoștințelor GPT‑5.6 Sol.

Pornind de la analiza ARC privind deficiențele GPT‑5.5(se deschide într-o fereastră nouă), am examinat câteva dintre încercările GPT‑5.6 Sol. La fel ca ARC, am observat că modelul nu părea prea isteț. Îi lua mult fiecare acțiune și înainta cu greu.

Dar, analizând mai atent, am descoperit că o mare parte din confuzia modelului nu îi era inerentă, ci provenea din setările cadrului de testare.

Mai întâi, am observat că după fiecare acțiune din joc era eliminat tot raționamentul privat. Astfel, la fiecare acțiune, GPT‑5.6 Sol trebuia să descifreze din nou jocul, fără să-și poată aminti ce gândise anterior. Modelul putea vedea în continuare istoricul mutărilor și scurtele note asociate, dar nu și planurile, observațiile sau gândurile care le generaseră.

În al doilea rând, am constatat că acest cadru de testare folosea o fereastră de trunchiere glisantă, astfel că acțiunile mai vechi deveneau invizibile pe măsură ce istoricul creștea. Așadar, GPT‑5.6 Sol nu doar că nu își putea aminti ce gândise anterior, ci pierdea și amintirea acțiunilor sale trecute.

Împreună, aceste două caracteristici ale cadrului de testare—eliminarea raționamentului și trunchierea glisantă—au explicat de ce GPT‑5.6 Sol învăța atât de greu în timp.

Agenții au rezultate optime când își amintesc ce au făcut

Modelele noastre sunt instruite să gândească prin mesaje private de raționament înainte de a genera răspunsuri sau apelări de instrumente. Aceste mesaje private de gândire sunt păstrate în istoricul conversației. Dacă o conversație devine prea lungă, o rezumăm și continuăm.

Diagramă care arată cum raționamentul modelului, apelările de instrumente, istoricul conversației și compactarea contextului funcționează împreună pe parcursul unei sarcini de lungă durată.

Așa sunt instruite modelele noastre și tot așa sunt implementate în ChatGPT și Codex. Pentru a reproduce mai fidel configurația noastră de producție, am implementat cadrul de testare ARC-AGI-3 folosind Responses API(se deschide într-o fereastră nouă). API-ul nostru simplifică gestionarea contextului: pentru GPT‑5.6, transmiterea ID-ului răspunsului anterior păstrează automat raționamentul între apelările de instrumente și replici.

După păstrarea raționamentului, am observat două schimbări majore. În primul rând, GPT‑5.6 Sol petrecea mai puțin timp gândind înaintea fiecărei acțiuni, deoarece nu mai trebuia să interpreteze jocul de la zero la fiecare tură. În al doilea rând, când își putea aminti gândurile anterioare, GPT‑5.6 Sol învăța mult mai bine în timp și aplica strategii coerente.

Următoarea îmbunătățire a venit din înlocuirea trunchierii glisante cu compactarea(se deschide într-o fereastră nouă), o altă setare din Responses API.

Cadrul de testare ARC-AGI-3 gestionează limitele contextului prin trunchierea glisantă. Când contextul conversației depășește 175.000 de caractere, mesajele cele mai vechi sunt eliminate.

Trunchierea glisantă are două dezavantaje. În primul rând, modelul pierde observațiile și acțiunile anterioare. În al doilea rând, modelul execută o mare parte din sarcini cu o fereastră contextuală mai încărcată, ceea ce poate reduce ușor performanța.

Când am activat compactarea în ARC-AGI-3, GPT‑5.6 Sol a reușit să păstreze mai bine, pe parcursul sesiunilor lungi, ceea ce învățase despre fiecare joc și a obținut un scor mai mare cu mai puține tokenuri de ieșire.

Pentru a ilustra efectul păstrării raționamentului și al activării compactării, iată o animație care arată fereastra contextuală de 175K a GPT‑5.6 Sol în timp ce rezolvă o serie de puzzle-uri ARC-AGI-3 cu fiecare cadru de testare.

Cele două coloane centrale arată cum este utilizată diferit fereastra contextuală a modelului de fiecare cadru de testare. Având o memorie mai bună a trecutului, GPT‑5.6 Sol se gândește mai puțin la fiecare acțiune și avansează mult mai repede. Notă: implementarea noastră folosește o limită de 175.000 de tokenuri în loc de caractere, dar rezultatul este foarte asemănător, deoarece marea majoritate a textului constă în grile de acțiuni pe care instrumentul nostru de tokenizare le transformă în tokenuri într-un raport de 1:1.

Împreună, păstrarea raționamentului și compactarea îi permit modelului GPT‑5.6 Sol (Max) să obțină un scor de aproximativ trei ori mai mare folosind de șase ori mai puține tokenuri de ieșire.

Concluzii și recomandări

Sperăm că aceste experimente ne vor reaminti că, de regulă, evaluările nu măsoară modelele în mod izolat—ele măsoară și un ansamblu de opțiuni mai puțin vizibile privind setările API-ului, proiectarea cadrului de testare și formularea solicitărilor. Nu este prima dată când ne surprind scorurile mici într-un test public de performanță, pentru ca apoi să descoperim că sistemul de evaluare folosește un cadru de testare generic care elimină mesajele de raționament.

Dacă dezvolți cu API-ul și încerci să maximizezi performanța, îți recomandăm să folosești aceleași setări pe care le implementăm în produsele noastre:

  • Folosește Responses API, nu vechiul nostru API pentru completarea discuțiilor
  • Păstrează raționamentul
  • Folosește compactarea

Iar dacă compari modele, îți recomandăm să te bazezi pe evaluările care folosesc setările de mai sus, acestea reflectând cel mai bine utilizarea reală în ChatGPT și Codex.

Îi suntem recunoscători echipei ARC pentru anii dedicați muncii creative privind evaluarea AGI și pentru analiza care ne-a inspirat să examinăm mai atent această situație.

Dacă vrei să-ți pui la încercare abilitățile în fața modelelor de vârf, încearcă și tu jocurile publice la adresa arcprize.org/tasks(se deschide într-o fereastră nouă).

Autor

Ilan Bigio, Ted Sanders