Salta al contingut principal
OpenAI

29 de juliol del 2026

RecercaPublicació

Com activar dos paràmetres va triplicar la puntuació a l'índex de referència ARC-AGI-3

S'està carregant…

Vídeo accelerat de GPT‑5.6 Sol intentant resoldre trencaclosques de índex de referència ARC-AGI-3, amb l'entorn d'execució oficial (esquerra) i el nostre entorn basat en l'API Responses (dreta), que conserva el raonament i activa la condensació de context. A la classificació d'aquest joc(s'obre en una finestra nova), cap model d'avantguarda supera cap nivell més enllà del primer. Amb el nostre entorn d'execució, GPT‑5.6 Sol resol tots sis nivells.

Quan vam veure per primera vegada les baixes puntuacions de GPT‑5.6 Sol a l'índex de referència ARC-AGI-3(s'obre en una finestra nova), ens vam quedar desconcertats.

GPT‑5.6 Sol ha resolt problemes matemàtics oberts des de fa molt de temps, com la conjectura de la doble cobertura per cicles(s'obre en una finestra nova), i ha superat jocs com Pokémon FireRed. Però a ARC-AGI-3, un índex de referència format per trencaclosques en 2D, GPT‑5.6 Sol només va obtenir un 7,8 %, mentre que GPT‑5.5 gairebé ni podia jugar-hi i va aconseguir un escàs 0,4 %.

Els trencaclosques en 2D eren especialment difícils per als nostres models? O hi havia algun altre factor?

Els índexs de referència rarament mesuren els models d'IA de manera aïllada. També mesuren decisions menys visibles sobre la configuració de l'API, el disseny de l'entorn d'execució i les instruccions. En el cas d'ARC-AGI-3, vam descobrir que activar dos paràmetres de l'API que fem servir a ChatGPT i Codex—el raonament conservat i la condensació de context—triplicava la puntuació i reduïa a una sisena part els segments textuals de sortida en el conjunt públic de tasques.

Amb l'entorn d'execució oficial, GPT‑5.6 Sol va obtenir un 13,3 % en el conjunt públic d'ARC-AGI-3. Amb el raonament conservat i la condensació de context, va obtenir un 38,3 %. Les puntuacions mesuren l'eficiència relativa de les accions humanes (RHAE(s'obre en una finestra nova)), una mètrica que compara el rendiment del model amb una referència humana. A partir dels registres oficials de les partides(s'obre en una finestra nova), estimem que els participants humans van obtenir de mitjana un 48 %. Als models no se'ls explica com es calcularà la puntuació i no poden veure-la durant la prova, les accions només retornen una representació textual de cada fotograma i el nivell on són.

ARC-AGI-3

ARC-AGI-3 és un índex de referència dissenyat per mesurar fins a quin punt els agents d'IA aprenen i raonen. Els agents exploren jocs en 2D desconeguts i dedueixen com funcionen sense instruccions explícites. Pots jugar a 25 jocs de demostració a arcprize.org/tasks(s'obre en una finestra nova).

ARC-AGI-3 utilitza intencionadament un entorn d'execució genèric, sense eines ni funcions especials. El raonament d'ARC era que un entorn d'execució senzill fa més visibles les mancances dels models i permet comparar-los de manera més justa. En canvi, els desenvolupadors comercials optimitzen els entorns d'execució per adaptar-los a les funcions i peculiaritats de cada model.

En l'àmbit dels videojocs, GPT‑5.6 Sol ha superat Pokémon FireRed amb un entorn d'execució basat exclusivament en la visió (en una retransmissió de GPT_Plays_Pokemon(s'obre en una finestra nova)), Slay the Spire mitjançant l'ús d'ordinador de Codex (en una retransmissió d'EpochAI(s'obre en una finestra nova)) i les primeres fases de Baba Is You (com van compartir Piotr Migdał i Piotr Grabowski(s'obre en una finestra nova)). Què tenia de tan diferent ARC-AGI-3?

GPT-5.6 Sol a Codex completa un repte diari aleatori a Slay the Spire 2.

Ethan Mollick mostra(s'obre en una finestra nova) com GPT‑5.6 Sol a Codex supera un repte diari aleatori a Slay the Spire 2, un joc publicat després de la data límit de coneixement de GPT‑5.6 Sol.

Inspirats per l'anàlisi d'ARC sobre les mancances de GPT‑5.5(s'obre en una finestra nova), vam examinar alguns dels intents de GPT‑5.6 Sol. Com ARC, vam observar que el model no semblava gaire espavilat. Dedicava molt de temps a cada acció i li costava avançar.

Però, en aprofundir-hi, vam descobrir que bona part de la confusió del model no era inherent al model mateix, sinó que es devia a la configuració de l'entorn d'execució.

Primer, vam observar que després de cada acció del joc es descartava tot el raonament privat. Això volia dir que, amb cada acció, GPT‑5.6 Sol havia de tornar a desxifrar el joc des de zero, sense poder recordar què havia pensat abans. El model encara podia veure un registre dels moviments anteriors i unes notes breus, però no els plans, les deduccions ni els pensaments que hi havien conduït.

En segon lloc, vam veure que l'entorn d'execució utilitzava una finestra de truncament mòbil, de manera que les accions més antigues deixaven de ser visibles a mesura que creixia l'historial. Per tant, GPT‑5.6 Sol no només era incapaç de recordar què havia pensat abans, sinó que també anava perdent el record de les seves accions anteriors.

Aquestes dues característiques de l'entorn d'execució—el descart del raonament i el truncament mòbil—ajudaven a explicar per què a GPT‑5.6 Sol li costava aprendre amb el temps.

Els agents rendeixen millor quan recorden què han fet

Els nostres models estan entrenats per pensar mitjançant missatges de raonament privat abans de generar respostes o crides a eines. Aquests missatges de pensament privat es conserven com a part de l'historial de la conversa. Si una conversa s'allarga massa, la resumim i continuem.

Diagrama que mostra com el raonament del model, les crides a eines, l'historial de la conversa i la condensació de context funcionen conjuntament al llarg d'una tasca prolongada.

Així és com entrenem els nostres models i també com els despleguem a ChatGPT i Codex. Per reproduir millor la nostra configuració de producció, vam implementar l'entorn d'execució d'ARC-AGI-3 amb la nostra API Responses(s'obre en una finestra nova). La nostra API facilita la gestió del context: amb GPT‑5.6, passar l'identificador de la resposta anterior conserva automàticament el raonament entre crides a eines i torns.

En conservar el raonament, vam observar dos grans canvis. En primer lloc, GPT‑5.6 Sol dedicava menys temps a pensar abans de cada acció, perquè ja no havia d'interpretar el joc des de zero a cada torn. En segon lloc, quan podia recordar els seus pensaments anteriors, GPT‑5.6 Sol aprenia molt millor amb el temps i aplicava estratègies coherents.

La millora següent va arribar en substituir el truncament mòbil per la condensació de context(s'obre en una finestra nova), un altre paràmetre de l'API Responses.

L'entorn d'execució d'ARC-AGI-3 gestiona els límits de context mitjançant el truncament mòbil. Quan el context de la conversa supera els 175.000 caràcters, es descarten els missatges més antics.

El truncament mòbil té dos inconvenients. En primer lloc, el model perd les observacions i accions anteriors. En segon lloc, passa bona part de les tasques treballant amb una finestra de context més plena, fet que pot reduir lleugerament el rendiment.

Quan vam activar la condensació de context a ARC-AGI-3, GPT‑5.6 Sol va poder conservar millor el que havia après sobre cada joc durant execucions més llargues i va aconseguir una puntuació superior amb menys segments textuals de sortida.

Per il·lustrar l'efecte de conservar el raonament i activar la condensació de context, aquesta animació mostra com GPT‑5.6 Sol utilitza la seva finestra de context de 175K mentre resol una sèrie de trencaclosques d'ARC-AGI-3 amb cada entorn d'execució.

Les dues columnes centrals mostren com cada entorn d'execució utilitza de manera diferent la finestra de context del model. Com que recorda millor el passat, GPT‑5.6 Sol pensa menys en cada acció i avança molt més de pressa. Nota: la nostra implementació utilitza un límit de 175.000 segments textuals en lloc de caràcters, però el resultat és força semblant, ja que la gran majoria del text són quadrícules d'accions que el nostre segmentador converteix en segments textuals amb una proporció d'1:1.

En conjunt, conservar el raonament i aplicar la condensació de context permet que GPT‑5.6 Sol (Max) obtingui aproximadament el triple de puntuació amb una sisena part dels segments textuals de sortida.

Conclusions i recomanacions

Esperem que aquests experiments ens recordin que les avaluacions rarament mesuren els models de manera aïllada: també mesuren un conjunt de decisions menys visibles sobre la configuració de l'API, el disseny de l'entorn d'execució i les instruccions. No és la primera vegada que ens sorprenen unes puntuacions baixes en un índex de referència públic i després descobrim que el sistema d'avaluació utilitzava un entorn d'execució genèric que descartava els missatges de raonament.

Si desenvolupes amb l'API i vols maximitzar el rendiment, et recomanem que utilitza la mateixa configuració que despleguem als nostres productes:

  • Utilitza l'API Responses, no l'antiga API de complecions de xat
  • Conserva el raonament
  • Utilitza la condensació de context

I, si compares models, et recomanem que et basis en avaluacions que utilitzin la configuració anterior, que és la que reprodueix millor l'ús real a ChatGPT i Codex.

Agraïm a ARC els seus anys de treball creatiu en l'avaluació de l'AGI i l'anàlisi que ens va inspirar a examinar aquesta qüestió més de prop.

Si vols posar-te a prova contra models d'avantguarda, pots provar els jocs públics a arcprize.org/tasks(s'obre en una finestra nova).

Autor

Ilan Bigio i Ted Sanders