Cómo dos ajustes triplicaron nuestras puntuaciones en ARC-AGI-3
Video acelerado de GPT‑5.6 Sol intentando resolver acertijos de la prueba de referencia ARC-AGI-3 con el arnés de ejecución oficial (izquierda) y nuestro arnés de la API de Responses (derecha), que conserva el razonamiento y habilita la compactación. En la clasificación de este juego(se abre en una nueva ventana), ningún modelo de vanguardia resuelve un nivel posterior al primero. Con nuestro arnés de ejecución, GPT‑5.6 Sol resuelve los seis.
Cuando vimos por primera vez las bajas puntuaciones de GPT‑5.6 Sol en la prueba de referencia ARC-AGI-3(se abre en una nueva ventana), nos desconcertamos.
GPT‑5.6 Sol ha resuelto problemas abiertos de larga data en matemáticas, como la conjetura de la doble cobertura de ciclos(se abre en una nueva ventana), y ha superado juegos como Pokémon FireRed. Pero en ARC-AGI-3, una prueba de referencia con juegos de acertijos en 2D, GPT‑5.6 Sol obtuvo apenas 7,8 %, mientras que GPT‑5.5 apenas podía jugar y consiguió un escaso 0,4 %.
¿Eran los juegos de acertijos en 2D inusualmente difíciles para nuestros modelos? ¿O sucedía algo más?
Las pruebas de referencia rara vez miden los modelos de IA de forma aislada. También miden decisiones menos visibles sobre la configuración de la API, el diseño del arnés de ejecución y las instrucciones. En el caso de ARC-AGI-3, descubrimos que activar dos ajustes de la API que usamos en ChatGPT y Codex—el razonamiento conservado y la compactación—triplicó las puntuaciones y redujo seis veces los tokens de salida en el conjunto público de tareas.
Con el arnés de ejecución oficial, GPT‑5.6 Sol obtuvo 13,3 % en el conjunto público de ARC-AGI-3. Con razonamiento conservado y compactación, obtuvo 38,3 %. Las puntuaciones miden la eficiencia relativa de las acciones humanas (RHAE(se abre en una nueva ventana))—una métrica que compara el desempeño del modelo con una referencia humana. Según los registros oficiales de partidas(se abre en una nueva ventana), estimamos que la puntuación promedio de los participantes humanos fue del 48 %. A los modelos no se les explica cómo se los calificará y no pueden ver su puntuación durante la prueba—las acciones solo devuelven una representación textual de cada fotograma y el nivel en el que están.
ARC-AGI-3 es una prueba de referencia diseñada para medir qué tan bien aprenden y razonan los agentes de IA. Los agentes exploran juegos 2D desconocidos y deducen cómo funcionan sin instrucciones explícitas. Puedes jugar 25 juegos de demostración en arcprize.org/tasks(se abre en una nueva ventana).
ARC-AGI-3 utiliza un arnés de ejecución deliberadamente genérico, sin herramientas ni funciones especiales. El razonamiento de ARC era que un arnés de ejecución sencillo hace más visibles las deficiencias de los modelos y permite compararlos con mayor imparcialidad. En cambio, los desarrolladores comerciales optimizan los arneses de ejecución para las funciones y particularidades de cada modelo.
En el ámbito de los videojuegos, GPT‑5.6 Sol ha superado Pokémon FireRed con un arnés de ejecución basado exclusivamente en visión (como transmitió GPT_Plays_Pokemon(se abre en una nueva ventana)), Slay the Spire mediante el uso de computadoras de Codex (como transmitió EpochAI(se abre en una nueva ventana)) y las primeras etapas de Baba Is You (como compartieron Piotr Migdał & Piotr Grabowski(se abre en una nueva ventana)). ¿Qué tenía de diferente ARC-AGI-3?

Ethan Mollick muestra(se abre en una nueva ventana) a GPT‑5.6 Sol en Codex superando un desafío diario aleatorio en Slay the Spire 2, un juego lanzado después de la fecha límite de conocimientos de GPT‑5.6 Sol.
Inspirados por el análisis de ARC sobre las deficiencias de GPT‑5.5(se abre en una nueva ventana), examinamos algunos de los intentos de GPT‑5.6 Sol. Al igual que ARC, observamos que el modelo no parecía muy hábil. Dedicaba mucho tiempo a cada acción y le costaba avanzar.
Pero al examinarlo más a fondo, descubrimos que gran parte de la confusión del modelo no era inherente a este, sino que se debía a la configuración del arnés de ejecución.
Primero, notamos que después de cada acción del juego se descartaba todo el razonamiento privado. Esto significaba que, con cada acción, GPT‑5.6 Sol debía descifrar el juego desde cero, sin poder recordar lo que había pensado antes. El modelo aún podía ver un registro de los movimientos anteriores y breves notas adjuntas, pero no los planes, hallazgos ni pensamientos que habían llevado a ellos.
Segundo, vimos que el arnés de ejecución usaba una ventana de truncamiento móvil, por lo que las acciones anteriores dejaban de ser visibles a medida que crecía el historial. Así, GPT‑5.6 Sol no solo era incapaz de recordar lo que había pensado, sino que también perdía la memoria de sus acciones anteriores.
En conjunto, estas dos características del arnés de ejecución—el descarte del razonamiento y el truncamiento móvil—ayudaron a explicar por qué GPT‑5.6 Sol tenía dificultades para aprender con el tiempo.
Nuestros modelos están entrenados para pensar mediante mensajes privados de razonamiento antes de generar respuestas o llamadas a herramientas. Estos mensajes privados de pensamiento se conservan como parte del historial de conversación. Si una conversación se vuelve demasiado larga, la resumimos y continuamos.
Así se entrenan nuestros modelos y también se implementan en ChatGPT y Codex. Para reproducir mejor nuestra configuración de producción, implementamos el arnés de ejecución de ARC-AGI-3 con nuestra API de Responses(se abre en una nueva ventana). Nuestra API facilita la gestión del contexto: en GPT‑5.6, pasar el ID de la respuesta anterior conserva automáticamente el razonamiento entre llamadas a herramientas y turnos.
Al conservar el razonamiento, notamos dos cambios importantes. Primero, GPT‑5.6 Sol dedicó menos tiempo a pensar antes de cada acción, porque ya no tenía que interpretar el juego desde cero en cada turno. Segundo, al poder recordar sus pensamientos anteriores, GPT‑5.6 Sol aprendía mucho mejor con el tiempo y aplicaba estrategias coherentes.
La siguiente mejora consistió en sustituir el truncamiento móvil por la compactación(se abre en una nueva ventana), otro ajuste de la API de Responses.
El arnés de ejecución de ARC-AGI-3 gestiona los límites de contexto mediante el truncamiento móvil. Cuando el contexto de la conversación supera los 175 000 caracteres, se descartan los mensajes más antiguos.
El truncamiento móvil tiene dos desventajas. Primero, el modelo pierde observaciones y acciones anteriores. Segundo, pasa gran parte de las tareas operando con una ventana de contexto más llena, lo que puede reducir ligeramente el desempeño.
Cuando habilitamos la compactación en ARC-AGI-3, GPT‑5.6 Sol pudo conservar mejor lo aprendido sobre cada juego durante ejecuciones más largas y logró una puntuación mayor con menos tokens de salida.
Para ilustrar el efecto de conservar el razonamiento y habilitar la compactación, esta animación muestra la ventana de contexto de 175 000 tokens de GPT‑5.6 Sol mientras resuelve una serie de acertijos de ARC-AGI-3 con cada arnés de ejecución.
Las dos columnas centrales muestran cómo cada arnés de ejecución utiliza de manera diferente la ventana de contexto del modelo. Al recordar mejor su actividad anterior, GPT‑5.6 Sol piensa menos en cada acción y avanza mucho más rápido. Nota: nuestra implementación usa un límite de 175 000 tokens en lugar de caracteres, pero el resultado es muy similar, ya que la gran mayoría del texto corresponde a cuadrículas de acciones que nuestro tokenizador convierte en tokens en una proporción de 1:1.
En conjunto, conservar el razonamiento y usar la compactación permiten que GPT‑5.6 Sol (Max) logre aproximadamente el triple de puntuación con seis veces menos tokens de salida.
Esperamos que estos experimentos sirvan para recordar que las evaluaciones rara vez miden los modelos de forma aislada: también miden un conjunto de decisiones menos visibles sobre la configuración de la API, el diseño del arnés de ejecución y las instrucciones. No es la primera vez que nos sorprenden las bajas puntuaciones de una prueba de referencia pública y luego descubrimos que el sistema de evaluación usaba un arnés de ejecución genérico que descartaba los mensajes de razonamiento.
Si desarrollas con nuestra API y buscas maximizar el desempeño, recomendamos usar los mismos ajustes que implementamos en nuestros productos:
- Usa nuestra API de Responses, no nuestra API para completar chats heredada
- Conserva el razonamiento
- Usa la compactación
Y si comparas modelos, recomendamos basarte en evaluaciones que usen los ajustes anteriores, pues son los que mejor representan el uso real en ChatGPT y Codex.
Agradecemos a ARC sus años de trabajo creativo en la evaluación de la IAG y el análisis que nos inspiró a examinar este tema más de cerca.
Si quieres poner a prueba tus habilidades frente a modelos de vanguardia, juega los juegos públicos en arcprize.org/tasks(se abre en una nueva ventana).


