Ir al contenido principal
OpenAI

29 de julio de 2026

InvestigaciónPublicación

Cómo activar dos ajustes triplicó nuestra puntuación en la prueba ARC-AGI-3

Cargando…

Vídeo acelerado de GPT‑5.6 Sol intentando resolver rompecabezas de la prueba ARC-AGI-3 con el arnés oficial (izquierda) y nuestro arnés de la API Responses (derecha), que conserva el razonamiento y aplica la compactación. En la clasificación de este juego(se abre en una ventana nueva), ningún modelo de vanguardia supera niveles posteriores al primero. Con nuestro arnés, GPT‑5.6 Sol resuelve los seis.

Cuando vimos por primera vez las bajas puntuaciones de GPT‑5.6 Sol en la prueba ARC-AGI-3(se abre en una ventana nueva), nos quedamos desconcertados.

GPT‑5.6 Sol ha resuelto problemas matemáticos abiertos desde hace mucho tiempo, como la conjetura de la doble cobertura de ciclos(se abre en una ventana nueva), y ha superado juegos como Pokémon FireRed. Sin embargo, en ARC-AGI-3, una prueba basada en juegos de rompecabezas en 2D, GPT‑5.6 Sol obtuvo apenas un 7,8 %, y GPT‑5.5 apenas podía jugar, con un exiguo 0,4 %.

¿Eran los juegos de rompecabezas en 2D especialmente difíciles para nuestros modelos? ¿O sucedía algo más?

Las pruebas rara vez miden los modelos de IA de forma aislada. También miden decisiones menos visibles sobre la configuración de la API, el diseño del arnés y las instrucciones. En el caso de ARC-AGI-3, descubrimos que activar dos ajustes de la API que utilizamos en ChatGPT y Codex—conservar el razonamiento y aplicar la compactación—triplicaba las puntuaciones y reducía seis veces los tokens de salida en el conjunto público de tareas.

Con el arnés oficial, GPT‑5.6 Sol obtuvo un 13,3 % en el conjunto público de ARC-AGI-3. Al conservar el razonamiento y aplicar la compactación, obtuvo un 38,3 %. Las puntuaciones miden la eficiencia relativa de las acciones humanas (RHAE(se abre en una ventana nueva)), métrica que compara el rendimiento del modelo con una referencia humana. Según los registros oficiales de partidas(se abre en una ventana nueva), estimamos que la puntuación media de los evaluadores humanos fue del 48 %. A los modelos no se les explica cómo se los puntuará y no pueden ver su puntuación durante la prueba: las acciones solo devuelven una representación textual de cada fotograma y el nivel en el que se encuentran.

ARC-AGI-3

ARC-AGI-3 es una prueba diseñada para medir la capacidad de los agentes de IA para aprender y razonar. Los agentes exploran juegos en 2D desconocidos y deducen cómo funcionan sin instrucciones explícitas. Puedes jugar a 25 juegos de demostración en arcprize.org/tasks(se abre en una ventana nueva).

ARC-AGI-3 utiliza deliberadamente un arnés genérico, sin herramientas ni funciones especiales. ARC consideró que un arnés sencillo permite ver mejor las limitaciones de los modelos y compararlos de forma más justa. En cambio, los desarrolladores comerciales optimizan los arneses para las funciones y particularidades de cada modelo.

En el ámbito de los videojuegos, GPT‑5.6 Sol ha superado Pokémon FireRed con un arnés basado exclusivamente en visión, como retransmitió GPT_Plays_Pokemon(se abre en una ventana nueva); Slay the Spire mediante el uso del ordenador con Codex, como retransmitió EpochAI(se abre en una ventana nueva); y las primeras fases de Baba Is You, como compartieron Piotr Migdał y Piotr Grabowski(se abre en una ventana nueva). ¿Qué tenía ARC-AGI-3 de diferente?

GPT-5.6 Sol en Codex completa un desafío diario aleatorio en Slay the Spire 2.

Ethan Mollick muestra(se abre en una ventana nueva) cómo GPT‑5.6 Sol en Codex supera un desafío diario aleatorio en Slay the Spire 2, un juego publicado después de la fecha límite de conocimiento de GPT‑5.6 Sol.

A partir del análisis de ARC sobre las limitaciones de GPT‑5.5(se abre en una ventana nueva), examinamos algunos de los intentos de GPT‑5.6 Sol. Al igual que ARC, observamos que el modelo no parecía demasiado espabilado. Dedicaba mucho tiempo a cada acción y apenas lograba avanzar.

Sin embargo, al profundizar, descubrimos que gran parte de la confusión del modelo no era inherente a este, sino que se debía a la configuración del arnés.

En primer lugar, observamos que todo el razonamiento privado se descartaba después de cada acción del juego. Esto significaba que, con cada acción, GPT‑5.6 Sol tenía que volver a descifrar el juego desde cero, sin poder recordar sus razonamientos anteriores. El modelo aún podía ver un registro de los movimientos anteriores y breves notas adjuntas, pero no los planes, hallazgos o ideas que habían conducido a ellos.

En segundo lugar, vimos que el arnés utilizaba una ventana de truncamiento móvil, por lo que las acciones más antiguas dejaban de ser visibles a medida que crecía el historial. Así pues, GPT‑5.6 Sol no solo era incapaz de recordar sus razonamientos anteriores, sino que también iba perdiendo el recuerdo de sus acciones pasadas.

En conjunto, estas dos características del arnés—el descarte del razonamiento y el truncamiento móvil—ayudaban a explicar por qué a GPT‑5.6 Sol le costaba aprender con el tiempo.

Los agentes rinden mejor cuando recuerdan lo que han hecho

Nuestros modelos están entrenados para pensar mediante mensajes privados de razonamiento antes de generar respuestas o llamadas a herramientas. Estos mensajes privados de razonamiento se conservan como parte del historial de conversación. Si una conversación se alarga demasiado, la resumimos y continuamos.

Diagrama que muestra cómo el razonamiento del modelo, las llamadas a herramientas, el historial de conversación y la compactación del contexto funcionan conjuntamente durante una tarea prolongada.

Así se entrenan nuestros modelos y también se implementan en ChatGPT y Codex. Para reproducir mejor nuestra configuración de producción, implementamos el arnés de ARC-AGI-3 con nuestra API Responses(se abre en una ventana nueva). Nuestra API facilita la gestión del contexto: en GPT‑5.6, pasar el ID de la respuesta anterior conserva automáticamente el razonamiento entre llamadas a herramientas y turnos.

Al conservar el razonamiento, observamos dos grandes cambios. En primer lugar, GPT‑5.6 Sol dedicaba menos tiempo a pensar antes de cada acción porque ya no tenía que interpretar el juego desde cero en cada turno. En segundo lugar, al poder recordar sus ideas anteriores, GPT‑5.6 Sol aprendía mucho mejor con el tiempo y aplicaba estrategias coherentes.

La siguiente mejora consistió en sustituir el truncamiento móvil por la compactación(se abre en una ventana nueva), otro ajuste de la API Responses.

El arnés de ARC-AGI-3 gestiona los límites de contexto mediante truncamiento móvil. Cuando el contexto de la conversación supera los 175 000 caracteres, se descartan los mensajes más antiguos.

El truncamiento móvil presenta dos inconvenientes. En primer lugar, el modelo pierde observaciones y acciones anteriores. En segundo lugar, realiza gran parte de las tareas con una ventana de contexto más llena, lo que puede reducir ligeramente el rendimiento.

Cuando activamos la compactación en ARC-AGI-3, GPT‑5.6 Sol pudo conservar mejor lo aprendido sobre cada juego durante ejecuciones más largas y logró una mayor puntuación con menos tokens de salida.

Para ilustrar el efecto de conservar el razonamiento y activar la compactación, esta animación muestra la ventana de contexto de 175 000 tokens de GPT‑5.6 Sol mientras resuelve una serie de rompecabezas de ARC-AGI-3 con cada arnés.

Las dos columnas centrales muestran cómo utiliza cada arnés la ventana de contexto del modelo de forma distinta. Al recordar mejor su pasado, GPT‑5.6 Sol piensa menos en cada acción y avanza mucho más rápido. Nota: nuestra implementación utiliza un límite de 175 000 tokens en lugar de caracteres, pero el resultado es muy similar, ya que la inmensa mayoría del texto son cuadrículas de acciones que nuestro tokenizador convierte en tokens con una proporción de 1:1.

En conjunto, conservar el razonamiento y aplicar la compactación permiten que GPT‑5.6 Sol (Max) logre aproximadamente el triple de puntuación con seis veces menos tokens de salida.

Conclusiones y recomendaciones

Esperamos que estos experimentos sirvan para recordar que las evaluaciones rara vez miden los modelos de forma aislada: también miden un conjunto de decisiones menos visibles sobre la configuración de la API, el diseño del arnés y las instrucciones. No es la primera vez que nos sorprenden unas puntuaciones bajas en una prueba pública y luego descubrimos que el sistema de evaluación utilizaba un arnés genérico que descartaba los mensajes de razonamiento.

Si desarrollas con la API y quieres maximizar el rendimiento, te recomendamos utilizar los mismos ajustes que implementamos en nuestros productos:

  • Usa nuestra API Responses, no la antigua API para completar chats
  • Conserva el razonamiento
  • Usa la compactación

Y si comparas modelos, te recomendamos basarte en evaluaciones que utilicen los ajustes anteriores, pues son los que mejor reflejan el uso real en ChatGPT y Codex.

Agradecemos a ARC sus años de trabajo creativo en la evaluación de la IAG y el análisis que nos inspiró a examinar este caso más de cerca.

Si quieres poner a prueba tus capacidades frente a modelos de vanguardia, juega a los juegos públicos en arcprize.org/tasks(se abre en una ventana nueva).

Autor

Ilan Bigio y Ted Sanders