Pular para o conteúdo principal
OpenAI

29 de julho de 2026

PesquisaPublicação

Como duas configurações triplicaram nossa pontuação no benchmark ARC-AGI-3

Carregando…

Vídeo acelerado do GPT‑5.6 Sol tentando resolver quebra-cabeças do benchmark ARC-AGI-3 com o harness oficial (à esquerda) e nosso harness da Responses API (à direita), que retém o raciocínio e ativa a compactação. No ranking deste jogo(abre em uma nova janela), nenhum modelo de fronteira resolve qualquer nível além do primeiro. Com nosso harness, o GPT‑5.6 Sol resolve os seis.

Quando vimos pela primeira vez as baixas pontuações do GPT‑5.6 Sol no benchmark ARC-AGI-3(abre em uma nova janela), ficamos intrigados.

O GPT‑5.6 Sol resolveu problemas matemáticos em aberto há muito tempo, como a conjectura da cobertura dupla de ciclos(abre em uma nova janela), e venceu jogos como Pokémon FireRed. Mas, no ARC-AGI-3, um benchmark de jogos de quebra-cabeça 2D, o GPT‑5.6 Sol obteve apenas 7,8%, enquanto o GPT‑5.5 mal conseguiu jogar, com meros 0,4%.

Será que jogos de quebra-cabeça 2D eram excepcionalmente difíceis para nossos modelos? Ou havia algo mais acontecendo?

Benchmarks raramente medem modelos de IA de forma isolada. Eles também medem escolhas menos visíveis sobre configurações da API, design do harness e elaboração de prompts. No caso do ARC-AGI-3, descobrimos que ativar duas configurações da API que usamos no ChatGPT e no Codex — retenção do raciocínio e compactação — triplicou as pontuações e reduziu em seis vezes os tokens de saída no conjunto público de tarefas.

Com o harness oficial, o GPT‑5.6 Sol obteve 13,3% no conjunto público do ARC-AGI-3. Com retenção do raciocínio e compactação, obteve 38,3%. As pontuações medem a Eficiência Relativa de Ações Humanas (RHAE(abre em uma nova janela))uma métrica que compara o desempenho do modelo a uma referência humana. Com base nos registros oficiais das partidas(abre em uma nova janela), estimamos que os participantes humanos obtiveram, em média, 48%. Os modelos não são informados sobre como serão avaliados e não veem sua pontuação durante a execuçãoas ações retornam apenas uma representação textual de cada quadro e o nível atual.

ARC-AGI-3

O ARC-AGI-3 é um benchmark criado para medir a capacidade de agentes de IA de aprender e raciocinar. Os agentes exploram jogos 2D desconhecidos e deduzem como eles funcionam sem instruções explícitas. Você pode jogar 25 demonstrações em arcprize.org/tasks(abre em uma nova janela).

O ARC-AGI-3 usa um harness intencionalmente genérico, sem ferramentas nem recursos especiais. A justificativa da ARC era que um harness simples deixaria as limitações dos modelos mais visíveis e tornaria as comparações entre eles mais justas. Já os desenvolvedores comerciais otimizam os harnesses para os recursos e as particularidades de cada modelo.

Em jogos, o GPT‑5.6 Sol venceu Pokémon FireRed com um harness baseado apenas em visão (em transmissão de GPT_Plays_Pokemon(abre em uma nova janela)), Slay the Spire usando o computador pelo Codex (em transmissão da EpochAI(abre em uma nova janela)) e as primeiras fases de Baba Is You (conforme compartilhado por Piotr Migdał & Piotr Grabowski(abre em uma nova janela)). O que havia de tão diferente no ARC-AGI-3?

GPT-5.6 Sol no Codex concluindo um desafio diário aleatório em Slay the Spire 2.

Ethan Mollick mostra(abre em uma nova janela) o GPT‑5.6 Sol no Codex vencendo um desafio diário aleatório em Slay the Spire 2, jogo lançado após a data de corte de conhecimento do GPT‑5.6 Sol.

Inspirados pela análise da ARC sobre as limitações do GPT‑5.5(abre em uma nova janela), examinamos algumas tentativas do GPT‑5.6 Sol. Assim como a ARC, vimos que o modelo não parecia muito inteligente. Ele demorava muito em cada ação e tinha dificuldade para avançar.

Mas, ao investigarmos mais a fundo, descobrimos que grande parte da confusão do modelo não era inerente a ele, e sim causada pelas configurações do harness.

Primeiro, percebemos que todo o raciocínio privado era descartado após cada ação no jogo. Isso significava que, a cada ação, o GPT‑5.6 Sol precisava entender o jogo novamente, sem conseguir se lembrar do que havia pensado antes. O modelo ainda via um registro das jogadas anteriores e breves anotações relacionadas, mas não os planos, insights ou pensamentos que levaram a elas.

Em segundo lugar, vimos que o harness usava uma janela de truncamento contínuo, fazendo com que ações mais antigas deixassem de ficar visíveis à medida que o histórico crescia. Assim, além de não conseguir se lembrar do que havia pensado, o GPT‑5.6 Sol também perdia a memória das ações anteriores.

Juntos, esses dois recursos do harness — descarte do raciocínio e truncamento contínuo — ajudavam a explicar por que o GPT‑5.6 Sol tinha dificuldade para aprender ao longo do tempo.

Os agentes têm melhor desempenho quando se lembram do que fizeram

Nossos modelos são treinados para pensar por meio de mensagens privadas de raciocínio antes de gerar respostas ou chamadas de ferramentas. Essas mensagens privadas de raciocínio são mantidas como parte do histórico da conversa. Se uma conversa fica longa demais, nós a resumimos e continuamos.

Diagrama mostrando como o raciocínio do modelo, as chamadas de ferramentas, o histórico da conversa e a compactação de contexto atuam em conjunto ao longo de uma tarefa prolongada.

É assim que nossos modelos são treinados e também implantados no ChatGPT e no Codex. Para reproduzir melhor nossa configuração de produção, implementamos o harness do ARC-AGI-3 com nossa Responses API(abre em uma nova janela). Nossa API facilita o gerenciamento do contexto: no GPT‑5.6, passar o ID da resposta anterior retém automaticamente o raciocínio entre chamadas de ferramentas e turnos.

Com a retenção do raciocínio, percebemos duas grandes mudanças. Primeiro, o GPT‑5.6 Sol passou menos tempo pensando antes de cada ação, pois já não precisava interpretar o jogo do zero a cada turno. Em segundo lugar, ao conseguir se lembrar do que havia pensado, o GPT‑5.6 Sol passou a aprender muito melhor ao longo do tempo e a adotar estratégias coerentes.

A melhoria seguinte veio da substituição do truncamento contínuo pela compactação(abre em uma nova janela), outra configuração da Responses API.

O harness do ARC-AGI-3 lida com os limites de contexto por meio do truncamento contínuo. Quando o contexto da conversa ultrapassa 175.000 caracteres, as mensagens mais antigas são descartadas.

O truncamento contínuo tem duas desvantagens. Primeiro, o modelo perde observações e ações anteriores. Em segundo lugar, ele passa boa parte das tarefas operando com uma janela de contexto mais cheia, o que pode prejudicar um pouco o desempenho.

Quando ativamos a compactação no ARC-AGI-3, o GPT‑5.6 Sol conseguiu preservar melhor o que havia aprendido sobre cada jogo durante execuções mais longas e alcançou uma pontuação maior com menos tokens de saída.

Para ilustrar o efeito de reter o raciocínio e ativar a compactação, esta animação mostra como a janela de contexto de 175 mil tokens do GPT‑5.6 Sol é usada enquanto ele resolve uma série de quebra-cabeças do ARC-AGI-3 com cada harness.

As duas colunas centrais mostram como cada harness usa a janela de contexto do modelo de maneira diferente. Com uma memória melhor do que fez antes, o GPT‑5.6 Sol pensa menos a cada ação e avança muito mais rápido. Observação: nossa implementação usa um limite de 175.000 tokens em vez de caracteres, mas o resultado é bastante semelhante, pois a grande maioria do texto consiste em grades de ações, tokenizadas na proporção de 1:1 pelo nosso tokenizador.

Juntas, a retenção do raciocínio e a compactação permitem que o GPT‑5.6 Sol (Max) alcance cerca de três vezes a pontuação com seis vezes menos tokens de saída.

Conclusão e recomendações

Esperamos que estes experimentos sirvam de lembrete de que avaliações raramente medem modelos de forma isolada — elas também medem um conjunto de escolhas menos visíveis sobre configurações da API, design do harness e elaboração de prompts. Esta não foi a primeira vez que nos surpreendemos com pontuações baixas em um benchmark público e depois descobrimos que o executor da avaliação usava um harness genérico que descartava mensagens de raciocínio.

Se você desenvolve com a API e busca maximizar o desempenho, recomendamos usar as mesmas configurações que adotamos em nossos produtos:

  • Use nossa Responses API, não a API chat completions legada
  • Retenha o raciocínio
  • Use a compactação

E, se estiver comparando modelos, recomendamos usar avaliações que adotem as configurações acima, pois são as que melhor refletem o uso real no ChatGPT e no Codex.

Agradecemos à ARC por seus anos de trabalho criativo na avaliação de AGI e pela análise que nos inspirou a investigar melhor esta questão.

Se quiser testar suas habilidades contra modelos de fronteira, experimente os jogos públicos em arcprize.org/tasks(abre em uma nova janela).

Autoria

Ilan Bigio, Ted Sanders