Passer au contenu principal
OpenAI

29 juillet 2026

RecherchesPublication

Comment deux paramètres ont triplé nos scores au benchmark ARC-AGI-3

Chargement...

Vidéo accélérée de GPT‑5.6 Sol tentant de résoudre les énigmes du benchmark ARC-AGI-3 avec le harnais officiel (à gauche) et notre harnais fondé sur l’API Responses (à droite), qui conserve le raisonnement et active le compactage. Dans le classement de ce jeu(ouverture dans une nouvelle fenêtre), aucun modèle de pointe ne dépasse le premier niveau. Avec notre harnais, GPT‑5.6 Sol résout les six niveaux.

Lorsque nous avons découvert les faibles scores de GPT‑5.6 Sol au benchmark ARC-AGI-3(ouverture dans une nouvelle fenêtre), nous sommes restés perplexes.

GPT‑5.6 Sol a résolu des problèmes mathématiques ouverts de longue date, comme la conjecture de la double couverture par cycles(ouverture dans une nouvelle fenêtre), et terminé des jeux comme Pokémon Rouge Feu. Mais sur ARC-AGI-3, un benchmark composé de jeux de réflexion en 2D, GPT‑5.6 Sol n’a obtenu que 7,8 %, tandis que GPT‑5.5 parvenait à peine à jouer, avec un maigre score de 0,4 %.

Les jeux de réflexion en 2D étaient-ils particulièrement difficiles pour nos modèles ? Ou y avait-il une autre explication ?

Les benchmarks mesurent rarement les modèles d’IA de manière isolée. Ils évaluent aussi des choix moins visibles concernant les paramètres d’API, la conception du harnais et la formulation des prompts. Dans le cas d’ARC-AGI-3, nous avons découvert que l’activation de deux paramètres d’API utilisés dans ChatGPT et Codex — la conservation du raisonnement et le compactage — triplait les scores et divisait par six le nombre de tokens de sortie sur l’ensemble public de tâches.

Avec le harnais officiel, GPT‑5.6 Sol a obtenu 13,3 % sur l’ensemble public d’ARC-AGI-3. Avec la conservation du raisonnement et le compactage, son score a atteint 38,3 %. Les scores mesurent l’efficacité relative des actions humaines (RHAE(ouverture dans une nouvelle fenêtre))une métrique qui compare les performances du modèle à une référence humaine. D’après les journaux de parties officiels(ouverture dans une nouvelle fenêtre), nous estimons que le score moyen des testeurs humains était de 48 %. Les modèles ne savent pas comment ils seront notés et ne voient jamais leur scoreles actions renvoient uniquement une représentation textuelle de chaque image et le niveau atteint.

ARC-AGI-3

ARC-AGI-3 est un benchmark conçu pour mesurer la capacité des agents d’IA à apprendre et à raisonner. Les agents explorent des jeux en 2D inconnus et en déduisent le fonctionnement sans instructions explicites. Vous pouvez jouer à 25 jeux de démonstration sur arcprize.org/tasks(ouverture dans une nouvelle fenêtre).

ARC-AGI-3 utilise volontairement un harnais générique, sans outils ni fonctionnalités particulières. Selon ARC, un harnais simple rend les lacunes des modèles plus visibles et permet des comparaisons plus équitables. À l’inverse, les développeurs commerciaux optimisent les harnais en fonction des caractéristiques et particularités de chaque modèle.

Dans le domaine du jeu vidéo, GPT‑5.6 Sol a terminé Pokémon Rouge Feu avec un harnais reposant uniquement sur la vision (partie diffusée par GPT_Plays_Pokemon(ouverture dans une nouvelle fenêtre)), Slay the Spire en utilisant un ordinateur via Codex (partie diffusée par EpochAI(ouverture dans une nouvelle fenêtre)) et les premiers niveaux de Baba Is You (comme l’ont montré Piotr Migdał & Piotr Grabowski(ouverture dans une nouvelle fenêtre)). Pourquoi ARC-AGI-3 était-il si différent ?

GPT-5.6 Sol dans Codex termine un défi quotidien aléatoire dans Slay the Spire 2.

Ethan Mollick montre(ouverture dans une nouvelle fenêtre) GPT‑5.6 Sol dans Codex remporter un défi quotidien aléatoire dans Slay the Spire 2, un jeu sorti après la date de fin des connaissances de GPT‑5.6 Sol.

Inspirés par l’analyse d’ARC sur les lacunes de GPT‑5.5(ouverture dans une nouvelle fenêtre), nous avons examiné certaines tentatives de GPT‑5.6 Sol. Comme ARC, nous avons constaté que le modèle ne semblait pas très brillant. Il s’attardait longtemps sur chaque action et peinait à progresser.

Mais en approfondissant notre analyse, nous avons découvert qu’une grande partie de sa confusion ne venait pas du modèle lui-même, mais des paramètres du harnais.

Tout d’abord, nous avons remarqué qu’après chaque action de jeu, tout le raisonnement privé était supprimé. À chaque action, GPT‑5.6 Sol devait donc comprendre à nouveau le jeu, sans pouvoir se souvenir de ses réflexions antérieures. Le modèle pouvait toujours consulter l’historique des actions et les brèves notes associées, mais pas les plans, les déductions ou les réflexions qui les avaient motivées.

Ensuite, nous avons constaté que le harnais utilisait une fenêtre de troncature glissante : à mesure que l’historique s’allongeait, les actions les plus anciennes disparaissaient. Ainsi, GPT‑5.6 Sol ne pouvait pas seulement se souvenir de ses réflexions passées : il perdait aussi la mémoire de ses actions antérieures.

Ces deux caractéristiques du harnais — la suppression du raisonnement et la troncature glissante — expliquaient en grande partie pourquoi GPT‑5.6 Sol peinait à apprendre au fil du temps.

Les agents réussissent mieux lorsqu’ils se souviennent de leurs actions

Nos modèles sont entraînés à réfléchir au moyen de messages de raisonnement privés avant de produire une réponse ou un appel d’outil. Ces messages de réflexion privés sont conservés dans l’historique de la conversation. Si une conversation devient trop longue, nous la résumons avant de poursuivre.

Schéma montrant comment le raisonnement du modèle, les appels d’outils, l’historique de conversation et le compactage du contexte fonctionnent ensemble au cours d’une tâche de longue durée.

C’est ainsi que nos modèles sont entraînés, mais aussi déployés dans ChatGPT et Codex. Pour mieux reproduire notre configuration de production, nous avons implémenté le harnais ARC-AGI-3 avec notre API Responses(ouverture dans une nouvelle fenêtre). Notre API facilite la gestion du contexte : avec GPT‑5.6, transmettre l’identifiant de la réponse précédente permet de conserver automatiquement le raisonnement entre les appels d’outils et les tours de conversation.

La conservation du raisonnement a entraîné deux changements majeurs. Premièrement, GPT‑5.6 Sol consacrait moins de temps à réfléchir avant chaque action, car il n’avait plus à réinterpréter le jeu depuis le début à chaque tour. Deuxièmement, en pouvant se souvenir de ses réflexions passées, GPT‑5.6 Sol apprenait bien mieux au fil du temps et appliquait des stratégies cohérentes.

L’amélioration suivante a consisté à remplacer la troncature glissante par le compactage(ouverture dans une nouvelle fenêtre), un autre paramètre de l’API Responses.

Le harnais ARC-AGI-3 gère les limites de contexte au moyen d’une troncature glissante. Lorsque le contexte de la conversation dépasse 175 000 caractères, les messages les plus anciens sont supprimés.

La troncature glissante présente deux inconvénients. Premièrement, le modèle perd les observations et actions antérieures. Deuxièmement, il effectue une grande partie des tâches avec une fenêtre de contexte plus remplie, ce qui peut légèrement nuire aux performances.

Lorsque nous avons activé le compactage sur ARC-AGI-3, GPT‑5.6 Sol a mieux conservé ce qu’il avait appris sur chaque jeu au fil des longues sessions et obtenu un meilleur score avec moins de tokens de sortie.

Pour illustrer l’effet de la conservation du raisonnement et de l’activation du compactage, voici une animation de la fenêtre de contexte de 175K de GPT‑5.6 Sol pendant qu’il résout une série d’énigmes ARC-AGI-3 avec chaque harnais.

Les deux colonnes centrales montrent comment chaque harnais utilise différemment la fenêtre de contexte du modèle. Grâce à une meilleure mémoire de ses actions passées, GPT‑5.6 Sol réfléchit moins à chaque action et progresse beaucoup plus vite. Remarque : notre implémentation fixe une limite de 175 000 tokens plutôt que de caractères, mais le résultat est très similaire, car l’immense majorité du texte se compose de grilles d’actions que notre tokenizer convertit selon un rapport de 1:1.

Ensemble, la conservation du raisonnement et le compactage permettent à GPT‑5.6 Sol (Max) d’obtenir un score environ trois fois supérieur avec six fois moins de tokens de sortie.

Conclusion et recommandations

Nous espérons que ces expériences rappelleront que les évaluations mesurent rarement les modèles de manière isolée : elles évaluent aussi tout un ensemble de choix moins visibles concernant les paramètres d’API, la conception du harnais et la formulation des prompts. Ce n’est pas la première fois que les faibles scores d’un benchmark public nous surprennent, avant que nous découvrions que le moteur d’évaluation utilisait un harnais générique qui supprimait les messages de raisonnement.

Si vous développez avec l’API et cherchez à maximiser les performances, nous vous recommandons d’utiliser les mêmes paramètres que dans nos propres produits :

  • Utilisez notre API Responses plutôt que notre ancienne API Chat Completions
  • Conservez le raisonnement
  • Utilisez le compactage

Et si vous comparez des modèles, nous vous recommandons de vous appuyer sur des évaluations qui utilisent les paramètres ci-dessus, car ils correspondent le mieux aux conditions réelles d’utilisation dans ChatGPT et Codex.

Nous remercions ARC pour ses années de travaux inventifs sur l’évaluation de l’AGI, ainsi que pour l’analyse qui nous a incités à examiner la question de plus près.

Si vous voulez vous mesurer aux modèles de pointe, essayez vous-même les jeux publics sur arcprize.org/tasks(ouverture dans une nouvelle fenêtre).

Auteur

Ilan Bigio, Ted Sanders