Comment deux réglages activés ont triplé nos résultats au banc d’essai ARC-AGI-3
Vidéo accélérée de GPT‑5.6 Sol tentant de résoudre des casse-têtes du banc d’essai ARC-AGI-3 avec le harnais officiel (à gauche) et notre harnais de l’API Responses (à droite), qui conserve le raisonnement et active le compactage. Au classement de ce jeu(s'ouvre dans une nouvelle fenêtre), aucun modèle de pointe ne réussit de niveau au-delà du premier. Avec notre harnais, GPT‑5.6 Sol réussit les six.
Lorsque nous avons vu pour la première fois les faibles résultats de GPT‑5.6 Sol au banc d’essai ARC-AGI-3(s'ouvre dans une nouvelle fenêtre), nous étions perplexes.
GPT‑5.6 Sol a résolu des problèmes mathématiques ouverts de longue date, comme la conjecture de la double couverture par cycles(s'ouvre dans une nouvelle fenêtre), et a terminé des jeux comme Pokémon FireRed. Pourtant, sur ARC-AGI-3, un banc d’essai composé de jeux de réflexion en 2D, GPT‑5.6 Sol n’a obtenu que 7,8 %, tandis que GPT‑5.5 arrivait à peine à jouer, avec un maigre résultat de 0,4 %.
Les jeux de réflexion en 2D étaient-ils particulièrement difficiles pour nos modèles? Ou se passait-il autre chose?
Les bancs d’essai mesurent rarement les modèles d’IA de façon isolée. Ils mesurent aussi des choix moins visibles concernant les réglages de l’API, la conception du harnais et la formulation des instructions. Dans le cas d’ARC-AGI-3, nous avons découvert que l’activation de deux réglages d’API utilisés dans ChatGPT et Codex — la conservation du raisonnement et le compactage — triplait les résultats tout en divisant par six le nombre de jetons de sortie sur l’ensemble public de tâches.
Avec le harnais officiel, GPT‑5.6 Sol a obtenu 13,3 % sur l’ensemble public d’ARC-AGI-3. Avec la conservation du raisonnement et le compactage, il a obtenu 38,3 %. Les résultats mesurent l’efficacité relative des actions humaines (RHAE(s'ouvre dans une nouvelle fenêtre)) — une mesure qui compare la performance du modèle à une référence humaine. D’après les journaux de jeu officiels(s'ouvre dans une nouvelle fenêtre), nous estimons que les testeurs humains ont obtenu en moyenne 48 %. Les modèles ignorent comment ils seront évalués et ne peuvent jamais voir leur résultat — les actions renvoient seulement une représentation textuelle de chaque image et le niveau atteint.
ARC-AGI-3 est un banc d’essai conçu pour mesurer la capacité des agents d’IA à apprendre et à raisonner. Les agents explorent des jeux en 2D inconnus et en déduisent le fonctionnement sans instructions explicites. Vous pouvez essayer 25 jeux de démonstration à l’adresse arcprize.org/tasks(s'ouvre dans une nouvelle fenêtre).
ARC-AGI-3 utilise volontairement un harnais générique, sans outils ni fonctions spéciales. Selon ARC, un harnais simple rend les lacunes des modèles plus visibles et permet des comparaisons plus équitables. À l’inverse, les développeurs commerciaux optimisent les harnais en fonction des caractéristiques et particularités de chaque modèle.
Dans le domaine des jeux, GPT‑5.6 Sol a terminé Pokémon FireRed avec un harnais fondé uniquement sur la vision, comme l’a diffusé GPT_Plays_Pokemon(s'ouvre dans une nouvelle fenêtre); Slay the Spire en utilisant un ordinateur avec Codex, comme l’a diffusé EpochAI(s'ouvre dans une nouvelle fenêtre); et les premiers niveaux de Baba Is You, comme l’ont présenté Piotr Migdał & Piotr Grabowski(s'ouvre dans une nouvelle fenêtre). Qu’est-ce qui rendait ARC-AGI-3 si différent?

Ethan Mollick montre(s'ouvre dans une nouvelle fenêtre) GPT‑5.6 Sol dans Codex réussissant un défi quotidien aléatoire dans Slay the Spire 2, un jeu sorti après la date limite des connaissances de GPT‑5.6 Sol.
Inspirés par l’analyse d’ARC sur les lacunes de GPT‑5.5(s'ouvre dans une nouvelle fenêtre), nous avons examiné certaines tentatives de GPT‑5.6 Sol. Comme ARC, nous avons constaté que le modèle ne semblait pas très futé. Il s’attardait longtemps sur chaque action et progressait difficilement.
En approfondissant notre analyse, nous avons toutefois découvert que la confusion du modèle n’était pas tant inhérente au modèle lui-même qu’aux réglages du harnais.
Nous avons d’abord remarqué qu’après chaque action de jeu, tout le raisonnement privé était supprimé. À chaque action, GPT‑5.6 Sol devait donc comprendre le jeu de nouveau, sans pouvoir se rappeler ses réflexions précédentes. Le modèle pouvait toujours consulter l’historique des coups précédents et les brèves notes associées, mais pas les plans, les déductions ou les réflexions qui les avaient motivés.
Nous avons ensuite constaté que le harnais utilisait une fenêtre de troncature glissante, rendant les anciennes actions invisibles à mesure que l’historique s’allongeait. Ainsi, GPT‑5.6 Sol ne pouvait pas seulement oublier ses réflexions précédentes : il perdait aussi la mémoire de ses actions passées.
Ensemble, ces deux caractéristiques du harnais — la suppression du raisonnement et la troncature glissante — expliquaient pourquoi GPT‑5.6 Sol avait tant de difficulté à apprendre au fil du temps.
Nos modèles sont entraînés à réfléchir au moyen de messages de raisonnement privés avant de produire des réponses ou des appels d’outils. Ces messages de réflexion privés sont conservés dans l’historique de la conversation. Si une conversation devient trop longue, nous la résumons avant de poursuivre.
C’est ainsi que nos modèles sont entraînés et déployés dans ChatGPT et Codex. Pour mieux reproduire notre environnement de production, nous avons mis en œuvre le harnais d’ARC-AGI-3 avec notre API Responses(s'ouvre dans une nouvelle fenêtre). Notre API simplifie la gestion du contexte : avec GPT‑5.6, transmettre l’identifiant de la réponse précédente conserve automatiquement le raisonnement entre les appels d’outils et les tours de conversation.
Lorsque le raisonnement était conservé, nous avons observé deux changements importants. Premièrement, GPT‑5.6 Sol réfléchissait moins longtemps avant chaque action, puisqu’il n’avait plus à réinterpréter le jeu depuis le début à chaque tour. Deuxièmement, lorsqu’il pouvait se rappeler ses réflexions antérieures, GPT‑5.6 Sol apprenait beaucoup mieux au fil du temps et appliquait des stratégies cohérentes.
L’amélioration suivante a consisté à remplacer la troncature glissante par le compactage(s'ouvre dans une nouvelle fenêtre), un autre réglage de l’API Responses.
Le harnais d’ARC-AGI-3 gère les limites de contexte au moyen d’une troncature glissante. Lorsque le contexte de la conversation dépasse 175 000 caractères, les messages les plus anciens sont supprimés.
La troncature glissante comporte deux inconvénients. Premièrement, le modèle perd les observations et les actions antérieures. Deuxièmement, il exécute une grande partie des tâches avec une fenêtre contextuelle plus remplie, ce qui peut légèrement nuire à ses performances.
Lorsque nous avons activé le compactage sur ARC-AGI-3, GPT‑5.6 Sol a mieux conservé ce qu’il avait appris sur chaque jeu pendant les longues exécutions, obtenant ainsi un meilleur résultat avec moins de jetons de sortie.
Pour illustrer l’effet de la conservation du raisonnement et de l’activation du compactage, voici une animation de la fenêtre contextuelle de 175 k de GPT‑5.6 Sol pendant qu’il résout une série de casse-têtes d’ARC-AGI-3 avec chaque harnais.
Les deux colonnes centrales montrent comment chaque harnais utilise différemment la fenêtre contextuelle du modèle. Grâce à une meilleure mémoire de ses actions passées, GPT‑5.6 Sol réfléchit moins à chaque action et avance beaucoup plus vite. Remarque : notre mise en œuvre impose une limite de 175 000 jetons plutôt que de caractères, mais les résultats sont très semblables, puisque la grande majorité du texte est constituée de grilles d’actions que notre segmenteur convertit en jetons selon un rapport de 1:1.
Ensemble, la conservation du raisonnement et le compactage permettent à GPT‑5.6 Sol (Max) d’obtenir un résultat environ trois fois supérieur avec six fois moins de jetons de sortie.
Nous espérons que ces expériences rappelleront que les évaluations mesurent rarement les modèles de façon isolée : elles mesurent aussi un ensemble de choix moins visibles concernant les réglages de l’API, la conception du harnais et la formulation des instructions. Ce n’est pas la première fois que les faibles résultats d’un banc d’essai public nous surprennent avant que nous découvrions que le système d’évaluation utilisait un harnais générique qui supprimait les messages de raisonnement.
Si vous développez avec l’API et cherchez à maximiser les performances, nous vous recommandons d’utiliser les mêmes réglages que dans nos propres produits :
- Utilisez notre API Responses plutôt que notre ancienne API Chat Completions
- Conservez le raisonnement
- Utilisez le compactage
Et si vous comparez des modèles, nous vous recommandons de vous fier aux évaluations qui utilisent les réglages ci-dessus, car ils correspondent le mieux à l’utilisation réelle dans ChatGPT et Codex.
Nous remercions ARC pour ses nombreuses années de travail créatif sur l’évaluation de l’AGI, ainsi que pour son analyse, qui nous a incités à examiner la question de plus près.
Si vous souhaitez vous mesurer aux modèles de pointe, essayez vous-même les jeux publics à l’adresse arcprize.org/tasks(s'ouvre dans une nouvelle fenêtre).


