공식 하네스(왼쪽)와 추론 유지 및 컨텍스트 압축을 지원하는 Responses API 하네스(오른쪽)를 사용해 GPT‑5.6 Sol이 ARC-AGI-3 퍼즐을 푸는 모습을 비교한 배속 영상입니다. 이 게임(새 창에서 열기)의 리더보드에서는 어떤 프런티어 모델도 첫 번째 레벨을 넘지 못했지만, Responses API 하네스를 사용한 GPT‑5.6 Sol은 여섯 개 레벨을 모두 해결했습니다.
처음 ARC-AGI-3(새 창에서 열기) 벤치마크에서 GPT‑5.6 Sol의 낮은 점수를 확인했을 때, 그 이유를 쉽게 이해할 수 없었습니다.
GPT‑5.6 Sol은 사이클 이중 덮개 추측(새 창에서 열기)과 같은 오랫동안 해결되지 않은 수학 난제를 해결했고, Pokémon FireRed 같은 게임도 클리어했습니다. 하지만 2D 퍼즐 게임으로 구성된 ARC-AGI-3 벤치마크에서는 GPT‑5.6 Sol이 7.8%에 그쳤고, GPT‑5.5는 게임을 거의 플레이하지 못해 겨우 0.4%를 기록했습니다.
2D 퍼즐 게임이 모델에 유난히 어려웠던 걸까요? 아니면 다른 이유가 있었던 걸까요?
벤치마크는 AI 모델만을 독립적으로 평가하는 경우가 드뭅니다. API 설정, 하네스 설계, 프롬프팅처럼 눈에 잘 드러나지 않는 선택들도 함께 평가에 영향을 미칩니다. ARC-AGI-3를 살펴본 결과, ChatGPT와 Codex에서 사용하는 두 가지 API 설정인 추론 유지와 컨텍스트 압축을 활성화하자 공개 태스크 세트에서 점수가 세 배로 높아졌고 출력 토큰 수는 6분의 1 수준으로 줄었습니다.
공식 하네스를 사용했을 때 GPT‑5.6 Sol은 ARC-AGI-3 공개 세트에서 13.3%를 기록했습니다. 추론 유지와 컨텍스트 압축을 적용하자 점수는 38.3%까지 상승했습니다. 점수는 모델의 성능을 인간 기준선과 비교하는 지표인 상대 인간 행동 효율(RHAE(새 창에서 열기))을 기준으로 산정됩니다. 공식 게임 플레이 로그(새 창에서 열기)를 바탕으로 추정한 결과, 인간 테스터의 평균 점수는 48%였습니다. 모델은 점수가 어떤 기준으로 계산되는지 알지 못하며, 플레이 도중에도 자신의 점수를 확인할 수 없습니다. 각 행동에는 현재 프레임의 텍스트 표현과 현재 플레이 중인 레벨 정보만 반환됩니다.
ARC-AGI-3는 AI 에이전트의 학습 및 추론 능력을 평가하기 위해 설계된 벤치마크입니다. 에이전트는 명시적인 설명 없이 처음 접하는 2D 게임을 탐색하며 게임의 규칙을 스스로 추론해야 합니다. arcprize.org/tasks(새 창에서 열기)에서 25개의 데모 게임을 직접 플레이해 볼 수 있습니다.
ARC-AGI-3는 도구나 특별한 기능을 포함하지 않는 범용 하네스를 의도적으로 사용합니다. ARC는 단순한 하네스를 사용할수록 모델의 한계가 더 분명하게 드러나고 모델 간 비교도 더 공정해진다고 판단했습니다. 반면 상용 개발사는 각 모델의 특성과 특성에 따른 동작 방식에 맞춰 하네스를 최적화합니다.
게임 분야에서 GPT‑5.6 Sol은 비전 전용 하네스로 Pokémon FireRed를 클리어했고(GPT_Plays_Pokemon(새 창에서 열기) 스트리밍), Codex의 Computer Use 기능으로 Slay the Spire를 공략했으며(EpochAI(새 창에서 열기) 스트리밍), Baba Is You의 첫 번째 스테이지도 완료했습니다(피오트르 미그다우와 피오트르 그라보프스키(새 창에서 열기) 공유). 그렇다면 ARC-AGI-3는 무엇이 달랐을까요?

에단 몰릭이 GPT‑5.6 Sol의 지식 기준 시점 이후에 출시된 게임인 Slay the Spire 2에서, Codex를 사용해 GPT‑5.6 Sol이 무작위 일일 챌린지를 완료하는 모습을 소개합니다(새 창에서 열기).
ARC가 GPT‑5.5의 한계를 분석(새 창에서 열기)한 내용을 바탕으로 GPT‑5.6 Sol의 플레이를 자세히 살펴봤습니다. ARC의 분석과 마찬가지로, 모델은 기대만큼 좋은 성능을 보여주지 못했습니다. 한 번의 행동을 결정하는 데 지나치게 오랜 시간을 들였고, 좀처럼 앞으로 나아가지 못했습니다.
하지만 더 자세히 들여다본 결과, 모델이 혼란을 겪었던 이유의 상당 부분은 모델 자체의 한계가 아니라 하네스 설정 때문이라는 사실을 확인했습니다.
먼저, 게임에서 한 번 행동할 때마다 모든 비공개 추론이 삭제된다는 점을 확인했습니다. 그 결과 GPT‑5.6 Sol은 행동을 할 때마다 이전에 어떤 추론을 했는지 기억하지 못한 채 게임을 처음부터 다시 파악해야 했습니다. 모델은 이전 행동 기록과 간단한 메모는 볼 수 있었지만, 그 행동에 이르게 된 계획이나 통찰, 사고 과정은 확인할 수 없었습니다.
두 번째로, 하네스가 롤링 트렁케이션을 사용하고 있다는 점도 확인했습니다. 대화 기록이 길어질수록 오래된 행동이 컨텍스트에서 제외되는 방식입니다. 그 결과 GPT‑5.6 Sol은 이전 추론을 기억하지 못했을 뿐 아니라, 과거에 어떤 행동을 했는지도 점차 잊게 되었습니다.
추론을 삭제하는 방식과 롤링 트렁케이션이라는 두 가지 하네스 설계는 GPT‑5.6 Sol이 시간이 지날수록 학습에 어려움을 겪었던 이유를 설명해 주었습니다.
모델은 응답을 생성하거나 도구를 호출하기 전에 비공개 추론 메시지를 통해 먼저 추론하도록 학습됩니다. 이러한 비공개 추론 메시지는 대화 기록의 일부로 유지됩니다. 대화가 너무 길어지면 이를 요약한 뒤 작업을 이어갑니다.
이것이 모델이 학습되는 방식이며, ChatGPT와 Codex에서도 동일한 방식으로 운영됩니다. 실제 프로덕션 환경과 최대한 동일하게 맞추기 위해 ARC-AGI-3 하네스를 Responses API(새 창에서 열기)로 구현했습니다. Responses API를 사용하면 컨텍스트를 쉽게 관리할 수 있습니다. GPT‑5.6에서는 이전 응답 ID를 전달하기만 하면 도구 호출과 여러 턴에 걸쳐 추론이 자동으로 유지됩니다.
추론을 유지하자 두 가지 큰 변화가 나타났습니다. 첫째, GPT‑5.6 Sol은 매 턴마다 게임을 처음부터 다시 해석할 필요가 없어졌기 때문에 각 행동을 결정하기 전에 들이는 추론 시간이 크게 줄었습니다. 둘째, 이전 추론을 기억할 수 있게 되면서 시간이 지날수록 더 효과적으로 학습했고, 일관된 전략을 세워 활용할 수 있었습니다.
다음 개선은 Responses API의 또 다른 기능인 컨텍스트 압축(새 창에서 열기)으로 롤링 트렁케이션을 대체하면서 이루어졌습니다.
ARC-AGI-3 하네스는 롤링 트렁케이션을 사용해 컨텍스트 길이 제한을 관리합니다. 대화 컨텍스트가 175,000자를 넘으면 가장 오래된 메시지부터 삭제됩니다.
롤링 트렁케이션에는 두 가지 단점이 있습니다. 첫째, 모델은 이전에 관찰한 내용과 수행한 행동을 잃게 됩니다. 둘째, 작업 대부분을 컨텍스트 윈도우가 거의 가득 찬 상태에서 수행하게 되어 성능이 다소 저하될 수 있습니다.
ARC-AGI-3에서 컨텍스트 압축을 활성화하자 GPT‑5.6 Sol은 장시간 실행되는 동안에도 각 게임에서 학습한 내용을 더 잘 유지할 수 있었고, 더 적은 출력 토큰으로 더 높은 점수를 기록했습니다.
추론 유지와 컨텍스트 압축의 효과를 보여주기 위해 각 하네스를 사용해 GPT‑5.6 Sol이 일련의 ARC-AGI-3 퍼즐을 푸는 동안 175,000토큰 크기의 컨텍스트 윈도우가 어떻게 활용되는지를 보여주는 애니메이션입니다.
가운데 두 열은 각 하네스에서 모델의 컨텍스트 윈도우를 어떻게 다르게 활용하는지 보여줍니다. 이전 내용을 더 잘 기억할 수 있게 되면서 GPT‑5.6 Sol은 행동마다 추론에 들이는 시간이 줄었고 훨씬 빠르게 작업을 진행합니다. 참고로 이 구현에서는 문자 수 대신 175,000토큰을 한도로 사용했습니다. 하지만 대부분의 텍스트가 액션 그리드이며 토크나이저에서 1:1 비율로 토큰화되기 때문에 실제 차이는 거의 없습니다.
추론 유지와 컨텍스트 압축을 함께 사용하면 GPT‑5.6 Sol(max)은 출력 토큰은 약 6분의 1 수준으로 줄이면서도 점수는 약 3배 높일 수 있습니다.
이번 실험을 통해 평가는 모델만을 독립적으로 측정하는 경우가 드물며, API 설정, 하네스 설계, 프롬프팅처럼 눈에 잘 드러나지 않는 여러 선택도 함께 평가 대상이 된다는 점을 다시 한번 확인할 수 있었습니다. 공개 벤치마크에서 낮은 점수를 확인한 뒤 평가 실행기가 추론 메시지를 삭제하는 범용 하네스를 사용하고 있다는 사실을 발견한 것은 이번이 처음이 아닙니다.
API를 사용하는 개발자가 최대 성능을 끌어내고자 한다면, ChatGPT와 Codex에 적용된 것과 동일한 설정을 사용하는 것을 권장합니다.
- 기존 Chat Completions API 대신 Responses API 사용
- 추론 유지
- 컨텍스트 압축 사용
모델을 비교하는 경우에는 위와 같은 설정을 사용하는 평가 결과를 참고하는 것이 좋습니다. 이러한 설정이 ChatGPT와 Codex의 실제 사용 환경을 가장 잘 반영하기 때문입니다.
AGI 평가 분야에서 수년간 창의적인 연구를 이어 온 ARC에 감사드립니다. 또한 ARC의 분석은 이번 문제를 더 자세히 살펴보는 계기가 되었습니다.
프런티어 모델과 직접 실력을 겨뤄보고 싶다면 arcprize.org/tasks(새 창에서 열기)에서 공개 게임을 플레이해 보세요.


