GPT‑5.6 Sol 嘗試解開 ARC-AGI-3 基準測試謎題的加速影片:左側使用官方任務執行框架,右側使用我們保留推理並啟用壓縮的 Responses API 任務執行框架。在這款遊戲(在新視窗中開啟)的排行榜上,沒有任何前沿模型能通過第一關之後的關卡。使用我們的任務執行框架後,GPT‑5.6 Sol 成功通過全部六關。
初次看到 GPT‑5.6 Sol 在 ARC-AGI-3(在新視窗中開啟) 基準測試中的低分時,我們感到不解。
GPT‑5.6 Sol 已解決數學界懸而未決已久的問題,例如循環雙覆蓋猜想(在新視窗中開啟),也成功破關《Pokémon FireRed》等遊戲。但在由 2D 解謎遊戲組成的 ARC-AGI-3 基準測試中,GPT‑5.6 Sol 僅獲得 7.8%,而 GPT‑5.5 幾乎完全不會玩,分數只有微不足道的 0.4%。
2D 解謎遊戲對我們的模型來說特別困難嗎?還是另有原因?
基準測試很少只衡量 AI 模型本身。它們同時也衡量 API 設定、任務執行框架設計和提示方式等較不顯眼的選擇。在 ARC-AGI-3 中,我們發現,只要開啟 ChatGPT 和 Codex 採用的兩項 API 設定—保留推理與壓縮—公開題組的分數便提高至三倍,輸出 token 則減少至六分之一。
使用官方任務執行框架時,GPT‑5.6 Sol 在 ARC-AGI-3 公開題組中獲得 13.3%。保留推理並啟用壓縮後,分數達 38.3%。分數衡量的是相對人類操作效率(RHAE(在新視窗中開啟))—這項指標會將模型表現與人類基準比較。根據官方遊戲紀錄(在新視窗中開啟),我們估計人類測試者的平均得分為 48%。模型不會得知評分方式,過程中也看不到自己的分數—每次操作只會傳回當前畫面及所在關卡的文字表示。
ARC-AGI-3 是一項用於衡量 AI 代理學習與推理能力的基準測試。代理會探索陌生的 2D 遊戲,在沒有明確指示的情況下推斷遊戲規則。你可以在 arcprize.org/tasks(在新視窗中開啟) 遊玩 25 款示範遊戲。
ARC-AGI-3 刻意採用通用的任務執行框架,不含工具或特殊功能。ARC 的考量是,簡單的任務執行框架能讓模型的不足更明顯,也能讓模型之間的比較更公平。相較之下,商業開發者會針對各模型的功能與特性,最佳化任務執行框架。
在遊戲方面,GPT‑5.6 Sol 已透過僅使用視覺的任務執行框架打敗《Pokémon FireRed》(由 GPT_Plays_Pokemon(在新視窗中開啟) 直播)、透過 Codex 的電腦操作功能打敗《Slay the Spire》(由 EpochAI(在新視窗中開啟) 直播),並通過《Baba Is You》的前幾個關卡(由 Piotr Migdał & Piotr Grabowski(在新視窗中開啟) 分享)。ARC-AGI-3 究竟有何不同?

Ethan Mollick 展示(在新視窗中開啟) Codex 中的 GPT‑5.6 Sol 成功完成《Slay the Spire 2》的隨機每日挑戰;這款遊戲是在 GPT‑5.6 Sol 的知識截止日期後才發行。
受到 ARC 對 GPT‑5.5 缺點的分析(在新視窗中開啟)啟發,我們檢視了 GPT‑5.6 Sol 的幾次嘗試。和 ARC 一樣,我們也發現模型看起來不太聰明。它每次操作都要思考很久,而且遲遲無法取得進展。
但深入研究後,我們發現模型的困惑大多並非源自模型本身,而是任務執行框架的設定所致。
首先,我們注意到,每次遊戲操作後,所有私密推理都會遭到捨棄。這表示 GPT‑5.6 Sol 每次操作時都得重新理解遊戲,無法記住先前的思考。模型仍看得到先前操作的紀錄與簡短附註,卻看不到促成這些操作的計畫、洞見或思路。
其次,我們發現任務執行框架採用滾動截斷視窗,導致記錄增加時,較早的操作逐漸變得不可見。因此,GPT‑5.6 Sol 不僅記不住先前的思考,連過去操作的記憶也逐漸消失。
任務執行框架的這兩項特性—捨棄推理與滾動截斷—共同解釋了 GPT‑5.6 Sol 為何難以隨時間持續學習。
我們的模型經過訓練,會先透過私密推理訊息思考,再輸出回覆或工具呼叫。這些私密思考訊息會保留在對話記錄中。如果對話過長,我們會加以摘要後繼續。
我們的模型以這種方式訓練,也以相同方式部署於 ChatGPT 和 Codex。為了更貼近正式環境的設定,我們使用 Responses API(在新視窗中開啟) 實作 ARC-AGI-3 任務執行框架。我們的 API 可輕鬆管理上下文:使用 GPT‑5.6 時,只要傳入前一次的回應 ID,就會自動在工具呼叫和對話輪次之間保留推理。
保留推理後,我們注意到兩項重大變化。首先,GPT‑5.6 Sol 每次操作前花在思考上的時間減少了,因為它不必每一輪都從頭理解遊戲。其次,能記住先前的思路後,GPT‑5.6 Sol 更能隨時間持續學習並採用連貫的策略。
下一項改善,是以 Responses API 的另一項設定壓縮(在新視窗中開啟)取代滾動截斷。
ARC-AGI-3 任務執行框架以滾動截斷處理上下文限制。當對話上下文超過 175,000 個字元時,最早的訊息就會遭到捨棄。
滾動截斷有兩項缺點。首先,模型會失去較早的觀察與操作。其次,模型在大部分任務期間都以較滿的上下文視窗運作,可能會略微影響表現。
在 ARC-AGI-3 上啟用壓縮後,GPT‑5.6 Sol 更能在長時間執行期間保留從各款遊戲中學到的內容,並以更少的輸出 token 取得更高分。
為說明保留推理與啟用壓縮的效果,以下動畫呈現 GPT‑5.6 Sol 分別使用兩種任務執行框架解開一系列 ARC-AGI-3 謎題時,其 175K 上下文視窗的使用情形。
中央兩欄呈現兩種任務執行框架使用模型上下文視窗的不同方式。由於更能記住過去,GPT‑5.6 Sol 每次操作所需的思考更少,推進速度也快得多。請注意:我們的實作採用 175,000 個 token 的上限,而非字元上限;但兩者結果相當接近,因為絕大部分文字都是操作網格,我們的 tokenizer 會以 1:1 的比例將其 token 化。
保留推理與壓縮相輔相成,讓 GPT‑5.6 Sol(Max)的分數提高至約三倍,同時將輸出 token 減少至六分之一。
我們希望這些實驗能提醒大家:評測很少只衡量模型本身,也會衡量 API 設定、任務執行框架設計和提示方式等一整套較不顯眼的選擇。這並非我們第一次對公開基準測試的低分感到意外,後來才發現評測執行器採用了會捨棄推理訊息的通用任務執行框架。
如果你是希望將效能最大化的 API 開發者,我們建議採用自家產品部署時使用的相同設定:
- 使用 Responses API,而非舊版 Chat Completions API
- 保留推理
- 使用壓縮
如果要比較模型,我們建議採用使用上述設定的評測,因為這些設定最貼近 ChatGPT 和 Codex 的實際使用方式。
我們感謝 ARC 多年來在 AGI 評估方面富有創意的工作,也感謝他們的分析啟發我們在此展開更深入的研究。
如果你想與前沿模型一較高下,可以前往 arcprize.org/tasks(在新視窗中開啟) 親自挑戰公開遊戲。


