這段加速影片展示 GPT‑5.6 Sol 嘗試解答 ARC-AGI-3 基準測試中的謎題:左方採用官方任務執行框架,右方採用我們保留推理並啟用上下文壓縮的 Responses API 任務執行框架。在這款遊戲(在新視窗中開啟)的排行榜上,沒有任何前沿模型能通過第一關之後的關卡;採用我們的任務執行框架後,GPT‑5.6 Sol 成功通過全部六關。
最初看到 GPT‑5.6 Sol 在 ARC-AGI-3(在新視窗中開啟) 基準測試中得分偏低時,我們感到困惑。
GPT‑5.6 Sol 曾解決多個長期未解的數學難題,例如循環雙覆蓋猜想(在新視窗中開啟),也成功破關《Pokémon FireRed》等遊戲。然而,在由二維解謎遊戲組成的 ARC-AGI-3 基準測試中,GPT‑5.6 Sol 僅得 7.8%,GPT‑5.5 更幾乎無法進行遊戲,得分只有 0.4%。
二維解謎遊戲對我們的模型而言,是否異常困難?還是另有原因?
基準測試很少只衡量 AI 模型本身。它們也會衡量一些較不顯眼的選擇,包括 API 設定、任務執行框架設計和提示詞。在 ARC-AGI-3 中,我們發現只要啟用 ChatGPT 和 Codex 採用的兩項 API 設定——保留推理和上下文壓縮——公開任務集的得分便增至三倍,輸出 token 則減至六分之一。
採用官方任務執行框架時,GPT‑5.6 Sol 在 ARC-AGI-3 公開任務集取得 13.3%;保留推理並啟用上下文壓縮後,得分為 38.3%。分數衡量相對人類行動效率(RHAE(在新視窗中開啟))——這項指標把模型表現與人類基準比較。根據官方遊戲記錄(在新視窗中開啟),我們估計人類測試者的平均得分為 48%。模型不會獲知評分方式,也無法在過程中查看分數——每次行動只會傳回當前畫面及所在關卡的文字表示。
ARC-AGI-3 是一項旨在衡量 AI 智能代理學習和推理能力的基準測試。智能代理會探索陌生的二維遊戲,並在沒有明確指示的情況下推斷其運作方式。你可以在 arcprize.org/tasks(在新視窗中開啟) 試玩 25 款示範遊戲。
ARC-AGI-3 刻意採用通用任務執行框架,不設工具或特殊功能。ARC 認為,簡單的任務執行框架能令模型的不足更明顯,也可讓模型之間的比較更公平。相比之下,商業開發者會針對每個模型的功能和特性,優化任務執行框架。
在遊戲方面,GPT‑5.6 Sol 曾透過純視覺任務執行框架通關《Pokémon FireRed》(由 GPT_Plays_Pokemon(在新視窗中開啟) 直播),透過 Codex 的電腦操作功能通關《Slay the Spire》(由 EpochAI(在新視窗中開啟) 直播),並完成《Baba Is You》的最初幾個關卡(由 Piotr Migdał & Piotr Grabowski(在新視窗中開啟) 分享)。ARC-AGI-3 究竟有何不同?

Ethan Mollick 展示(在新視窗中開啟)了 Codex 中的 GPT‑5.6 Sol 如何完成《Slay the Spire 2》的隨機每日挑戰;這款遊戲在 GPT‑5.6 Sol 的知識截止日期後才推出。
受到 ARC 對 GPT‑5.5 不足之處的分析(在新視窗中開啟)啟發,我們檢視了 GPT‑5.6 Sol 的部分嘗試。我們與 ARC 一樣,看到模型的表現似乎不太聰明。它每次行動前都思考很久,卻難有進展。
然而,深入研究後,我們發現模型的大部分困惑並非源於模型本身,而是任務執行框架的設定所致。
首先,我們發現每次遊戲行動後,所有私有推理都會被捨棄。這表示 GPT‑5.6 Sol 每次行動時,都要重新理解遊戲,無法記得先前的思考。模型仍可看到過往操作記錄和簡短附註,卻看不到促成這些操作的計劃、見解或思路。
其次,我們發現任務執行框架採用了滾動截斷視窗,令較舊的行動隨記錄增加而逐漸不可見。因此,GPT‑5.6 Sol 不僅無法記得過往思考,也逐漸忘記先前的行動。
任務執行框架的這兩項特性——捨棄推理和滾動截斷——共同解釋了 GPT‑5.6 Sol 為何難以持續學習。
我們訓練模型在輸出回覆或調用工具前,先以私有推理訊息思考。這些私有思考訊息會保留為對話記錄的一部分。如果對話過長,我們會先加以摘要,再繼續對話。
我們的模型不僅以這種方式訓練,也以同樣方式部署於 ChatGPT 和 Codex。為了更貼近我們的正式環境設定,我們以 Responses API(在新視窗中開啟) 實作 ARC-AGI-3 任務執行框架。我們的 API 讓上下文管理更簡單:對 GPT‑5.6 而言,只要傳入上一個回應 ID,便會自動在工具調用和對話輪次之間保留推理。
保留推理後,我們觀察到兩項重大變化。首先,GPT‑5.6 Sol 每次行動前花在思考上的時間減少,因為它不必每一輪都從頭理解遊戲。其次,能夠記得過往思考後,GPT‑5.6 Sol 更能隨時間學習,並採用連貫的策略。
下一項改進,是以 上下文壓縮(在新視窗中開啟)取代滾動截斷;這是 Responses API 的另一項設定。
ARC-AGI-3 任務執行框架以滾動截斷處理上下文限制。對話上下文超過 175,000 個字元時,最舊的訊息便會被捨棄。
滾動截斷有兩項缺點。首先,模型會失去較早的觀察結果和行動。其次,模型執行大部分任務時,上下文視窗都較為飽和,可能令表現略為下降。
我們在 ARC-AGI-3 啟用上下文壓縮後,GPT‑5.6 Sol 更能在較長的執行過程中保留對每款遊戲的認知,並以較少輸出 token 取得更高分。
為說明保留推理和啟用上下文壓縮的效果,以下動畫展示 GPT‑5.6 Sol 分別使用兩種任務執行框架解答一系列 ARC-AGI-3 謎題時,其 17.5 萬 token 上下文視窗的狀況。
中間兩欄顯示兩種任務執行框架如何以不同方式使用模型的上下文視窗。由於更能記得過往情況,GPT‑5.6 Sol 每次行動所需的思考更少,進展也快得多。請注意:我們的實作採用 175,000 個 token 的上限,而非字元上限,但兩者結果相當接近,因為絕大部分文字都是行動網格,我們的 tokenizer 會以 1:1 的比例將其 token 化。
保留推理和上下文壓縮相輔相成,令 GPT‑5.6 Sol(Max)以減至六分之一的輸出 token,取得約三倍得分。
我們希望這些實驗能提醒大家,評測很少只衡量模型本身,也會衡量一系列較不顯眼的選擇,包括 API 設定、任務執行框架設計和提示詞。這並非我們首次因公開基準測試的低分而感到意外,後來才發現評測執行器採用了會捨棄推理訊息的通用任務執行框架。
如果你是希望盡量提升效能的 API 開發者,我們建議採用與自家產品相同的設定:
- 使用 Responses API,而非舊有的 Chat Completions API
- 保留推理
- 使用上下文壓縮
如果你要比較模型,我們建議採用使用上述設定的評測,因為這些設定最貼近 ChatGPT 和 Codex 的實際使用情況。
我們感謝 ARC 多年來在 AGI 評測方面所作的創新工作,以及啟發我們深入研究此事的分析。
如果你想親自挑戰前沿模型,可前往 arcprize.org/tasks(在新視窗中開啟) 試玩這些公開遊戲。


