这段加速视频展示了 GPT‑5.6 Sol 尝试解决 ARC-AGI-3 基准测试中的谜题:左侧使用官方执行框架,右侧使用我们保留推理并启用压缩的 Responses API 执行框架。在这款游戏(在新窗口中打开)的排行榜上,没有任何前沿模型能通过第一关之后的关卡。使用我们的执行框架后,GPT‑5.6 Sol 通关了全部六关。
最初看到 GPT‑5.6 Sol 在 ARC-AGI-3(在新窗口中打开) 基准测试中的低分时,我们十分困惑。
GPT‑5.6 Sol 已经解决了数学界长期悬而未决的难题,例如圈双覆盖猜想(在新窗口中打开),也通关了《宝可梦 火红》等游戏。但在由二维益智游戏组成的 ARC-AGI-3 基准测试中,GPT‑5.6 Sol 仅得 7.8%,GPT‑5.5 更是几乎无法游玩,得分只有 0.4%。
二维益智游戏对我们的模型来说格外困难吗?还是另有原因?
基准测试很少只衡量 AI 模型本身。它们还会衡量一些不太显眼的选择,包括 API 设置、执行框架设计和提示方式。在 ARC-AGI-3 上,我们发现,开启 ChatGPT 和 Codex 中使用的两项 API 设置——保留推理和压缩——可使公开任务集的得分增至三倍,同时将输出词元降至六分之一。
使用官方执行框架时,GPT‑5.6 Sol 在 ARC-AGI-3 公开集上得分为 13.3%;保留推理并启用压缩后,得分达到 38.3%。分数衡量相对人类行动效率(RHAE(在新窗口中打开))—该指标将模型表现与人类基准进行比较。根据官方游戏记录(在新窗口中打开),我们估计人类测试者的平均得分为 48%。模型不会获知评分方式,在整个过程中也看不到自己的分数—每次操作只会返回当前画面及所在关卡的文本表示。
ARC-AGI-3 是一项旨在衡量 AI 智能体学习和推理能力的基准测试。智能体需要探索陌生的二维游戏,在没有明确说明的情况下推断游戏机制。你可以前往 arcprize.org/tasks(在新窗口中打开) 体验 25 款演示游戏。
ARC-AGI-3 有意采用不含工具或特殊功能的通用执行框架。ARC 认为,简单的执行框架能更清楚地暴露模型的不足,也能让模型之间的比较更加公平。相比之下,商业开发者会针对每个模型的功能和特点优化执行框架。
在游戏方面,GPT‑5.6 Sol 已通过仅使用视觉的执行框架通关《宝可梦 火红》(由 GPT_Plays_Pokemon(在新窗口中打开) 直播),通过 Codex 的计算机操作功能通关《杀戮尖塔》(由 EpochAI(在新窗口中打开) 直播),并完成《巴巴是你》的前几个关卡(由 Piotr Migdał & Piotr Grabowski(在新窗口中打开) 分享)。ARC-AGI-3 究竟有何不同?

Ethan Mollick 展示了(在新窗口中打开) Codex 中的 GPT‑5.6 Sol 如何完成《杀戮尖塔 2》的一项随机每日挑战;这款游戏发布于 GPT‑5.6 Sol 的知识截止日期之后。
受到 ARC 对 GPT‑5.5 缺陷的分析(在新窗口中打开)启发,我们查看了 GPT‑5.6 Sol 的一些尝试。和 ARC 一样,我们也发现模型看起来并不聪明。它每次行动前都会思考很久,却迟迟无法取得进展。
但在深入研究后,我们发现模型的困惑大多并非源于模型本身,而是执行框架中的设置。
首先,我们注意到,每次游戏操作后,所有私有推理都会被丢弃。这意味着 GPT‑5.6 Sol 每次行动时都必须重新理解游戏,无法记住之前的思考。模型仍能看到过去的操作记录和简短附注,但看不到促成这些操作的计划、见解或思考。
其次,我们发现执行框架采用了滚动截断窗口,随着历史记录增长,较早的操作会逐渐不可见。因此,GPT‑5.6 Sol 不仅无法记住过去的思考,也在逐渐忘记过去的操作。
执行框架的这两项特性——丢弃推理和滚动截断——共同解释了 GPT‑5.6 Sol 为何难以持续学习。
我们的模型经过训练,会先通过私有推理消息进行思考,再输出回复或调用工具。这些私有思考消息会作为对话历史的一部分保留下来。如果对话过长,我们会对其进行总结,然后继续。
我们的模型正是以这种方式训练,也以同样的方式部署在 ChatGPT 和 Codex 中。为了更贴近我们的生产环境,我们使用 Responses API(在新窗口中打开) 实现了 ARC-AGI-3 执行框架。我们的 API 可轻松管理上下文:对于 GPT‑5.6,只需传入上一次响应的 ID,即可在工具调用和对话轮次之间自动保留推理。
保留推理后,我们观察到两项显著变化。首先,GPT‑5.6 Sol 每次行动前的思考时间更短,因为它不再需要每一轮都从头理解游戏。其次,能够记住过去的思考后,GPT‑5.6 Sol 更善于持续学习和采用连贯的策略。
下一项改进是用 压缩(在新窗口中打开)取代滚动截断;压缩是 Responses API 中的另一项设置。
ARC-AGI-3 执行框架通过滚动截断来应对上下文限制。当对话上下文超过 175,000 个字符时,最早的消息会被丢弃。
滚动截断有两个缺点。首先,模型会丢失较早的观察和操作。其次,模型在大部分任务期间都要使用接近满载的上下文窗口,这可能会略微影响表现。
在 ARC-AGI-3 上启用压缩后,GPT‑5.6 Sol 能在更长的运行过程中更好地保留从每款游戏中学到的内容,并以更少的输出词元取得更高的得分。
为了直观展示保留推理和启用压缩的效果,下面的动画呈现了 GPT‑5.6 Sol 分别使用两种执行框架解决一系列 ARC-AGI-3 谜题时,其 175K 上下文窗口的变化。
中间两列展示了两种执行框架以不同方式使用模型上下文窗口的情况。由于能更好地记住过去,GPT‑5.6 Sol 每次行动所需的思考更少,推进速度也快得多。注意:我们的实现采用 175,000 个词元而非字符作为上限,但两者最终非常接近,因为绝大多数文本都是操作网格,我们的分词器会按 1:1 的比例将其转换为词元。
保留推理与压缩结合使用后,GPT‑5.6 Sol(Max)的得分约为原来的三倍,而输出词元仅为原来的六分之一。
我们希望这些实验能够提醒大家:评测很少只衡量模型本身,也会衡量一系列不太显眼的选择,包括 API 设置、执行框架设计和提示方式。这并非我们第一次因公开基准测试中的低分而感到意外,随后才发现评测运行程序使用了会丢弃推理消息的通用执行框架。
如果你是希望充分发挥性能的 API 开发者,我们建议采用与自家产品相同的设置:
- 使用 Responses API,而非旧版 Chat Completions API
- 保留推理
- 使用压缩
如果你要比较模型,我们建议采用使用上述设置的评测,因为这些设置最贴近 ChatGPT 和 Codex 中的实际应用。
我们感谢 ARC 多年来在 AGI 评测领域开展的创造性工作,也感谢其分析启发我们进一步深入研究。
如果你想与前沿模型一较高下,可以前往 arcprize.org/tasks(在新窗口中打开) 亲自挑战这些公开游戏。


