GPT‑5.6 开发者指南
来自初创公司生产实践的技术经验
GPT‑5.6 模型系列不仅大幅降低了实现前沿级智能体性能的成本,也进一步拓展了能力边界。
本指南将介绍初创公司如何通过更智能的模型选择,以及有助于保持推理连续性、多智能体编排和程序化工具调用的新 API 控制功能,以更低的成本打造速度更快、能力更强的智能体。
自 GPT‑5 起,每一代模型都致力于用更少的 Token 处理时间跨度更长的任务。GPT‑5.6 延续了这一趋势:智能体性能更强、成本更低,同时几乎无需改动底层执行框架。
在总体成本效益提升的基础上,较低推理强度下的准确率也有所提高,进一步放大了收益。例如,在 Agents’ Last Exam 中,保持执行框架不变时,采用“低”推理强度的 GPT‑5.6 Sol 表现优于采用“高”推理强度的 GPT‑5.5。我们在生产测试中也看到了类似成果:初创公司表示,将推理强度调低至低于此前的默认值后,多种工作流的成本均显著下降。
以往,对于时间跨度较长的用例,升级到采用最高推理强度的旗舰模型通常是最佳选择。这主要是因为,与成本优化型模型相比,这些模型在处理更长上下文和工具调用方面的能力明显更强。5.6 系列改变了这一局面:借助更多测试时计算,Luna 和 Terra 往往能实现与 GPT‑5.4 和 5.5 相近的表现,成本却低得多。
以 BrowseComp 中的任务为例:这是一项基于搜索的基准测试,用于检验模型查找冷门事实的能力。三个月前,GPT‑5.5(极高)在这项基准测试中取得了 84.36% 的得分,总成本为 33.27 美元。发布时,GPT‑5.6 Luna(极高)以 1.33 美元的成本取得了 84.04% 的得分,表现基本相同。此后,我们进一步下调了价格。详细了解我们最新的降价信息。
5.6 系列中的小型模型非常适合高负载工作、对延迟敏感的交互,以及智能体工作流中的重复步骤。例如,如果一家法律科技初创公司需要先解析手写备忘录,再交由智能体分析,那么如今不必再为整个用例使用前沿模型,而可以用 Terra 或 Luna 提取内容,从而显著节省成本。
除了提升 GPT‑5.6 的开箱即用性能,我们还为 Responses API 推出了新的基础功能,以释放更多效益。我们结合三项相辅相成的架构改进,对 GPT‑5.6 进行了端到端训练,使智能体能够更高效地运行:
- 复用已完成的工作:通过在模型的多轮交互间保留推理(在新窗口中打开),并使用原生压缩(在新窗口中打开)来精简长对话,模型可以在时间跨度更长的任务中保持工作连贯性,避免思路混乱或不得不重建先前上下文。
- 适时并行拆解:借助原生多智能体编排(在新窗口中打开),可以协调多个智能体并行处理不同工作流,更快完成复杂任务。
- 将确定性工作移入代码:使用程序化工具调用(在新窗口中打开)在模型的上下文窗口之外筛选、汇总和编排工具输出,将模型 Token 留给判断工作,同时降低成本和延迟,减少上下文退化。
结合使用这些功能,效果可能十分显著。例如,在 ARC-AGI-3 中,GPT‑5.6 Sol 使用标准执行框架取得了 13.3% 的得分。然而,启用保留推理和压缩后,得分跃升至 38.3%,同时输出 Token 用量降至约六分之一。模型本身没有变化,性能却提高到近三倍。你可以在此详细了解我们的 ARC-AGI-3 执行框架研究。
智能体工作流通常涉及两类工作:
- 需要判断的任务
- 主要涉及移动、筛选和合并数据的工作
当智能体检索 100 份申报文件、按日期筛选并识别相关交易时,不应要求模型在上下文窗口中逐一推理所有中间结果。程序化工具调用让 GPT‑5.6 能够编写 JavaScript 来编排工具、并行执行相互独立的调用,并在上下文窗口之外处理输出。这样,模型就能专注于真正需要智能的工作:运用判断力。
对于复杂且可并行处理的任务,将操作和推理分配到多个智能体工作流中,既能更快完成任务,也能提升智能水平。在这类配置中,主智能体负责对子智能体进行编排,并向它们委派任务。各个子智能体并行完成各自目标,最后将输出传回主智能体,由其进行最终整合。团队可以在 Responses API 中启用多智能体(在新窗口中打开),直接开始运用这一能力。ChatGPT 中的 Ultra 能力设置也是以这种方式运行的。
“Qualia 让多个智能体团队处理开放式研究问题,而 GPT‑5.6 Sol 与我们的需求一拍即合。与 GPT‑5.5 相比,它有显著提升,完成速度几乎快过我们测试的所有其他模型,很快就成了我们首选的 OpenAI 模型。”
“GPT‑5.6 是我们见过的 OpenAI 最出色的编排模型。我们一次向它提交了六份规格说明,同时让它撰写、构建并逐一讲解;它始终掌握所有内容,质量也没有下降。”
虽然 GPT‑5.6 能准确判断适当的子智能体数量及其启动时机,但多智能体行为仍具有很强的可引导性。通过提示模型应在何时调用子智能体,可以提高仅在额外 Token 开销能够改善性能时才启动智能体的概率。
整个模型系列的提示词缓存 TTL 均已延长至至少 30 分钟,现在还可以在模型的上下文窗口内确定性地设置缓存断点。这让初创公司能够显著提高缓存命中率。
除了设置缓存断点,继续使用合适的 prompt_cache_key(在新窗口中打开),还能提高请求被分配到曾处理过相同前缀的推理引擎上的概率,从而降低延迟。
这些案例共同凸显出一点:构建智能体的经济性已经发生了巨大变化。
过去需要每一步都使用前沿模型的用例,如今通过采用小型模型、调整推理强度并做出高效的架构选择,只需很少一部分成本就能取得相当甚至更好的结果。
期待看到大家构建出精彩成果!
- 2026 年
- API 平台
关于作者
本指南由 Samarth Madduru(在新窗口中打开)、Prashant Mital(在新窗口中打开)、Dave Leo(在新窗口中打开) 和 Julien Reiman(在新窗口中打开) 编写,内容基于他们从早期测试到投入生产的全过程中,与使用 GPT‑5.6 进行构建的初创公司密切合作所积累的经验。


