GPT‑6 让持久运行的智能体能够连续数小时处理复杂任务,从重构代码库到制作经过充分研究的文档和演示文稿。这些智能体背后的应用会连续发出相互承接的 API 请求,通常会沿用前几轮中的相同指令、工具定义和上下文。OpenAI 会缓存这些共享上下文,以便跨请求复用计算,从而缩短响应时间,并让开发者在缓存的输入 Token 上享受最高 90% 的折扣。
随 GPT‑6 系列一同推出的新版提示词缓存系统,默认即可提供更高的缓存命中率。现在,符合条件且在 30 分钟内复用的共享前缀可享受缓存折扣。我们还推出了新工具,帮助开发者监控缓存性能、诊断缓存未命中,并选择要缓存的提示词范围。
新的提示词缓存控制面板(在新窗口中打开)会显示应用输入中有多少内容由缓存提供。跟踪命中率随时间的变化,并使用输入构成图表比较已缓存和未缓存的 Token。这些视图可帮助你发现缓存命中率下降,并评估应用变更对缓存性能的影响。

如果出现意外的缓存未命中,请使用提示词缓存诊断工具(在新窗口中打开)了解具体原因。将请求与最近的响应进行比较,找出模型、工具、设置或输入中阻碍复用的变化。受影响 Token 数量的估算值可帮助你判断影响程度,并确定如何优化集成,以尽可能提高缓存命中率。
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
选择要缓存的内容。显式缓存断点让你能够选择要复用的提示词前缀。更新后的提示词缓存指南(在新窗口中打开)介绍了如何使用这些断点、已缓存前缀保持可用的时长,以及工具和输入的变化如何影响复用。
在不中断缓存的情况下调整推理强度。在 GPT‑6 模型上,你现在可以在两次响应之间更改推理强度(在新窗口中打开),而不会中断缓存。对于较难的任务,可以提高强度;对于常规的后续任务,则可降低强度。只需追加一个 configuration_update,同时保持请求级推理强度不变。这样,你可以根据任务需要调整推理量,同时保留可复用的上下文。
在工具和指令发生变化时保留缓存。随着智能体对工具的使用需求发生变化,应保持工具定义、架构和顺序稳定,让较早的上下文仍可复用。使用 allowed_tools 仅允许调用相关工具;如果无需工具,则将 tool_choice 设为 none,而不要移除工具定义。使用新的开发者消息,将新指令追加到上下文末尾附近,以覆盖旧指令。请参阅我们的工具变更管理指南(在新窗口中打开)。
预热缓存以降低延迟。预热(在新窗口中打开)会提前准备已知上下文,让请求到达后模型能更快开始响应。例如,应用可以在启动时、用户提出第一个问题前,预热共享指令、工具定义或参考资料。这样可在用户等待前完成相关处理。
这些可选控制功能建立在引擎默认性能之上,帮助你根据工作负载定制缓存。
在提示词缓存控制面板(在新窗口中打开)中监控缓存命中率。
使用诊断工具(在新窗口中打开)排查意外的缓存未命中。
按照提示词缓存指南(在新窗口中打开)改进设置,或使用 Codex(在新窗口中打开) 审查代码、应用改进并衡量结果。


