跳至主要内容
OpenAI

2026年9月22日

产品

为 GPT‑6 打造更出色的提示词缓存

更高的缓存命中率和新工具,让持久运行的智能体速度更快、成本更低。

正在加载…

GPT‑6 让持久运行的智能体能够连续数小时处理复杂任务,从重构代码库到制作经过充分研究的文档和演示文稿。这些智能体背后的应用会连续发出相互承接的 API 请求,通常会沿用前几轮中的相同指令、工具定义和上下文。OpenAI 会缓存这些共享上下文,以便跨请求复用计算,从而缩短响应时间,并让开发者在缓存的输入 Token 上享受最高 90% 的折扣。

随 GPT‑6 系列一同推出的新版提示词缓存系统,默认即可提供更高的缓存命中率。现在,符合条件且在 30 分钟内复用的共享前缀可享受缓存折扣。我们还推出了新工具,帮助开发者监控缓存性能、诊断缓存未命中,并选择要缓存的提示词范围。

OpenAI 的提示词缓存对于帮助 GitHub Copilot 大规模提供快速、高效的体验至关重要。过去几个月里,在向 OpenAI 模型发出的数十亿次请求中,需要重新处理的提示词 Token 占比相较此前基线降低了 50% 以上。由此带来了更高效的推理栈,也让开发者能更快获得首个响应。
—Mario Rodriguez,首席产品官

监控缓存并诊断缓存未命中

新的提示词缓存控制面板(在新窗口中打开)会显示应用输入中有多少内容由缓存提供。跟踪命中率随时间的变化,并使用输入构成图表比较已缓存和未缓存的 Token。这些视图可帮助你发现缓存命中率下降,并评估应用变更对缓存性能的影响。

提示词缓存控制面板,显示缓存命中率、缓存性能随时间的变化以及输入 Token 构成。

如果出现意外的缓存未命中,请使用提示词缓存诊断工具(在新窗口中打开)了解具体原因。将请求与最近的响应进行比较,找出模型、工具、设置或输入中阻碍复用的变化。受影响 Token 数量的估算值可帮助你判断影响程度,并确定如何优化集成,以尽可能提高缓存命中率。

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

为应用优化缓存

选择要缓存的内容。显式缓存断点让你能够选择要复用的提示词前缀。更新后的提示词缓存指南(在新窗口中打开)介绍了如何使用这些断点、已缓存前缀保持可用的时长,以及工具和输入的变化如何影响复用。

在不中断缓存的情况下调整推理强度。在 GPT‑6 模型上,你现在可以在两次响应之间更改推理强度(在新窗口中打开),而不会中断缓存。对于较难的任务,可以提高强度;对于常规的后续任务,则可降低强度。只需追加一个 configuration_update,同时保持请求级推理强度不变。这样,你可以根据任务需要调整推理量,同时保留可复用的上下文。

在工具和指令发生变化时保留缓存。随着智能体对工具的使用需求发生变化,应保持工具定义、架构和顺序稳定,让较早的上下文仍可复用。使用 allowed_tools 仅允许调用相关工具;如果无需工具,则将 tool_choice 设为 none,而不要移除工具定义。使用新的开发者消息,将新指令追加到上下文末尾附近,以覆盖旧指令。请参阅我们的工具变更管理指南(在新窗口中打开)

预热缓存以降低延迟。预热(在新窗口中打开)会提前准备已知上下文,让请求到达后模型能更快开始响应。例如,应用可以在启动时、用户提出第一个问题前,预热共享指令、工具定义或参考资料。这样可在用户等待前完成相关处理。

这些可选控制功能建立在引擎默认性能之上,帮助你根据工作负载定制缓存。

1 条/ 共 3 条
OpenAI 的提示词缓存诊断功能和控制面板帮助我们将缓存命中率提高了几个百分点,成本降低了 20%。现在,当缓存意外失效时,我们会收到提醒,并使用 Codex 智能体诊断根本原因。显式断点还让我们能够缓存稳定的上下文,同时将频繁变化的内容保留在提示词末尾。这样一来,我们可以在复用几乎全部共享上下文的同时,为后台任务派生对话,并且在经济上切实可行。
—Arian Hanifi,首席技术官

开始使用

作者

OpenAI