跳到主要內容
OpenAI

2026年9月22日

產品

為 GPT‑6 提供更佳的提示詞快取

更高的快取命中率和新工具,讓持續運作的智能代理速度更快、成本更低。

正在載入...

GPT‑6 讓持續運作的智能代理可以花數小時處理複雜工作,包括重構程式碼庫,以及製作經深入研究的文件和簡報。這些智能代理背後的應用程式會連續發出彼此承接的 API 請求,並經常沿用先前輪次中的相同指示、工具定義和上下文。OpenAI 會快取這些共用上下文,以重用不同請求之間的運算結果,從而縮短回應時間,並為開發人員提供快取輸入 Token 最高 90% 的折扣。

隨 GPT‑6 系列推出,我們亦發佈了改良的提示詞快取系統,預設即可提供更高的快取命中率。現在,只要符合資格的共用前綴在 30 分鐘內獲重用,即可享有快取折扣。我們亦推出新工具,協助開發人員監察快取效能、診斷未命中原因,並選擇要快取提示詞的哪些部分。

OpenAI 的提示詞快取對協助 GitHub Copilot 大規模提供快速高效的體驗至關重要。過去數月,在向 OpenAI 模型發出的數十億次請求中,與先前基準相比,需要重新處理的提示詞 Token 比例已減少超過 50%。這帶來更高效的推論技術堆疊,亦縮短了開發人員收到首次回應的時間。
—Mario Rodriguez,產品總監

監察快取並診斷快取未命中

新的提示詞快取儀表板(在新視窗中開啟)會顯示應用程式輸入中有多少內容由快取提供。追蹤命中率隨時間的變化,並使用輸入組成圖表比較已快取和未快取的 Token。這些檢視畫面有助你發現快取命中率下降,並評估應用程式變更對快取效能的影響。

提示詞快取儀表板,顯示快取命中率、快取效能的時間變化及輸入 Token 組成。

如遇到意外的快取未命中,請使用提示詞快取診斷工具(在新視窗中開啟)了解原因。將請求與近期回應比較,找出模型、工具、設定或輸入中的哪些變更導致無法重用。估算受影響的 Token 數目,有助你評估影響程度,並決定如何優化整合,以盡量提高快取命中率。

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

為應用程式優化快取

選擇要快取的內容。明確的快取中斷點讓你選擇要重用哪些提示詞前綴。更新後的提示詞快取指南(在新視窗中開啟)說明如何使用這些中斷點、已快取前綴維持有效的時間,以及工具和輸入變更會如何影響重用。

調整推理強度而不中斷快取。在 GPT‑6 模型中,你現在可以在兩次回應之間變更推理強度(在新視窗中開啟),而不會中斷快取。你可以為較困難的工作提高強度,或為例行跟進降低強度:只需附加 configuration_update,同時保持請求層級的推理強度不變。這讓你在保留可重用上下文的同時,按工作需要調整推理量。

在工具和指示變更時保留快取。智能代理的工具使用需求改變時,請保持工具定義、結構描述和排序穩定,讓先前的上下文仍可重用。使用 allowed_tools 只允許呼叫相關工具;如無需使用工具,則將 tool_choice 設為 none,而不是移除定義。使用新的開發人員訊息,在上下文末端附近附加新指示,以覆寫較舊的指示。請參閱我們的工具變更管理指引(在新視窗中開啟)

預熱快取以縮短延遲。預熱(在新視窗中開啟)會預先準備已知上下文,讓模型在收到請求時可以更快開始回應。例如,應用程式可以在啟動期間、用戶提出第一個問題之前,預熱共用指示、工具定義或參考資料。這可將處理工序移出用戶的等候時間。

這些選用控制功能建基於引擎的預設效能,助你按工作負載調整快取方式。

1/3
OpenAI 的提示詞快取診斷工具和儀表板協助我們將快取命中率提高數個百分點,成本因而降低 20%。現在,快取意外失效時我們會收到警示,並使用 Codex 智能代理診斷根本原因。明確的中斷點亦讓我們能快取穩定的上下文,同時將經常變動的內容保留在提示詞末端。這讓我們能以符合成本效益的方式分支複製對話來執行背景工作,同時重用幾乎所有共用上下文。
—Arian Hanifi,技術總監

開始使用

作者

OpenAI