跳至主要內容
OpenAI

2026年9月22日

產品

GPT‑6 更出色的提示詞快取

更高的快取命中率與新工具,讓持續運作的智慧體執行得更快、成本更低。

載入中…

GPT‑6 讓持續運作的智慧體能花數小時處理複雜工作,從重構程式碼庫,到製作經過充分研究的文件與簡報。這些智慧體背後的應用程式會發出一連串彼此承接的 API 請求,並經常沿用先前對話中的相同指示、工具定義與內容脈絡。OpenAI 會快取這些共用內容脈絡,以便在不同請求間重複運用運算結果,不僅縮短回應時間,也讓開發者使用已快取的輸入 Token 時可享最高 90% 的折扣。

我們隨 GPT‑6 系列推出改良版提示詞快取系統,預設即可提供更高的快取命中率。現在,只要在 30 分鐘內重複使用符合資格的共用前綴,即可享有快取折扣。我們也推出新工具,協助開發者監控快取效能、診斷未命中原因,並選擇要快取多少提示詞內容。

OpenAI 的提示詞快取對於協助 GitHub Copilot 大規模提供快速、高效率的體驗至關重要。過去幾個月來,在傳送至 OpenAI 模型的數十億項請求中,需要重新處理的提示詞 Token 占比相較於先前基準已降低逾 50%。因此,推論堆疊效率更高,開發者也能更快收到第一則回應。
—Mario Rodriguez,產品長

監控快取並診斷快取未命中

全新的提示詞快取儀表板(在新視窗中開啟)會顯示應用程式有多少輸入內容是由快取提供。追蹤命中率的時間趨勢,並使用輸入組成圖表比較已快取與未快取的 Token。這些檢視畫面可協助您發現快取命中率下降,並評估應用程式的變更如何影響快取效能。

提示詞快取儀表板,顯示快取命中率、快取效能的時間趨勢,以及輸入 Token 的組成。

若發現快取意外未命中,請使用提示詞快取診斷工具(在新視窗中開啟)瞭解原因。將一項請求與近期回應進行比較,找出模型、工具、設定或輸入中的哪些變更導致內容無法重複使用。系統會估算受影響的 Token 數量,協助您評估影響程度,並判斷如何最佳化整合,以盡可能提高快取命中率。

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

為應用程式最佳化快取

選擇要快取的內容。明確的快取中斷點可讓您選擇要重複使用哪些提示詞前綴。更新後的提示詞快取指南(在新視窗中開啟)會說明如何使用這些中斷點、已快取前綴可供重複使用的期限,以及工具和輸入變更會如何影響重複使用。

調整推理強度,而不中斷快取。在 GPT‑6 模型上,現在可以在回應之間變更推理強度(在新視窗中開啟),而不中斷快取。面對較困難的工作時可提高強度,處理例行的後續工作時則可降低強度;只要附加 configuration_update,並維持請求層級的推理強度不變即可。如此一來,您就能依工作需求調整推理量,同時保留可重複使用的內容脈絡。

在工具與指示變更時保留快取。當智慧體使用工具的需求改變時,請維持工具定義、結構描述及順序不變,讓先前的內容脈絡仍可重複使用。請使用 allowed_tools,僅讓相關工具可供呼叫;若不需要任何工具,則將 tool_choice 設為 none,而不要移除定義。使用新的開發者訊息,將新指示附加至內容脈絡末端,以覆寫舊指示。請參閱我們的工具變更管理指南(在新視窗中開啟)

預熱快取以縮短延遲。預熱(在新視窗中開啟)會事先準備已知的內容脈絡,讓模型在收到請求時能更快開始回應。例如,應用程式可以在啟動期間、使用者提出第一個問題前,預熱共用指示、工具定義或參考資料。如此便能將處理時間排除在使用者的等候時間之外。

這些選用控制項以引擎的預設效能為基礎,協助您依工作負載調整快取方式。

1 之 3
OpenAI 的提示詞快取診斷功能與儀表板,協助我們將快取命中率提高數個百分點,並降低 20% 的成本。現在,快取若意外失效,我們便會收到警示,並使用 Codex 智慧體診斷根本原因。明確的中斷點也讓我們能快取穩定的內容脈絡,同時將經常變動的內容保留在提示詞末端。如此一來,我們便能以符合經濟效益的方式為背景工作分支對話,同時重複使用幾乎所有共用內容脈絡。
—Arian Hanifi,技術長

開始使用

作者

OpenAI