GPT‑6 讓持續運作的智慧體能花數小時處理複雜工作,從重構程式碼庫,到製作經過充分研究的文件與簡報。這些智慧體背後的應用程式會發出一連串彼此承接的 API 請求,並經常沿用先前對話中的相同指示、工具定義與內容脈絡。OpenAI 會快取這些共用內容脈絡,以便在不同請求間重複運用運算結果,不僅縮短回應時間,也讓開發者使用已快取的輸入 Token 時可享最高 90% 的折扣。
我們隨 GPT‑6 系列推出改良版提示詞快取系統,預設即可提供更高的快取命中率。現在,只要在 30 分鐘內重複使用符合資格的共用前綴,即可享有快取折扣。我們也推出新工具,協助開發者監控快取效能、診斷未命中原因,並選擇要快取多少提示詞內容。
全新的提示詞快取儀表板(在新視窗中開啟)會顯示應用程式有多少輸入內容是由快取提供。追蹤命中率的時間趨勢,並使用輸入組成圖表比較已快取與未快取的 Token。這些檢視畫面可協助您發現快取命中率下降,並評估應用程式的變更如何影響快取效能。

若發現快取意外未命中,請使用提示詞快取診斷工具(在新視窗中開啟)瞭解原因。將一項請求與近期回應進行比較,找出模型、工具、設定或輸入中的哪些變更導致內容無法重複使用。系統會估算受影響的 Token 數量,協助您評估影響程度,並判斷如何最佳化整合,以盡可能提高快取命中率。
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
選擇要快取的內容。明確的快取中斷點可讓您選擇要重複使用哪些提示詞前綴。更新後的提示詞快取指南(在新視窗中開啟)會說明如何使用這些中斷點、已快取前綴可供重複使用的期限,以及工具和輸入變更會如何影響重複使用。
調整推理強度,而不中斷快取。在 GPT‑6 模型上,現在可以在回應之間變更推理強度(在新視窗中開啟),而不中斷快取。面對較困難的工作時可提高強度,處理例行的後續工作時則可降低強度;只要附加 configuration_update,並維持請求層級的推理強度不變即可。如此一來,您就能依工作需求調整推理量,同時保留可重複使用的內容脈絡。
在工具與指示變更時保留快取。當智慧體使用工具的需求改變時,請維持工具定義、結構描述及順序不變,讓先前的內容脈絡仍可重複使用。請使用 allowed_tools,僅讓相關工具可供呼叫;若不需要任何工具,則將 tool_choice 設為 none,而不要移除定義。使用新的開發者訊息,將新指示附加至內容脈絡末端,以覆寫舊指示。請參閱我們的工具變更管理指南(在新視窗中開啟)。
預熱快取以縮短延遲。預熱(在新視窗中開啟)會事先準備已知的內容脈絡,讓模型在收到請求時能更快開始回應。例如,應用程式可以在啟動期間、使用者提出第一個問題前,預熱共用指示、工具定義或參考資料。如此便能將處理時間排除在使用者的等候時間之外。
這些選用控制項以引擎的預設效能為基礎,協助您依工作負載調整快取方式。
在提示詞快取儀表板(在新視窗中開啟)中監控快取命中率。
使用診斷工具(在新視窗中開啟)調查意外未命中的原因。
依照提示詞快取指南(在新視窗中開啟)改善設定,或使用 Codex(在新視窗中開啟)檢查程式碼、套用改進措施並衡量成果。


