GPT‑6 讓持續運作的智能代理可以花數小時處理複雜工作,包括重構程式碼庫,以及製作經深入研究的文件和簡報。這些智能代理背後的應用程式會連續發出彼此承接的 API 請求,並經常沿用先前輪次中的相同指示、工具定義和上下文。OpenAI 會快取這些共用上下文,以重用不同請求之間的運算結果,從而縮短回應時間,並為開發人員提供快取輸入 Token 最高 90% 的折扣。
隨 GPT‑6 系列推出,我們亦發佈了改良的提示詞快取系統,預設即可提供更高的快取命中率。現在,只要符合資格的共用前綴在 30 分鐘內獲重用,即可享有快取折扣。我們亦推出新工具,協助開發人員監察快取效能、診斷未命中原因,並選擇要快取提示詞的哪些部分。
新的提示詞快取儀表板(在新視窗中開啟)會顯示應用程式輸入中有多少內容由快取提供。追蹤命中率隨時間的變化,並使用輸入組成圖表比較已快取和未快取的 Token。這些檢視畫面有助你發現快取命中率下降,並評估應用程式變更對快取效能的影響。

如遇到意外的快取未命中,請使用提示詞快取診斷工具(在新視窗中開啟)了解原因。將請求與近期回應比較,找出模型、工具、設定或輸入中的哪些變更導致無法重用。估算受影響的 Token 數目,有助你評估影響程度,並決定如何優化整合,以盡量提高快取命中率。
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
選擇要快取的內容。明確的快取中斷點讓你選擇要重用哪些提示詞前綴。更新後的提示詞快取指南(在新視窗中開啟)說明如何使用這些中斷點、已快取前綴維持有效的時間,以及工具和輸入變更會如何影響重用。
調整推理強度而不中斷快取。在 GPT‑6 模型中,你現在可以在兩次回應之間變更推理強度(在新視窗中開啟),而不會中斷快取。你可以為較困難的工作提高強度,或為例行跟進降低強度:只需附加 configuration_update,同時保持請求層級的推理強度不變。這讓你在保留可重用上下文的同時,按工作需要調整推理量。
在工具和指示變更時保留快取。智能代理的工具使用需求改變時,請保持工具定義、結構描述和排序穩定,讓先前的上下文仍可重用。使用 allowed_tools 只允許呼叫相關工具;如無需使用工具,則將 tool_choice 設為 none,而不是移除定義。使用新的開發人員訊息,在上下文末端附近附加新指示,以覆寫較舊的指示。請參閱我們的工具變更管理指引(在新視窗中開啟)。
預熱快取以縮短延遲。預熱(在新視窗中開啟)會預先準備已知上下文,讓模型在收到請求時可以更快開始回應。例如,應用程式可以在啟動期間、用戶提出第一個問題之前,預熱共用指示、工具定義或參考資料。這可將處理工序移出用戶的等候時間。
這些選用控制功能建基於引擎的預設效能,助你按工作負載調整快取方式。
在提示詞快取儀表板(在新視窗中開啟)監察快取命中率。
使用診斷工具(在新視窗中開啟)調查意外的快取未命中。
按照提示詞快取指南(在新視窗中開啟)改善設定,或使用 Codex(在新視窗中開啟) 審查程式碼、套用改進並衡量成果。


