GPT‑6 により、永続的なエージェントは、コードベースのリファクタリングから、十分な調査に基づく文書やプレゼンテーションの作成まで、複雑なタスクに数時間取り組めます。こうしたエージェントを支えるアプリケーションは、相互に連続する一連の API リクエストを行い、多くの場合、以前のターンと同じ指示、ツール定義、コンテキストを引き継ぎます。OpenAI はその共有コンテキストをキャッシュし、リクエスト間で計算を再利用します。これにより応答時間が短縮され、開発者はキャッシュ済み入力トークンについて最大 90% の割引を受けられます。
GPT‑6 ファミリーでは、デフォルトでより高いキャッシュヒット率を実現する、改良版のプロンプトキャッシュシステムを導入しました。現在は、30 分以内に再利用された対象の共有プレフィックスにキャッシュ割引を適用しています。さらに、開発者がキャッシュ性能を監視し、ミスを診断し、プロンプトのどの範囲をキャッシュするかを選べる新しいツールも導入します。
新しい プロンプトキャッシュダッシュボード(新しいウィンドウで開く)では、アプリケーションへの入力のうち、キャッシュから提供された割合を確認できます。ヒット率の推移を追跡し、入力構成グラフでキャッシュ済みトークンと未キャッシュトークンを比較できます。これらの表示を使うと、キャッシュヒット率の低下を見つけ、アプリケーションへの変更がキャッシュ性能に与える影響を評価できます。

予期しないキャッシュミスが発生した場合は、プロンプトキャッシュ診断ツール(新しいウィンドウで開く)で原因を確認できます。リクエストを直近のレスポンスと比較し、再利用を妨げたモデル、ツール、設定、入力の変更を特定します。影響を受ける推定トークン数から影響の規模を把握し、キャッシュヒット率を最大化するために統合をどう最適化できるか判断できます。
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
キャッシュ対象の選択明示的なキャッシュブレークポイントを使うと、再利用するプロンプトプレフィックスを選択できます。改訂されたプロンプトキャッシュガイド(新しいウィンドウで開く)では、ブレークポイントの使用方法、キャッシュ済みプレフィックスが対象となる期間、ツールや入力の変更が再利用に与える影響を説明しています。
キャッシュを維持したまま推論量を調整GPT‑6 モデルでは、キャッシュを無効にすることなく、レスポンス間で推論量を変更(新しいウィンドウで開く)できるようになりました。リクエスト単位の推論量は変更せず、configuration_update を追加することで、難しいタスクでは推論量を増やし、定型的なフォローアップでは減らせます。これにより、再利用可能なコンテキストを維持しながら、タスクに必要な推論量を調整できます。
ツールや指示が変わってもキャッシュを維持エージェントが使用するツールの要件が変わっても、ツール定義、スキーマ、順序を固定し、以前のコンテキストを再利用できる状態に保ちます。定義を削除する代わりに、allowed_tools で関連ツールのみを呼び出し可能にするか、ツールが不要な場合は tool_choice を none に設定します。新しい developer メッセージを使ってコンテキストの末尾付近に新たな指示を追加し、以前の指示を上書きします。ツール変更の管理ガイド(新しいウィンドウで開く)をご覧ください。
キャッシュの事前ウォームアップによるレイテンシ短縮事前ウォームアップ(新しいウィンドウで開く)では、既知のコンテキストをあらかじめ準備し、リクエストの到着時にモデルがより早く応答を開始できるようにします。たとえば、アプリケーションの起動時に、ユーザーが最初の質問をする前に、共有の指示、ツール定義、参考資料を事前ウォームアップできます。これにより、ユーザーの待ち時間外で処理を済ませられます。
これらのオプション機能は、エンジンのデフォルト性能を基盤とし、ワークロードに合わせたキャッシュの調整に役立ちます。
プロンプトキャッシュダッシュボード(新しいウィンドウで開く)でキャッシュヒット率を監視します。
診断ツール(新しいウィンドウで開く)で予期しないミスを調査します。
プロンプトキャッシュガイド(新しいウィンドウで開く)に沿って設定を改善するか、Codex を使用(新しいウィンドウで開く)してコードのレビュー、改善の適用、結果の測定を行います。


