メインコンテンツにスキップ
OpenAI

2026年9月22日

製品

GPT‑6 のプロンプトキャッシュを強化

キャッシュヒット率の向上と新ツールにより、永続的なエージェントを高速化し、コストを削減

読み込んでいます...

GPT‑6 により、永続的なエージェントは、コードベースのリファクタリングから、十分な調査に基づく文書やプレゼンテーションの作成まで、複雑なタスクに数時間取り組めます。こうしたエージェントを支えるアプリケーションは、相互に連続する一連の API リクエストを行い、多くの場合、以前のターンと同じ指示、ツール定義、コンテキストを引き継ぎます。OpenAI はその共有コンテキストをキャッシュし、リクエスト間で計算を再利用します。これにより応答時間が短縮され、開発者はキャッシュ済み入力トークンについて最大 90% の割引を受けられます。

GPT‑6 ファミリーでは、デフォルトでより高いキャッシュヒット率を実現する、改良版のプロンプトキャッシュシステムを導入しました。現在は、30 分以内に再利用された対象の共有プレフィックスにキャッシュ割引を適用しています。さらに、開発者がキャッシュ性能を監視し、ミスを診断し、プロンプトのどの範囲をキャッシュするかを選べる新しいツールも導入します。

OpenAI のプロンプトキャッシュは、GitHub Copilot が大規模環境でも高速かつ効率的な体験を提供するうえで、極めて重要な役割を果たしています。過去数か月で、OpenAI モデルへの数十億件のリクエストを通じ、新たな処理が必要なプロンプトトークンの割合を、従来の基準から 50% 以上削減しました。その結果、推論スタックの効率が向上し、開発者が最初の応答を得るまでの時間も短縮されました。
—Mario Rodriguez 氏、最高製品責任者

キャッシュの監視とキャッシュミスの診断

新しい プロンプトキャッシュダッシュボード(新しいウィンドウで開く)では、アプリケーションへの入力のうち、キャッシュから提供された割合を確認できます。ヒット率の推移を追跡し、入力構成グラフでキャッシュ済みトークンと未キャッシュトークンを比較できます。これらの表示を使うと、キャッシュヒット率の低下を見つけ、アプリケーションへの変更がキャッシュ性能に与える影響を評価できます。

キャッシュヒット率、キャッシュ性能の推移、入力トークンの構成を示すプロンプトキャッシュダッシュボード

予期しないキャッシュミスが発生した場合は、プロンプトキャッシュ診断ツール(新しいウィンドウで開く)で原因を確認できます。リクエストを直近のレスポンスと比較し、再利用を妨げたモデル、ツール、設定、入力の変更を特定します。影響を受ける推定トークン数から影響の規模を把握し、キャッシュヒット率を最大化するために統合をどう最適化できるか判断できます。

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

アプリケーションのキャッシュ最適化

キャッシュ対象の選択明示的なキャッシュブレークポイントを使うと、再利用するプロンプトプレフィックスを選択できます。改訂されたプロンプトキャッシュガイド(新しいウィンドウで開く)では、ブレークポイントの使用方法、キャッシュ済みプレフィックスが対象となる期間、ツールや入力の変更が再利用に与える影響を説明しています。

キャッシュを維持したまま推論量を調整GPT‑6 モデルでは、キャッシュを無効にすることなく、レスポンス間で推論量を変更(新しいウィンドウで開く)できるようになりました。リクエスト単位の推論量は変更せず、configuration_update を追加することで、難しいタスクでは推論量を増やし、定型的なフォローアップでは減らせます。これにより、再利用可能なコンテキストを維持しながら、タスクに必要な推論量を調整できます。

ツールや指示が変わってもキャッシュを維持エージェントが使用するツールの要件が変わっても、ツール定義、スキーマ、順序を固定し、以前のコンテキストを再利用できる状態に保ちます。定義を削除する代わりに、allowed_tools で関連ツールのみを呼び出し可能にするか、ツールが不要な場合は tool_choice を none に設定します。新しい developer メッセージを使ってコンテキストの末尾付近に新たな指示を追加し、以前の指示を上書きします。ツール変更の管理ガイド(新しいウィンドウで開く)をご覧ください。

キャッシュの事前ウォームアップによるレイテンシ短縮事前ウォームアップ(新しいウィンドウで開く)では、既知のコンテキストをあらかじめ準備し、リクエストの到着時にモデルがより早く応答を開始できるようにします。たとえば、アプリケーションの起動時に、ユーザーが最初の質問をする前に、共有の指示、ツール定義、参考資料を事前ウォームアップできます。これにより、ユーザーの待ち時間外で処理を済ませられます。

これらのオプション機能は、エンジンのデフォルト性能を基盤とし、ワークロードに合わせたキャッシュの調整に役立ちます。

1/3
OpenAI のプロンプトキャッシュ診断とダッシュボードにより、キャッシュヒット率を数ポイント改善し、コストを 20% 削減できました。今ではキャッシュが予期せず機能しなくなるとアラートを受け取り、Codex エージェントで根本原因を診断しています。明示的なブレークポイントにより、安定したコンテキストをキャッシュしながら、頻繁に変わる内容をプロンプトの末尾に保つこともできます。その結果、共有コンテキストのほぼすべてを再利用しつつ、バックグラウンドタスク向けに会話をフォークすることが、コスト面でも現実的になりました。
—Arian Hanifi 氏、最高技術責任者

はじめに

著者

OpenAI