メインコンテンツにスキップ
OpenAI

API 利用者向け Fast モード

Fast モードは、柔軟な従量課金制と、信頼性の高い高速パフォーマンスを両立します。当社の最新のフロンティアモデルである gpt-5.6-sol では、Fast モードを使用すると、処理速度が最大2.5倍に向上します。

Fast モードを選択すると、以下のメリットが得られます。

  • 予測可能な低レイテンシ:Fast モードは、需要のピーク時でも、標準処理サービスより高速かつ安定した速度でトークンを生成します。
  • 手軽に使える柔軟性:Fast モードは標準処理と同様、事前のプロビジョニングなしで、柔軟な従量課金制で利用できます。

注:2026年7月30日、優先処理の名称は Fast モードに変更されました。API リクエストでは、service_tier: priority と service_tier: fast のどちらも使用できます。

100万入力トークンあたりの料金(キャッシュされた)100万入力トークンあたりの料金100万出力トークンあたりの料金稼働率の SLA3レイテンシ SLA3
GPT-5.6 Sol
long-context を除く1
$10.00$1.00$60.0099.9%99% > 1秒あたり80トークン2
GPT-5.6 Terra
long-context を除く1
$4.00$0.40$24.0099.9%99% > 1秒あたり70トークン2
GPT-5.6 Luna
long-context を除く1
$0.40$0.04$2.4099.9%99% > 1秒あたり100トークン2
GPT-5.5
long-context を除く1
$12.50$1.250$75.0099.9%99% > 1秒あたり50トークン2
GPT-5.4 mini
long-context を除く1
$1.50$0.150$9.0099.9%99% > 1秒あたり100トークン2
GPT-5.4
long-context を除く1
$5.00$0.500$30.0099.9%99% > 1秒あたり50トークン2
GPT-5.2
$3.50$0.350$28.0099.9%99% > 1秒あたり50トークン2
GPT-5.1
$2.50$0.250$20.0099.9%99% > 1秒あたり50トークン2
GPT-5
$2.50$0.250$20.0099.9%99% > 1秒あたり50トークン2
GPT-5 mini
$0.45$0.045$3.6099.9%99% > 1秒あたり80トークン2
GPT-5.1 codex
$2.50$0.250$20.0099.9%99% > 1秒あたり50トークン2
GPT-5 codex
$2.50$0.250$20.0099.9%99% > 1秒あたり50トークン2
GPT-4.1
$3.50$0.875$14.0099.9%99% > 1秒あたり80トークン2
GPT-4.1 mini
$0.70$0.175$2.8099.9%99% > 1秒あたり90トークン2
GPT-4.1 nano
$0.20$0.050$0.8099.9%99% > 1秒あたり100トークン2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
$4.25$2.125$17.0099.9%99% > 1秒あたり80トークン2
gpt-4o-2024-05-13
$8.75$26.2599.9%99% > 1秒あたり80トークン2
GPT-4o mini
$0.25$0.125$1.0099.9%99% > 1秒あたり90トークン2
o3
$3.50$0.875$14.0099.9%99% > 1秒あたり80トークン2
o4-mini
$2.00$0.500$8.0099.9%99% > 1秒あたり90トークン2
1272,000以上のプロンプト トークンでの推定リクエスト
2p50リクエストのレイテンシ(5分あたり)として計算p50リクエストのレイテンシ(1分あたり)として計算されるレイテンシ SLA を含む既存のエンタープライズ契約を締結しているお客様については、従来の SLA も引き続き適用されます。
3これは、Enterprise のお客様にのみ該当します

仕組み

既存の service_tier パラメーターで service_tier = "fast" を指定すると、リクエスト単位でトラフィックを Fast モードに振り向けることができます。

Fast モードで処理されたトークンは、トークン単位で課金され、標準処理よりも割高な料金が適用されます。

リクエスト単位で設定するほか、[Project settings]>[Default Service Tier]で[Fast]を選択し、プロジェクトのデフォルトのサービスティアを Fast モードに設定することもできます。リクエスト単位での上書きも可能です。プロジェクト設定で[Fast]を選択することは、[Priority]を選択することと同等です。

制限事項

  • Fast モードのレート制限は他のサービスティアと共有されます。
  • まれに、Fast モードの1分あたりのトークン数が急増すると、ランプレート制限に達する場合があります。ランプレート制限を超えた場合、追加のトラフィックは、代わりに標準処理へ送られることがあります。

よくある質問

料金

モデル

レート上限

信頼性

ポリシー