跳至主要內容
OpenAI

API 客戶適用的快速模式

快速模式提供穩定且高速的效能,同時保有按需付費的靈活性。對於我們最新的前沿模型 gpt-5.6-sol,使用快速模式處理速度最高可提升至 2.5 倍。

選擇快速模式,即可獲得以下優勢:

  • 穩定可預期的低延遲:即使在需求高峰期間,快速模式生成 Token 的速度仍比標準處理更快、更穩定。
  • 靈活彈性:與標準處理相同,快速模式也可以透過彈性的按需付費方式使用,無需事先部署。

注意:「優先處理」已於 2026 年 7 月 30 日更名為「快速模式」。你可以在 API 請求中使用 service_tier: priority 或 service_tier: fast。

Short contextLong context正常運作時間 SLA3延遲 SLA3
每一百萬個輸入權杖的費用每一百萬個輸入權杖的費用 (快取)每一百萬個輸出權杖的費用每一百萬個輸入權杖的費用每一百萬個輸入權杖的費用 (快取)每一百萬個輸出權杖的費用
GPT-5.6 Sol
US$10.00US$1.00US$60.00US$20.00US$2.00US$90.0099.9%每秒 99% > 80 個權杖2
GPT-5.6 Terra
US$4.00US$0.40US$24.00US$8.00US$0.80US$36.0099.9%每秒 99% > 70 個權杖2
GPT-5.6 Luna
US$0.40US$0.04US$2.40US$0.80US$0.08US$3.6099.9%每秒 99% > 100 個權杖2
GPT-5.5
不支援長段文字記憶力解功能1
US$12.50US$1.250US$75.0099.9%每秒 99% > 50 個權杖2
GPT-5.4 mini
不支援長段文字記憶力解功能1
US$1.50US$0.150US$9.0099.9%每秒 99% > 100 個權杖2
GPT-5.4
不支援長段文字記憶力解功能1
US$5.00US$0.500US$30.0099.9%每秒 99% > 50 個權杖2
GPT-5.2
US$3.50US$0.350US$28.0099.9%每秒 99% > 50 個權杖2
GPT-5.1
US$2.50US$0.250US$20.0099.9%每秒 99% > 50 個權杖2
GPT-5
US$2.50US$0.250US$20.0099.9%每秒 99% > 50 個權杖2
GPT-5 mini
US$0.45US$0.045US$3.6099.9%每秒 99% > 80 個權杖2
GPT-5.1 codex
US$2.50US$0.250US$20.0099.9%每秒 99% > 50 個權杖2
GPT-5 codex
US$2.50US$0.250US$20.0099.9%每秒 99% > 50 個權杖2
GPT-4.1
US$3.50US$0.875US$14.0099.9%每秒 99% > 80 個權杖2
GPT-4.1 mini
US$0.70US$0.175US$2.8099.9%每秒 99% > 90 個權杖2
GPT-4.1 nano
US$0.20US$0.050US$0.8099.9%每秒 99% > 100 個權杖2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
US$4.25US$2.125US$17.0099.9%每秒 99% > 80 個權杖2
gpt-4o-2024-05-13
US$8.75US$26.2599.9%每秒 99% > 80 個權杖2
GPT-4o mini
US$0.25US$0.125US$1.0099.9%每秒 99% > 90 個權杖2
o3
US$3.50US$0.875US$14.0099.9%每秒 99% > 80 個權杖2
o4-mini
US$2.00US$0.500US$8.0099.9%每秒 99% > 90 個權杖2
1預估會使用超過 27.2 萬個提示詞 Token 的請求
2以每 5 分鐘為單位,計算第 50 百分位的請求延遲。客戶若已簽訂企業合約,且延遲 SLA 是以每分鐘計算第 50 百分位的請求延遲為準,則原來的 SLA 仍適用。
3僅適用於 Enterprise 方案客戶

運作方式

客戶可使用現有的 service_tier 參數,針對個別請求將流量導向快速模式,只要將 service_tier 設為「fast」即可。

快速模式所使用的 Token 將按其數量計費,價格相較於標準處理服務稍高。

除了可以在請求層級進行設定外,也可在「專案設定 > 預設服務層級:快速」中,將專案設為優先級。你仍然可以按個別請求覆寫設定。在專案設定中選取「快速」,等同於選取「優先」。

限制說明

  • 快速模式與其他服務層級共用速率限制。
  • 在少數情況下,如果快速模式的每分鐘 Token 數快速增加,可能會觸及流量增速限制。若超過流量增速限制,額外流量可能會改由「標準處理」處理。

常見問題

定價

模型

速率限制

可靠性

政策