API 客戶適用的快速模式
快速模式提供穩定且高速的效能,同時保有按需付費的靈活性。對於我們最新的前沿模型 gpt-5.6-sol,使用快速模式處理速度最高可提升至 2.5 倍。
選擇快速模式,即可獲得以下優勢:
- 穩定可預期的低延遲:即使在需求高峰期間,快速模式生成 Token 的速度仍比標準處理更快、更穩定。
- 靈活彈性:與標準處理相同,快速模式也可以透過彈性的按需付費方式使用,無需事先部署。
注意:「優先處理」已於 2026 年 7 月 30 日更名為「快速模式」。你可以在 API 請求中使用 service_tier: priority 或 service_tier: fast。
| Short context | Long context | 正常運作時間 SLA3 | 延遲 SLA3 | |||||
|---|---|---|---|---|---|---|---|---|
| 每一百萬個輸入權杖的費用 | 每一百萬個輸入權杖的費用 (快取) | 每一百萬個輸出權杖的費用 | 每一百萬個輸入權杖的費用 | 每一百萬個輸入權杖的費用 (快取) | 每一百萬個輸出權杖的費用 | |||
GPT-5.6 Sol | US$10.00 | US$1.00 | US$60.00 | US$20.00 | US$2.00 | US$90.00 | 99.9% | 每秒 99% > 80 個權杖2 |
GPT-5.6 Terra | US$4.00 | US$0.40 | US$24.00 | US$8.00 | US$0.80 | US$36.00 | 99.9% | 每秒 99% > 70 個權杖2 |
GPT-5.6 Luna | US$0.40 | US$0.04 | US$2.40 | US$0.80 | US$0.08 | US$3.60 | 99.9% | 每秒 99% > 100 個權杖2 |
GPT-5.5 不支援長段文字記憶力解功能1 | US$12.50 | US$1.250 | US$75.00 | — | — | — | 99.9% | 每秒 99% > 50 個權杖2 |
GPT-5.4 mini 不支援長段文字記憶力解功能1 | US$1.50 | US$0.150 | US$9.00 | — | — | — | 99.9% | 每秒 99% > 100 個權杖2 |
GPT-5.4 不支援長段文字記憶力解功能1 | US$5.00 | US$0.500 | US$30.00 | — | — | — | 99.9% | 每秒 99% > 50 個權杖2 |
GPT-5.2 | US$3.50 | US$0.350 | US$28.00 | — | — | — | 99.9% | 每秒 99% > 50 個權杖2 |
GPT-5.1 | US$2.50 | US$0.250 | US$20.00 | — | — | — | 99.9% | 每秒 99% > 50 個權杖2 |
GPT-5 | US$2.50 | US$0.250 | US$20.00 | — | — | — | 99.9% | 每秒 99% > 50 個權杖2 |
GPT-5 mini | US$0.45 | US$0.045 | US$3.60 | — | — | — | 99.9% | 每秒 99% > 80 個權杖2 |
GPT-5.1 codex | US$2.50 | US$0.250 | US$20.00 | — | — | — | 99.9% | 每秒 99% > 50 個權杖2 |
GPT-5 codex | US$2.50 | US$0.250 | US$20.00 | — | — | — | 99.9% | 每秒 99% > 50 個權杖2 |
GPT-4.1 | US$3.50 | US$0.875 | US$14.00 | — | — | — | 99.9% | 每秒 99% > 80 個權杖2 |
GPT-4.1 mini | US$0.70 | US$0.175 | US$2.80 | — | — | — | 99.9% | 每秒 99% > 90 個權杖2 |
GPT-4.1 nano | US$0.20 | US$0.050 | US$0.80 | — | — | — | 99.9% | 每秒 99% > 100 個權杖2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | US$4.25 | US$2.125 | US$17.00 | — | — | — | 99.9% | 每秒 99% > 80 個權杖2 |
gpt-4o-2024-05-13 | US$8.75 | — | US$26.25 | — | — | — | 99.9% | 每秒 99% > 80 個權杖2 |
GPT-4o mini | US$0.25 | US$0.125 | US$1.00 | — | — | — | 99.9% | 每秒 99% > 90 個權杖2 |
o3 | US$3.50 | US$0.875 | US$14.00 | — | — | — | 99.9% | 每秒 99% > 80 個權杖2 |
o4-mini | US$2.00 | US$0.500 | US$8.00 | — | — | — | 99.9% | 每秒 99% > 90 個權杖2 |
運作方式
客戶可使用現有的 service_tier 參數,針對個別請求將流量導向快速模式,只要將 service_tier 設為「fast」即可。
快速模式所使用的 Token 將按其數量計費,價格相較於標準處理服務稍高。
除了可以在請求層級進行設定外,也可在「專案設定 > 預設服務層級:快速」中,將專案設為優先級。你仍然可以按個別請求覆寫設定。在專案設定中選取「快速」,等同於選取「優先」。
限制說明
- 快速模式與其他服務層級共用速率限制。
- 在少數情況下,如果快速模式的每分鐘 Token 數快速增加,可能會觸及流量增速限制。若超過流量增速限制,額外流量可能會改由「標準處理」處理。