面向 API 客户的快速模式
快速模式提供稳定可靠的高速性能,兼具即用即付的灵活性。对于我们最新的前沿模型 gpt-5.6-sol,你可以通过快速模式获得高达 2.5 倍的速度提升。
选择快速模式,你将获得:
- 可预测的低延迟:快速模式生成 Token 的速度比标准处理服务更快且更稳定,即使在需求高峰期也是如此。
- 易于使用的灵活性:与标准处理服务一样,快速模式可通过灵活的即用即付模式使用,而无需提前预配。
注意:优先处理 (Priority processing) 已于 2026 年 7 月 30 日更名为快速模式 (Fast mode)。在 API 请求中,你既可以使用 service_tier: priority,也可以使用 service_tier: fast。
| 每百万输入令牌的价格 | 每百万输入令牌的价格(缓存) | 每百万输出令牌的价格 | 正常运行时间 SLA3 | 延迟 SLA3 | |
|---|---|---|---|---|---|
GPT-5.6 Sol 不包括长上下文1 | US$10.00 | US$1.00 | US$60.00 | 99.9% | 99% > 80每秒令牌数2 |
GPT-5.6 Terra 不包括长上下文1 | US$4.00 | US$0.40 | US$24.00 | 99.9% | 99% > 70每秒令牌数2 |
GPT-5.6 Luna 不包括长上下文1 | US$0.40 | US$0.04 | US$2.40 | 99.9% | 99% > 100每秒令牌数2 |
GPT-5.5 不包括长上下文1 | US$12.50 | US$1.250 | US$75.00 | 99.9% | 99% > 50每秒令牌数2 |
GPT-5.4 mini 不包括长上下文1 | US$1.50 | US$0.150 | US$9.00 | 99.9% | 99% > 100每秒令牌数2 |
GPT-5.4 不包括长上下文1 | US$5.00 | US$0.500 | US$30.00 | 99.9% | 99% > 50每秒令牌数2 |
GPT-5.2 | US$3.50 | US$0.350 | US$28.00 | 99.9% | 99% > 50每秒令牌数2 |
GPT-5.1 | US$2.50 | US$0.250 | US$20.00 | 99.9% | 99% > 50每秒令牌数2 |
GPT-5 | US$2.50 | US$0.250 | US$20.00 | 99.9% | 99% > 50每秒令牌数2 |
GPT-5 mini | US$0.45 | US$0.045 | US$3.60 | 99.9% | 99% > 80每秒令牌数2 |
GPT-5.1 codex | US$2.50 | US$0.250 | US$20.00 | 99.9% | 99% > 50每秒令牌数2 |
GPT-5 codex | US$2.50 | US$0.250 | US$20.00 | 99.9% | 99% > 50每秒令牌数2 |
GPT-4.1 | US$3.50 | US$0.875 | US$14.00 | 99.9% | 99% > 80每秒令牌数2 |
GPT-4.1 mini | US$0.70 | US$0.175 | US$2.80 | 99.9% | 99% > 90每秒令牌数2 |
GPT-4.1 nano | US$0.20 | US$0.050 | US$0.80 | 99.9% | 99% > 100每秒令牌数2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | US$4.25 | US$2.125 | US$17.00 | 99.9% | 99% > 80每秒令牌数2 |
gpt-4o-2024-05-13 | US$8.75 | — | US$26.25 | 99.9% | 99% > 80每秒令牌数2 |
GPT-4o mini | US$0.25 | US$0.125 | US$1.00 | 99.9% | 99% > 90每秒令牌数2 |
o3 | US$3.50 | US$0.875 | US$14.00 | 99.9% | 99% > 80每秒令牌数2 |
o4-mini | US$2.00 | US$0.500 | US$8.00 | 99.9% | 99% > 90每秒令牌数2 |
运作方式
客户可以在每个请求中使用现有的 service_tier 参数,将流量定向到快速模式,选项为 service_tier = "fast"。
通过快速模式服务的 Token 将按每个 Token 计费,价格相较标准处理服务费率更高。
除了可以在请求级别进行配置外,你还可以通过“项目设置”→“默认服务层级:快速”,将项目默认设为快速模式。单个请求仍可覆盖该默认值。在项目设置中选择“快速”等同于选择“优先”。
限制
- 快速模式的速率限制与其他服务层级共享。
- 在少数情况下,如果快速模式的每分钟 Token 使用量快速增加,可能会触发流量提升速率限制。一旦超过该限制,额外的流量将自动切换至标准处理服务。