面向 API 客户的预留层级
概览
预留层级专为希望预先购买超出其常规速率限制容量的客户而设计,确保其在需求高峰期也能获得稳定的算力支持。
预留层级允许你为特定模型购买预配吞吐量 (provisioned throughput)。为了让你更直观地了解自己需要多少吞吐量,它采用“美元/分钟”作为计价单位。你的预留额度可以在标准处理和快速模式、不同上下文长度以及不同区域之间灵活使用。预留层级不适用于批处理或灵活处理。超出预留额度部分的用量,将按标准的即用即付费率计费。
通过选择预留层级,你可以确保在我们需求最大的模型上获得算力保障,并解锁更大的业务规模。购买的预留层级额度会自动叠加到你的速率限制中,让你能够在需求高峰期确保获得充足的算力。
运作方式
通过预留层级,你可以为特定模型购买一个“美元/分钟”的预留额度。当你的用量在该预留额度内时,针对该模型发起的标准处理和快速模式请求都将从你的预留额度中抵扣。
如果用量超过了你的预留额度,超出部分将按你选择的服务层级以即用即付的方式处理,并按正常费率计费。
例如:
- 如果你为 GPT‑5.6 预留了 $2/分钟的额度,该模型符合条件的用量将按标价 (list price) 从你的预留额度中扣除。
- 在任何符合条件的用量不高于 $2 的分钟内,你的用量都由预留层级覆盖,不会产生额外的用量费用。
- 如果在一分钟内,你符合条件的用量超过了 $2,超出预留额度的部分将按标准的即用即付费率计费。例如,如果你在一分钟内消耗了 $2.75,其中 $2.00 由预留层级覆盖,剩余的 $0.75 将作为即用即付的超额部分进行计费。
这些用量计算均依据该模型的即用即付标价进行。关于优惠如何应用于预留层级,请参阅下方的常见问题解答 (FAQ)。