Scale Tier para clientes de API
Scale Tier is available on models released before GPT‑5.6. For GPT‑5.6 and future model releases, see Reserved Tier
This offering is available to Enterprise customers. Please contact our sales team to learn more. To access the same premium latency and reliability benefits on a flexible, pay-as-you-go basis, see Fast mode.
Scale Tier lets you purchase a set number of API input and output tokens per minute (known as “token units”) upfront for access to one specific model snapshot. Each token unit is purchased for a minimum of 30 days. Additional models may be added based on customer interest.
By choosing Scale Tier, you can unlock:
- Predictable latency: Scale Tier is designed to generate tokens faster and at a more consistent speed than the pay-as-you-go (PAYG) service, even during peak demand.
- Uncapped scale: Any quota purchases with Scale Tier is automatically added to your rate limits, so you can confidently scale further.
- Higher reliability: Scale Tier traffic offers a 99.9% uptime SLA and prioritized compute.
| Pacote de entradas | Pacote de resultados | SLA de tempo de atividade | SLA de latência | |
|---|---|---|---|---|
| GPT-5.5 | 50.000 TPM US$ 750,00 por unidade/dia | N/D3 | 99,9% | 99% > 100 tokens por segundo2 |
| GPT-5.4 mini | 50.000 TPM US$ 100,00 por unidade/dia | N/D3 | 99,9% | 99% > 100 tokens por segundo2 |
GPT-5.4 exclui contexto longo4 | 50.000 TPM US$ 300,00 por unidade/dia | N/D3 | 99,9% | 99% > 50 tokens por segundo2 |
| GPT-5.2 | 25.000 TPM US$ 105,00 por unidade/dia | 2.500 TPM US$ 84,00 por unidade/dia | 99,9% | 99% > 50 tokens por segundo2 |
| GPT-5.1 | 25.000 TPM US$ 75,00 por unidade/dia | 2.500 TPM US$ 60,00 por unidade/dia | 99,9% | 99% > 50 tokens por segundo2 |
| GPT-5 | 25.000 TPM US$ 75,00 por unidade/dia | 2.500 TPM US$ 60,00 por unidade/dia | 99,9% | 99% > 50 tokens por segundo2 |
| GPT-5 mini | 500.000 TPM US$ 275,00 por unidade/dia | 50.000 TPM US$ 220,00 por unidade/dia | 99,9% | 99% > 80 tokens por segundo2 |
GPT-4.1 exclui janela de contexto1 | 30.000 TPM US$ 110,00 por unidade/dia | 2.500 TPM US$ 36,00 por unidade/dia | 99,9% | 99% > 80 tokens por segundo2 |
GPT-4.1 mini exclui janela de contexto1 | 500.000 TPM US$ 450,00 por unidade/dia | 50.000 TPM US$ 175,00 por unidade/dia | 99,9% | 99% > 90 tokens por segundo2 |
GPT-4.1 nano exclui janela de contexto1 | 500.000 TPM US$ 110,00 por unidade/dia | 50.000 TPM US$ 40,00 por unidade/dia | 99,9% | 99% > 100 tokens por segundo2 |
| GPT-4.1 fine tuning | 30.000 TPM US$ 165,00 por unidade/dia | 2.500 TPM US$ 36,00 por unidade/dia | 99,9% | 99% > 80 tokens por segundo2 |
| GPT-4.1 mini fine tuning | 500.000 TPM US$ 900,00 por unidade/dia | 50.000 TPM US$ 175,00 por unidade/dia | 99,9% | 99% > 90 tokens por segundo2 |
| o3 | 25.000 TPM US$ 75,00 por unidade/dia | 5.000 TPM US$ 60,00 por unidade/dia | 99,9% | 99% > 80 tokens por segundo2 |
| o4-mini | 30.000 TPM US$ 50,00 por unidade/dia | 5.000 TPM US$ 32,50 por unidade/dia | 99,9% | 99% > 90 tokens por segundo2 |
| GPT-4o | 30.000 TPM US$ 124,59 por unidade/dia | 2.500 TPM US$ 39,34 por unidade/dia | 99,9% | 99% > 80 tokens por segundo2 |
| GPT-4o mini | 500.000 TPM US$ 114,75 por unidade/dia | 50.000 TPM US$ 49,18 por unidade/dia | 99,9% | 99% > 90 tokens por segundo2 |
| GPT-4o mini fine tuning | 500.000 TPM US$ 229,50 por unidade/dia | 50.000 TPM US$ 98,36 por unidade/dia | 99,9% | 99% > 90 tokens por segundo2 |
| o1 | 5.000 TPM US$ 163,93 por unidade/dia | 1.000 TPM US$ 131,15 por unidade/dia | 99,9% | 99% > 80 tokens por segundo2 |
| o3-mini | 30.000 TPM US$ 78,69 por unidade/dia | 5.000 TPM US$ 52,46 por unidade/dia | 99,9% | 99% > 90 tokens por segundo2 |
Como funciona
Com o Scale Tier, você pode comprar unidades de tokens de entrada e saída. Por exemplo, com o GPT‑4.1, cada unidade de entrada custa US$ 110/dia e dá direito a 30 mil tokens de entrada/min. Cada unidade de saída custa US$ 36/dia e dá direito a 2,5 mil tokens de saída/min. Cada unidade de token é comprada por um mínimo de 30 dias.
Mais informações sobre como o Scale Tier interage com Prompt Caching podem ser encontradas na seção de FAQ abaixo.
Com o GPT‑5.4 e o GPT‑5.5, você compra uma quantidade combinada de tokens de entrada e saída por minuto. Isso oferece maior flexibilidade e elimina a necessidade de prever a proporção entre tokens de entrada e saída. Ao usar o Nível de escala, contabilizamos os tokens na sua cota combinada da seguinte forma:
- Tokens de entrada contam como 1
- Tokens de entrada em cache seguem o cache por modelo, conforme descrito abaixo na seção de FAQ
- Tokens de saída contam com base na razão de preço PayG entre tokens de saída e tokens de entrada para o modelo. Por exemplo, com o GPT‑5.4, um token de saída conta como 6.
