Pular para o conteúdo principal
OpenAI

Scale Tier para clientes de API

Scale Tier is available on models released before GPT‑5.6. For GPT‑5.6 and future model releases, see Reserved Tier

This offering is available to Enterprise customers. Please contact our sales team⁠ to learn more. To access the same premium latency and reliability benefits on a flexible, pay-as-you-go basis, see Fast mode.

Scale Tier lets you purchase a set number of API input and output tokens per minute (known as “token units”) upfront for access to one specific model snapshot. Each token unit is purchased for a minimum of 30 days. Additional models may be added based on customer interest.

By choosing Scale Tier, you can unlock:

  • Predictable latency: Scale Tier is designed to generate tokens faster and at a more consistent speed than the pay-as-you-go (PAYG) service, even during peak demand.
  • Uncapped scale: Any quota purchases with Scale Tier is automatically added to your rate limits, so you can confidently scale further. 
  • Higher reliability: Scale Tier traffic offers a 99.9% uptime SLA and prioritized compute.
Pacote de entradasPacote de resultadosSLA de tempo de atividadeSLA de latência
GPT-5.550.000 TPM
US$ 750,00 por unidade/dia
N/D399,9%99% > 100 tokens por segundo2
GPT-5.4 mini50.000 TPM
US$ 100,00 por unidade/dia
N/D399,9%99% > 100 tokens por segundo2
GPT-5.4
exclui contexto longo4
50.000 TPM
US$ 300,00 por unidade/dia
N/D399,9%99% > 50 tokens por segundo2
GPT-5.225.000 TPM
US$ 105,00 por unidade/dia
2.500 TPM
US$ 84,00 por unidade/dia
99,9%99% > 50 tokens por segundo2
GPT-5.125.000 TPM
US$ 75,00 por unidade/dia
2.500 TPM
US$ 60,00 por unidade/dia
99,9%99% > 50 tokens por segundo2
GPT-525.000 TPM
US$ 75,00 por unidade/dia
2.500 TPM
US$ 60,00 por unidade/dia
99,9%99% > 50 tokens por segundo2
GPT-5 mini500.000 TPM
US$ 275,00 por unidade/dia
50.000 TPM
US$ 220,00 por unidade/dia
99,9%99% > 80 tokens por segundo2
GPT-4.1
exclui janela de contexto1
30.000 TPM
US$ 110,00 por unidade/dia
2.500 TPM
US$ 36,00 por unidade/dia
99,9%99% > 80 tokens por segundo2
GPT-4.1 mini
exclui janela de contexto1
500.000 TPM
US$ 450,00 por unidade/dia
50.000 TPM
US$ 175,00 por unidade/dia
99,9%99% > 90 tokens por segundo2
GPT-4.1 nano
exclui janela de contexto1
500.000 TPM
US$ 110,00 por unidade/dia
50.000 TPM
US$ 40,00 por unidade/dia
99,9%99% > 100 tokens por segundo2
GPT-4.1 fine tuning30.000 TPM
US$ 165,00 por unidade/dia
2.500 TPM
US$ 36,00 por unidade/dia
99,9%99% > 80 tokens por segundo2
GPT-4.1 mini fine tuning500.000 TPM
US$ 900,00 por unidade/dia
50.000 TPM
US$ 175,00 por unidade/dia
99,9%99% > 90 tokens por segundo2
o325.000 TPM
US$ 75,00 por unidade/dia
5.000 TPM
US$ 60,00 por unidade/dia
99,9%99% > 80 tokens por segundo2
o4-mini30.000 TPM
US$ 50,00 por unidade/dia
5.000 TPM
US$ 32,50 por unidade/dia
99,9%99% > 90 tokens por segundo2
GPT-4o30.000 TPM
US$ 124,59 por unidade/dia
2.500 TPM
US$ 39,34 por unidade/dia
99,9%99% > 80 tokens por segundo2
GPT-4o mini500.000 TPM
US$ 114,75 por unidade/dia
50.000 TPM
US$ 49,18 por unidade/dia
99,9%99% > 90 tokens por segundo2
GPT-4o mini fine tuning500.000 TPM
US$ 229,50 por unidade/dia
50.000 TPM
US$ 98,36 por unidade/dia
99,9%99% > 90 tokens por segundo2
o15.000 TPM
US$ 163,93 por unidade/dia
1.000 TPM
US$ 131,15 por unidade/dia
99,9%99% > 80 tokens por segundo2
o3-mini30.000 TPM
US$ 78,69 por unidade/dia
5.000 TPM
US$ 52,46 por unidade/dia
99,9%99% > 90 tokens por segundo2
1Solicitações estimadas em >128 mil tokens de prompt
2Calculado como o 50º percentil da latência das requisições a cada 5 minutos. Para clientes com contratos Enterprise que especificam SLAs de latência calculados como o 50º percentil da latência das requisições a cada 1 minuto, os SLAs anteriores continuam em vigor.
3Com o GPT-5.4, o Nível de Escala é comprado como um pacote de tokens de entrada e saída combinados por minuto. O uso de tokens de entrada, tokens de entrada em cache e tokens de saída é contabilizado nesse pacote combinado em taxas diferentes. Consulte a seção "Como funciona" abaixo.
4O contexto longo é maior que 272 mil

Como funciona

Com o Scale Tier, você pode comprar unidades de tokens de entrada e saída. Por exemplo, com o GPT‑4.1, cada unidade de entrada custa US$ 110/dia e dá direito a 30 mil tokens de entrada/min. Cada unidade de saída custa US$ 36/dia e dá direito a 2,5 mil tokens de saída/min. Cada unidade de token é comprada por um mínimo de 30 dias.

Mais informações sobre como o Scale Tier interage com Prompt Caching podem ser encontradas na seção de FAQ abaixo.

Com o GPT‑5.4 e o GPT‑5.5, você compra uma quantidade combinada de tokens de entrada e saída por minuto. Isso oferece maior flexibilidade e elimina a necessidade de prever a proporção entre tokens de entrada e saída. Ao usar o Nível de escala, contabilizamos os tokens na sua cota combinada da seguinte forma:

  • Tokens de entrada contam como 1
  • Tokens de entrada em cache seguem o cache por modelo, conforme descrito abaixo na seção de FAQ
  • Tokens de saída contam com base na razão de preço PayG entre tokens de saída e tokens de entrada para o modelo. Por exemplo, com o GPT‑5.4, um token de saída conta como 6.

Preços

Unidades de tokens e limites de taxa

Modelos

Confiabilidade

Políticas