Modo Fast para clientes da API
O modo Fast oferece desempenho confiável e de alta velocidade, com a flexibilidade do pagamento conforme o uso. Com nosso modelo de ponta mais recente, o gpt-5.6-sol, você pode obter velocidades até 2,5 vezes maiores com o modo Fast.
Ao escolher o modo Fast, você tem acesso a:
- Latência baixa e previsível: o modo Fast gera tokens com mais rapidez e a uma velocidade mais consistente do que o serviço de processamento padrão, mesmo nos picos de demanda.
- Uso simples e flexível: assim como o processamento padrão, o modo Fast oferece acesso flexível com pagamento conforme o uso, sem exigir provisionamento antecipado.
Observação: o processamento prioritário passou a se chamar modo Fast em 30 de julho de 2026. Você pode usar service_tier: priority ou service_tier: fast nas suas solicitações à API.
| Short context | Long context | SLA de tempo de atividade3 | SLA de latência3 | |||||
|---|---|---|---|---|---|---|---|---|
| Preço por 1 milhão de tokens de entrada | Preço por 1 milhão de tokens de entrada (em cache) | Preço por 1 milhão de tokens de saída | Preço por 1 milhão de tokens de entrada | Preço por 1 milhão de tokens de entrada (em cache) | Preço por 1 milhão de tokens de saída | |||
GPT-5.6 Sol | US$ 10,00 | US$ 1,00 | US$ 60,00 | US$ 20,00 | US$ 2,00 | US$ 90,00 | 99,9% | 99% > 80 tokens por segundo2 |
GPT-5.6 Terra | US$ 4,00 | US$ 0,40 | US$ 24,00 | US$ 8,00 | US$ 0,80 | US$ 36,00 | 99,9% | 99% > 70 tokens por segundo2 |
GPT-5.6 Luna | US$ 0,40 | US$ 0,04 | US$ 2,40 | US$ 0,80 | US$ 0,08 | US$ 3,60 | 99,9% | 99% > 100 tokens por segundo2 |
GPT-5.5 exclui janela de contexto1 | US$ 12,50 | US$ 1,250 | US$ 75,00 | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5.4 mini exclui janela de contexto1 | US$ 1,50 | US$ 0,150 | US$ 9,00 | — | — | — | 99,9% | 99% > 100 tokens por segundo2 |
GPT-5.4 exclui janela de contexto1 | US$ 5,00 | US$ 0,500 | US$ 30,00 | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5.2 | US$ 3,50 | US$ 0,350 | US$ 28,00 | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5.1 | US$ 2,50 | US$ 0,250 | US$ 20,00 | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5 | US$ 2,50 | US$ 0,250 | US$ 20,00 | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5 mini | US$ 0,45 | US$ 0,045 | US$ 3,60 | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
GPT-5.1 codex | US$ 2,50 | US$ 0,250 | US$ 20,00 | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5 codex | US$ 2,50 | US$ 0,250 | US$ 20,00 | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-4.1 | US$ 3,50 | US$ 0,875 | US$ 14,00 | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
GPT-4.1 mini | US$ 0,70 | US$ 0,175 | US$ 2,80 | — | — | — | 99,9% | 99% > 90 tokens por segundo2 |
GPT-4.1 nano | US$ 0,20 | US$ 0,050 | US$ 0,80 | — | — | — | 99,9% | 99% > 100 tokens por segundo2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | US$ 4,25 | US$ 2,125 | US$ 17,00 | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
gpt-4o-2024-05-13 | US$ 8,75 | — | US$ 26,25 | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
GPT-4o mini | US$ 0,25 | US$ 0,125 | US$ 1,00 | — | — | — | 99,9% | 99% > 90 tokens por segundo2 |
o3 | US$ 3,50 | US$ 0,875 | US$ 14,00 | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
o4-mini | US$ 2,00 | US$ 0,500 | US$ 8,00 | — | — | — | 99,9% | 99% > 90 tokens por segundo2 |
Como funciona
Os clientes podem direcionar o tráfego ao modo Fast em cada solicitação usando o parâmetro service_tier já existente, com a opção service_tier = "fast".
Os tokens processados no modo Fast serão cobrados por token, a tarifas superiores às do processamento padrão.
Além de configurar o modo Fast em cada solicitação, você também pode defini-lo como padrão para um projeto em Configurações do projeto > Nível de serviço padrão: Fast. Ainda é possível substituir essa configuração em cada solicitação. Selecionar Fast nas configurações do projeto equivale a selecionar Priority.
Limitações
- Os limites de taxa do modo Fast são compartilhados com outros níveis de serviço.
- Em casos raros, aumentos rápidos no volume de tokens por minuto no modo Fast podem fazer você atingir os limites de taxa de aumento. Se você exceder esse limite, o tráfego adicional poderá ser direcionado para o processamento padrão.