Modo Fast para clientes da API
O modo Fast oferece desempenho confiável e de alta velocidade, com a flexibilidade do pagamento conforme o uso. Com o modo Fast, o gpt-5.6-sol pode atingir velocidades até 2,5 vezes maiores.
Ao escolher o modo Fast, você tem acesso a:
Latência baixa e previsível: o modo Fast gera tokens com mais rapidez e a uma velocidade mais consistente do que o serviço de processamento padrão, mesmo nos picos de demanda.
Uso simples e flexível: assim como o processamento padrão, o modo Fast oferece acesso flexível com pagamento conforme o uso, sem exigir provisionamento antecipado.
Observação: o processamento prioritário passou a se chamar modo Fast em 30 de julho de 2026. Você pode usar service_tier: priority ou service_tier: fast nas suas solicitações à API.
| Breve contexto | Contexto Longo | SLA de tempo de atividade3 | SLA de latência3 | |||||
|---|---|---|---|---|---|---|---|---|
| Preço por 1 milhão de tokens de entrada | Preço por 1 milhão de tokens de entrada (em cache) | Preço por 1 milhão de tokens de saída | Preço por 1 milhão de tokens de entrada | Preço por 1 milhão de tokens de entrada (em cache) | Preço por 1 milhão de tokens de saída | |||
GPT-6 Astra | US$ 20,00 | US$ 2,00 | US$ 100,00 | US$ 40,00 | US$ 4,00 | US$ 150,00 | — | — |
GPT-6.1 Sol | US$ 4,00 | US$ 0,20 | US$ 20,00 | US$ 8,00 | US$ 0,40 | US$ 30,00 | — | — |
GPT-6 Sol | US$ 4,00 | US$ 0,40 | US$ 20,00 | US$ 8,00 | US$ 0,80 | US$ 30,00 | — | — |
GPT-6 Luna | US$ 0,20 | US$ 0,02 | US$ 1,00 | US$ 0,40 | US$ 0,04 | US$ 1,50 | — | — |
GPT-5.6 Sol | US$ 8,00 | US$ 0,80 | US$ 40,00 | US$ 16,00 | US$ 1,60 | US$ 60,00 | 99,9% | 99% > 80 tokens por segundo2 |
GPT-5.6 Terra | US$ 4,00 | US$ 0,40 | US$ 24,00 | US$ 8,00 | US$ 0,80 | US$ 36,00 | 99,9% | 99% > 70 tokens por segundo2 |
GPT-5.6 Luna | US$ 0,40 | US$ 0,04 | US$ 2,40 | US$ 0,80 | US$ 0,08 | US$ 3,60 | 99,9% | 99% > 100 tokens por segundo2 |
GPT-5.5 exclui janela de contexto1 | US$ 12,50 | US$ 1,250 | US$ 75,00 | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5.4 mini exclui janela de contexto1 | US$ 1,50 | US$ 0,150 | US$ 9,00 | — | — | — | 99,9% | 99% > 100 tokens por segundo2 |
GPT-5.4 exclui janela de contexto1 | US$ 5,00 | US$ 0,500 | US$ 30,00 | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5.2 | US$ 3,50 | US$ 0,350 | US$ 28,00 | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5.1 | US$ 2,50 | US$ 0,250 | US$ 20,00 | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5 | US$ 2,50 | US$ 0,250 | US$ 20,00 | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5 mini | US$ 0,45 | US$ 0,045 | US$ 3,60 | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
GPT-5.1 codex | US$ 2,50 | US$ 0,250 | US$ 20,00 | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5 codex | US$ 2,50 | US$ 0,250 | US$ 20,00 | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-4.1 | US$ 3,50 | US$ 0,875 | US$ 14,00 | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
GPT-4.1 mini | US$ 0,70 | US$ 0,175 | US$ 2,80 | — | — | — | 99,9% | 99% > 90 tokens por segundo2 |
GPT-4.1 nano | US$ 0,20 | US$ 0,050 | US$ 0,80 | — | — | — | 99,9% | 99% > 100 tokens por segundo2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | US$ 4,25 | US$ 2,125 | US$ 17,00 | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
gpt-4o-2024-05-13 | US$ 8,75 | — | US$ 26,25 | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
GPT-4o mini | US$ 0,25 | US$ 0,125 | US$ 1,00 | — | — | — | 99,9% | 99% > 90 tokens por segundo2 |
o3 | US$ 3,50 | US$ 0,875 | US$ 14,00 | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
o4-mini | US$ 2,00 | US$ 0,500 | US$ 8,00 | — | — | — | 99,9% | 99% > 90 tokens por segundo2 |
Como funciona
Os clientes podem direcionar o tráfego ao modo Fast em cada solicitação usando o parâmetro service_tier já existente, com a opção service_tier = "fast".
Os tokens processados no modo Fast serão cobrados por token, a tarifas superiores às do processamento padrão.
Além de configurar o modo Fast em cada solicitação, você também pode defini-lo como padrão para um projeto em Configurações do projeto > Nível de serviço padrão: Fast. Ainda é possível substituir essa configuração em cada solicitação. Selecionar Fast nas configurações do projeto equivale a selecionar Priority.
Limitações
Os limites de taxa do modo Fast são compartilhados com outros níveis de serviço.
Em casos raros, aumentos rápidos no volume de tokens por minuto no modo Fast podem fazer você atingir os limites de taxa de aumento. Se você exceder esse limite, o tráfego adicional poderá ser direcionado para o processamento padrão.