Modo Fast para clientes API
O modo Fast oferece desempenho fiável e de elevada velocidade, com a flexibilidade do pagamento por utilização. Para o GPT‑5.6 Sol, pode aceder a velocidades até 2,5 vezes superiores com o modo Fast.
Ao escolher o modo Fast, pode desbloquear:
Latência previsivelmente baixa: o modo Fast gera tokens mais depressa e a uma velocidade mais consistente do que o serviço Standard processing, mesmo em períodos de maior procura.
Flexibilidade fácil de usar: tal como o Standard processing, o modo Fast pode ser acedido num modelo flexível pay-as-you-Go, sem necessidade de aprovisionamento antecipado.
Nota: o processamento prioritário passou a chamar-se modo Fast a 30 de julho de 2026. Pode utilizar service_tier: priority ou service_tier: fast nos seus pedidos à API.
| Contexto curto | Contexto longo | SLA de tempo de atividade3 | SLA de latência3 | |||||
|---|---|---|---|---|---|---|---|---|
| Preço por 1M de tokens de entrada | Preço por 1M de tokens de entrada (em cache) | Preço por 1M de tokens de saída | Preço por 1M de tokens de entrada | Preço por 1M de tokens de entrada (em cache) | Preço por 1M de tokens de saída | |||
GPT-6 Astra | 20,00 US$ | 2,00 US$ | 100,00 US$ | 40,00 US$ | 4,00 US$ | 150,00 US$ | — | — |
GPT-6.1 Sol | 4,00 US$ | 0,20 US$ | 20,00 US$ | 8,00 US$ | 0,40 US$ | 30,00 US$ | — | — |
GPT-6 Sol | 4,00 US$ | 0,40 US$ | 20,00 US$ | 8,00 US$ | 0,80 US$ | 30,00 US$ | — | — |
GPT-6 Luna | 0,20 US$ | 0,02 US$ | 1,00 US$ | 0,40 US$ | 0,04 US$ | 1,50 US$ | — | — |
GPT-5.6 Sol | 8,00 US$ | 0,80 US$ | 40,00 US$ | 16,00 US$ | 1,60 US$ | 60,00 US$ | 99,9% | 99% > 80 tokens por segundo2 |
GPT-5.6 Terra | 4,00 US$ | 0,40 US$ | 24,00 US$ | 8,00 US$ | 0,80 US$ | 36,00 US$ | 99,9% | 99% > 70 tokens por segundo2 |
GPT-5.6 Luna | 0,40 US$ | 0,04 US$ | 2,40 US$ | 0,80 US$ | 0,08 US$ | 3,60 US$ | 99,9% | 99% > 100 tokens por segundo2 |
GPT-5.5 exclui contextos longos1 | 12,50 US$ | 1,250 US$ | 75,00 US$ | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5.4 mini exclui contextos longos1 | 1,50 US$ | 0,150 US$ | 9,00 US$ | — | — | — | 99,9% | 99% > 100 tokens por segundo2 |
GPT-5.4 exclui contextos longos1 | 5,00 US$ | 0,500 US$ | 30,00 US$ | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5.2 | 3,50 US$ | 0,350 US$ | 28,00 US$ | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5.1 | 2,50 US$ | 0,250 US$ | 20,00 US$ | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5 | 2,50 US$ | 0,250 US$ | 20,00 US$ | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5 mini | 0,45 US$ | 0,045 US$ | 3,60 US$ | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
GPT-5.1 codex | 2,50 US$ | 0,250 US$ | 20,00 US$ | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5 codex | 2,50 US$ | 0,250 US$ | 20,00 US$ | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-4.1 | 3,50 US$ | 0,875 US$ | 14,00 US$ | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
GPT-4.1 mini | 0,70 US$ | 0,175 US$ | 2,80 US$ | — | — | — | 99,9% | 99% > 90 tokens por segundo2 |
GPT-4.1 nano | 0,20 US$ | 0,050 US$ | 0,80 US$ | — | — | — | 99,9% | 99% > 100 tokens por segundo2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | 4,25 US$ | 2,125 US$ | 17,00 US$ | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
gpt-4o-2024-05-13 | 8,75 US$ | — | 26,25 US$ | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
GPT-4o mini | 0,25 US$ | 0,125 US$ | 1,00 US$ | — | — | — | 99,9% | 99% > 90 tokens por segundo2 |
o3 | 3,50 US$ | 0,875 US$ | 14,00 US$ | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
o4-mini | 2,00 US$ | 0,500 US$ | 8,00 US$ | — | — | — | 99,9% | 99% > 90 tokens por segundo2 |
Como funciona
Os clientes podem enviar tráfego para o modo Fast pedido a pedido, utilizando o parâmetro existente service_tier, com a opção service_tier = "fast".
Os tokens servidos pelo modo Fast serão faturados por token, a um preço superior às tarifas do processamento Standard.
Para além de poder ser configurado ao nível de cada pedido, também é possível definir o modo Fast como predefinição de um projeto em Project settings > Default Service Tier: Fast. Ainda assim, é possível substituir esta definição em cada pedido. Selecionar Fast nas definições do projeto é equivalente a selecionar Priority.
Limitações
Os limites de taxa do modo Fast são partilhados com outras Camadas de serviço.
Em casos raros, aumentos rápidos dos seus tokens por minuto no modo Fast podem levar a ultrapassar os limites de taxa de rampa. Se exceder o limite de taxa de rampa, o tráfego adicional poderá ser enviado para o Standard processing.