Modo Fast para clientes API
O modo Fast oferece desempenho fiável e de elevada velocidade, com a flexibilidade do pagamento por utilização. Para o nosso mais recente modelo de fronteira, o gpt-5.6-sol, pode aceder a velocidades até 2,5x mais rápidas com o modo Fast.
Ao escolher o modo Fast, pode desbloquear:
- Latência previsivelmente baixa: o modo Fast gera tokens mais depressa e a uma velocidade mais consistente do que o serviço Standard processing, mesmo em períodos de maior procura.
- Flexibilidade fácil de usar: tal como o Standard processing, o modo Fast pode ser acedido num modelo flexível pay-as-you-Go, sem necessidade de aprovisionamento antecipado.
Nota: o processamento prioritário passou a chamar-se modo Fast a 30 de julho de 2026. Pode utilizar service_tier: priority ou service_tier: fast nos seus pedidos à API.
| Short context | Long context | SLA de tempo de atividade3 | SLA de latência3 | |||||
|---|---|---|---|---|---|---|---|---|
| Preço por 1M de tokens de entrada | Preço por 1M de tokens de entrada (em cache) | Preço por 1M de tokens de saída | Preço por 1M de tokens de entrada | Preço por 1M de tokens de entrada (em cache) | Preço por 1M de tokens de saída | |||
GPT-5.6 Sol | 10,00 US$ | 1,00 US$ | 60,00 US$ | 20,00 US$ | 2,00 US$ | 90,00 US$ | 99,9% | 99% > 80 tokens por segundo2 |
GPT-5.6 Terra | 4,00 US$ | 0,40 US$ | 24,00 US$ | 8,00 US$ | 0,80 US$ | 36,00 US$ | 99,9% | 99% > 70 tokens por segundo2 |
GPT-5.6 Luna | 0,40 US$ | 0,04 US$ | 2,40 US$ | 0,80 US$ | 0,08 US$ | 3,60 US$ | 99,9% | 99% > 100 tokens por segundo2 |
GPT-5.5 exclui contextos longos1 | 12,50 US$ | 1,250 US$ | 75,00 US$ | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5.4 mini exclui contextos longos1 | 1,50 US$ | 0,150 US$ | 9,00 US$ | — | — | — | 99,9% | 99% > 100 tokens por segundo2 |
GPT-5.4 exclui contextos longos1 | 5,00 US$ | 0,500 US$ | 30,00 US$ | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5.2 | 3,50 US$ | 0,350 US$ | 28,00 US$ | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5.1 | 2,50 US$ | 0,250 US$ | 20,00 US$ | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5 | 2,50 US$ | 0,250 US$ | 20,00 US$ | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5 mini | 0,45 US$ | 0,045 US$ | 3,60 US$ | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
GPT-5.1 codex | 2,50 US$ | 0,250 US$ | 20,00 US$ | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-5 codex | 2,50 US$ | 0,250 US$ | 20,00 US$ | — | — | — | 99,9% | 99% > 50 tokens por segundo2 |
GPT-4.1 | 3,50 US$ | 0,875 US$ | 14,00 US$ | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
GPT-4.1 mini | 0,70 US$ | 0,175 US$ | 2,80 US$ | — | — | — | 99,9% | 99% > 90 tokens por segundo2 |
GPT-4.1 nano | 0,20 US$ | 0,050 US$ | 0,80 US$ | — | — | — | 99,9% | 99% > 100 tokens por segundo2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | 4,25 US$ | 2,125 US$ | 17,00 US$ | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
gpt-4o-2024-05-13 | 8,75 US$ | — | 26,25 US$ | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
GPT-4o mini | 0,25 US$ | 0,125 US$ | 1,00 US$ | — | — | — | 99,9% | 99% > 90 tokens por segundo2 |
o3 | 3,50 US$ | 0,875 US$ | 14,00 US$ | — | — | — | 99,9% | 99% > 80 tokens por segundo2 |
o4-mini | 2,00 US$ | 0,500 US$ | 8,00 US$ | — | — | — | 99,9% | 99% > 90 tokens por segundo2 |
Como funciona
Os clientes podem enviar tráfego para o modo Fast pedido a pedido, utilizando o parâmetro existente service_tier, com a opção service_tier = "fast".
Os tokens servidos pelo modo Fast serão faturados por token, a um preço superior às tarifas do processamento Standard.
Para além de poder ser configurado ao nível de cada pedido, também é possível definir o modo Fast como predefinição de um projeto em Project settings > Default Service Tier: Fast. Ainda assim, é possível substituir esta definição em cada pedido. Selecionar Fast nas definições do projeto é equivalente a selecionar Priority.
Limitações
- Os limites de taxa do modo Fast são partilhados com outras Camadas de serviço.
- Em casos raros, aumentos rápidos dos seus tokens por minuto no modo Fast podem levar a ultrapassar os limites de taxa de rampa. Se exceder o limite de taxa de rampa, o tráfego adicional poderá ser enviado para o Standard processing.