Pular para o conteúdo principal
OpenAI

Modo Fast para clientes da API

O modo Fast oferece desempenho confiável e de alta velocidade, com a flexibilidade do pagamento conforme o uso. Com nosso modelo de ponta mais recente, o gpt-5.6-sol, você pode obter velocidades até 2,5 vezes maiores com o modo Fast.

Ao escolher o modo Fast, você tem acesso a:

  • Latência baixa e previsível: o modo Fast gera tokens com mais rapidez e a uma velocidade mais consistente do que o serviço de processamento padrão, mesmo nos picos de demanda.
  • Uso simples e flexível: assim como o processamento padrão, o modo Fast oferece acesso flexível com pagamento conforme o uso, sem exigir provisionamento antecipado.

Observação: o processamento prioritário passou a se chamar modo Fast em 30 de julho de 2026. Você pode usar service_tier: priority ou service_tier: fast nas suas solicitações à API.

Short contextLong contextSLA de tempo de atividade3SLA de latência3
Preço por 1 milhão de tokens de entradaPreço por 1 milhão de tokens de entrada (em cache)Preço por 1 milhão de tokens de saídaPreço por 1 milhão de tokens de entradaPreço por 1 milhão de tokens de entrada (em cache)Preço por 1 milhão de tokens de saída
GPT-5.6 Sol
US$ 10,00US$ 1,00US$ 60,00US$ 20,00US$ 2,00US$ 90,0099,9%99% > 80 tokens por segundo2
GPT-5.6 Terra
US$ 4,00US$ 0,40US$ 24,00US$ 8,00US$ 0,80US$ 36,0099,9%99% > 70 tokens por segundo2
GPT-5.6 Luna
US$ 0,40US$ 0,04US$ 2,40US$ 0,80US$ 0,08US$ 3,6099,9%99% > 100 tokens por segundo2
GPT-5.5
exclui janela de contexto1
US$ 12,50US$ 1,250US$ 75,0099,9%99% > 50 tokens por segundo2
GPT-5.4 mini
exclui janela de contexto1
US$ 1,50US$ 0,150US$ 9,0099,9%99% > 100 tokens por segundo2
GPT-5.4
exclui janela de contexto1
US$ 5,00US$ 0,500US$ 30,0099,9%99% > 50 tokens por segundo2
GPT-5.2
US$ 3,50US$ 0,350US$ 28,0099,9%99% > 50 tokens por segundo2
GPT-5.1
US$ 2,50US$ 0,250US$ 20,0099,9%99% > 50 tokens por segundo2
GPT-5
US$ 2,50US$ 0,250US$ 20,0099,9%99% > 50 tokens por segundo2
GPT-5 mini
US$ 0,45US$ 0,045US$ 3,6099,9%99% > 80 tokens por segundo2
GPT-5.1 codex
US$ 2,50US$ 0,250US$ 20,0099,9%99% > 50 tokens por segundo2
GPT-5 codex
US$ 2,50US$ 0,250US$ 20,0099,9%99% > 50 tokens por segundo2
GPT-4.1
US$ 3,50US$ 0,875US$ 14,0099,9%99% > 80 tokens por segundo2
GPT-4.1 mini
US$ 0,70US$ 0,175US$ 2,8099,9%99% > 90 tokens por segundo2
GPT-4.1 nano
US$ 0,20US$ 0,050US$ 0,8099,9%99% > 100 tokens por segundo2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
US$ 4,25US$ 2,125US$ 17,0099,9%99% > 80 tokens por segundo2
gpt-4o-2024-05-13
US$ 8,75US$ 26,2599,9%99% > 80 tokens por segundo2
GPT-4o mini
US$ 0,25US$ 0,125US$ 1,0099,9%99% > 90 tokens por segundo2
o3
US$ 3,50US$ 0,875US$ 14,0099,9%99% > 80 tokens por segundo2
o4-mini
US$ 2,00US$ 0,500US$ 8,0099,9%99% > 90 tokens por segundo2
1Solicitações estimadas em mais de 272 mil tokens de prompt
2Calculado como o 50º percentil da latência das requisições a cada 5 minutos. Para clientes com contratos Enterprise que especificam SLAs de latência calculados como o 50º percentil da latência das requisições a cada 1 minuto, os SLAs anteriores continuam em vigor.
3Apenas para clientes do plano Enterprise

Como funciona

Os clientes podem direcionar o tráfego ao modo Fast em cada solicitação usando o parâmetro service_tier já existente, com a opção service_tier = "fast".

Os tokens processados no modo Fast serão cobrados por token, a tarifas superiores às do processamento padrão.

Além de configurar o modo Fast em cada solicitação, você também pode defini-lo como padrão para um projeto em Configurações do projeto > Nível de serviço padrão: Fast. Ainda é possível substituir essa configuração em cada solicitação. Selecionar Fast nas configurações do projeto equivale a selecionar Priority.

Limitações

  • Os limites de taxa do modo Fast são compartilhados com outros níveis de serviço.
  • Em casos raros, aumentos rápidos no volume de tokens por minuto no modo Fast podem fazer você atingir os limites de taxa de aumento. Se você exceder esse limite, o tráfego adicional poderá ser direcionado para o processamento padrão.

Perguntas frequentes

Preços

Modelos

Limites de taxa

Confiabilidade

Políticas