Ir al contenido principal
OpenAI

Modo rápido para clientes de API

El Modo rápido ofrece un rendimiento fiable y de alta velocidad con la flexibilidad del pago por Go. Para nuestro último modelo de vanguardia, gpt-5.6-sol, puedes acceder a velocidades hasta 2,5 veces superiores con el Modo rápido.

Al elegir Modo rápido, podrás desbloquear:

  • Latencia previsiblemente baja: el Modo rápido genera tokens más rápido y a una velocidad más constante que el servicio de procesamiento estándar, incluso durante los picos de demanda.
  • Flexibilidad fácil de usar: al igual que el procesamiento estándar, el Modo rápido se puede utilizar de forma flexible con un modelo de pago por uso, sin necesidad de aprovisionamiento previo.

Nota: El procesamiento Prioritario cambió de nombre a Modo rápido el 30 de julio de 2026 Puedes usar service_tier: priority o service_tier: fast en tus solicitudes de API.

Short contextLong contextTiempo de actividad garantizado3Latencia garantizada3
Precio por millón de tókenes de entradaPrecio por millón de tókenes de entrada (en caché)Precio por millón de tókenes de salidaPrecio por millón de tókenes de entradaPrecio por millón de tókenes de entrada (en caché)Precio por millón de tókenes de salida
GPT-5.6 Sol
10,00 US$1,00 US$60,00 US$20,00 US$2,00 US$90,00 US$99,9 %99 % > 80 tókenes por segundo 2
GPT-5.6 Terra
4,00 US$0,40 US$24,00 US$8,00 US$0,80 US$36,00 US$99,9 %99 % > 70 tókenes por segundo 2
GPT-5.6 Luna
0,40 US$0,04 US$2,40 US$0,80 US$0,08 US$3,60 US$99,9 %99 % > 100 tókenes por segundo 2
GPT-5.5
excluye contexto largo1
12,50 US$1,250 US$75,00 US$99,9 %99 % > 50 tókenes por segundo 2
GPT-5.4 mini
excluye contexto largo1
1,50 US$0,150 US$9,00 US$99,9 %99 % > 100 tókenes por segundo 2
GPT-5.4
excluye contexto largo1
5,00 US$0,500 US$30,00 US$99,9 %99 % > 50 tókenes por segundo 2
GPT-5.2
3,50 US$0,350 US$28,00 US$99,9 %99 % > 50 tókenes por segundo 2
GPT-5.1
2,50 US$0,250 US$20,00 US$99,9 %99 % > 50 tókenes por segundo 2
GPT-5
2,50 US$0,250 US$20,00 US$99,9 %99 % > 50 tókenes por segundo 2
GPT-5 mini
0,45 US$0,045 US$3,60 US$99,9 %99 % > 80 tókenes por segundo 2
GPT-5.1 codex
2,50 US$0,250 US$20,00 US$99,9 %99 % > 50 tókenes por segundo 2
GPT-5 codex
2,50 US$0,250 US$20,00 US$99,9 %99 % > 50 tókenes por segundo 2
GPT-4.1
3,50 US$0,875 US$14,00 US$99,9 %99 % > 80 tókenes por segundo 2
GPT-4.1 mini
0,70 US$0,175 US$2,80 US$99,9 %99 % > 90 tókenes por segundo 2
GPT-4.1 nano
0,20 US$0,050 US$0,80 US$99,9 %99 % > 100 tókenes por segundo 2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
4,25 US$2,125 US$17,00 US$99,9 %99 % > 80 tókenes por segundo 2
gpt-4o-2024-05-13
8,75 US$26,25 US$99,9 %99 % > 80 tókenes por segundo 2
GPT-4o mini
0,25 US$0,125 US$1,00 US$99,9 %99 % > 90 tókenes por segundo 2
o3
3,50 US$0,875 US$14,00 US$99,9 %99 % > 80 tókenes por segundo 2
o4-mini
2,00 US$0,500 US$8,00 US$99,9 %99 % > 90 tókenes por segundo 2
1Solicitudes estimadas en >272 000 tokens de prompt
2Se calcula como latencia p50 de solicitudes en intervalos de 5 minutos. Para los clientes que ya tengan acuerdos empresariales con ANS de latencia p50 de solicitudes por minuto, dichos acuerdos anteriores siguen siendo vigentes.
3Aplicable únicamente a los clientes de Enterprise

¿Cómo funcionan?

Los clientes pueden dirigir las solicitudes al modo rápido de forma individual utilizando el parámetro service_tier existente, con la opción service_tier = "fast".

Los tokens procesados por el Modo rápido se facturarán por cada token, a un precio superior al de la tarifa estándar de procesamiento.

Además de configurarse a nivel de solicitud, también puedes establecer Modo rápido como el modo predeterminado de un proyecto en Configuración del proyecto > Nivel de servicio predeterminado: rápido. Aún puedes anular la configuración por solicitud. Seleccionar Rápido en la configuración del proyecto equivale a seleccionar Prioridad.

Limitaciones

  • Los límites de solicitudes del Modo rápido se comparten con otros niveles de servicio.
  • En raras ocasiones, los aumentos rápidos de tus tokens por minuto del Modo rápido pueden provocar que alcances los límites de solicitudes progresivos. Si excedes el límite de solicitudes de aumento progresivo, el tráfico adicional podría ser enviado al procesamiento estándar.

Preguntas frecuentes

Precios

Modelos

Límites de velocidad

Fiabilidad

Políticas