Pasar al contenido principal
OpenAI

Modo rápido para clientes de la API

El Modo rápido ofrece un rendimiento confiable y de alta velocidad con la flexibilidad del pago por uso. Con nuestro modelo de vanguardia más reciente, gpt-5.6-sol, puedes alcanzar velocidades de hasta 2.5 veces superiores con el Modo rápido.

Al elegir Modo rápido, podrás desbloquear:

  • Baja latencia predecible: el Modo rápido genera tokens más rápido y a una velocidad más constante que el servicio de procesamiento estándar, incluso durante los picos de demanda.
  • Flexibilidad y facilidad de uso: al igual que el procesamiento estándar, se puede acceder al Modo rápido de manera flexible y con pago por uso, sin necesidad de aprovisionamiento anticipado.

Nota: El Procesamiento prioritario pasó a llamarse Modo rápido el 30 de julio de 2026. Puedes usar service_tier: priority o service_tier: fast en tus solicitudes de API.

Short contextLong contextTiempo en funcionamiento garantizado3Latencia garantizada3
Precio por 1 millón de tokens de entradaPrecio por 1 millón de tokens de entrada (en caché)Precio por 1 millón de tokens de salidaPrecio por 1 millón de tokens de entradaPrecio por 1 millón de tokens de entrada (en caché)Precio por 1 millón de tokens de salida
GPT-5.6 Sol
USD 10.00USD 1.00USD 60.00USD 20.00USD 2.00USD 90.0099.9%99% > 80 tokens por segundo2
GPT-5.6 Terra
USD 4.00USD 0.40USD 24.00USD 8.00USD 0.80USD 36.0099.9%99% > 70 tokens por segundo2
GPT-5.6 Luna
USD 0.40USD 0.04USD 2.40USD 0.80USD 0.08USD 3.6099.9%99% > 100 tokens por segundo2
GPT-5.5
excluye el contexto extenso1
USD 12.50USD 1.250USD 75.0099.9%99% > 50 tokens por segundo2
GPT-5.4 mini
excluye el contexto extenso1
USD 1.50USD 0.150USD 9.0099.9%99% > 100 tokens por segundo2
GPT-5.4
excluye el contexto extenso1
USD 5.00USD 0.500USD 30.0099.9%99% > 50 tokens por segundo2
GPT-5.2
USD 3.50USD 0.350USD 28.0099.9%99% > 50 tokens por segundo2
GPT-5.1
USD 2.50USD 0.250USD 20.0099.9%99% > 50 tokens por segundo2
GPT-5
USD 2.50USD 0.250USD 20.0099.9%99% > 50 tokens por segundo2
GPT-5 mini
USD 0.45USD 0.045USD 3.6099.9%99% > 80 tokens por segundo2
GPT-5.1 codex
USD 2.50USD 0.250USD 20.0099.9%99% > 50 tokens por segundo2
GPT-5 codex
USD 2.50USD 0.250USD 20.0099.9%99% > 50 tokens por segundo2
GPT-4.1
USD 3.50USD 0.875USD 14.0099.9%99% > 80 tokens por segundo2
GPT-4.1 mini
USD 0.70USD 0.175USD 2.8099.9%99% > 90 tokens por segundo2
GPT-4.1 nano
USD 0.20USD 0.050USD 0.8099.9%99% > 100 tokens por segundo2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
USD 4.25USD 2.125USD 17.0099.9%99% > 80 tokens por segundo2
gpt-4o-2024-05-13
USD 8.75USD 26.2599.9%99% > 80 tokens por segundo2
GPT-4o mini
USD 0.25USD 0.125USD 1.0099.9%99% > 90 tokens por segundo2
o3
USD 3.50USD 0.875USD 14.0099.9%99% > 80 tokens por segundo2
o4-mini
USD 2.00USD 0.500USD 8.0099.9%99% > 90 tokens por segundo2
1Solicitudes estimadas en >272 mil tokens de prompt
2Calculado con la latencia de solicitud p50 en intervalos de 5 minutos. Las garantías de funcionamiento anteriores también siguen siendo aplicables a los clientes con contratos empresariales existentes que tienen acuerdos de latencia calculados según la latencia p50 de las solicitudes en intervalos por minuto.
3Aplica únicamente para clientes Enterprise

¿Cómo funciona?

Los clientes pueden dirigir el tráfico al Modo rápido en función de cada solicitud utilizando el parámetro service_tier existente, con la opción service_tier = "fast".

Los tokens a los que se aplique el Modo rápido se facturarán por token, a un precio más alto que la tarifa estándar de procesamiento.

Además de configurarse a nivel de solicitud, también puedes establecer un proyecto en Modo rápido en Configuración del proyecto > Nivel de servicio predeterminado: rápido. Aún puedes reemplazar esta configuración en cada solicitud. Seleccionar Modo rápido en la configuración de tu proyecto equivale a seleccionar Procesamiento prioritario.

Limitaciones

  • Los límites de solicitudes del Modo rápido se comparten con otros niveles de servicio.
  • En raras ocasiones, los aumentos rápidos de tus tokens por minuto en Modo rápido pueden hacer que alcances los límites de solicitudes de aumento. Si excedes el límite de aumento de la velocidad de tráfico, el tráfico adicional podría ser enviado al procesamiento estándar.

Preguntas frecuentes

Precios

Modelos

Límites de velocidad

Confiabilidad

Políticas