Modo rápido para clientes de la API
El Modo rápido ofrece un rendimiento confiable y de alta velocidad con la flexibilidad del pago por uso. Con nuestro modelo de vanguardia más reciente, gpt-5.6-sol, puedes alcanzar velocidades de hasta 2.5 veces superiores con el Modo rápido.
Al elegir Modo rápido, podrás desbloquear:
- Baja latencia predecible: el Modo rápido genera tokens más rápido y a una velocidad más constante que el servicio de procesamiento estándar, incluso durante los picos de demanda.
- Flexibilidad y facilidad de uso: al igual que el procesamiento estándar, se puede acceder al Modo rápido de manera flexible y con pago por uso, sin necesidad de aprovisionamiento anticipado.
Nota: El Procesamiento prioritario pasó a llamarse Modo rápido el 30 de julio de 2026. Puedes usar service_tier: priority o service_tier: fast en tus solicitudes de API.
| Short context | Long context | Tiempo en funcionamiento garantizado3 | Latencia garantizada3 | |||||
|---|---|---|---|---|---|---|---|---|
| Precio por 1 millón de tokens de entrada | Precio por 1 millón de tokens de entrada (en caché) | Precio por 1 millón de tokens de salida | Precio por 1 millón de tokens de entrada | Precio por 1 millón de tokens de entrada (en caché) | Precio por 1 millón de tokens de salida | |||
GPT-5.6 Sol | USD 10.00 | USD 1.00 | USD 60.00 | USD 20.00 | USD 2.00 | USD 90.00 | 99.9% | 99% > 80 tokens por segundo2 |
GPT-5.6 Terra | USD 4.00 | USD 0.40 | USD 24.00 | USD 8.00 | USD 0.80 | USD 36.00 | 99.9% | 99% > 70 tokens por segundo2 |
GPT-5.6 Luna | USD 0.40 | USD 0.04 | USD 2.40 | USD 0.80 | USD 0.08 | USD 3.60 | 99.9% | 99% > 100 tokens por segundo2 |
GPT-5.5 excluye el contexto extenso1 | USD 12.50 | USD 1.250 | USD 75.00 | — | — | — | 99.9% | 99% > 50 tokens por segundo2 |
GPT-5.4 mini excluye el contexto extenso1 | USD 1.50 | USD 0.150 | USD 9.00 | — | — | — | 99.9% | 99% > 100 tokens por segundo2 |
GPT-5.4 excluye el contexto extenso1 | USD 5.00 | USD 0.500 | USD 30.00 | — | — | — | 99.9% | 99% > 50 tokens por segundo2 |
GPT-5.2 | USD 3.50 | USD 0.350 | USD 28.00 | — | — | — | 99.9% | 99% > 50 tokens por segundo2 |
GPT-5.1 | USD 2.50 | USD 0.250 | USD 20.00 | — | — | — | 99.9% | 99% > 50 tokens por segundo2 |
GPT-5 | USD 2.50 | USD 0.250 | USD 20.00 | — | — | — | 99.9% | 99% > 50 tokens por segundo2 |
GPT-5 mini | USD 0.45 | USD 0.045 | USD 3.60 | — | — | — | 99.9% | 99% > 80 tokens por segundo2 |
GPT-5.1 codex | USD 2.50 | USD 0.250 | USD 20.00 | — | — | — | 99.9% | 99% > 50 tokens por segundo2 |
GPT-5 codex | USD 2.50 | USD 0.250 | USD 20.00 | — | — | — | 99.9% | 99% > 50 tokens por segundo2 |
GPT-4.1 | USD 3.50 | USD 0.875 | USD 14.00 | — | — | — | 99.9% | 99% > 80 tokens por segundo2 |
GPT-4.1 mini | USD 0.70 | USD 0.175 | USD 2.80 | — | — | — | 99.9% | 99% > 90 tokens por segundo2 |
GPT-4.1 nano | USD 0.20 | USD 0.050 | USD 0.80 | — | — | — | 99.9% | 99% > 100 tokens por segundo2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | USD 4.25 | USD 2.125 | USD 17.00 | — | — | — | 99.9% | 99% > 80 tokens por segundo2 |
gpt-4o-2024-05-13 | USD 8.75 | — | USD 26.25 | — | — | — | 99.9% | 99% > 80 tokens por segundo2 |
GPT-4o mini | USD 0.25 | USD 0.125 | USD 1.00 | — | — | — | 99.9% | 99% > 90 tokens por segundo2 |
o3 | USD 3.50 | USD 0.875 | USD 14.00 | — | — | — | 99.9% | 99% > 80 tokens por segundo2 |
o4-mini | USD 2.00 | USD 0.500 | USD 8.00 | — | — | — | 99.9% | 99% > 90 tokens por segundo2 |
¿Cómo funciona?
Los clientes pueden dirigir el tráfico al Modo rápido en función de cada solicitud utilizando el parámetro service_tier existente, con la opción service_tier = "fast".
Los tokens a los que se aplique el Modo rápido se facturarán por token, a un precio más alto que la tarifa estándar de procesamiento.
Además de configurarse a nivel de solicitud, también puedes establecer un proyecto en Modo rápido en Configuración del proyecto > Nivel de servicio predeterminado: rápido. Aún puedes reemplazar esta configuración en cada solicitud. Seleccionar Modo rápido en la configuración de tu proyecto equivale a seleccionar Procesamiento prioritario.
Limitaciones
- Los límites de solicitudes del Modo rápido se comparten con otros niveles de servicio.
- En raras ocasiones, los aumentos rápidos de tus tokens por minuto en Modo rápido pueden hacer que alcances los límites de solicitudes de aumento. Si excedes el límite de aumento de la velocidad de tráfico, el tráfico adicional podría ser enviado al procesamiento estándar.