Modo rápido para clientes de API
El Modo rápido ofrece un rendimiento fiable y de alta velocidad con la flexibilidad del pago por Go. Para nuestro último modelo de vanguardia, gpt-5.6-sol, puedes acceder a velocidades hasta 2,5 veces superiores con el Modo rápido.
Al elegir Modo rápido, podrás desbloquear:
- Latencia previsiblemente baja: el Modo rápido genera tokens más rápido y a una velocidad más constante que el servicio de procesamiento estándar, incluso durante los picos de demanda.
- Flexibilidad fácil de usar: al igual que el procesamiento estándar, el Modo rápido se puede utilizar de forma flexible con un modelo de pago por uso, sin necesidad de aprovisionamiento previo.
Nota: El procesamiento Prioritario cambió de nombre a Modo rápido el 30 de julio de 2026 Puedes usar service_tier: priority o service_tier: fast en tus solicitudes de API.
| Short context | Long context | Tiempo de actividad garantizado3 | Latencia garantizada3 | |||||
|---|---|---|---|---|---|---|---|---|
| Precio por millón de tókenes de entrada | Precio por millón de tókenes de entrada (en caché) | Precio por millón de tókenes de salida | Precio por millón de tókenes de entrada | Precio por millón de tókenes de entrada (en caché) | Precio por millón de tókenes de salida | |||
GPT-5.6 Sol | 10,00 US$ | 1,00 US$ | 60,00 US$ | 20,00 US$ | 2,00 US$ | 90,00 US$ | 99,9 % | 99 % > 80 tókenes por segundo 2 |
GPT-5.6 Terra | 4,00 US$ | 0,40 US$ | 24,00 US$ | 8,00 US$ | 0,80 US$ | 36,00 US$ | 99,9 % | 99 % > 70 tókenes por segundo 2 |
GPT-5.6 Luna | 0,40 US$ | 0,04 US$ | 2,40 US$ | 0,80 US$ | 0,08 US$ | 3,60 US$ | 99,9 % | 99 % > 100 tókenes por segundo 2 |
GPT-5.5 excluye contexto largo1 | 12,50 US$ | 1,250 US$ | 75,00 US$ | — | — | — | 99,9 % | 99 % > 50 tókenes por segundo 2 |
GPT-5.4 mini excluye contexto largo1 | 1,50 US$ | 0,150 US$ | 9,00 US$ | — | — | — | 99,9 % | 99 % > 100 tókenes por segundo 2 |
GPT-5.4 excluye contexto largo1 | 5,00 US$ | 0,500 US$ | 30,00 US$ | — | — | — | 99,9 % | 99 % > 50 tókenes por segundo 2 |
GPT-5.2 | 3,50 US$ | 0,350 US$ | 28,00 US$ | — | — | — | 99,9 % | 99 % > 50 tókenes por segundo 2 |
GPT-5.1 | 2,50 US$ | 0,250 US$ | 20,00 US$ | — | — | — | 99,9 % | 99 % > 50 tókenes por segundo 2 |
GPT-5 | 2,50 US$ | 0,250 US$ | 20,00 US$ | — | — | — | 99,9 % | 99 % > 50 tókenes por segundo 2 |
GPT-5 mini | 0,45 US$ | 0,045 US$ | 3,60 US$ | — | — | — | 99,9 % | 99 % > 80 tókenes por segundo 2 |
GPT-5.1 codex | 2,50 US$ | 0,250 US$ | 20,00 US$ | — | — | — | 99,9 % | 99 % > 50 tókenes por segundo 2 |
GPT-5 codex | 2,50 US$ | 0,250 US$ | 20,00 US$ | — | — | — | 99,9 % | 99 % > 50 tókenes por segundo 2 |
GPT-4.1 | 3,50 US$ | 0,875 US$ | 14,00 US$ | — | — | — | 99,9 % | 99 % > 80 tókenes por segundo 2 |
GPT-4.1 mini | 0,70 US$ | 0,175 US$ | 2,80 US$ | — | — | — | 99,9 % | 99 % > 90 tókenes por segundo 2 |
GPT-4.1 nano | 0,20 US$ | 0,050 US$ | 0,80 US$ | — | — | — | 99,9 % | 99 % > 100 tókenes por segundo 2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | 4,25 US$ | 2,125 US$ | 17,00 US$ | — | — | — | 99,9 % | 99 % > 80 tókenes por segundo 2 |
gpt-4o-2024-05-13 | 8,75 US$ | — | 26,25 US$ | — | — | — | 99,9 % | 99 % > 80 tókenes por segundo 2 |
GPT-4o mini | 0,25 US$ | 0,125 US$ | 1,00 US$ | — | — | — | 99,9 % | 99 % > 90 tókenes por segundo 2 |
o3 | 3,50 US$ | 0,875 US$ | 14,00 US$ | — | — | — | 99,9 % | 99 % > 80 tókenes por segundo 2 |
o4-mini | 2,00 US$ | 0,500 US$ | 8,00 US$ | — | — | — | 99,9 % | 99 % > 90 tókenes por segundo 2 |
¿Cómo funcionan?
Los clientes pueden dirigir las solicitudes al modo rápido de forma individual utilizando el parámetro service_tier existente, con la opción service_tier = "fast".
Los tokens procesados por el Modo rápido se facturarán por cada token, a un precio superior al de la tarifa estándar de procesamiento.
Además de configurarse a nivel de solicitud, también puedes establecer Modo rápido como el modo predeterminado de un proyecto en Configuración del proyecto > Nivel de servicio predeterminado: rápido. Aún puedes anular la configuración por solicitud. Seleccionar Rápido en la configuración del proyecto equivale a seleccionar Prioridad.
Limitaciones
- Los límites de solicitudes del Modo rápido se comparten con otros niveles de servicio.
- En raras ocasiones, los aumentos rápidos de tus tokens por minuto del Modo rápido pueden provocar que alcances los límites de solicitudes progresivos. Si excedes el límite de solicitudes de aumento progresivo, el tráfico adicional podría ser enviado al procesamiento estándar.