Mode rapide pour les clients de l’API
Le Mode rapide offre des performances fiables et rapides, avec la souplesse du paiement à l’usage. Avec le Mode rapide, gpt-5.6-sol peut fonctionner jusqu’à 2,5 fois plus vite.
En optant pour le Mode rapide, vous bénéficiez des avantages suivants :
Latence faible et prévisible : le Mode rapide génère des tokens plus rapidement et à une vitesse plus constante que le service de traitement standard, même en période de forte demande.
Flexibilité d’utilisation : comme le traitement standard, le Mode rapide est accessible de manière flexible, sur une base de facturation à l'usage, sans nécessiter de capacité provisionnée à l’avance.
Remarque : le traitement Prioritaire a été renommé Mode rapide le 30 juillet 2026. Vous pouvez utiliser « service_tier: priority » ou « service_tier: fast » dans vos requêtes d’API.
| Bref contexte | Contexte étendu | SLA de disponibilité3 | SLA de latence3 | |||||
|---|---|---|---|---|---|---|---|---|
| Prix pour 1 000 000 jetons d’entrée | Prix pour 1 million de jetons d’entrée (mis en mémoire cache) | Prix pour 1 000 000 de jetons de sortie | Prix pour 1 000 000 jetons d’entrée | Prix pour 1 million de jetons d’entrée (mis en mémoire cache) | Prix pour 1 000 000 de jetons de sortie | |||
GPT-6 Astra | 20,00 $ US | 2,00 $ US | 100,00 $ US | 40,00 $ US | 4,00 $ US | 150,00 $ US | — | — |
GPT-6.1 Sol | 4,00 $ US | 0,20 $ US | 20,00 $ US | 8,00 $ US | 0,40 $ US | 30,00 $ US | — | — |
GPT-6 Sol | 4,00 $ US | 0,40 $ US | 20,00 $ US | 8,00 $ US | 0,80 $ US | 30,00 $ US | — | — |
GPT-6 Luna | 0,20 $ US | 0,02 $ US | 1,00 $ US | 0,40 $ US | 0,04 $ US | 1,50 $ US | — | — |
GPT-5.6 Sol | 8,00 $ US | 0,80 $ US | 40,00 $ US | 16,00 $ US | 1,60 $ US | 60,00 $ US | 99,9 % | 99 % > 80 jetons par seconde2 |
GPT-5.6 Terra | 4,00 $ US | 0,40 $ US | 24,00 $ US | 8,00 $ US | 0,80 $ US | 36,00 $ US | 99,9 % | 99 % > 70 jetons par seconde2 |
GPT-5.6 Luna | 0,40 $ US | 0,04 $ US | 2,40 $ US | 0,80 $ US | 0,08 $ US | 3,60 $ US | 99,9 % | 99 % > 100 jetons par seconde2 |
GPT-5.5 hors requêtes à long contexte1 | 12,50 $ US | 1,250 $ US | 75,00 $ US | — | — | — | 99,9 % | 99 % > 50 jetons par seconde2 |
GPT-5.4 mini hors requêtes à long contexte1 | 1,50 $ US | 0,150 $ US | 9,00 $ US | — | — | — | 99,9 % | 99 % > 100 jetons par seconde2 |
GPT-5.4 hors requêtes à long contexte1 | 5,00 $ US | 0,500 $ US | 30,00 $ US | — | — | — | 99,9 % | 99 % > 50 jetons par seconde2 |
GPT-5.2 | 3,50 $ US | 0,350 $ US | 28,00 $ US | — | — | — | 99,9 % | 99 % > 50 jetons par seconde2 |
GPT-5.1 | 2,50 $ US | 0,250 $ US | 20,00 $ US | — | — | — | 99,9 % | 99 % > 50 jetons par seconde2 |
GPT-5 | 2,50 $ US | 0,250 $ US | 20,00 $ US | — | — | — | 99,9 % | 99 % > 50 jetons par seconde2 |
GPT-5 mini | 0,45 $ US | 0,045 $ US | 3,60 $ US | — | — | — | 99,9 % | 99 % > 80 jetons par seconde2 |
GPT-5.1 codex | 2,50 $ US | 0,250 $ US | 20,00 $ US | — | — | — | 99,9 % | 99 % > 50 jetons par seconde2 |
GPT-5 codex | 2,50 $ US | 0,250 $ US | 20,00 $ US | — | — | — | 99,9 % | 99 % > 50 jetons par seconde2 |
GPT-4.1 | 3,50 $ US | 0,875 $ US | 14,00 $ US | — | — | — | 99,9 % | 99 % > 80 jetons par seconde2 |
GPT-4.1 mini | 0,70 $ US | 0,175 $ US | 2,80 $ US | — | — | — | 99,9 % | 99 % > 90 jetons par seconde2 |
GPT-4.1 nano | 0,20 $ US | 0,050 $ US | 0,80 $ US | — | — | — | 99,9 % | 99 % > 100 jetons par seconde2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | 4,25 $ US | 2,125 $ US | 17,00 $ US | — | — | — | 99,9 % | 99 % > 80 jetons par seconde2 |
gpt-4o-2024-05-13 | 8,75 $ US | — | 26,25 $ US | — | — | — | 99,9 % | 99 % > 80 jetons par seconde2 |
GPT-4o mini | 0,25 $ US | 0,125 $ US | 1,00 $ US | — | — | — | 99,9 % | 99 % > 90 jetons par seconde2 |
o3 | 3,50 $ US | 0,875 $ US | 14,00 $ US | — | — | — | 99,9 % | 99 % > 80 jetons par seconde2 |
o4-mini | 2,00 $ US | 0,500 $ US | 8,00 $ US | — | — | — | 99,9 % | 99 % > 90 jetons par seconde2 |
Comment ça marche?
Les clients peuvent orienter le trafic vers le Mode rapide à la demande en utilisant le paramètre service_tier existant, avec l’option service_tier = "fast".
Les tokens servis par le Mode rapide seront facturés au token, à un tarif majoré par rapport aux tarifs de traitement standard.
En plus d’être configuré au niveau de la requête, vous pouvez aussi définir un projet en Mode rapide par défaut dans les paramètres du projet > Offre par défaut : Mode rapide. Vous pouvez toujours le modifier pour chaque demande. La sélection du Mode rapide dans les paramètres de votre projet équivaut à sélectionner Prioritaire.
Limites
Les limites de débit du Mode rapide sont partagées avec les autres offres.
Dans de rares cas, une augmentation rapide du nombre de tokens par minute de votre Mode rapide peut entraîner l’atteinte des limites de débit de montée en charge. Ce dépassement peut entraîner une bascule du trafic additionnel vers le traitement standard.