Passer au contenu principal
OpenAI

Mode rapide pour les clients API

Le mode Rapide offre des performances fiables et rapides, avec la souplesse du paiement à l’usage. Pour notre dernier modèle de pointe, gpt-5.6-sol, vous pouvez accéder à des vitesses jusqu’à 2,5 fois plus rapides avec le mode rapide.

En optant pour le mode rapide, vous pouvez débloquer :

  • Latence faible et prévisible : le mode rapide génère des tokens plus rapidement et à une vitesse plus constante que le service de traitement standard, même en période de forte demande.
  • Flexibilité d’utilisation : comme le traitement standard, le mode Rapide est accessible de manière flexible, sur une base de facturation à l’usage, sans nécessiter de capacité provisionnée à l’avance.

Remarque : le traitement Prioritaire a été renommé mode Rapide le 30 juillet 2026. Vous pouvez utiliser soit service_tier :priority, soit service_tier :fast dans vos requêtes API.

Short contextLong contextSLA de disponibilité3SLA de latence3
Prix pour 1 000 000 jetons d’entréePrix pour 1 000 000 de jetons d’entrée (mis en mémoire cache)Prix pour 1 000 000 de jetons de sortiePrix pour 1 000 000 jetons d’entréePrix pour 1 000 000 de jetons d’entrée (mis en mémoire cache)Prix pour 1 000 000 de jetons de sortie
GPT-5.6 Sol
10,00 $US1,00 $US60,00 $US20,00 $US2,00 $US90,00 $US99,9 %99 % > 80 jetons par seconde2
GPT-5.6 Terra
4,00 $US0,40 $US24,00 $US8,00 $US0,80 $US36,00 $US99,9 %99 % > 70 jetons par seconde2
GPT-5.6 Luna
0,40 $US0,04 $US2,40 $US0,80 $US0,08 $US3,60 $US99,9 %99 % > 100 jetons par seconde2
GPT-5.5
hors requêtes à long contexte1
12,50 $US1,250 $US75,00 $US99,9 %99 % > 50 jetons par seconde2
GPT-5.4 mini
hors requêtes à long contexte1
1,50 $US0,150 $US9,00 $US99,9 %99 % > 100 jetons par seconde2
GPT-5.4
hors requêtes à long contexte1
5,00 $US0,500 $US30,00 $US99,9 %99 % > 50 jetons par seconde2
GPT-5.2
3,50 $US0,350 $US28,00 $US99,9 %99 % > 50 jetons par seconde2
GPT-5.1
2,50 $US0,250 $US20,00 $US99,9 %99 % > 50 jetons par seconde2
GPT-5
2,50 $US0,250 $US20,00 $US99,9 %99 % > 50 jetons par seconde2
GPT-5 mini
0,45 $US0,045 $US3,60 $US99,9 %99 % > 80 jetons par seconde2
GPT-5.1 codex
2,50 $US0,250 $US20,00 $US99,9 %99 % > 50 jetons par seconde2
GPT-5 codex
2,50 $US0,250 $US20,00 $US99,9 %99 % > 50 jetons par seconde2
GPT-4.1
3,50 $US0,875 $US14,00 $US99,9 %99 % > 80 jetons par seconde2
GPT-4.1 mini
0,70 $US0,175 $US2,80 $US99,9 %99 % > 90 jetons par seconde2
GPT-4.1 nano
0,20 $US0,050 $US0,80 $US99,9 %99 % > 100 jetons par seconde2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
4,25 $US2,125 $US17,00 $US99,9 %99 % > 80 jetons par seconde2
gpt-4o-2024-05-13
8,75 $US26,25 $US99,9 %99 % > 80 jetons par seconde2
GPT-4o mini
0,25 $US0,125 $US1,00 $US99,9 %99 % > 90 jetons par seconde2
o3
3,50 $US0,875 $US14,00 $US99,9 %99 % > 80 jetons par seconde2
o4-mini
2,00 $US0,500 $US8,00 $US99,9 %99 % > 90 jetons par seconde2
1Requêtes estimées à plus de 272 000 tokens de prompt
2Latence médiane des requêtes sur une période de 5 minutes Pour les clients ayant des accords d’entreprise existants incluant des SLA de latence calculés sur la latence médiane des requêtes par minute, les SLA précédents restent valables.
3Ne concerne que les clients Enterprise

Comment ça marche ?

Les clients peuvent orienter le trafic vers le mode rapide à la demande en utilisant le paramètre service_tier existant, avec l’option service_tier = "fast".

Les tokens traités en mode Rapide seront facturés par token, à un tarif majoré par rapport aux tarifs de traitement standard.

En plus d’être configuré au niveau de la requête, vous pouvez aussi définir un projet en mode Rapide par défaut dans les paramètres du projet > Offre par défaut : mode Rapide. Vous pouvez toujours le modifier pour chaque demande. Sélectionner Rapide dans les paramètres de votre projet équivaut à sélectionner Prioritaire.

Limites

  • Les limites de débit du mode rapide sont partagées avec les autres offres.
  • Dans de rares cas, une augmentation rapide du nombre de tokens par minute, en mode Rapide, peut entraîner un dépassement des limites de débit de montée en charge. Ce dépassement peut entraîner une bascule du trafic additionnel vers le traitement standard.

Foire aux questions

Tarification

Modèles

Limites de débit

Fiabilité

Politiques