Overslaan naar hoofdinhoud
OpenAI

Prioriteitsverwerking voor API-klanten

Fast mode offers reliable, high-speed performance with the flexibility to pay-as-you-go. For our latest frontier model, gpt-5.6-sol, you can access up to 2.5x faster speeds with Fast mode.

By choosing Fast mode, you can unlock:

  • Predictably low latency: Fast mode generates tokens faster and at a more consistent speed than the Standard processing service, even during peak demand.
  • Easy-to-use flexibility: Like Standard processing, Fast mode can be accessed on a flexible, pay-as-you-go basis instead of requiring advance provisioning.

Note: Priority processing was renamed Fast mode on July 30, 2026. You can use either service_tier: priority or service_tier: fast in your API requests.

Prijs per miljoen invoertokensPrijs per miljoen invoertokens (uit de cache)Prijs per miljoen uitvoertokensBeschikbaarheid SLA3Latentie SLA3
GPT-5.6 Sol
sluit lange context uit1
US$ 10,00US$ 1,00US$ 60,0099,9%In 99% van de gevallen meer dan 80 tokens per seconde2
GPT-5.6 Terra
sluit lange context uit1
US$ 4,00US$ 0,40US$ 24,0099,9%In 99% van de gevallen meer dan 70 tokens per seconde2
GPT-5.6 Luna
sluit lange context uit1
US$ 0,40US$ 0,04US$ 2,4099,9%In 99% van de gevallen meer dan 100 tokens per seconde2
GPT-5.5
sluit lange context uit1
US$ 12,50US$ 1,250US$ 75,0099,9%In 99% van de gevallen meer dan 50 tokens per seconde2
GPT-5.4 mini
sluit lange context uit1
US$ 1,50US$ 0,150US$ 9,0099,9%In 99% van de gevallen meer dan 100 tokens per seconde2
GPT-5.4
sluit lange context uit1
US$ 5,00US$ 0,500US$ 30,0099,9%In 99% van de gevallen meer dan 50 tokens per seconde2
GPT-5.2
US$ 3,50US$ 0,350US$ 28,0099,9%In 99% van de gevallen meer dan 50 tokens per seconde2
GPT-5.1
US$ 2,50US$ 0,250US$ 20,0099,9%In 99% van de gevallen meer dan 50 tokens per seconde2
GPT-5
US$ 2,50US$ 0,250US$ 20,0099,9%In 99% van de gevallen meer dan 50 tokens per seconde2
GPT-5 mini
US$ 0,45US$ 0,045US$ 3,6099,9%In 99% van de gevallen meer dan 80 tokens per seconde2
GPT-5.1 codex
US$ 2,50US$ 0,250US$ 20,0099,9%In 99% van de gevallen meer dan 50 tokens per seconde2
GPT-5 codex
US$ 2,50US$ 0,250US$ 20,0099,9%In 99% van de gevallen meer dan 50 tokens per seconde2
GPT-4.1
US$ 3,50US$ 0,875US$ 14,0099,9%In 99% van de gevallen meer dan 80 tokens per seconde2
GPT-4.1 mini
US$ 0,70US$ 0,175US$ 2,8099,9%In 99% van de gevallen meer dan 90 tokens per seconde2
GPT-4.1 nano
US$ 0,20US$ 0,050US$ 0,8099,9%In 99% van de gevallen meer dan 100 tokens per seconde2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
US$ 4,25US$ 2,125US$ 17,0099,9%In 99% van de gevallen meer dan 80 tokens per seconde2
gpt-4o-2024-05-13
US$ 8,75US$ 26,2599,9%In 99% van de gevallen meer dan 80 tokens per seconde2
GPT-4o mini
US$ 0,25US$ 0,125US$ 1,0099,9%In 99% van de gevallen meer dan 90 tokens per seconde2
o3
US$ 3,50US$ 0,875US$ 14,0099,9%In 99% van de gevallen meer dan 80 tokens per seconde2
o4-mini
US$ 2,00US$ 0,500US$ 8,0099,9%In 99% van de gevallen meer dan 90 tokens per seconde2
1Verzoeken geschat op >272K prompt-tokens
2Wordt berekend als p50-latentie (responstijd) in blokken van vijf minuten. Ben je al klant met een bestaand Enterprise-contract waarin de SLA voor de p50-latentie per minuut wordt berekend? Dan blijft die SLA ook gewoon gelden.
3Dit is alleen van toepassing op Enterprise-klanten

Hoe het werkt

Customers can direct traffic to Fast mode on a per request basis using the existing service_tier parameter, with the option service_tier = "fast".

Tokens served by Fast mode will be billed on a per-token basis, priced at a premium relative to Standard processing rates.

In addition to being configured at the request level, you can also default a project to Fast mode in Project settings > Default Service Tier: Fast. You can still override per request. Selecting Fast in your project settings is equivalent to selecting Priority.

Beperkingen

  • Fast mode rate limits are shared with other service tiers.
  • In rare cases, rapid increases to your Fast mode Tokens per Minute can lead to hitting ramp rate limits. If you exceed the ramp rate limit, then additional traffic may be sent to Standard processing instead.

Frequently asked questions

Prijzen

Modellen

Volumelimieten

Betrouwbaarheid

Beleidsregels