Preskočite na glavni sadržaj
OpenAI

Prioritetna obrada za API korisnike

Fast mode offers reliable, high-speed performance with the flexibility to pay-as-you-go. For our latest frontier model, gpt-5.6-sol, you can access up to 2.5x faster speeds with Fast mode.

By choosing Fast mode, you can unlock:

  • Predictably low latency: Fast mode generates tokens faster and at a more consistent speed than the Standard processing service, even during peak demand.
  • Easy-to-use flexibility: Like Standard processing, Fast mode can be accessed on a flexible, pay-as-you-go basis instead of requiring advance provisioning.

Note: Priority processing was renamed Fast mode on July 30, 2026. You can use either service_tier: priority or service_tier: fast in your API requests.

Cijena po 1M ulaznih tokenaCijena po 1M ulaznih tokena (predmemorirano)Cijena po 1M izlaznih tokenaUptime SLA3Latencija SLA3
GPT-5.6 Sol
isključuje dugi kontekst1
10,00 USD1,00 USD60,00 USD99,9%99% > 80 tokena po sekundi2
GPT-5.6 Terra
isključuje dugi kontekst1
4,00 USD0,40 USD24,00 USD99,9%99% > 70 tokena po sekundi2
GPT-5.6 Luna
isključuje dugi kontekst1
0,40 USD0,04 USD2,40 USD99,9%99% > 100 tokena po sekundi2
GPT-5.5
isključuje dugi kontekst1
12,50 USD1,250 USD75,00 USD99,9%99% > 50 tokena po sekundi2
GPT-5.4 mini
isključuje dugi kontekst1
1,50 USD0,150 USD9,00 USD99,9%99% > 100 tokena po sekundi2
GPT-5.4
isključuje dugi kontekst1
5,00 USD0,500 USD30,00 USD99,9%99% > 50 tokena po sekundi2
GPT-5.2
3,50 USD0,350 USD28,00 USD99,9%99% > 50 tokena po sekundi2
GPT-5.1
2,50 USD0,250 USD20,00 USD99,9%99% > 50 tokena po sekundi2
GPT-5
2,50 USD0,250 USD20,00 USD99,9%99% > 50 tokena po sekundi2
GPT-5 mini
0,45 USD0,045 USD3,60 USD99,9%99% > 80 tokena po sekundi2
GPT-5.1 codex
2,50 USD0,250 USD20,00 USD99,9%99% > 50 tokena po sekundi2
GPT-5 codex
2,50 USD0,250 USD20,00 USD99,9%99% > 50 tokena po sekundi2
GPT-4.1
3,50 USD0,875 USD14,00 USD99,9%99% > 80 tokena po sekundi2
GPT-4.1 mini
0,70 USD0,175 USD2,80 USD99,9%99% > 90 tokena po sekundi2
GPT-4.1 nano
0,20 USD0,050 USD0,80 USD99,9%99% > 100 tokena po sekundi2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
4,25 USD2,125 USD17,00 USD99,9%99% > 80 tokena po sekundi2
gpt-4o-2024-05-13
8,75 USD26,25 USD99,9%99% > 80 tokena po sekundi2
GPT-4o mini
0,25 USD0,125 USD1,00 USD99,9%99% > 90 tokena po sekundi2
o3
3,50 USD0,875 USD14,00 USD99,9%99% > 80 tokena po sekundi2
o4-mini
2,00 USD0,500 USD8,00 USD99,9%99% > 90 tokena po sekundi2
1Zahtjevi procijenjeni na > 272.000 upit tokena
2Izračunato kao p50 latencija zahtjeva na osnovu svakih 5 minuta. Za klijente s postojećim enterprise ugovorima koji imaju SLA-ove za latentnost izračunate kao p50 latentnost zahtjeva na minutnoj osnovi, prethodni SLA-ovi su također i dalje primjenjivi.
3Ovo se odnosi samo na korisnike Enterprise

Kako to radi

Customers can direct traffic to Fast mode on a per request basis using the existing service_tier parameter, with the option service_tier = "fast".

Tokens served by Fast mode will be billed on a per-token basis, priced at a premium relative to Standard processing rates.

In addition to being configured at the request level, you can also default a project to Fast mode in Project settings > Default Service Tier: Fast. You can still override per request. Selecting Fast in your project settings is equivalent to selecting Priority.

Ograničenja

  • Fast mode rate limits are shared with other service tiers.
  • In rare cases, rapid increases to your Fast mode Tokens per Minute can lead to hitting ramp rate limits. If you exceed the ramp rate limit, then additional traffic may be sent to Standard processing instead.

Frequently asked questions

Cijene

Modeli

Ograničenja zahtjeva

Pouzdanost

Politike