Preskočite na glavni sadržaj
OpenAI

Brzi mod za API korisnike

Brzi mod nudi pouzdane, visokobrzinske performanse uz fleksibilnost plaćanja po Go. Za naš najnoviji granični model, gpt-5.6-sol, uz Brzi mod možete ostvariti brzine do 2,5 puta veće.

Odabirom Brzog moda možeš otključati:

  • Predvidivo nisko kašnjenje: Brzi mod generira tokene brže i konstantnijom brzinom od standardne usluge obrade, čak i tokom vršnih perioda potražnje.
  • Jednostavna fleksibilnost korištenja: kao i standardna obrada, Brzi mod može se koristiti na fleksibilnoj osnovi plaćanja po korištenju umjesto da zahtijeva prethodno dodjeljivanje resursa.

Napomena: Prioritetna obrada je preimenovana u Brzi mod 30.07.2026. Možete koristiti ili service_tier: priority ili service_tier: fast u svojim API zahtjevima.

Short contextLong contextUptime SLA3Latencija SLA3
Cijena po 1M ulaznih tokenaCijena po 1M ulaznih tokena (predmemorirano)Cijena po 1M izlaznih tokenaCijena po 1M ulaznih tokenaCijena po 1M ulaznih tokena (predmemorirano)Cijena po 1M izlaznih tokena
GPT-5.6 Sol
10,00 USD1,00 USD60,00 USD20,00 USD2,00 USD90,00 USD99,9%99% > 80 tokena po sekundi2
GPT-5.6 Terra
4,00 USD0,40 USD24,00 USD8,00 USD0,80 USD36,00 USD99,9%99% > 70 tokena po sekundi2
GPT-5.6 Luna
0,40 USD0,04 USD2,40 USD0,80 USD0,08 USD3,60 USD99,9%99% > 100 tokena po sekundi2
GPT-5.5
isključuje dugi kontekst1
12,50 USD1,250 USD75,00 USD99,9%99% > 50 tokena po sekundi2
GPT-5.4 mini
isključuje dugi kontekst1
1,50 USD0,150 USD9,00 USD99,9%99% > 100 tokena po sekundi2
GPT-5.4
isključuje dugi kontekst1
5,00 USD0,500 USD30,00 USD99,9%99% > 50 tokena po sekundi2
GPT-5.2
3,50 USD0,350 USD28,00 USD99,9%99% > 50 tokena po sekundi2
GPT-5.1
2,50 USD0,250 USD20,00 USD99,9%99% > 50 tokena po sekundi2
GPT-5
2,50 USD0,250 USD20,00 USD99,9%99% > 50 tokena po sekundi2
GPT-5 mini
0,45 USD0,045 USD3,60 USD99,9%99% > 80 tokena po sekundi2
GPT-5.1 codex
2,50 USD0,250 USD20,00 USD99,9%99% > 50 tokena po sekundi2
GPT-5 codex
2,50 USD0,250 USD20,00 USD99,9%99% > 50 tokena po sekundi2
GPT-4.1
3,50 USD0,875 USD14,00 USD99,9%99% > 80 tokena po sekundi2
GPT-4.1 mini
0,70 USD0,175 USD2,80 USD99,9%99% > 90 tokena po sekundi2
GPT-4.1 nano
0,20 USD0,050 USD0,80 USD99,9%99% > 100 tokena po sekundi2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
4,25 USD2,125 USD17,00 USD99,9%99% > 80 tokena po sekundi2
gpt-4o-2024-05-13
8,75 USD26,25 USD99,9%99% > 80 tokena po sekundi2
GPT-4o mini
0,25 USD0,125 USD1,00 USD99,9%99% > 90 tokena po sekundi2
o3
3,50 USD0,875 USD14,00 USD99,9%99% > 80 tokena po sekundi2
o4-mini
2,00 USD0,500 USD8,00 USD99,9%99% > 90 tokena po sekundi2
1Zahtjevi procijenjeni na > 272.000 upit tokena
2Izračunato kao p50 latencija zahtjeva na osnovu svakih 5 minuta. Za klijente s postojećim enterprise ugovorima koji imaju SLA-ove za latentnost izračunate kao p50 latentnost zahtjeva na minutnoj osnovi, prethodni SLA-ovi su također i dalje primjenjivi.
3Ovo se odnosi samo na korisnike Enterprise

Kako to radi

Korisnici mogu usmjeriti saobraćaj na Brzi mod po zahtjevu, koristeći postojeći parametar service_tier, s opcijom service_tier = "fast".

Tokeni obrađeni u Brzom modu bit će naplaćeni po tokenu, po višoj cijeni u odnosu na standardne stope obrade.

Osim što se može konfigurirati na nivou zahtjeva, možete također postaviti projekat na Brzi mod u postavkama projekta > predodređeni nivo usluge: Brzi mod. Još uvijek možete nadjačati po zahtjevu. Odabir opcije „brzo” u postavkama projekta ekvivalentan je odabiru opcije „prioritet”.

Ograničenja

  • Ograničenja brzine za Brzi mod dijele se s drugim nivoima usluge.
  • U rijetkim slučajevima, rapidan porast tokena po minuti u Brzom modu može dovesti do dostizanja ograničenja brzine povećanja. Ako prekoračite ograničenje brzine rampi, dodatni saobraćaj može biti poslan na Standardnu obradu umjesto toga.

Često postavljana pitanja

Cijene

Modeli

Ograničenja zahtjeva

Pouzdanost

Politike