Sari la conținutul principal
OpenAI

Mod rapid pentru clienți API

Modul rapid oferă performanțe fiabile, de viteză ridicată, cu flexibilitatea de a plăti în funcție de utilizare. Pentru cel mai recent model de vârf al nostru, gpt-5.6-sol, poți accesa viteze de până la 2,5 ori mai mari cu modul rapid.

Alegând modul rapid, poți debloca:

  • Latență previzibil de scăzută: modul rapid generează tokenuri mai rapid și la o viteză mai constantă decât serviciul de procesare standard, chiar și în timpul cererii maxime.
  • Flexibilitate ușor de utilizat: la fel ca procesarea standard, modul rapid poate fi accesat pe bază flexibilă, cu plată în funcți de utilizare, în loc să necesite alocare în avans.

Observație: procesarea prioritară a fost redenumită „Mod rapid” pe 30 iulie 2026. Poți utiliza fie service_tier: priority, fie service_tier: fast în solicitările tale API.

Short contextLong contextSLA pentru timpul de funcționare3SLA de latență3
Preț per 1 milion de tokenuri de intrarePreț per 1 milion de tokenuri de intrare (memorate în cache)Preț per 1 milion de tokenuri de ieșirePreț per 1 milion de tokenuri de intrarePreț per 1 milion de tokenuri de intrare (memorate în cache)Preț per 1 milion de tokenuri de ieșire
GPT-5.6 Sol
10,00 USD1,00 USD60,00 USD20,00 USD2,00 USD90,00 USD99,9 %99 % > 80 tokenuri pe secundă2
GPT-5.6 Terra
4,00 USD0,40 USD24,00 USD8,00 USD0,80 USD36,00 USD99,9 %99 % > 70 tokenuri pe secundă2
GPT-5.6 Luna
0,40 USD0,04 USD2,40 USD0,80 USD0,08 USD3,60 USD99,9 %99 % > 100 tokenuri pe secundă2
GPT-5.5
exclude contextul lung1
12,50 USD1,250 USD75,00 USD99,9 %99 % > 50 tokenuri pe secundă2
GPT-5.4 mini
exclude contextul lung1
1,50 USD0,150 USD9,00 USD99,9 %99 % > 100 tokenuri pe secundă2
GPT-5.4
exclude contextul lung1
5,00 USD0,500 USD30,00 USD99,9 %99 % > 50 tokenuri pe secundă2
GPT-5.2
3,50 USD0,350 USD28,00 USD99,9 %99 % > 50 tokenuri pe secundă2
GPT-5.1
2,50 USD0,250 USD20,00 USD99,9 %99 % > 50 tokenuri pe secundă2
GPT-5
2,50 USD0,250 USD20,00 USD99,9 %99 % > 50 tokenuri pe secundă2
GPT-5 mini
0,45 USD0,045 USD3,60 USD99,9 %99 % > 80 tokenuri pe secundă2
GPT-5.1 codex
2,50 USD0,250 USD20,00 USD99,9 %99 % > 50 tokenuri pe secundă2
GPT-5 codex
2,50 USD0,250 USD20,00 USD99,9 %99 % > 50 tokenuri pe secundă2
GPT-4.1
3,50 USD0,875 USD14,00 USD99,9 %99 % > 80 tokenuri pe secundă2
GPT-4.1 mini
0,70 USD0,175 USD2,80 USD99,9 %99 % > 90 tokenuri pe secundă2
GPT-4.1 nano
0,20 USD0,050 USD0,80 USD99,9 %99 % > 100 tokenuri pe secundă2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
4,25 USD2,125 USD17,00 USD99,9 %99 % > 80 tokenuri pe secundă2
gpt-4o-2024-05-13
8,75 USD26,25 USD99,9 %99 % > 80 tokenuri pe secundă2
GPT-4o mini
0,25 USD0,125 USD1,00 USD99,9 %99 % > 90 tokenuri pe secundă2
o3
3,50 USD0,875 USD14,00 USD99,9 %99 % > 80 tokenuri pe secundă2
o4-mini
2,00 USD0,500 USD8,00 USD99,9 %99 % > 90 tokenuri pe secundă2
1Solicitările sunt estimate la >272.000 de tokenuri de solicitări
2Calculată ca latență a solicitării p50 la fiecare 5 minute. Pentru clienții cu contracte Enterprise existente care au SLA-uri de latență calculate ca latență a solicitării p50 pe minut, se aplică și SLA-urile anterioare.
3Acest lucru este valabil doar pentru clienții Enterprise.

Cum funcționează

Clienții pot direcționa traficul către modul rapid pentru fiecare solicitare în parte, utilizând parametrul service_tier existent, cu opțiunea service_tier = "fast".

Tokenurile servite de modul rapid vor fi facturate pe token, la un preț premium în raport cu tarifele de procesare standard.

Pe lângă configurarea la nivel de solicitare, poți seta implicit un proiect la modul rapid în setările proiectului > Nivel serviciu implicit: mod rapid. Poți în continuare să alegi suprascrierea pentru fiecare solicitare. Selectarea opțiunii Rapid în setările proiectului este echivalentă cu selectarea opțiunii Prioritate.

Limitări

  • Limitele de rată ale modului rapid sunt la comun cu alte niveluri de servicii.
  • În cazuri rare, creșterile rapide ale numărului de tokenuri pe minut în modul rapid pot duce la atingerea limitelor ratei de creștere. Dacă depășești limita ratei de creștere, atunci traficul suplimentar poate fi trimis către procesarea standard.

Întrebări frecvente

Prețuri

Modele

Limite de tarif

Fiabilitate

Politici