Mod rapid pentru clienți API
Modul rapid oferă performanțe fiabile, de viteză ridicată, cu flexibilitatea de a plăti în funcție de utilizare. Pentru cel mai recent model de vârf al nostru, gpt-5.6-sol, poți accesa viteze de până la 2,5 ori mai mari cu modul rapid.
Alegând modul rapid, poți debloca:
- Latență previzibil de scăzută: modul rapid generează tokenuri mai rapid și la o viteză mai constantă decât serviciul de procesare standard, chiar și în timpul cererii maxime.
- Flexibilitate ușor de utilizat: la fel ca procesarea standard, modul rapid poate fi accesat pe bază flexibilă, cu plată în funcți de utilizare, în loc să necesite alocare în avans.
Observație: procesarea prioritară a fost redenumită „Mod rapid” pe 30 iulie 2026. Poți utiliza fie service_tier: priority, fie service_tier: fast în solicitările tale API.
| Short context | Long context | SLA pentru timpul de funcționare3 | SLA de latență3 | |||||
|---|---|---|---|---|---|---|---|---|
| Preț per 1 milion de tokenuri de intrare | Preț per 1 milion de tokenuri de intrare (memorate în cache) | Preț per 1 milion de tokenuri de ieșire | Preț per 1 milion de tokenuri de intrare | Preț per 1 milion de tokenuri de intrare (memorate în cache) | Preț per 1 milion de tokenuri de ieșire | |||
GPT-5.6 Sol | 10,00 USD | 1,00 USD | 60,00 USD | 20,00 USD | 2,00 USD | 90,00 USD | 99,9 % | 99 % > 80 tokenuri pe secundă2 |
GPT-5.6 Terra | 4,00 USD | 0,40 USD | 24,00 USD | 8,00 USD | 0,80 USD | 36,00 USD | 99,9 % | 99 % > 70 tokenuri pe secundă2 |
GPT-5.6 Luna | 0,40 USD | 0,04 USD | 2,40 USD | 0,80 USD | 0,08 USD | 3,60 USD | 99,9 % | 99 % > 100 tokenuri pe secundă2 |
GPT-5.5 exclude contextul lung1 | 12,50 USD | 1,250 USD | 75,00 USD | — | — | — | 99,9 % | 99 % > 50 tokenuri pe secundă2 |
GPT-5.4 mini exclude contextul lung1 | 1,50 USD | 0,150 USD | 9,00 USD | — | — | — | 99,9 % | 99 % > 100 tokenuri pe secundă2 |
GPT-5.4 exclude contextul lung1 | 5,00 USD | 0,500 USD | 30,00 USD | — | — | — | 99,9 % | 99 % > 50 tokenuri pe secundă2 |
GPT-5.2 | 3,50 USD | 0,350 USD | 28,00 USD | — | — | — | 99,9 % | 99 % > 50 tokenuri pe secundă2 |
GPT-5.1 | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9 % | 99 % > 50 tokenuri pe secundă2 |
GPT-5 | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9 % | 99 % > 50 tokenuri pe secundă2 |
GPT-5 mini | 0,45 USD | 0,045 USD | 3,60 USD | — | — | — | 99,9 % | 99 % > 80 tokenuri pe secundă2 |
GPT-5.1 codex | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9 % | 99 % > 50 tokenuri pe secundă2 |
GPT-5 codex | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9 % | 99 % > 50 tokenuri pe secundă2 |
GPT-4.1 | 3,50 USD | 0,875 USD | 14,00 USD | — | — | — | 99,9 % | 99 % > 80 tokenuri pe secundă2 |
GPT-4.1 mini | 0,70 USD | 0,175 USD | 2,80 USD | — | — | — | 99,9 % | 99 % > 90 tokenuri pe secundă2 |
GPT-4.1 nano | 0,20 USD | 0,050 USD | 0,80 USD | — | — | — | 99,9 % | 99 % > 100 tokenuri pe secundă2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | 4,25 USD | 2,125 USD | 17,00 USD | — | — | — | 99,9 % | 99 % > 80 tokenuri pe secundă2 |
gpt-4o-2024-05-13 | 8,75 USD | — | 26,25 USD | — | — | — | 99,9 % | 99 % > 80 tokenuri pe secundă2 |
GPT-4o mini | 0,25 USD | 0,125 USD | 1,00 USD | — | — | — | 99,9 % | 99 % > 90 tokenuri pe secundă2 |
o3 | 3,50 USD | 0,875 USD | 14,00 USD | — | — | — | 99,9 % | 99 % > 80 tokenuri pe secundă2 |
o4-mini | 2,00 USD | 0,500 USD | 8,00 USD | — | — | — | 99,9 % | 99 % > 90 tokenuri pe secundă2 |
Cum funcționează
Clienții pot direcționa traficul către modul rapid pentru fiecare solicitare în parte, utilizând parametrul service_tier existent, cu opțiunea service_tier = "fast".
Tokenurile servite de modul rapid vor fi facturate pe token, la un preț premium în raport cu tarifele de procesare standard.
Pe lângă configurarea la nivel de solicitare, poți seta implicit un proiect la modul rapid în setările proiectului > Nivel serviciu implicit: mod rapid. Poți în continuare să alegi suprascrierea pentru fiecare solicitare. Selectarea opțiunii Rapid în setările proiectului este echivalentă cu selectarea opțiunii Prioritate.
Limitări
- Limitele de rată ale modului rapid sunt la comun cu alte niveluri de servicii.
- În cazuri rare, creșterile rapide ale numărului de tokenuri pe minut în modul rapid pot duce la atingerea limitelor ratei de creștere. Dacă depășești limita ratei de creștere, atunci traficul suplimentar poate fi trimis către procesarea standard.