Tryb szybki dla klientów korzystających z interfejsów API
Tryb szybki zapewnia niezawodne, szybkie działanie oraz możliwość elastycznego płacenia za użycie. W przypadku naszego najnowszego modelu pionierskiego, gpt-5.6-sol w Trybie szybkim możesz uzyskać wyniki nawet 2,5 raza szybciej.
Wybierając tryb szybki, możesz uzyskać:
- Przewidywalnie niskie opóźnienia: Tryb szybki generuje tokeny szybciej i z bardziej stabilną prędkością niż usługa Przetwarzania standardowego, nawet w okresach szczytowego zapotrzebowania.
- Wygodną elastyczność: podobnie jak Przetwarzanie standardowe Tryb szybki jest dostępny w elastycznym modelu płatności za wykorzystanie i nie wymaga wcześniejszej rezerwacji zasobów.
Uwaga: 30 lipca 2026 nazwa „Przetwarzanie priorytetowe” została zmieniona na „Tryb szybki”. W żądaniach API możesz używać zarówno service_tier: priority, jak i service_tier: fast.
| Short context | Long context | Umowa SLA dotycząca czasu dostępności3 | Umowa SLA dotycząca opóźnienia3 | |||||
|---|---|---|---|---|---|---|---|---|
| Cena za 1 mln tokenów wejściowych | Cena za 1 mln tokenów wejściowych (buforowane) | Cena za 1 mln tokenów wyjściowych | Cena za 1 mln tokenów wejściowych | Cena za 1 mln tokenów wejściowych (buforowane) | Cena za 1 mln tokenów wyjściowych | |||
GPT-5.6 Sol | 10,00 USD | 1,00 USD | 60,00 USD | 20,00 USD | 2,00 USD | 90,00 USD | 99,9% | 99% > 80 tokenów na sekundę2 |
GPT-5.6 Terra | 4,00 USD | 0,40 USD | 24,00 USD | 8,00 USD | 0,80 USD | 36,00 USD | 99,9% | 99% > 70 tokenów na sekundę2 |
GPT-5.6 Luna | 0,40 USD | 0,04 USD | 2,40 USD | 0,80 USD | 0,08 USD | 3,60 USD | 99,9% | 99% > 100 tokenów na sekundę2 |
GPT-5.5 z wykluczeniem długiego kontekstu1 | 12,50 USD | 1,250 USD | 75,00 USD | — | — | — | 99,9% | 99% > 50 tokenów na sekundę2 |
GPT-5.4 mini z wykluczeniem długiego kontekstu1 | 1,50 USD | 0,150 USD | 9,00 USD | — | — | — | 99,9% | 99% > 100 tokenów na sekundę2 |
GPT-5.4 z wykluczeniem długiego kontekstu1 | 5,00 USD | 0,500 USD | 30,00 USD | — | — | — | 99,9% | 99% > 50 tokenów na sekundę2 |
GPT-5.2 | 3,50 USD | 0,350 USD | 28,00 USD | — | — | — | 99,9% | 99% > 50 tokenów na sekundę2 |
GPT-5.1 | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9% | 99% > 50 tokenów na sekundę2 |
GPT-5 | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9% | 99% > 50 tokenów na sekundę2 |
GPT-5 mini | 0,45 USD | 0,045 USD | 3,60 USD | — | — | — | 99,9% | 99% > 80 tokenów na sekundę2 |
GPT-5.1 codex | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9% | 99% > 50 tokenów na sekundę2 |
GPT-5 codex | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9% | 99% > 50 tokenów na sekundę2 |
GPT-4.1 | 3,50 USD | 0,875 USD | 14,00 USD | — | — | — | 99,9% | 99% > 80 tokenów na sekundę2 |
GPT-4.1 mini | 0,70 USD | 0,175 USD | 2,80 USD | — | — | — | 99,9% | 99% > 90 tokenów na sekundę2 |
GPT-4.1 nano | 0,20 USD | 0,050 USD | 0,80 USD | — | — | — | 99,9% | 99% > 100 tokenów na sekundę2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | 4,25 USD | 2,125 USD | 17,00 USD | — | — | — | 99,9% | 99% > 80 tokenów na sekundę2 |
gpt-4o-2024-05-13 | 8,75 USD | — | 26,25 USD | — | — | — | 99,9% | 99% > 80 tokenów na sekundę2 |
GPT-4o mini | 0,25 USD | 0,125 USD | 1,00 USD | — | — | — | 99,9% | 99% > 90 tokenów na sekundę2 |
o3 | 3,50 USD | 0,875 USD | 14,00 USD | — | — | — | 99,9% | 99% > 80 tokenów na sekundę2 |
o4-mini | 2,00 USD | 0,500 USD | 8,00 USD | — | — | — | 99,9% | 99% > 90 tokenów na sekundę2 |
Jak ten model działa?
Klienci mogą kierować ruch do Trybu szybkiego dla poszczególnych żądań przy użyciu istniejącego parametru service_tier, korzystając z opcji service_tier = "fast".
Tokeny obsługiwane w Trybie szybkim będą rozliczane na podstawie ich liczby, a cena będzie wyższa niż w przypadku przetwarzania Standardowego.
Oprócz konfiguracji na poziomie żądania, można również ustawić dla projektu domyślnie Tryb szybki w sekcji Ustawienia projektu > Domyślny poziom planu: Tryb szybki. Można nadal wykonywać nadpisywania wg żądania. Wybranie opcji Szybkiej w ustawieniach projektu jest równoważne z wybraniem opcji Priorytetowej.
Ograniczenia
- Limity zapytań dla Trybu szybkiego są współdzielone z innymi poziomami planu.
- W rzadkich przypadkach gwałtowny wzrost liczby tokenów na minutę w Trybie szybkim może spowodować wystąpienie limitów zapytań. W przypadku przekroczenia limitu narastania liczby zapytań dodatkowy ruch może zostać przekierowany do przetwarzania standardowego.