Przejdź do treści głównej
OpenAI

Tryb szybki dla klientów korzystających z interfejsów API

Tryb szybki zapewnia niezawodne, szybkie działanie oraz możliwość elastycznego płacenia za użycie. W przypadku naszego najnowszego modelu pionierskiego, gpt-5.6-sol w Trybie szybkim możesz uzyskać wyniki nawet 2,5 raza szybciej.

Wybierając tryb szybki, możesz uzyskać:

  • Przewidywalnie niskie opóźnienia: Tryb szybki generuje tokeny szybciej i z bardziej stabilną prędkością niż usługa Przetwarzania standardowego, nawet w okresach szczytowego zapotrzebowania.
  • Wygodną elastyczność: podobnie jak Przetwarzanie standardowe Tryb szybki jest dostępny w elastycznym modelu płatności za wykorzystanie i nie wymaga wcześniejszej rezerwacji zasobów.

Uwaga: 30 lipca 2026 nazwa „Przetwarzanie priorytetowe” została zmieniona na „Tryb szybki”. W żądaniach API możesz używać zarówno service_tier: priority, jak i service_tier: fast.

Short contextLong contextUmowa SLA dotycząca czasu dostępności3Umowa SLA dotycząca opóźnienia3
Cena za 1 mln tokenów wejściowychCena za 1 mln tokenów wejściowych (buforowane)Cena za 1 mln tokenów wyjściowychCena za 1 mln tokenów wejściowychCena za 1 mln tokenów wejściowych (buforowane)Cena za 1 mln tokenów wyjściowych
GPT-5.6 Sol
10,00 USD1,00 USD60,00 USD20,00 USD2,00 USD90,00 USD99,9%99% > 80 tokenów na sekundę2
GPT-5.6 Terra
4,00 USD0,40 USD24,00 USD8,00 USD0,80 USD36,00 USD99,9%99% > 70 tokenów na sekundę2
GPT-5.6 Luna
0,40 USD0,04 USD2,40 USD0,80 USD0,08 USD3,60 USD99,9%99% > 100 tokenów na sekundę2
GPT-5.5
z wykluczeniem długiego kontekstu1
12,50 USD1,250 USD75,00 USD99,9%99% > 50 tokenów na sekundę2
GPT-5.4 mini
z wykluczeniem długiego kontekstu1
1,50 USD0,150 USD9,00 USD99,9%99% > 100 tokenów na sekundę2
GPT-5.4
z wykluczeniem długiego kontekstu1
5,00 USD0,500 USD30,00 USD99,9%99% > 50 tokenów na sekundę2
GPT-5.2
3,50 USD0,350 USD28,00 USD99,9%99% > 50 tokenów na sekundę2
GPT-5.1
2,50 USD0,250 USD20,00 USD99,9%99% > 50 tokenów na sekundę2
GPT-5
2,50 USD0,250 USD20,00 USD99,9%99% > 50 tokenów na sekundę2
GPT-5 mini
0,45 USD0,045 USD3,60 USD99,9%99% > 80 tokenów na sekundę2
GPT-5.1 codex
2,50 USD0,250 USD20,00 USD99,9%99% > 50 tokenów na sekundę2
GPT-5 codex
2,50 USD0,250 USD20,00 USD99,9%99% > 50 tokenów na sekundę2
GPT-4.1
3,50 USD0,875 USD14,00 USD99,9%99% > 80 tokenów na sekundę2
GPT-4.1 mini
0,70 USD0,175 USD2,80 USD99,9%99% > 90 tokenów na sekundę2
GPT-4.1 nano
0,20 USD0,050 USD0,80 USD99,9%99% > 100 tokenów na sekundę2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
4,25 USD2,125 USD17,00 USD99,9%99% > 80 tokenów na sekundę2
gpt-4o-2024-05-13
8,75 USD26,25 USD99,9%99% > 80 tokenów na sekundę2
GPT-4o mini
0,25 USD0,125 USD1,00 USD99,9%99% > 90 tokenów na sekundę2
o3
3,50 USD0,875 USD14,00 USD99,9%99% > 80 tokenów na sekundę2
o4-mini
2,00 USD0,500 USD8,00 USD99,9%99% > 90 tokenów na sekundę2
1Żądania szacowane na >272 tys. tokenów poleceń
2Obliczone jako opóźnienie żądania p50 w odstępach 5-minutowych. W przypadku klientów z istniejącymi umowami korporacyjnymi i umowami SLA dotyczącymi opóźnienia obliczonego jako opóźnienie żądania p50 na minutę wcześniejsze umowy SLA także obowiązują.
3Dotyczy to tylko klientów korzystających z planu Enterprise

Jak ten model działa?

Klienci mogą kierować ruch do Trybu szybkiego dla poszczególnych żądań przy użyciu istniejącego parametru service_tier, korzystając z opcji service_tier = "fast".

Tokeny obsługiwane w Trybie szybkim będą rozliczane na podstawie ich liczby, a cena będzie wyższa niż w przypadku przetwarzania Standardowego.

Oprócz konfiguracji na poziomie żądania, można również ustawić dla projektu domyślnie Tryb szybki w sekcji Ustawienia projektu > Domyślny poziom planu: Tryb szybki. Można nadal wykonywać nadpisywania wg żądania. Wybranie opcji Szybkiej w ustawieniach projektu jest równoważne z wybraniem opcji Priorytetowej.

Ograniczenia

  • Limity zapytań dla Trybu szybkiego są współdzielone z innymi poziomami planu.
  • W rzadkich przypadkach gwałtowny wzrost liczby tokenów na minutę w Trybie szybkim może spowodować wystąpienie limitów zapytań. W przypadku przekroczenia limitu narastania liczby zapytań dodatkowy ruch może zostać przekierowany do przetwarzania standardowego.

Częste pytania

Cennik

Modele

Limity

Niezawodność

Polityki