Преминаване към основното съдържание
OpenAI

Бърз режим за клиенти на API

Бързият режим предлага надеждна, високоскоростна производителност с гъвкаво плащане според потреблението. С нашия най-нов авангарден модел, gpt-5.6-sol, в Бързия режим можете да получите до 2,5 пъти по-високи скорости.

Като изберете Бърз режим, можете да отключите:

  • Предвидима ниска латентност: Бързият режим осигурява генериране на токени по-бързо и с по-последователна скорост от Стандартната услуга за обработка, дори по време на пиково търсене.
  • Лесна за използване гъвкавост: Подобно на Стандартната обработка, може да се получи достъп до Бърз режим на гъвкава основа, плащайки според използването, вместо да се изисква предварително осигуряване.

Забележка: „Приоритетна обработка“ беше преименувана на „Бърз режим“ на 30.07.2026 г. Можете да използвате service_tier: priority или service_tier: fast във Вашите API заявки.

Short contextLong contextСпоразумение за ниво на обслужване за ъптайм3Споразумение за ниво на обслужване за забавяне3
Цена за 1M входящи токениЦена за 1 млн. входящи токени (кеширани)Цена за 1 млн. изходящи токенаЦена за 1M входящи токениЦена за 1 млн. входящи токени (кеширани)Цена за 1 млн. изходящи токена
GPT-5.6 Sol
10,00 щ.д.1,00 щ.д.60,00 щ.д.20,00 щ.д.2,00 щ.д.90,00 щ.д.99,9%99% > 80 токени в секунда2
GPT-5.6 Terra
4,00 щ.д.0,40 щ.д.24,00 щ.д.8,00 щ.д.0,80 щ.д.36,00 щ.д.99,9%99% > 70 токени в секунда2
GPT-5.6 Luna
0,40 щ.д.0,04 щ.д.2,40 щ.д.0,80 щ.д.0,08 щ.д.3,60 щ.д.99,9%99% > 100 токени в секунда2
GPT-5.5
изключва дълги контексти1
12,50 щ.д.1,250 щ.д.75,00 щ.д.99,9%99% > 50 токени в секунда2
GPT-5.4 mini
изключва дълги контексти1
1,50 щ.д.0,150 щ.д.9,00 щ.д.99,9%99% > 100 токени в секунда2
GPT-5.4
изключва дълги контексти1
5,00 щ.д.0,500 щ.д.30,00 щ.д.99,9%99% > 50 токени в секунда2
GPT-5.2
3,50 щ.д.0,350 щ.д.28,00 щ.д.99,9%99% > 50 токени в секунда2
GPT-5.1
2,50 щ.д.0,250 щ.д.20,00 щ.д.99,9%99% > 50 токени в секунда2
GPT-5
2,50 щ.д.0,250 щ.д.20,00 щ.д.99,9%99% > 50 токени в секунда2
GPT-5 mini
0,45 щ.д.0,045 щ.д.3,60 щ.д.99,9%99% > 80 токени в секунда2
GPT-5.1 codex
2,50 щ.д.0,250 щ.д.20,00 щ.д.99,9%99% > 50 токени в секунда2
GPT-5 codex
2,50 щ.д.0,250 щ.д.20,00 щ.д.99,9%99% > 50 токени в секунда2
GPT-4.1
3,50 щ.д.0,875 щ.д.14,00 щ.д.99,9%99% > 80 токени в секунда2
GPT-4.1 mini
0,70 щ.д.0,175 щ.д.2,80 щ.д.99,9%99% > 90 токени в секунда2
GPT-4.1 nano
0,20 щ.д.0,050 щ.д.0,80 щ.д.99,9%99% > 100 токени в секунда2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
4,25 щ.д.2,125 щ.д.17,00 щ.д.99,9%99% > 80 токени в секунда2
gpt-4o-2024-05-13
8,75 щ.д.26,25 щ.д.99,9%99% > 80 токени в секунда2
GPT-4o mini
0,25 щ.д.0,125 щ.д.1,00 щ.д.99,9%99% > 90 токени в секунда2
o3
3,50 щ.д.0,875 щ.д.14,00 щ.д.99,9%99% > 80 токени в секунда2
o4-mini
2,00 щ.д.0,500 щ.д.8,00 щ.д.99,9%99% > 90 токени в секунда2
1Заявките са приблизително над 272 000 токена за подкана
2Изчислява се като p50 забавяне на заявките на всеки 5 минути. За клиенти с вече съществуващи корпоративни споразумения, които имат SLA за забавяне, изчислени като p50 забавяне на заявките на минута, предишните SLA също са все още приложими.
3Това е приложимо само за клиенти на Enterprise

Как работи

Клиентите могат да насочват трафика към Бърз режим за всяка заявка поотделно, използвайки съществуващия параметър service_tier с опцията service_tier = "fast".

Токените, обслужвани от Бързия режим, ще бъдат таксувани на база на токен, като цената е по-висока в сравнение със Стандартните тарифи за обработка.

Освен че може да бъде конфигуриран на ниво заявка, можете също така да зададете проекта в Бърз режим по подразбиране в Настройки на проекта → Стандартно ниво на услуга: Бърз. Все още можете да промените настройките за всяка заявка. Избирането на „Бърз“ в настройките на проекта е равнозначно на избирането на „Приоритет“.

Ограничения

  • Лимитите на заявките за Бърз режим са споделени с други нива на услугата.
  • В редки случаи бързото увеличаване на Вашите токени за Бърз режим на минута може да доведе до достигане на лимитите на заявките за нарастване. Ако надвишите лимитите на заявките за нарастване, допълнителният трафик може да бъде пренасочен към Стандартна обработка.

Често задавани въпроси

Ценообразуване

Модели

Ограничения на натоварването

Надеждност

Политики