Переход к основному контенту
OpenAI

Быстрый режим для клиентов API

Быстрый режим обеспечивает надёжную высокую производительность с гибкой оплатой по мере использования. Для нашей новейшей передовой модели gpt-5.6-sol в быстром режиме доступна скорость до 2,5 раза выше.

Выбирая Быстрый режим, вы получаете:

  • Стабильно низкая задержка: Быстрый режим генерирует токены быстрее и равномернее, чем стандартная обработка, даже в периоды пикового спроса.
  • Гибкость без предварительного резервирования: как и стандартная обработка, быстрый режим доступен с оплатой по мере использования и не требует предварительного выделения ресурсов.

Примечание: 30 июля 2026г. Приоритетная обработка была переименована в Быстрый режим. В API-запросах можно использовать service_tier: priority или service_tier: fast.

Short contextLong contextSLA на время безотказной работы3SLA на время отклика3
Цена за 1 миллион входных токеновЦена за 1 миллион входных токенов (кэшированных)Цена за 1 миллион выходных токеновЦена за 1 миллион входных токеновЦена за 1 миллион входных токенов (кэшированных)Цена за 1 миллион выходных токенов
GPT-5.6 Sol
10,00 $1,00 $60,00 $20,00 $2,00 $90,00 $99,9 %99 % > 80 токенов в секунду2
GPT-5.6 Terra
4,00 $0,40 $24,00 $8,00 $0,80 $36,00 $99,9 %99 % > 70 токенов в секунду2
GPT-5.6 Luna
0,40 $0,04 $2,40 $0,80 $0,08 $3,60 $99,9 %99 % > 100 токенов в секунду2
GPT-5.5
без длительного контекста1
12,50 $1,250 $75,00 $99,9 %99 % > 50 токенов в секунду2
GPT-5.4 mini
без длительного контекста1
1,50 $0,150 $9,00 $99,9 %99 % > 100 токенов в секунду2
GPT-5.4
без длительного контекста1
5,00 $0,500 $30,00 $99,9 %99 % > 50 токенов в секунду2
GPT-5.2
3,50 $0,350 $28,00 $99,9 %99 % > 50 токенов в секунду2
GPT-5.1
2,50 $0,250 $20,00 $99,9 %99 % > 50 токенов в секунду2
GPT-5
2,50 $0,250 $20,00 $99,9 %99 % > 50 токенов в секунду2
GPT-5 mini
0,45 $0,045 $3,60 $99,9 %99 % > 80 токенов в секунду2
GPT-5.1 codex
2,50 $0,250 $20,00 $99,9 %99 % > 50 токенов в секунду2
GPT-5 codex
2,50 $0,250 $20,00 $99,9 %99 % > 50 токенов в секунду2
GPT-4.1
3,50 $0,875 $14,00 $99,9 %99 % > 80 токенов в секунду2
GPT-4.1 mini
0,70 $0,175 $2,80 $99,9 %99 % > 90 токенов в секунду2
GPT-4.1 nano
0,20 $0,050 $0,80 $99,9 %99 % > 100 токенов в секунду2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
4,25 $2,125 $17,00 $99,9 %99 % > 80 токенов в секунду2
gpt-4o-2024-05-13
8,75 $26,25 $99,9 %99 % > 80 токенов в секунду2
GPT-4o mini
0,25 $0,125 $1,00 $99,9 %99 % > 90 токенов в секунду2
o3
3,50 $0,875 $14,00 $99,9 %99 % > 80 токенов в секунду2
o4-mini
2,00 $0,500 $8,00 $99,9 %99 % > 90 токенов в секунду2
1Оценка: >272 тыс. токенов промта
2Рассчитывается как задержка запроса p50 на основе 5-минутных интервалов. Для клиентов с существующими корпоративными соглашениями, в которых SLA по задержкам рассчитываются как задержка запросов p50 на поминутной основе, предыдущие SLA также остаются в силе.
3Это применимо только к корпоративным клиентам.

Принцип работы

Клиенты могут направлять трафик в Быстрый режим для каждого запроса отдельно с помощью существующего параметра service_tier и значения service_tier = "fast".

Токены, обработанные в быстром режиме, будут тарифицироваться за каждый токен по повышенной ставке относительно стандартной обработки.

Помимо настройки на уровне запроса, вы также можете задать для проекта быстрый режим по умолчанию в разделе «Настройки проекта» > «Тарифный план по умолчанию: быстрый режим». Вы можете переопределить это для каждого запроса. Выбор варианта «быстрый» в настройках проекта равнозначен выбору варианта «Приоритет» (Priority).

Ограничения

  • Для Быстрого режима действуют общие лимиты запросов с другими уровнями обслуживания.
  • В редких случаях резкое увеличение числа токенов в минуту в быстром режиме может привести к срабатыванию лимитов скорости наращивания трафика. Если вы превысите лимит скорости наращивания трафика, дополнительный трафик может быть отправлен на стандартную обработку.

Часто задаваемые вопросы

Цены

Модели

Ограничения скорости

Надежность

Политики