Быстрый режим для клиентов API
Быстрый режим обеспечивает надёжную высокую производительность с гибкой оплатой по мере использования. Для нашей новейшей передовой модели gpt-5.6-sol в быстром режиме доступна скорость до 2,5 раза выше.
Выбирая Быстрый режим, вы получаете:
- Стабильно низкая задержка: Быстрый режим генерирует токены быстрее и равномернее, чем стандартная обработка, даже в периоды пикового спроса.
- Гибкость без предварительного резервирования: как и стандартная обработка, быстрый режим доступен с оплатой по мере использования и не требует предварительного выделения ресурсов.
Примечание: 30 июля 2026г. Приоритетная обработка была переименована в Быстрый режим. В API-запросах можно использовать service_tier: priority или service_tier: fast.
| Short context | Long context | SLA на время безотказной работы3 | SLA на время отклика3 | |||||
|---|---|---|---|---|---|---|---|---|
| Цена за 1 миллион входных токенов | Цена за 1 миллион входных токенов (кэшированных) | Цена за 1 миллион выходных токенов | Цена за 1 миллион входных токенов | Цена за 1 миллион входных токенов (кэшированных) | Цена за 1 миллион выходных токенов | |||
GPT-5.6 Sol | 10,00 $ | 1,00 $ | 60,00 $ | 20,00 $ | 2,00 $ | 90,00 $ | 99,9 % | 99 % > 80 токенов в секунду2 |
GPT-5.6 Terra | 4,00 $ | 0,40 $ | 24,00 $ | 8,00 $ | 0,80 $ | 36,00 $ | 99,9 % | 99 % > 70 токенов в секунду2 |
GPT-5.6 Luna | 0,40 $ | 0,04 $ | 2,40 $ | 0,80 $ | 0,08 $ | 3,60 $ | 99,9 % | 99 % > 100 токенов в секунду2 |
GPT-5.5 без длительного контекста1 | 12,50 $ | 1,250 $ | 75,00 $ | — | — | — | 99,9 % | 99 % > 50 токенов в секунду2 |
GPT-5.4 mini без длительного контекста1 | 1,50 $ | 0,150 $ | 9,00 $ | — | — | — | 99,9 % | 99 % > 100 токенов в секунду2 |
GPT-5.4 без длительного контекста1 | 5,00 $ | 0,500 $ | 30,00 $ | — | — | — | 99,9 % | 99 % > 50 токенов в секунду2 |
GPT-5.2 | 3,50 $ | 0,350 $ | 28,00 $ | — | — | — | 99,9 % | 99 % > 50 токенов в секунду2 |
GPT-5.1 | 2,50 $ | 0,250 $ | 20,00 $ | — | — | — | 99,9 % | 99 % > 50 токенов в секунду2 |
GPT-5 | 2,50 $ | 0,250 $ | 20,00 $ | — | — | — | 99,9 % | 99 % > 50 токенов в секунду2 |
GPT-5 mini | 0,45 $ | 0,045 $ | 3,60 $ | — | — | — | 99,9 % | 99 % > 80 токенов в секунду2 |
GPT-5.1 codex | 2,50 $ | 0,250 $ | 20,00 $ | — | — | — | 99,9 % | 99 % > 50 токенов в секунду2 |
GPT-5 codex | 2,50 $ | 0,250 $ | 20,00 $ | — | — | — | 99,9 % | 99 % > 50 токенов в секунду2 |
GPT-4.1 | 3,50 $ | 0,875 $ | 14,00 $ | — | — | — | 99,9 % | 99 % > 80 токенов в секунду2 |
GPT-4.1 mini | 0,70 $ | 0,175 $ | 2,80 $ | — | — | — | 99,9 % | 99 % > 90 токенов в секунду2 |
GPT-4.1 nano | 0,20 $ | 0,050 $ | 0,80 $ | — | — | — | 99,9 % | 99 % > 100 токенов в секунду2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | 4,25 $ | 2,125 $ | 17,00 $ | — | — | — | 99,9 % | 99 % > 80 токенов в секунду2 |
gpt-4o-2024-05-13 | 8,75 $ | — | 26,25 $ | — | — | — | 99,9 % | 99 % > 80 токенов в секунду2 |
GPT-4o mini | 0,25 $ | 0,125 $ | 1,00 $ | — | — | — | 99,9 % | 99 % > 90 токенов в секунду2 |
o3 | 3,50 $ | 0,875 $ | 14,00 $ | — | — | — | 99,9 % | 99 % > 80 токенов в секунду2 |
o4-mini | 2,00 $ | 0,500 $ | 8,00 $ | — | — | — | 99,9 % | 99 % > 90 токенов в секунду2 |
Принцип работы
Клиенты могут направлять трафик в Быстрый режим для каждого запроса отдельно с помощью существующего параметра service_tier и значения service_tier = "fast".
Токены, обработанные в быстром режиме, будут тарифицироваться за каждый токен по повышенной ставке относительно стандартной обработки.
Помимо настройки на уровне запроса, вы также можете задать для проекта быстрый режим по умолчанию в разделе «Настройки проекта» > «Тарифный план по умолчанию: быстрый режим». Вы можете переопределить это для каждого запроса. Выбор варианта «быстрый» в настройках проекта равнозначен выбору варианта «Приоритет» (Priority).
Ограничения
- Для Быстрого режима действуют общие лимиты запросов с другими уровнями обслуживания.
- В редких случаях резкое увеличение числа токенов в минуту в быстром режиме может привести к срабатыванию лимитов скорости наращивания трафика. Если вы превысите лимит скорости наращивания трафика, дополнительный трафик может быть отправлен на стандартную обработку.