Швидкий режим для користувачів API
Швидкий режим забезпечує надійну та швидку роботу з гнучкою моделлю оплати за фактичне використання. Для нашої актуальної передової моделі, gpt-5.6-sol, швидкий режим забезпечує до 2,5 раза вищу швидкість.
Обравши швидкий режим, ви отримуєте такі переваги:
- Стабільно низька затримка: швидкий режим створює токени швидше та з більш стабільною швидкістю, ніж при стандартній обробці, навіть під час пікового навантаження.
- Легкість у використанні та гнучкість: як і стандартна обробка, швидкий режим доступний на гнучкій основі з оплатою за фактичне використання замість необхідності попереднього резервування.
Примітка: 30 липня 2026 року режим «Пріоритетна обробка» було перейменовано на «Швидкий режим». У своїх API-запитах ви можете використовувати service_tier: priority або service_tier: fast.
| Short context | Long context | Угода про рівень доступності (SLA)3 | Latency SLA3 | |||||
|---|---|---|---|---|---|---|---|---|
| Ціна за 1 млн вхідних токенів | Ціна за 1 млн вхідних токенів (кешовані) | Ціна за 1 млн вихідних маркерів | Ціна за 1 млн вхідних токенів | Ціна за 1 млн вхідних токенів (кешовані) | Ціна за 1 млн вихідних маркерів | |||
GPT-5.6 Sol | 10,00 USD | 1,00 USD | 60,00 USD | 20,00 USD | 2,00 USD | 90,00 USD | 99,9% | 99% > 80 токенів за секунду2 |
GPT-5.6 Terra | 4,00 USD | 0,40 USD | 24,00 USD | 8,00 USD | 0,80 USD | 36,00 USD | 99,9% | 99% > 70 токенів за секунду2 |
GPT-5.6 Luna | 0,40 USD | 0,04 USD | 2,40 USD | 0,80 USD | 0,08 USD | 3,60 USD | 99,9% | 99% > 100 токенів за секунду2 |
GPT-5.5 виключає розширений контекст1 | 12,50 USD | 1,250 USD | 75,00 USD | — | — | — | 99,9% | 99% > 50 токенів за секунду2 |
GPT-5.4 mini виключає розширений контекст1 | 1,50 USD | 0,150 USD | 9,00 USD | — | — | — | 99,9% | 99% > 100 токенів за секунду2 |
GPT-5.4 виключає розширений контекст1 | 5,00 USD | 0,500 USD | 30,00 USD | — | — | — | 99,9% | 99% > 50 токенів за секунду2 |
GPT-5.2 | 3,50 USD | 0,350 USD | 28,00 USD | — | — | — | 99,9% | 99% > 50 токенів за секунду2 |
GPT-5.1 | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9% | 99% > 50 токенів за секунду2 |
GPT-5 | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9% | 99% > 50 токенів за секунду2 |
GPT-5 mini | 0,45 USD | 0,045 USD | 3,60 USD | — | — | — | 99,9% | 99% > 80 токенів за секунду2 |
GPT-5.1 codex | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9% | 99% > 50 токенів за секунду2 |
GPT-5 codex | 2,50 USD | 0,250 USD | 20,00 USD | — | — | — | 99,9% | 99% > 50 токенів за секунду2 |
GPT-4.1 | 3,50 USD | 0,875 USD | 14,00 USD | — | — | — | 99,9% | 99% > 80 токенів за секунду2 |
GPT-4.1 mini | 0,70 USD | 0,175 USD | 2,80 USD | — | — | — | 99,9% | 99% > 90 токенів за секунду2 |
GPT-4.1 nano | 0,20 USD | 0,050 USD | 0,80 USD | — | — | — | 99,9% | 99% > 100 токенів за секунду2 |
GPT-4o gpt-4o-2024-11-20 gpt-4o-2024-08-06 | 4,25 USD | 2,125 USD | 17,00 USD | — | — | — | 99,9% | 99% > 80 токенів за секунду2 |
gpt-4o-2024-05-13 | 8,75 USD | — | 26,25 USD | — | — | — | 99,9% | 99% > 80 токенів за секунду2 |
GPT-4o mini | 0,25 USD | 0,125 USD | 1,00 USD | — | — | — | 99,9% | 99% > 90 токенів за секунду2 |
o3 | 3,50 USD | 0,875 USD | 14,00 USD | — | — | — | 99,9% | 99% > 80 токенів за секунду2 |
o4-mini | 2,00 USD | 0,500 USD | 8,00 USD | — | — | — | 99,9% | 99% > 90 токенів за секунду2 |
Як це працює
Клієнти можуть спрямовувати трафік на швидкий режим для кожного запиту, використовуючи існуючий параметр service_tier із опцією service_tier = "fast".
Токени, оброблені в швидкому режимі, будуть оплачуватися на основі кількості токенів, із вищою ціною порівняно зі тарифами на стандартну обробку.
Окрім налаштування на рівні запиту, ви також можете за замовчуванням установити для проєкту швидкий режим у налаштуваннях проєкту > Рівень обслуговування за замовчуванням: швидкий режим. При цьому можна перевизначати і кожен запит окремо. Вибір значення «Швидко» в налаштуваннях проєкту еквівалентний вибору значення «Пріоритет».
Обмеження
- Ліміти запитів швидкого режиму спільні з іншими рівнями обслуговування.
- У рідкісних випадках швидке збільшення кількості токенів за хвилину в швидкому режимі може призвести до досягнення лімітів запитів. При перевищенні ліміту запитів додатковий трафік може бути перенаправлений на обробку в стандартному режимі.