Перейти до основного вмісту
OpenAI

22 вересня 2026 р.

Продукт

Покращене кешування промпту для GPT‑6

Вища частка влучань у кеш і нові інструменти, що допомагають агентам тривалої дії працювати швидше й дешевше.

Завантаження…

GPT‑6 дає агентам тривалої дії змогу годинами виконувати складні завдання — від рефакторингу кодових баз до створення ґрунтовно опрацьованих документів і презентацій. Застосунки, на яких працюють ці агенти, послідовно надсилають взаємопов’язані запити до API, часто передаючи далі ті самі інструкції, визначення інструментів і контекст із попередніх кроків. OpenAI кешує цей спільний контекст, щоб повторно використовувати обчислення між запитами, скорочувати час відповіді й надавати розробникам знижки до 90% на кешовані вхідні токени.

Разом із сімейством GPT‑6 ми запустили вдосконалену систему кешування промпту, яка за замовчуванням забезпечує вищу частку влучань у кеш. Тепер ми надаємо знижки за кешування придатних спільних префіксів, повторно використаних у межах 30-хвилинного вікна. Ми також представляємо нові інструменти, які допоможуть розробникам відстежувати ефективність кешу, діагностувати промахи й вибирати, яку частину промпту кешувати.

Кешування промпту від OpenAI відіграє ключову роль у тому, щоб GitHub Copilot міг швидко й ефективно працювати в масштабі. За останні кілька місяців ми більш ніж на 50% скоротили частку токенів промпту, які потребують нової обробки, у мільярдах запитів до моделей OpenAI порівняно з попереднім базовим рівнем. У результаті стек інференсу став ефективнішим, а розробники швидше отримують першу відповідь.
—Маріо Родрігес, директор із продукту

Відстежуйте кешування й діагностуйте промахи кешу

Нова інформаційна панель кешування промпту(відкривається у новому вікні) показує, яка частина вхідних даних вашого застосунку надходить із кешу. Відстежуйте частку влучань із часом і використовуйте діаграму складу вхідних даних, щоб порівнювати кешовані та некешовані токени. Ці подання допомагають помічати зниження частки влучань у кеш і оцінювати, як зміни у вашому застосунку впливають на ефективність кешування.

Інформаційна панель кешування промпту з часткою влучань у кеш, динамікою ефективності кешу та складом вхідних токенів.

Якщо стався неочікуваний промах кешу, скористайтеся інструментом діагностики кешування промпту(відкривається у новому вікні), щоб з’ясувати причину. Порівняйте запит із нещодавньою відповіддю, щоб виявити зміни в моделі, інструментах, налаштуваннях або вхідних даних, які перешкодили повторному використанню. Орієнтовна кількість уражених токенів допомагає оцінити масштаб впливу й вирішити, як оптимізувати інтеграцію для максимальної частки влучань у кеш.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Оптимізуйте кешування для свого застосунку

Виберіть, що кешувати. Явні точки розриву кешу дають змогу вибирати, які префікси промпту використовувати повторно. Оновлений посібник із кешування промпту(відкривається у новому вікні) пояснює, як ними користуватися, як довго кешовані префікси залишаються придатними та як зміни інструментів і вхідних даних впливають на повторне використання.

Регулюйте інтенсивність міркування, не порушуючи кеш. У моделях GPT‑6 тепер можна змінювати інтенсивність міркування(відкривається у новому вікні) між відповідями, не порушуючи кеш. Підвищуйте інтенсивність для складнішого завдання або знижуйте її для звичайного уточнення, додаючи configuration_update і не змінюючи інтенсивність міркування на рівні запиту. Так можна регулювати обсяг міркування, потрібний для завдання, зберігаючи придатний до повторного використання контекст.

Зберігайте кеш під час змін інструментів та інструкцій. Коли потреби агента у використанні інструментів змінюються, зберігайте визначення, схеми й порядок інструментів незмінними, щоб попередній контекст можна було використовувати повторно. Замість вилучення визначень використовуйте allowed_tools, щоб дозволити виклик лише доречних інструментів, або встановіть tool_choice у значення none, якщо інструменти не потрібні. Додавайте нові інструкції ближче до кінця контексту за допомогою нових повідомлень розробника, щоб вони замінювали попередні. Ознайомтеся з нашими рекомендаціями щодо керування змінами інструментів(відкривається у новому вікні).

Попередньо прогрівайте кеш, щоб зменшити затримку. Попереднє прогрівання(відкривається у новому вікні) завчасно готує відомий контекст, щоб після надходження запиту модель могла швидше почати відповідати. Наприклад, під час запуску застосунок може попередньо прогріти спільні інструкції, визначення інструментів або довідкові матеріали — ще до першого запитання користувача. Завдяки цьому обробка не забирає час очікування користувача.

Ці необов’язкові засоби керування доповнюють стандартну продуктивність рушія й допомагають адаптувати кешування до вашого навантаження.

1 із 3
Діагностика кешування промпту й інформаційна панель OpenAI допомогли нам підвищити частку влучань у кеш на кілька відсоткових пунктів і скоротити витрати на 20%. Тепер ми отримуємо сповіщення про неочікувані збої кешування й залучаємо агентів Codex для діагностики першопричини. Явні точки розриву також дають змогу кешувати стабільний контекст, залишаючи в кінці промпту вміст, який часто змінюється. Завдяки цьому стало економічно доцільно створювати форки розмов для фонових завдань, повторно використовуючи майже весь спільний контекст.
—Аріан Ханіфі, технічний директор

Початок роботи

Автор

OpenAI