Покращене кешування промпту для GPT‑6
Вища частка влучань у кеш і нові інструменти, що допомагають агентам тривалої дії працювати швидше й дешевше.
GPT‑6 дає агентам тривалої дії змогу годинами виконувати складні завдання — від рефакторингу кодових баз до створення ґрунтовно опрацьованих документів і презентацій. Застосунки, на яких працюють ці агенти, послідовно надсилають взаємопов’язані запити до API, часто передаючи далі ті самі інструкції, визначення інструментів і контекст із попередніх кроків. OpenAI кешує цей спільний контекст, щоб повторно використовувати обчислення між запитами, скорочувати час відповіді й надавати розробникам знижки до 90% на кешовані вхідні токени.
Разом із сімейством GPT‑6 ми запустили вдосконалену систему кешування промпту, яка за замовчуванням забезпечує вищу частку влучань у кеш. Тепер ми надаємо знижки за кешування придатних спільних префіксів, повторно використаних у межах 30-хвилинного вікна. Ми також представляємо нові інструменти, які допоможуть розробникам відстежувати ефективність кешу, діагностувати промахи й вибирати, яку частину промпту кешувати.
Нова інформаційна панель кешування промпту(відкривається у новому вікні) показує, яка частина вхідних даних вашого застосунку надходить із кешу. Відстежуйте частку влучань із часом і використовуйте діаграму складу вхідних даних, щоб порівнювати кешовані та некешовані токени. Ці подання допомагають помічати зниження частки влучань у кеш і оцінювати, як зміни у вашому застосунку впливають на ефективність кешування.

Якщо стався неочікуваний промах кешу, скористайтеся інструментом діагностики кешування промпту(відкривається у новому вікні), щоб з’ясувати причину. Порівняйте запит із нещодавньою відповіддю, щоб виявити зміни в моделі, інструментах, налаштуваннях або вхідних даних, які перешкодили повторному використанню. Орієнтовна кількість уражених токенів допомагає оцінити масштаб впливу й вирішити, як оптимізувати інтеграцію для максимальної частки влучань у кеш.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Виберіть, що кешувати. Явні точки розриву кешу дають змогу вибирати, які префікси промпту використовувати повторно. Оновлений посібник із кешування промпту(відкривається у новому вікні) пояснює, як ними користуватися, як довго кешовані префікси залишаються придатними та як зміни інструментів і вхідних даних впливають на повторне використання.
Регулюйте інтенсивність міркування, не порушуючи кеш. У моделях GPT‑6 тепер можна змінювати інтенсивність міркування(відкривається у новому вікні) між відповідями, не порушуючи кеш. Підвищуйте інтенсивність для складнішого завдання або знижуйте її для звичайного уточнення, додаючи configuration_update і не змінюючи інтенсивність міркування на рівні запиту. Так можна регулювати обсяг міркування, потрібний для завдання, зберігаючи придатний до повторного використання контекст.
Зберігайте кеш під час змін інструментів та інструкцій. Коли потреби агента у використанні інструментів змінюються, зберігайте визначення, схеми й порядок інструментів незмінними, щоб попередній контекст можна було використовувати повторно. Замість вилучення визначень використовуйте allowed_tools, щоб дозволити виклик лише доречних інструментів, або встановіть tool_choice у значення none, якщо інструменти не потрібні. Додавайте нові інструкції ближче до кінця контексту за допомогою нових повідомлень розробника, щоб вони замінювали попередні. Ознайомтеся з нашими рекомендаціями щодо керування змінами інструментів(відкривається у новому вікні).
Попередньо прогрівайте кеш, щоб зменшити затримку. Попереднє прогрівання(відкривається у новому вікні) завчасно готує відомий контекст, щоб після надходження запиту модель могла швидше почати відповідати. Наприклад, під час запуску застосунок може попередньо прогріти спільні інструкції, визначення інструментів або довідкові матеріали — ще до першого запитання користувача. Завдяки цьому обробка не забирає час очікування користувача.
Ці необов’язкові засоби керування доповнюють стандартну продуктивність рушія й допомагають адаптувати кешування до вашого навантаження.
Відстежуйте частку влучань у кеш на інформаційній панелі кешування промпту(відкривається у новому вікні).
Досліджуйте неочікувані промахи за допомогою інструмента діагностики(відкривається у новому вікні).
Дотримуйтеся посібника з кешування промпту(відкривається у новому вікні), щоб покращити налаштування, або скористайтеся Codex(відкривається у новому вікні), щоб перевірити код, застосувати вдосконалення й оцінити результати.


