Переход к основному контенту
OpenAI

22 сентября 2026 г.

Товар

Улучшенное кэширование промптов для GPT‑6

Больше попаданий в кэш и новые инструменты, позволяющие постоянным агентам работать быстрее и дешевле.

Загрузка…

GPT‑6 позволяет постоянным агентам часами выполнять сложные задачи — от рефакторинга кодовых баз до подготовки глубоко проработанных документов и презентаций. Приложения, на которых работают эти агенты, последовательно отправляют взаимосвязанные API-запросы, зачастую передавая неизменными инструкции, определения инструментов и контекст предыдущих шагов. OpenAI кэширует этот общий контекст, чтобы повторно использовать результаты вычислений в разных запросах. Это сокращает время ответа и дает разработчикам скидку до 90% на кэшированные входные токены.

Вместе с семейством GPT‑6 мы запустили улучшенную систему кэширования промптов, которая по умолчанию обеспечивает более высокую долю попаданий в кэш. Теперь скидка за кэширование действует для подходящих общих префиксов, повторно используемых в течение 30 минут. Мы также представляем новые инструменты, которые помогут разработчикам отслеживать эффективность кэша, диагностировать промахи и выбирать, какую часть промпта кэшировать.

Кэширование промптов OpenAI играет ключевую роль, помогая GitHub Copilot быстро и эффективно работать в любом масштабе. За последние несколько месяцев мы более чем на 50% сократили долю токенов промптов, требующих новой обработки, по сравнению с прежним базовым уровнем — и это при миллиардах запросов к моделям OpenAI. В результате стек инференса стал эффективнее, а разработчики быстрее получают первый ответ.
—Марио Родригес, директор по продукту

Мониторинг кэширования и диагностика промахов кэша

Новая панель мониторинга кэширования промптов(открывается в новом окне) показывает, какая доля входных данных вашего приложения поступает из кэша. Отслеживайте долю попаданий с течением времени и сравнивайте кэшированные и некэшированные токены на диаграмме состава входных данных. Эти представления помогают выявлять снижение доли попаданий в кэш и оценивать влияние изменений в приложении на эффективность кэширования.

Панель мониторинга кэширования промптов с долей попаданий в кэш, динамикой эффективности кэша и составом входных токенов.

При неожиданном промахе кэша выяснить причину поможет инструмент диагностики кэширования промптов(открывается в новом окне). Сравните запрос с недавним ответом, чтобы выявить изменения модели, инструментов, настроек или входных данных, которые помешали повторному использованию. Оценочное число затронутых токенов помогает определить масштаб последствий и понять, как оптимизировать интеграцию, чтобы максимально повысить долю попаданий в кэш.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Оптимизация кэширования для вашего приложения

Выберите, что кэшировать. Явные точки разрыва кэша позволяют выбирать, какие префиксы промпта использовать повторно. В обновленном руководстве по кэшированию промптов(открывается в новом окне) объясняется, как применять такие точки, как долго кэшированные префиксы остаются доступными для повторного использования и как на него влияют изменения инструментов и входных данных.

Регулируйте интенсивность рассуждений, не нарушая работу кэша. В моделях GPT‑6 теперь можно изменять интенсивность рассуждений(открывается в новом окне) между ответами, не нарушая работу кэша. Повысьте интенсивность для сложной задачи или снизьте ее для обычного уточняющего запроса, добавив configuration_update и не меняя интенсивность рассуждений на уровне запроса. Так можно регулировать объем необходимых задаче рассуждений, сохраняя пригодный для повторного использования контекст.

Сохраняйте кэш при изменении инструментов и инструкций. Когда потребности агента в инструментах меняются, сохраняйте определения, схемы и порядок инструментов неизменными, чтобы предыдущий контекст оставался пригодным для повторного использования. Вместо удаления определений используйте allowed_tools, чтобы разрешить вызов только нужных инструментов, или задайте для tool_choice значение none, если инструменты не требуются. Добавляйте новые инструкции ближе к концу контекста в новых сообщениях разработчика, чтобы переопределить прежние. Ознакомьтесь с нашими рекомендациями по управлению изменениями инструментов(открывается в новом окне).

Предварительно прогревайте кэш, чтобы сократить задержку. Предварительный прогрев(открывается в новом окне) заранее подготавливает известный контекст, чтобы модель могла быстрее начать отвечать после поступления запроса. Например, при запуске приложение может предварительно прогреть общие инструкции, определения инструментов или справочные материалы — еще до первого вопроса пользователя. Благодаря этому обработка не увеличивает время ожидания пользователя.

Эти необязательные средства управления дополняют стандартные возможности движка и помогают адаптировать кэширование к вашей нагрузке.

1 из 3
Средства диагностики и панель мониторинга кэширования промптов от OpenAI помогли нам повысить долю попаданий в кэш на несколько процентных пунктов и сократить расходы на 20%. Теперь мы получаем оповещения о неожиданных сбоях кэширования и с помощью агентов Codex выявляем первопричину. Явные точки разрыва также позволяют кэшировать стабильный контекст, оставляя часто меняющееся содержимое в конце промпта. Благодаря этому форкать разговоры для фоновых задач и повторно использовать почти весь общий контекст стало экономически целесообразно.
—Ариан Ханифи, технический директор

Начало работы

Автор

OpenAI