Улучшенное кэширование промптов для GPT‑6
Больше попаданий в кэш и новые инструменты, позволяющие постоянным агентам работать быстрее и дешевле.
GPT‑6 позволяет постоянным агентам часами выполнять сложные задачи — от рефакторинга кодовых баз до подготовки глубоко проработанных документов и презентаций. Приложения, на которых работают эти агенты, последовательно отправляют взаимосвязанные API-запросы, зачастую передавая неизменными инструкции, определения инструментов и контекст предыдущих шагов. OpenAI кэширует этот общий контекст, чтобы повторно использовать результаты вычислений в разных запросах. Это сокращает время ответа и дает разработчикам скидку до 90% на кэшированные входные токены.
Вместе с семейством GPT‑6 мы запустили улучшенную систему кэширования промптов, которая по умолчанию обеспечивает более высокую долю попаданий в кэш. Теперь скидка за кэширование действует для подходящих общих префиксов, повторно используемых в течение 30 минут. Мы также представляем новые инструменты, которые помогут разработчикам отслеживать эффективность кэша, диагностировать промахи и выбирать, какую часть промпта кэшировать.
Новая панель мониторинга кэширования промптов(открывается в новом окне) показывает, какая доля входных данных вашего приложения поступает из кэша. Отслеживайте долю попаданий с течением времени и сравнивайте кэшированные и некэшированные токены на диаграмме состава входных данных. Эти представления помогают выявлять снижение доли попаданий в кэш и оценивать влияние изменений в приложении на эффективность кэширования.

При неожиданном промахе кэша выяснить причину поможет инструмент диагностики кэширования промптов(открывается в новом окне). Сравните запрос с недавним ответом, чтобы выявить изменения модели, инструментов, настроек или входных данных, которые помешали повторному использованию. Оценочное число затронутых токенов помогает определить масштаб последствий и понять, как оптимизировать интеграцию, чтобы максимально повысить долю попаданий в кэш.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Выберите, что кэшировать. Явные точки разрыва кэша позволяют выбирать, какие префиксы промпта использовать повторно. В обновленном руководстве по кэшированию промптов(открывается в новом окне) объясняется, как применять такие точки, как долго кэшированные префиксы остаются доступными для повторного использования и как на него влияют изменения инструментов и входных данных.
Регулируйте интенсивность рассуждений, не нарушая работу кэша. В моделях GPT‑6 теперь можно изменять интенсивность рассуждений(открывается в новом окне) между ответами, не нарушая работу кэша. Повысьте интенсивность для сложной задачи или снизьте ее для обычного уточняющего запроса, добавив configuration_update и не меняя интенсивность рассуждений на уровне запроса. Так можно регулировать объем необходимых задаче рассуждений, сохраняя пригодный для повторного использования контекст.
Сохраняйте кэш при изменении инструментов и инструкций. Когда потребности агента в инструментах меняются, сохраняйте определения, схемы и порядок инструментов неизменными, чтобы предыдущий контекст оставался пригодным для повторного использования. Вместо удаления определений используйте allowed_tools, чтобы разрешить вызов только нужных инструментов, или задайте для tool_choice значение none, если инструменты не требуются. Добавляйте новые инструкции ближе к концу контекста в новых сообщениях разработчика, чтобы переопределить прежние. Ознакомьтесь с нашими рекомендациями по управлению изменениями инструментов(открывается в новом окне).
Предварительно прогревайте кэш, чтобы сократить задержку. Предварительный прогрев(открывается в новом окне) заранее подготавливает известный контекст, чтобы модель могла быстрее начать отвечать после поступления запроса. Например, при запуске приложение может предварительно прогреть общие инструкции, определения инструментов или справочные материалы — еще до первого вопроса пользователя. Благодаря этому обработка не увеличивает время ожидания пользователя.
Эти необязательные средства управления дополняют стандартные возможности движка и помогают адаптировать кэширование к вашей нагрузке.
Отслеживайте долю попаданий в кэш на панели мониторинга кэширования промптов(открывается в новом окне).
Исследуйте неожиданные промахи с помощью инструмента диагностики(открывается в новом окне).
Следуйте руководству по кэшированию промптов(открывается в новом окне), чтобы улучшить конфигурацию, или используйте Codex(открывается в новом окне) для анализа кода, внесения улучшений и оценки результатов.


