По-добро кеширане на подкани за GPT‑6
Повече попадения в кеша и нови инструменти, с които постоянните агенти работят по-бързо и с по-ниски разходи.
GPT‑6 позволява на постоянните агенти да работят с часове по сложни задачи — от рефакториране на кодови бази до създаване на задълбочено проучени документи и презентации. Приложенията зад тези агенти изпращат поредица от надграждащи се API заявки, които често пренасят същите инструкции, дефиниции на инструменти и контекст от предишни стъпки. OpenAI кешира този споделен контекст, за да използва повторно изчисленията между заявките, като съкращава времето за отговор и предоставя на разработчиците отстъпки до 90% за кеширани входни токени.
Със семейството GPT‑6 пуснахме подобрена система за кеширане на подкани, която по подразбиране постига по-висок процент попадения в кеша. Вече предоставяме отстъпки за кеширане на отговарящи на условията споделени префикси, използвани повторно в рамките на 30 минути. Въвеждаме и нови инструменти, с които разработчиците могат да наблюдават ефективността на кеша, да диагностицират пропуски и да избират каква част от подканата да кешират.
Новото табло за кеширане на подкани(отваря се в нов прозорец) показва каква част от входните данни на приложението ви се обслужва от кеша. Следете процента попадения във времето и използвайте диаграмата за състава на входа, за да сравнявате кешираните и некешираните токени. Тези изгледи ви помагат да забелязвате спадове в попаденията в кеша и да оценявате как промените в приложението влияят върху ефективността на кеширането.

Когато забележите неочакван пропуск в кеша, използвайте инструмента за диагностика на кеширането на подкани(отваря се в нов прозорец), за да разберете какво се е случило. Сравнете дадена заявка със скорошен отговор, за да откриете промени в модела, инструментите, настройките или входните данни, които са попречили на повторното използване. Приблизителният брой засегнати токени ви помага да оцените мащаба на въздействието и да решите как да оптимизирате интеграцията си за максимален процент попадения в кеша.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Изберете какво да кеширате. Явните точки за прекъсване на кеша ви позволяват да избирате кои префикси на подканата да се използват повторно. Обновеният наръчник за кеширане на подкани(отваря се в нов прозорец) обяснява как да ги използвате, колко дълго кешираните префикси отговарят на условията и как промените в инструментите и входните данни влияят върху повторното използване.
Регулирайте интензивността на структурираното анализиране, без да нарушавате кеша. При моделите GPT‑6 вече можете да променяте интензивността на структурираното анализиране(отваря се в нов прозорец) между отговорите, без да нарушавате кеша. Увеличете интензивността за по-трудна задача или я намалете за рутинен последващ въпрос, като добавите configuration_update и оставите непроменена зададената на ниво заявка интензивност на структурираното анализиране. Така можете да регулирате колко структурирано анализиране изисква дадена задача, като запазите контекста за повторна употреба.
Запазете кеша при промени в инструментите и инструкциите. Когато нуждите на агента ви от инструменти се променят, запазете стабилни техните дефиниции, схеми и подредба, за да може по-ранният контекст да се използва повторно. Използвайте allowed_tools, за да могат да се извикват само подходящите инструменти, или задайте tool_choice на none, когато не са нужни инструменти, вместо да премахвате дефинициите. Използвайте нови съобщения за разработчици, за да добавяте нови инструкции към края на контекста, които да заменят по-старите. Вижте нашите насоки за управление на промените в инструментите(отваря се в нов прозорец).
Загрейте предварително кеша, за да намалите забавянето. Предварителното загряване(отваря се в нов прозорец) подготвя предварително известния контекст, така че моделът да започне да отговаря по-бързо при получаване на заявка. Например при стартиране приложението може предварително да зареди в кеша споделени инструкции, дефиниции на инструменти или справочни материали, преди потребителят да зададе първия си въпрос. Така обработката се извършва извън времето за изчакване на потребителя.
Тези незадължителни контроли надграждат стандартната производителност на системата и ви помагат да адаптирате кеширането към работното си натоварване.
Следете процента попадения в кеша в таблото за кеширане на подкани(отваря се в нов прозорец).
Проучвайте неочакваните пропуски с инструмента за диагностика(отваря се в нов прозорец).
Следвайте наръчника за кеширане на подкани(отваря се в нов прозорец), за да подобрите конфигурацията си, или използвайте Codex(отваря се в нов прозорец), за да прегледате кода, да приложите подобрения и да измерите резултатите.


