Преминаване към основното съдържание
OpenAI

22 септември 2026 г.

Продукт

По-добро кеширане на подкани за GPT‑6

Повече попадения в кеша и нови инструменти, с които постоянните агенти работят по-бързо и с по-ниски разходи.

Зареждане…

GPT‑6 позволява на постоянните агенти да работят с часове по сложни задачи — от рефакториране на кодови бази до създаване на задълбочено проучени документи и презентации. Приложенията зад тези агенти изпращат поредица от надграждащи се API заявки, които често пренасят същите инструкции, дефиниции на инструменти и контекст от предишни стъпки. OpenAI кешира този споделен контекст, за да използва повторно изчисленията между заявките, като съкращава времето за отговор и предоставя на разработчиците отстъпки до 90% за кеширани входни токени.

Със семейството GPT‑6 пуснахме подобрена система за кеширане на подкани, която по подразбиране постига по-висок процент попадения в кеша. Вече предоставяме отстъпки за кеширане на отговарящи на условията споделени префикси, използвани повторно в рамките на 30 минути. Въвеждаме и нови инструменти, с които разработчиците могат да наблюдават ефективността на кеша, да диагностицират пропуски и да избират каква част от подканата да кешират.

Кеширането на подкани от OpenAI има ключова роля за бързата и ефективна работа на GitHub Copilot в голям мащаб. През последните няколко месеца намалихме с над 50% дела на токените в подканите, които изискват нова обработка при милиарди заявки към модели на OpenAI, спрямо предишното ни базово ниво. Резултатът е по-ефективна инфраструктура за инференция и по-кратко време до първия отговор за разработчиците.
—Марио Родригес, главен продуктов директор

Наблюдение на кеширането и диагностика на пропуски в кеша

Новото табло за кеширане на подкани(отваря се в нов прозорец) показва каква част от входните данни на приложението ви се обслужва от кеша. Следете процента попадения във времето и използвайте диаграмата за състава на входа, за да сравнявате кешираните и некешираните токени. Тези изгледи ви помагат да забелязвате спадове в попаденията в кеша и да оценявате как промените в приложението влияят върху ефективността на кеширането.

Табло за кеширане на подкани, показващо процента попадения в кеша, ефективността на кеша във времето и състава на входните токени.

Когато забележите неочакван пропуск в кеша, използвайте инструмента за диагностика на кеширането на подкани(отваря се в нов прозорец), за да разберете какво се е случило. Сравнете дадена заявка със скорошен отговор, за да откриете промени в модела, инструментите, настройките или входните данни, които са попречили на повторното използване. Приблизителният брой засегнати токени ви помага да оцените мащаба на въздействието и да решите как да оптимизирате интеграцията си за максимален процент попадения в кеша.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Оптимизирайте кеширането за приложението си

Изберете какво да кеширате. Явните точки за прекъсване на кеша ви позволяват да избирате кои префикси на подканата да се използват повторно. Обновеният наръчник за кеширане на подкани(отваря се в нов прозорец) обяснява как да ги използвате, колко дълго кешираните префикси отговарят на условията и как промените в инструментите и входните данни влияят върху повторното използване.

Регулирайте интензивността на структурираното анализиране, без да нарушавате кеша. При моделите GPT‑6 вече можете да променяте интензивността на структурираното анализиране(отваря се в нов прозорец) между отговорите, без да нарушавате кеша. Увеличете интензивността за по-трудна задача или я намалете за рутинен последващ въпрос, като добавите configuration_update и оставите непроменена зададената на ниво заявка интензивност на структурираното анализиране. Така можете да регулирате колко структурирано анализиране изисква дадена задача, като запазите контекста за повторна употреба.

Запазете кеша при промени в инструментите и инструкциите. Когато нуждите на агента ви от инструменти се променят, запазете стабилни техните дефиниции, схеми и подредба, за да може по-ранният контекст да се използва повторно. Използвайте allowed_tools, за да могат да се извикват само подходящите инструменти, или задайте tool_choice на none, когато не са нужни инструменти, вместо да премахвате дефинициите. Използвайте нови съобщения за разработчици, за да добавяте нови инструкции към края на контекста, които да заменят по-старите. Вижте нашите насоки за управление на промените в инструментите(отваря се в нов прозорец).

Загрейте предварително кеша, за да намалите забавянето. Предварителното загряване(отваря се в нов прозорец) подготвя предварително известния контекст, така че моделът да започне да отговаря по-бързо при получаване на заявка. Например при стартиране приложението може предварително да зареди в кеша споделени инструкции, дефиниции на инструменти или справочни материали, преди потребителят да зададе първия си въпрос. Така обработката се извършва извън времето за изчакване на потребителя.

Тези незадължителни контроли надграждат стандартната производителност на системата и ви помагат да адаптирате кеширането към работното си натоварване.

1 от 3
Диагностиката и таблото на OpenAI за кеширане на подкани ни помогнаха да повишим процента попадения в кеша с няколко процентни пункта и да намалим разходите с 20%. Вече получаваме известия, когато кеширането неочаквано спре да работи, и използваме агенти на Codex, за да установим първопричината. Явните точки за прекъсване ни позволяват също да кешираме стабилния контекст, а често променящото се съдържание да остава в края на подканата. Така стана икономически изгодно да клонираме разговори за фонови задачи, като използваме повторно почти целия споделен контекст.
—Ариан Ханифи, главен технологичен директор

Първи стъпки