Прескокни до главната содржина
OpenAI

22 септември 2026 г.

Производ

Подобро кеширање промпт за GPT‑6

Повисоки стапки на погодоци во кешот и нови алатки со кои постојаните агенти работат побрзо и поевтино.

Се вчитува...

GPT‑6 им овозможува на постојаните агенти со часови да работат на сложени задачи, од рефакторирање кодни бази до изработка на темелно истражени документи и презентации. Апликациите зад овие агенти испраќаат низа API-барања што се надоврзуваат едно на друго, често пренесувајќи ги истите упатства, дефиниции на алатки и контекст од претходните размени. OpenAI го кешира тој заеднички контекст за повторно да ги користи пресметките низ повеќе барања, со што го скратува времето на одговор и им нуди на програмерите попуст до 90% за кешираните влезни токени.

Со семејството GPT‑6 воведовме подобрен систем за кеширање промпт, кој стандардно обезбедува повисоки стапки на погодоци во кешот. Сега нудиме попусти за кеширање на подобните заеднички префикси што повторно се користат во период од 30 минути. Воведуваме и нови алатки со кои програмерите ќе можат да ги следат перформансите на кешот, да ги дијагностицираат промашувањата и да изберат колкав дел од промптот да се кешира.

Кеширањето промпт на OpenAI има клучна улога во тоа GitHub Copilot да нуди брзо и ефикасно искуство во голем обем. Во изминатите неколку месеци, во споредба со претходната почетна вредност, за повеќе од 50% го намаливме уделот на токени од промптот што бараат нова обработка низ милијарди барања до моделите на OpenAI. Резултатот е поефикасен систем за инференција и пократко време до првиот одговор за програмерите.
—Mario Rodriguez, директор за производи

Следете го кеширањето и дијагностицирајте ги промашувањата на кешот

Новата Контролна табла за кеширање промпт(се отвора во нов прозорец) покажува колкав дел од влезот на вашата апликација се вчитува од кешот. Следете ги стапките на погодоци низ времето и користете го графиконот за составот на влезот за да ги споредите кешираните и некешираните токени. Овие прикази ви помагаат да забележите пад на погодоците во кешот и да процените како промените во апликацијата влијаат врз перформансите на кеширањето.

Контролна табла за кеширање промпт што ги прикажува стапката на погодоци во кешот, перформансите на кешот низ времето и составот на влезните токени.

Кога ќе забележите неочекувано промашување на кешот, користете ја алатката за дијагностика на кеширањето промпт(се отвора во нов прозорец) за да дознаете што се случило. Споредете барање со неодамнешен одговор за да ги откриете промените во моделот, алатките, поставките или влезот што го спречиле повторното користење. Проценетиот број засегнати токени ви помага да го утврдите обемот на влијанието и да одлучите како да ја оптимизирате интеграцијата за да постигнете највисоки стапки на погодоци во кешот.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Оптимизирајте го кеширањето за вашата апликација

Изберете што да се кешира. Експлицитните точки на прекин на кешот ви овозможуваат да изберете кои префикси на промптот повторно да се користат. Обновениот водич за кеширање промпт(се отвора во нов прозорец) објаснува како да ги користите, колку долго кешираните префикси остануваат подобни и како промените во алатките и влезовите влијаат врз повторното користење.

Приспособете го интензитетот на расудување без да го нарушите кешот. Кај моделите GPT‑6 сега можете да го менувате интензитетот на расудување(се отвора во нов прозорец) меѓу одговорите без да го нарушите кешот. Зголемете го интензитетот за потешка задача или намалете го за рутинско дополнително барање со додавање configuration_update, без да го менувате интензитетот на расудување на ниво на барање. Така можете да го приспособите потребното ниво на расудување за задачата, а притоа да го зачувате контекстот за повторна употреба.

Зачувајте го кешот при промени на алатките и упатствата. Како што се менуваат потребите на вашиот агент за користење алатки, одржувајте ги стабилни нивните дефиниции, шеми и редослед за претходниот контекст да остане употреблив. Користете allowed_tools за да овозможите повикување само на релевантните алатки или поставете tool_choice на none кога не се потребни алатки, наместо да ги отстранувате дефинициите. Користете нови програмерски пораки за да додадете нови упатства кон крајот на контекстот и со нив да ги замените постарите. Погледнете ги нашите насоки за управување со промените на алатките(се отвора во нов прозорец).

Однапред загрејте го кешот за да ја намалите латентноста. Однапред загревањето(се отвора во нов прозорец) го подготвува познатиот контекст однапред, за моделот да почне да одговара побрзо кога ќе пристигне барање. На пример, при стартувањето апликацијата може однапред да ги загрее заедничките упатства, дефинициите на алатките или референтните материјали, пред корисникот да го постави првото прашање. Така обработката се одвива надвор од времето во кое корисникот чека.

Овие изборни контроли ги надградуваат стандардните перформанси на системот и ви помагаат да го приспособите кеширањето на вашиот обем на работа.

1 од 3
Дијагностиката и контролната табла на OpenAI за кеширање промпт ни помогнаа да ја подобриме стапката на погодоци во кешот за неколку процентни поени, намалувајќи ги трошоците за 20%. Сега добиваме известувања кога кеширањето неочекувано ќе се наруши и користиме агенти на Codex за да ја утврдиме основната причина. Експлицитните точки на прекин ни овозможуваат да го кешираме стабилниот контекст, а содржината што често се менува да ја задржиме на крајот од промптот. Така стана економски исплатливо да разгрануваме разговори за задачи во заднина, притоа повторно користејќи го речиси целиот заеднички контекст.
—Arian Hanifi, директор за технологија

Започнете

Автор

OpenAI