Пређите на главни садржај
OpenAI

22. септембар 2026.

Производ

Боље кеширање инструкције за GPT‑6

Више стопе погодака кеша и нови алати који трајним агентима омогућавају бржи рад уз ниже трошкове.

Учитавање…

GPT‑6 омогућава трајним агентима да сатима раде на сложеним задацима, од рефакторисања програмског кода до израде темељно истражених докумената и презентација. Апликације које покрећу ове агенте шаљу низ међусобно повезаних API захтева, често преносећи исте инструкције, дефиниције алата и контекст из претходних корака. OpenAI кешира тај заједнички контекст како би поново користио резултате обраде у различитим захтевима, скратио време одзива и програмерима пружио попуст до 90% на кеширане улазне токене.

Са породицом GPT‑6 покренули смо побољшан систем кеширања инструкције који подразумевано пружа више стопе погодака кеша. Сада одобравамо попусте за кеширање прихватљивих заједничких префикса који се поново користе у року од 30 минута. Уводимо и нове алате који програмерима помажу да прате учинак кеша, дијагностикују промашаје и одаберу колики део инструкције желе да кеширају.

Кеширање инструкције компаније OpenAI има пресудну улогу у томе да GitHub Copilot брзо и ефикасно ради у великим размерама. Током протеклих неколико месеци, у милијардама захтева упућених OpenAI моделима, смањили смо за више од 50% удео токена инструкције који захтевају нову обраду у односу на претходну полазну вредност. Резултат су ефикаснији систем за инференцију и краће време до првог одговора за програмере.
—Mario Rodriguez, директор производа

Пратите кеширање и дијагностикујте промашаје кеша

Нова контролна табла за кеширање инструкције(отвара се у новом прозору) приказује колики се део улазних података ваше апликације преузима из кеша. Пратите стопе погодака током времена и помоћу графикона састава улазних података упоредите кеширане и некеширане токене. Ови прикази вам помажу да уочите пад стопе погодака кеша и процените како измене апликације утичу на учинак кеширања.

Контролна табла за кеширање инструкције која приказује стопу погодака кеша, учинак кеша током времена и састав улазних токена.

Када уочите неочекиван промашај кеша, употребите алат за дијагностику кеширања инструкције(отвара се у новом прозору) да бисте разумели шта се догодило. Упоредите захтев са недавним одговором да бисте утврдили које су измене модела, алата, подешавања или улазних података спречиле поновну употребу. Процењени број погођених токена помаже вам да одредите размере утицаја и одлучите како да оптимизујете интеграцију ради што веће стопе погодака кеша.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Оптимизујте кеширање за своју апликацију

Одаберите шта желите да кеширате. Експлицитне тачке прекида кеша омогућавају вам да изаберете које префиксе инструкције желите поново да користите. Ажурирани водич за кеширање инструкције(отвара се у новом прозору) објашњава како да их користите, колико дуго кеширани префикси испуњавају услове за поновну употребу и како измене алата и улазних података утичу на њу.

Прилагодите ниво резоновања без прекида кеша. На GPT‑6 моделима сада можете да мењате ниво резоновања(отвара се у новом прозору) између одговора без прекида кеша. Повећајте ниво за тежи задатак или га смањите за рутинско додатно питање додавањем ставке configuration_update, без промене нивоа резоновања у самом захтеву. Тако можете да прилагодите количину резоновања потребну за задатак, а да притом очувате контекст који се може поново користити.

Очувајте кеш док се алати и инструкције мењају. Како се мењају потребе вашег агента за коришћењем алата, задржите стабилне дефиниције, шеме и редослед алата како би ранији контекст остао погодан за поновну употребу. Користите allowed_tools да омогућите позивање само релевантних алата или подесите tool_choice на none када алати нису потребни, уместо да уклањате дефиниције. Помоћу нових порука програмера додајте нове инструкције при крају контекста како би замениле старије. Погледајте наше смернице за управљање изменама алата(отвара се у новом прозору).

Унапред припремите кеш да бисте смањили кашњење. Унапред припремљен кеш(отвара се у новом прозору) садржи унапред обрађен познати контекст, па модел може раније да почне са одговором када захтев стигне. На пример, апликација при покретању може унапред да припреми заједничке инструкције, дефиниције алата или референтни материјал, пре него што корисник постави прво питање. Тиме се обрада обавља пре него што корисник почне да чека.

Ове опционе контроле надограђују подразумеване перформансе система и помажу вам да кеширање прилагодите свом радном оптерећењу.

1 од 3
Дијагностика кеширања инструкције и контролна табла компаније OpenAI помогле су нам да повећамо стопу погодака кеша за неколико процентних поена и смањимо трошкове за 20%. Сада добијамо упозорења када се кеширање неочекивано прекине и користимо Codex агенте да бисмо открили основни узрок. Експлицитне тачке прекида омогућавају нам и да кеширамо стабилан контекст, док садржај који се често мења задржавамо на крају инструкције. Захваљујући томе, додатно копирање разговора за позадинске задатке постало је економски исплативо, уз поновну употребу готово целог заједничког контекста.
—Arian Hanifi, директор технологије

Започните

Аутор

OpenAI