Preskočiť na hlavný obsah
OpenAI

22. septembra 2026

Produkt

Lepší caching príkazov pre GPT‑6

Vyššia miera zásahov cache a nové nástroje, vďaka ktorým dlhodobo pracujúci agenti fungujú rýchlejšie a lacnejšie.

Načítava sa…

GPT‑6 umožňuje dlhodobo pracujúcim agentom venovať sa celé hodiny zložitým úlohám, od refaktorovania kódových báz až po tvorbu dôkladne spracovaných dokumentov a prezentácií. Aplikácie, na ktorých sú títo agenti postavení, odosielajú sériu nadväzujúcich požiadaviek API, ktoré často opakovane používajú rovnaké pokyny, definície nástrojov a kontext z predchádzajúcich interakcií. OpenAI ukladá tento spoločný kontext do cache, aby sa výpočty dali opätovne využiť v rôznych požiadavkách. Skracuje tak čas odozvy a vývojárom poskytuje zľavy až 90 % na vstupné tokeny načítané z cache.

S rodinou GPT‑6 sme uviedli vylepšený systém cachingu príkazov, ktorý predvolene dosahuje vyššiu mieru zásahov cache. Zľavy za použitie cache teraz poskytujeme pre oprávnené spoločné prefixy, ktoré sa opätovne použijú do 30 minút. Predstavujeme aj nové nástroje, ktoré vývojárom pomôžu sledovať výkon cache, diagnostikovať minutia a vybrať, aká časť príkazu sa má uložiť do cache.

Caching príkazov od OpenAI zohráva kľúčovú úlohu v tom, aby GitHub Copilot dokázal poskytovať rýchle a efektívne služby vo veľkom rozsahu. Za posledných niekoľko mesiacov sme v porovnaní s predchádzajúcou východiskovou hodnotou znížili o viac než 50 % podiel tokenov príkazov, ktoré treba spracovať nanovo, a to pri miliardách požiadaviek na modely OpenAI. Výsledkom je efektívnejší inferenčný systém a kratší čas do prvej odpovede pre vývojárov.
—Mario Rodriguez, produktový riaditeľ

Sledujte caching a diagnostikujte minutia cache

Nový informačný panel cachingu príkazov(otvorí sa v novom okne) ukazuje, aká časť vstupu vašej aplikácie sa načítava z cache. Sledujte mieru zásahov v čase a pomocou grafu zloženia vstupu porovnávajte tokeny načítané z cache s tokenmi spracovanými bez nej. Tieto zobrazenia vám pomôžu odhaliť pokles miery zásahov cache a vyhodnotiť, ako zmeny aplikácie ovplyvňujú výkon cachingu.

Informačný panel cachingu príkazov zobrazujúci mieru zásahov cache, vývoj jej výkonu v čase a zloženie vstupných tokenov.

Ak zaznamenáte neočakávané minutie cache, pomocou diagnostického nástroja cachingu príkazov(otvorí sa v novom okne) zistíte, čo sa stalo. Porovnajte požiadavku s nedávnou odpoveďou a identifikujte zmeny modelu, nástrojov, nastavení alebo vstupu, ktoré zabránili opätovnému použitiu. Odhadovaný počet ovplyvnených tokenov vám pomôže posúdiť rozsah vplyvu a rozhodnúť sa, ako optimalizovať integráciu, aby ste maximalizovali mieru zásahov cache.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Optimalizujte caching pre svoju aplikáciu

Vyberte, čo sa má uložiť do cache. Explicitné body prerušenia cache vám umožňujú vybrať, ktoré prefixy príkazu sa majú opätovne použiť. Aktualizovaný sprievodca cachingom príkazov(otvorí sa v novom okne) vysvetľuje, ako ich používať, ako dlho možno prefixy uložené v cache opätovne použiť a ako zmeny nástrojov a vstupov ovplyvňujú ich opätovné použitie.

Upravte intenzitu uvažovania bez narušenia cache. V modeloch GPT‑6 teraz môžete medzi odpoveďami meniť intenzitu uvažovania(otvorí sa v novom okne) bez narušenia cache. Pri náročnejšej úlohe intenzitu zvýšte a pri bežnej nadväzujúcej úlohe ju znížte pridaním configuration_update, pričom intenzita uvažovania na úrovni požiadavky zostane nezmenená. Môžete tak upraviť mieru uvažovania potrebnú na úlohu a zároveň zachovať opätovne použiteľný kontext.

Zachovajte cache aj pri zmenách nástrojov a pokynov. Keď sa menia potreby agenta pri používaní nástrojov, zachovajte stabilné definície, schémy a poradie nástrojov, aby sa dal predchádzajúci kontext naďalej používať. Namiesto odstraňovania definícií použite allowed_tools, aby sa dali volať iba relevantné nástroje, alebo nastavte tool_choice na none, keď žiadne nástroje nie sú potrebné. Nové pokyny pridávajte na koniec kontextu prostredníctvom nových správ vývojára, aby prepísali staršie pokyny. Prečítajte si naše odporúčania na správu zmien nástrojov(otvorí sa v novom okne).

Predhrejte cache a znížte latenciu. Predhriatie(otvorí sa v novom okne) vopred pripraví známy kontext, takže model môže po prijatí požiadavky začať odpovedať skôr. Aplikácia môže napríklad počas spúšťania, ešte pred prvou otázkou používateľa, predhriať spoločné pokyny, definície nástrojov alebo referenčné materiály. Spracovanie sa tak presunie mimo času, počas ktorého používateľ čaká.

Tieto voliteľné ovládacie prvky rozširujú predvolený výkon systému a pomáhajú vám prispôsobiť caching pracovnému zaťaženiu.

1 z 3
Diagnostika a informačný panel cachingu príkazov od OpenAI nám pomohli zvýšiť mieru zásahov cache o niekoľko percentuálnych bodov a znížiť náklady o 20 %. Teraz dostávame upozornenia, keď caching neočakávane prestane fungovať, a pomocou agentov Codex zisťujeme hlavnú príčinu. Explicitné body prerušenia nám tiež umožňujú ukladať stabilný kontext do cache a často sa meniaci obsah ponechať na konci príkazu. Vďaka tomu je ekonomicky realizovateľné rozvetvenie konverzácií pre úlohy na pozadí, pričom opätovne využívame takmer celý spoločný kontext.
—Arian Hanifi, technologický riaditeľ

Začíname

Autor

OpenAI