Lepší caching príkazov pre GPT‑6
Vyššia miera zásahov cache a nové nástroje, vďaka ktorým dlhodobo pracujúci agenti fungujú rýchlejšie a lacnejšie.
GPT‑6 umožňuje dlhodobo pracujúcim agentom venovať sa celé hodiny zložitým úlohám, od refaktorovania kódových báz až po tvorbu dôkladne spracovaných dokumentov a prezentácií. Aplikácie, na ktorých sú títo agenti postavení, odosielajú sériu nadväzujúcich požiadaviek API, ktoré často opakovane používajú rovnaké pokyny, definície nástrojov a kontext z predchádzajúcich interakcií. OpenAI ukladá tento spoločný kontext do cache, aby sa výpočty dali opätovne využiť v rôznych požiadavkách. Skracuje tak čas odozvy a vývojárom poskytuje zľavy až 90 % na vstupné tokeny načítané z cache.
S rodinou GPT‑6 sme uviedli vylepšený systém cachingu príkazov, ktorý predvolene dosahuje vyššiu mieru zásahov cache. Zľavy za použitie cache teraz poskytujeme pre oprávnené spoločné prefixy, ktoré sa opätovne použijú do 30 minút. Predstavujeme aj nové nástroje, ktoré vývojárom pomôžu sledovať výkon cache, diagnostikovať minutia a vybrať, aká časť príkazu sa má uložiť do cache.
Nový informačný panel cachingu príkazov(otvorí sa v novom okne) ukazuje, aká časť vstupu vašej aplikácie sa načítava z cache. Sledujte mieru zásahov v čase a pomocou grafu zloženia vstupu porovnávajte tokeny načítané z cache s tokenmi spracovanými bez nej. Tieto zobrazenia vám pomôžu odhaliť pokles miery zásahov cache a vyhodnotiť, ako zmeny aplikácie ovplyvňujú výkon cachingu.

Ak zaznamenáte neočakávané minutie cache, pomocou diagnostického nástroja cachingu príkazov(otvorí sa v novom okne) zistíte, čo sa stalo. Porovnajte požiadavku s nedávnou odpoveďou a identifikujte zmeny modelu, nástrojov, nastavení alebo vstupu, ktoré zabránili opätovnému použitiu. Odhadovaný počet ovplyvnených tokenov vám pomôže posúdiť rozsah vplyvu a rozhodnúť sa, ako optimalizovať integráciu, aby ste maximalizovali mieru zásahov cache.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Vyberte, čo sa má uložiť do cache. Explicitné body prerušenia cache vám umožňujú vybrať, ktoré prefixy príkazu sa majú opätovne použiť. Aktualizovaný sprievodca cachingom príkazov(otvorí sa v novom okne) vysvetľuje, ako ich používať, ako dlho možno prefixy uložené v cache opätovne použiť a ako zmeny nástrojov a vstupov ovplyvňujú ich opätovné použitie.
Upravte intenzitu uvažovania bez narušenia cache. V modeloch GPT‑6 teraz môžete medzi odpoveďami meniť intenzitu uvažovania(otvorí sa v novom okne) bez narušenia cache. Pri náročnejšej úlohe intenzitu zvýšte a pri bežnej nadväzujúcej úlohe ju znížte pridaním configuration_update, pričom intenzita uvažovania na úrovni požiadavky zostane nezmenená. Môžete tak upraviť mieru uvažovania potrebnú na úlohu a zároveň zachovať opätovne použiteľný kontext.
Zachovajte cache aj pri zmenách nástrojov a pokynov. Keď sa menia potreby agenta pri používaní nástrojov, zachovajte stabilné definície, schémy a poradie nástrojov, aby sa dal predchádzajúci kontext naďalej používať. Namiesto odstraňovania definícií použite allowed_tools, aby sa dali volať iba relevantné nástroje, alebo nastavte tool_choice na none, keď žiadne nástroje nie sú potrebné. Nové pokyny pridávajte na koniec kontextu prostredníctvom nových správ vývojára, aby prepísali staršie pokyny. Prečítajte si naše odporúčania na správu zmien nástrojov(otvorí sa v novom okne).
Predhrejte cache a znížte latenciu. Predhriatie(otvorí sa v novom okne) vopred pripraví známy kontext, takže model môže po prijatí požiadavky začať odpovedať skôr. Aplikácia môže napríklad počas spúšťania, ešte pred prvou otázkou používateľa, predhriať spoločné pokyny, definície nástrojov alebo referenčné materiály. Spracovanie sa tak presunie mimo času, počas ktorého používateľ čaká.
Tieto voliteľné ovládacie prvky rozširujú predvolený výkon systému a pomáhajú vám prispôsobiť caching pracovnému zaťaženiu.
Sledujte mieru zásahov cache na informačnom paneli cachingu príkazov(otvorí sa v novom okne).
Preskúmajte neočakávané minutia pomocou diagnostického nástroja(otvorí sa v novom okne).
Podľa sprievodcu cachingom príkazov(otvorí sa v novom okne) vylepšite svoje nastavenie alebo použite Codex(otvorí sa v novom okne) na kontrolu kódu, zavedenie zlepšení a meranie výsledkov.


