Přeskoč na hlavní obsah
OpenAI

22. září 2026

Produkt

Lepší ukládání promptů do mezipaměti pro GPT‑6

Vyšší míra úspěšných přístupů a nové nástroje, díky nimž trvalí agenti pracují rychleji a levněji.

Načítání…

GPT‑6 umožňuje trvalým agentům pracovat celé hodiny na složitých úlohách, od refaktoringu kódových základen až po tvorbu důkladně zpracovaných dokumentů a prezentací. Aplikace, na kterých tito agenti běží, odesílají sérii navazujících požadavků API a často přenášejí stejné pokyny, definice nástrojů a kontext z předchozích kol. OpenAI tento sdílený kontext ukládá do mezipaměti, aby bylo možné výpočty opakovaně využívat napříč požadavky. Tím zkracuje dobu odezvy a vývojářům nabízí až 90% slevu na vstupní tokeny z mezipaměti.

S rodinou GPT‑6 jsme spustili vylepšený systém ukládání promptů do mezipaměti, který již ve výchozím nastavení dosahuje vyšší míry úspěšných přístupů. Slevu za využití mezipaměti nyní poskytujeme u způsobilých sdílených prefixů, které se znovu použijí během 30 minut. Představujeme také nové nástroje, které vývojářům pomohou sledovat výkon mezipaměti, diagnostikovat minutí a zvolit, jak velkou část promptu do ní uložit.

Ukládání promptů do mezipaměti od OpenAI zásadně pomáhá službě GitHub Copilot poskytovat rychlé a efektivní prostředí ve velkém měřítku. Za posledních několik měsíců jsme oproti předchozí výchozí úrovni snížili o více než 50 % podíl tokenů promptu, které je nutné zpracovat znovu, a to napříč miliardami požadavků na modely OpenAI. Výsledkem je efektivnější inferenční infrastruktura a kratší doba do první odpovědi pro vývojáře.
—Mario Rodriguez, produktový ředitel

Sledujte ukládání do mezipaměti a diagnostikujte minutí

Nový Panel ukládání promptů do mezipaměti(otevře se v novém okně) ukazuje, jaká část vstupu vaší aplikace se načítá z mezipaměti. Sledujte vývoj míry úspěšných přístupů v čase a pomocí grafu skladby vstupu porovnávejte tokeny uložené a neuložené v mezipaměti. Tyto přehledy vám pomohou odhalit poklesy míry úspěšných přístupů a vyhodnotit, jak změny aplikace ovlivňují výkon ukládání do mezipaměti.

Panel ukládání promptů do mezipaměti zobrazující míru úspěšných přístupů, vývoj výkonu mezipaměti v čase a skladbu vstupních tokenů.

Pokud zaznamenáte neočekávané minutí mezipaměti, zjistěte příčinu pomocí diagnostického nástroje pro ukládání promptů do mezipaměti(otevře se v novém okně). Porovnejte požadavek s nedávnou odpovědí a zjistěte, které změny modelu, nástrojů, nastavení nebo vstupu zabránily opětovnému použití. Odhadovaný počet dotčených tokenů vám pomůže posoudit rozsah dopadu a rozhodnout, jak integraci optimalizovat, abyste maximalizovali míru úspěšných přístupů do mezipaměti.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Optimalizujte ukládání do mezipaměti pro svou aplikaci

Zvolte, co chcete ukládat do mezipaměti. Explicitní body přerušení mezipaměti umožňují zvolit, které prefixy promptu se mají opakovaně používat. Aktualizovaný průvodce ukládáním promptů do mezipaměti(otevře se v novém okně) vysvětluje, jak je používat, jak dlouho lze uložené prefixy opakovaně využívat a jak jejich využití ovlivňují změny nástrojů a vstupů.

Upravujte míru uvažování bez narušení mezipaměti. U modelů GPT‑6 nyní můžete mezi odpověďmi měnit míru uvažování(otevře se v novém okně), aniž byste narušili mezipaměť. U náročnější úlohy míru zvyšte a u běžného doplňujícího požadavku ji snižte připojením configuration_update, aniž byste měnili míru uvažování na úrovni požadavku. Můžete tak upravit rozsah uvažování potřebný pro danou úlohu a zároveň zachovat opakovaně použitelný kontext.

Zachovejte mezipaměť i při změnách nástrojů a pokynů. Když se mění potřeby vašeho agenta při používání nástrojů, zachovejte stabilní definice, schémata a pořadí nástrojů, aby bylo možné dřívější kontext nadále používat. Místo odstraňování definic použijte allowed_tools, aby bylo možné volat pouze relevantní nástroje, nebo nastavte tool_choice na none, pokud žádné nástroje nepotřebujete. Nové pokyny přidávejte pomocí nových zpráv vývojáře na konec kontextu, aby přepsaly ty starší. Přečtěte si naše pokyny ke správě změn nástrojů(otevře se v novém okně).

Předehřejte mezipaměť a zkraťte latenci. Předehřátí(otevře se v novém okně) připraví známý kontext předem, takže model může po přijetí požadavku začít odpovídat dříve. Aplikace může například při spuštění, ještě než uživatel položí první otázku, předehřát sdílené pokyny, definice nástrojů nebo referenční materiály. Zpracování tak proběhne mimo dobu, kdy uživatel čeká.

Tyto volitelné ovládací prvky rozšiřují výchozí možnosti systému a pomáhají přizpůsobit ukládání do mezipaměti vašemu pracovnímu zatížení.

1 z 3
Diagnostika ukládání promptů do mezipaměti a přehledový panel od OpenAI nám pomohly zvýšit míru úspěšných přístupů o několik procentních bodů a snížit náklady o 20 %. Když se ukládání do mezipaměti nečekaně přeruší, dostaneme nyní upozornění a hlavní příčinu diagnostikujeme pomocí agentů Codex. Explicitní body přerušení nám také umožňují ukládat stabilní kontext do mezipaměti a často se měnící obsah ponechat na konci promptu. Díky tomu se ekonomicky vyplatí větvit konverzace pro úlohy na pozadí a zároveň opakovaně využívat téměř celý sdílený kontext.
—Arian Hanifi, technický ředitel

Začínáme