Ugrás a fő tartalomra
OpenAI

2026. szeptember 22.

Termék

Jobb prompt-gyorsítótárazás a GPT‑6‑hoz

Magasabb gyorsítótár-találati arány és új eszközök, amelyekkel a tartós ügynökök gyorsabban, alacsonyabb költséggel működhetnek.

Betöltés…

A GPT‑6 lehetővé teszi, hogy a tartós ügynökök órákon át dolgozzanak összetett feladatokon, a kódbázisok átalakításától az alapos kutatáson alapuló dokumentumok és prezentációk elkészítéséig. Az ügynökök mögött álló alkalmazások egymásra épülő API-kéréseket küldenek, és gyakran továbbviszik a korábbi fordulók azonos utasításait, eszközdefinícióit és kontextusát. Az OpenAI gyorsítótárazza ezt a közös kontextust, így a számítások több kérésnél is újra felhasználhatók. Ez gyorsabb válaszokat és akár 90%-os kedvezményt biztosít a fejlesztőknek a gyorsítótárazott bemeneti tokenek árából.

A GPT‑6 modellcsaláddal továbbfejlesztett prompt-gyorsítótárazási rendszert vezettünk be, amely alapértelmezés szerint magasabb találati arányt biztosít. Mostantól kedvezményt adunk a gyorsítótárból azokra a jogosult közös előtagokra, amelyeket 30 percen belül újra felhasználnak. Új eszközöket is bevezetünk, amelyekkel a fejlesztők nyomon követhetik a gyorsítótár teljesítményét, feltárhatják a kihagyások okát, és megadhatják, hogy az utasítás mekkora részét kívánják gyorsítótárazni.

Az OpenAI prompt-gyorsítótárazása kulcsszerepet játszik abban, hogy a GitHub Copilot nagy léptékben is gyors és hatékony felhasználói élményt nyújtson. Az elmúlt hónapokban a korábbi alapértékhez képest több mint 50%-kal csökkentettük az új feldolgozást igénylő utasítástokenek arányát az OpenAI modelljeinek küldött több milliárd kérésben. Ennek eredménye egy hatékonyabb következtetési rendszer, valamint rövidebb várakozási idő az első válaszig a fejlesztők számára.
—Mario Rodriguez, termékigazgató

A gyorsítótárazás figyelése és a kihagyások diagnosztizálása

Az új Prompt-gyorsítótárazási irányítópult(új ablakban nyílik meg) megmutatja, hogy az alkalmazás bemenetének mekkora részét szolgálja ki a gyorsítótár. Kövesse nyomon a találati arány időbeli alakulását, a bemenet összetételét ábrázoló diagramon pedig hasonlítsa össze a gyorsítótárazott és a nem gyorsítótárazott tokeneket. Ezek a nézetek segítenek észrevenni a gyorsítótár találati arányának visszaesését, és felmérni, hogyan hatnak az alkalmazás módosításai a gyorsítótárazás teljesítményére.

Prompt-gyorsítótárazási irányítópult a gyorsítótár találati arányával, időbeli teljesítményével és a bemeneti tokenek összetételével.

Váratlan gyorsítótár-kihagyás esetén a prompt-gyorsítótárazási diagnosztikai eszközzel(új ablakban nyílik meg) derítheti ki, mi történt. Hasonlítsa össze a kérést egy közelmúltbeli válasszal, hogy azonosítsa a modell, az eszközök, a beállítások vagy a bemenet azon változásait, amelyek megakadályozták az újrafelhasználást. Az érintett tokenek becsült száma segít felmérni a hatás mértékét, és eldönteni, hogyan optimalizálható az integráció a gyorsítótár találati arányának maximalizálásához.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

A gyorsítótárazás optimalizálása az alkalmazáshoz

Válassza ki, mit kíván gyorsítótárazni. Az explicit gyorsítótár-töréspontokkal kiválaszthatja, mely utasítás-előtagokat szeretné újra felhasználni. A frissített prompt-gyorsítótárazási útmutató(új ablakban nyílik meg) bemutatja a töréspontok használatát, azt, hogy meddig maradnak jogosultak a gyorsítótárazott előtagok, valamint azt, hogyan befolyásolják az eszközök és bemenetek változásai az újrafelhasználást.

Módosítsa az érvelési ráfordítást a gyorsítótár megszakítása nélkül. A GPT‑6 modelleknél mostantól a válaszok között is módosíthatja az érvelési ráfordítást(új ablakban nyílik meg) a gyorsítótár megszakítása nélkül. Növelje a ráfordítást egy nehezebb feladathoz, vagy csökkentse egy rutinszerű utókérdéshez egy configuration_update hozzáfűzésével, miközben a kérés szintjén változatlanul hagyja az érvelési ráfordítást. Így az újrafelhasználható kontextus megőrzése mellett szabályozhatja, mennyi érvelést igényeljen a feladat.

Őrizze meg a gyorsítótárat az eszközök és utasítások változásakor. Ahogy változnak az ügynök eszközhasználati igényei, tartsa változatlanul az eszközdefiníciókat, a sémákat és a sorrendet, hogy a korábbi kontextus újra felhasználható maradjon. A definíciók eltávolítása helyett a allowed_tools használatával csak a releváns eszközöket tegye meghívhatóvá, ha pedig nincs szükség eszközökre, állítsa a tool_choice értékét none-ra. Új fejlesztői üzenetekkel fűzze az új utasításokat a kontextus végéhez, hogy felülírják a korábbiakat. Tekintse meg az eszközmódosítások kezeléséről szóló útmutatónkat(új ablakban nyílik meg).

A késés csökkentéséhez melegítse elő a gyorsítótárat. Az előmelegítés(új ablakban nyílik meg) előre előkészíti az ismert kontextust, így a modell a kérés beérkezésekor hamarabb kezdhet válaszolni. Egy alkalmazás például már indításkor, a felhasználó első kérdése előtt előmelegítheti a közös utasításokat, eszközdefiníciókat vagy referenciaanyagokat. Így a feldolgozás nem növeli a felhasználó várakozási idejét.

Ezek az opcionális vezérlők a motor alapértelmezett teljesítményére épülnek, és segítenek a gyorsítótárazást a munkaterheléshez igazítani.

1 / 3
Az OpenAI prompt-gyorsítótárazási diagnosztikája és irányítópultja néhány százalékponttal javította a gyorsítótár találati arányát, így 20%-kal csökkentek a költségeink. Most már riasztást kapunk, ha a gyorsítótárazás váratlanul megszakad, a kiváltó ok feltárásához pedig Codex-ügynököket használunk. Az explicit töréspontokkal a stabil kontextust gyorsítótárazhatjuk, miközben a gyakran változó tartalmat az utasítás végén tarthatjuk. Így gazdaságossá vált elágazásokat létrehozni a beszélgetésekből a háttérfeladatokhoz, miközben a közös kontextus szinte teljes egészét újra felhasználjuk.
—Arian Hanifi, technológiai igazgató

Első lépések

Szerző

OpenAI