Jobb prompt-gyorsítótárazás a GPT‑6‑hoz
Magasabb gyorsítótár-találati arány és új eszközök, amelyekkel a tartós ügynökök gyorsabban, alacsonyabb költséggel működhetnek.
A GPT‑6 lehetővé teszi, hogy a tartós ügynökök órákon át dolgozzanak összetett feladatokon, a kódbázisok átalakításától az alapos kutatáson alapuló dokumentumok és prezentációk elkészítéséig. Az ügynökök mögött álló alkalmazások egymásra épülő API-kéréseket küldenek, és gyakran továbbviszik a korábbi fordulók azonos utasításait, eszközdefinícióit és kontextusát. Az OpenAI gyorsítótárazza ezt a közös kontextust, így a számítások több kérésnél is újra felhasználhatók. Ez gyorsabb válaszokat és akár 90%-os kedvezményt biztosít a fejlesztőknek a gyorsítótárazott bemeneti tokenek árából.
A GPT‑6 modellcsaláddal továbbfejlesztett prompt-gyorsítótárazási rendszert vezettünk be, amely alapértelmezés szerint magasabb találati arányt biztosít. Mostantól kedvezményt adunk a gyorsítótárból azokra a jogosult közös előtagokra, amelyeket 30 percen belül újra felhasználnak. Új eszközöket is bevezetünk, amelyekkel a fejlesztők nyomon követhetik a gyorsítótár teljesítményét, feltárhatják a kihagyások okát, és megadhatják, hogy az utasítás mekkora részét kívánják gyorsítótárazni.
Az új Prompt-gyorsítótárazási irányítópult(új ablakban nyílik meg) megmutatja, hogy az alkalmazás bemenetének mekkora részét szolgálja ki a gyorsítótár. Kövesse nyomon a találati arány időbeli alakulását, a bemenet összetételét ábrázoló diagramon pedig hasonlítsa össze a gyorsítótárazott és a nem gyorsítótárazott tokeneket. Ezek a nézetek segítenek észrevenni a gyorsítótár találati arányának visszaesését, és felmérni, hogyan hatnak az alkalmazás módosításai a gyorsítótárazás teljesítményére.

Váratlan gyorsítótár-kihagyás esetén a prompt-gyorsítótárazási diagnosztikai eszközzel(új ablakban nyílik meg) derítheti ki, mi történt. Hasonlítsa össze a kérést egy közelmúltbeli válasszal, hogy azonosítsa a modell, az eszközök, a beállítások vagy a bemenet azon változásait, amelyek megakadályozták az újrafelhasználást. Az érintett tokenek becsült száma segít felmérni a hatás mértékét, és eldönteni, hogyan optimalizálható az integráció a gyorsítótár találati arányának maximalizálásához.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Válassza ki, mit kíván gyorsítótárazni. Az explicit gyorsítótár-töréspontokkal kiválaszthatja, mely utasítás-előtagokat szeretné újra felhasználni. A frissített prompt-gyorsítótárazási útmutató(új ablakban nyílik meg) bemutatja a töréspontok használatát, azt, hogy meddig maradnak jogosultak a gyorsítótárazott előtagok, valamint azt, hogyan befolyásolják az eszközök és bemenetek változásai az újrafelhasználást.
Módosítsa az érvelési ráfordítást a gyorsítótár megszakítása nélkül. A GPT‑6 modelleknél mostantól a válaszok között is módosíthatja az érvelési ráfordítást(új ablakban nyílik meg) a gyorsítótár megszakítása nélkül. Növelje a ráfordítást egy nehezebb feladathoz, vagy csökkentse egy rutinszerű utókérdéshez egy configuration_update hozzáfűzésével, miközben a kérés szintjén változatlanul hagyja az érvelési ráfordítást. Így az újrafelhasználható kontextus megőrzése mellett szabályozhatja, mennyi érvelést igényeljen a feladat.
Őrizze meg a gyorsítótárat az eszközök és utasítások változásakor. Ahogy változnak az ügynök eszközhasználati igényei, tartsa változatlanul az eszközdefiníciókat, a sémákat és a sorrendet, hogy a korábbi kontextus újra felhasználható maradjon. A definíciók eltávolítása helyett a allowed_tools használatával csak a releváns eszközöket tegye meghívhatóvá, ha pedig nincs szükség eszközökre, állítsa a tool_choice értékét none-ra. Új fejlesztői üzenetekkel fűzze az új utasításokat a kontextus végéhez, hogy felülírják a korábbiakat. Tekintse meg az eszközmódosítások kezeléséről szóló útmutatónkat(új ablakban nyílik meg).
A késés csökkentéséhez melegítse elő a gyorsítótárat. Az előmelegítés(új ablakban nyílik meg) előre előkészíti az ismert kontextust, így a modell a kérés beérkezésekor hamarabb kezdhet válaszolni. Egy alkalmazás például már indításkor, a felhasználó első kérdése előtt előmelegítheti a közös utasításokat, eszközdefiníciókat vagy referenciaanyagokat. Így a feldolgozás nem növeli a felhasználó várakozási idejét.
Ezek az opcionális vezérlők a motor alapértelmezett teljesítményére épülnek, és segítenek a gyorsítótárazást a munkaterheléshez igazítani.
Kövesse nyomon a gyorsítótár találati arányát a Prompt-gyorsítótárazási irányítópulton(új ablakban nyílik meg).
Vizsgálja ki a váratlan kihagyásokat a diagnosztikai eszközzel(új ablakban nyílik meg).
Kövesse a prompt-gyorsítótárazási útmutatót(új ablakban nyílik meg) a konfiguráció javításához, vagy használja a Codexet(új ablakban nyílik meg) a kód ellenőrzéséhez, a fejlesztések alkalmazásához és az eredmények méréséhez.


