Boljše predpomnjenje pozivov za GPT‑6
Več zadetkov v predpomnilniku in nova orodja, s katerimi vztrajni agenti delujejo hitreje in z nižjimi stroški.
GPT‑6 omogoča vztrajnim agentom, da več ur opravljajo zahtevna opravila, od preoblikovanja kodnih zbirk do priprave temeljito raziskanih dokumentov in predstavitev. Aplikacije, ki poganjajo te agente, pošiljajo zaporedje zahtev API, ki se nadgrajujejo, pri tem pa pogosto ohranjajo ista navodila, definicije orodij in kontekst iz prejšnjih korakov. OpenAI ta skupni kontekst shrani v predpomnilnik, da lahko izračune znova uporabi pri različnih zahtevah, s čimer skrajša odzivni čas in razvijalcem omogoči do 90-odstotni popust za predpomnjene vhodne žetone.
Z družino GPT‑6 smo uvedli izboljšan sistem za predpomnjenje pozivov, ki že privzeto zagotavlja večji delež zadetkov v predpomnilniku. Popust za predpomnjenje zdaj velja za ustrezne skupne predpone, ki so znova uporabljene v 30 minutah. Uvajamo tudi nova orodja, s katerimi lahko razvijalci spremljajo učinkovitost predpomnilnika, ugotavljajo vzroke zgrešenih dostopov in izberejo, kolikšen del poziva naj se predpomni.
Nova nadzorna plošča za predpomnjenje pozivov(odpre se v novem oknu) prikazuje, kolikšen del vhodnih podatkov aplikacije se pridobi iz predpomnilnika. Spremljajte delež zadetkov skozi čas in z grafikonom sestave vhodnih podatkov primerjajte predpomnjene in nepredpomnjene žetone. Ti prikazi vam pomagajo odkriti upad zadetkov v predpomnilniku in oceniti, kako spremembe aplikacije vplivajo na učinkovitost predpomnjenja.

Ko opazite nepričakovan zgrešen dostop do predpomnilnika, z diagnostičnim orodjem za predpomnjenje pozivov(odpre se v novem oknu) ugotovite, kaj se je zgodilo. Zahtevo primerjajte z nedavnim odgovorom ter poiščite spremembe modela, orodij, nastavitev ali vhodnih podatkov, ki so preprečile ponovno uporabo. Ocenjeno število prizadetih žetonov vam pomaga presoditi obseg vpliva in se odločiti, kako optimizirati integracijo, da bo delež zadetkov v predpomnilniku čim večji.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Izberite, kaj želite predpomniti. Z izrecnimi prekinitvenimi točkami predpomnjenja lahko izberete, katere predpone poziva želite znova uporabiti. Posodobljen vodnik za predpomnjenje pozivov(odpre se v novem oknu) pojasnjuje, kako jih uporabljati, kako dolgo predpomnjene predpone ostanejo upravičene do ponovne uporabe ter kako spremembe orodij in vhodnih podatkov vplivajo nanjo.
Prilagodite intenzivnost sklepanja, ne da bi prekinili predpomnjenje. Pri modelih GPT‑6 lahko zdaj med odgovori spreminjate intenzivnost sklepanja(odpre se v novem oknu), ne da bi prekinili predpomnjenje. Za zahtevnejše opravilo intenzivnost povečajte, za rutinsko nadaljevanje pa jo zmanjšajte tako, da dodate configuration_update, medtem ko intenzivnost sklepanja na ravni zahteve ostane nespremenjena. Tako lahko prilagodite količino sklepanja, ki jo zahteva opravilo, in obenem ohranite kontekst za ponovno uporabo.
Ohranite predpomnilnik tudi ob spremembah orodij in navodil. Ko se potrebe agenta glede uporabe orodij spreminjajo, ohranite definicije in sheme orodij ter njihov vrstni red nespremenjene, da bo prejšnji kontekst še naprej mogoče znova uporabiti. S allowed_tools omogočite klicanje samo ustreznih orodij, kadar orodja niso potrebna, pa namesto odstranjevanja definicij nastavite tool_choice na none. Z novimi sporočili razvijalca dodajte nova navodila proti koncu konteksta, da preglasijo starejša. Oglejte si naša navodila za upravljanje sprememb orodij(odpre se v novem oknu).
Vnaprej ogrejte predpomnilnik in skrajšajte zakasnitev. Vnaprejšnje ogrevanje(odpre se v novem oknu) vnaprej pripravi znani kontekst, da se lahko model ob prejemu zahteve začne hitreje odzivati. Aplikacija lahko na primer med zagonom, še preden uporabnik zastavi prvo vprašanje, vnaprej ogreje skupna navodila, definicije orodij ali referenčno gradivo. Obdelava tako ne poteka med uporabnikovim čakanjem.
Ti izbirni kontrolniki nadgrajujejo privzeto učinkovitost mehanizma in vam pomagajo prilagoditi predpomnjenje svoji delovni obremenitvi.
Delež zadetkov v predpomnilniku spremljajte na nadzorni plošči za predpomnjenje pozivov(odpre se v novem oknu).
Nepričakovane zgrešene dostope raziščite z diagnostičnim orodjem(odpre se v novem oknu).
Upoštevajte vodnik za predpomnjenje pozivov(odpre se v novem oknu) in izboljšajte svojo nastavitev ali pa uporabite Codex(odpre se v novem oknu) za pregled kode, uvedbo izboljšav in merjenje rezultatov.


