Preskočite na glavno vsebino
OpenAI

22. september 2026

Izdelek

Boljše predpomnjenje pozivov za GPT‑6

Več zadetkov v predpomnilniku in nova orodja, s katerimi vztrajni agenti delujejo hitreje in z nižjimi stroški.

Nalaganje …

GPT‑6 omogoča vztrajnim agentom, da več ur opravljajo zahtevna opravila, od preoblikovanja kodnih zbirk do priprave temeljito raziskanih dokumentov in predstavitev. Aplikacije, ki poganjajo te agente, pošiljajo zaporedje zahtev API, ki se nadgrajujejo, pri tem pa pogosto ohranjajo ista navodila, definicije orodij in kontekst iz prejšnjih korakov. OpenAI ta skupni kontekst shrani v predpomnilnik, da lahko izračune znova uporabi pri različnih zahtevah, s čimer skrajša odzivni čas in razvijalcem omogoči do 90-odstotni popust za predpomnjene vhodne žetone.

Z družino GPT‑6 smo uvedli izboljšan sistem za predpomnjenje pozivov, ki že privzeto zagotavlja večji delež zadetkov v predpomnilniku. Popust za predpomnjenje zdaj velja za ustrezne skupne predpone, ki so znova uporabljene v 30 minutah. Uvajamo tudi nova orodja, s katerimi lahko razvijalci spremljajo učinkovitost predpomnilnika, ugotavljajo vzroke zgrešenih dostopov in izberejo, kolikšen del poziva naj se predpomni.

Predpomnjenje pozivov OpenAI ima ključno vlogo pri tem, da GitHub Copilot zagotavlja hitre in učinkovite izkušnje v velikem obsegu. V zadnjih nekaj mesecih smo v primerjavi s prejšnjim izhodiščem za več kot 50 % zmanjšali delež žetonov pozivov, ki jih je treba na novo obdelati pri milijardah zahtev za modele OpenAI. Rezultat sta učinkovitejši sklad za sklepanje in krajši čas do prvega odgovora za razvijalce.
—Mario Rodriguez, direktor za izdelke

Spremljajte predpomnjenje in ugotavljajte vzroke zgrešenih dostopov

Nova nadzorna plošča za predpomnjenje pozivov(odpre se v novem oknu) prikazuje, kolikšen del vhodnih podatkov aplikacije se pridobi iz predpomnilnika. Spremljajte delež zadetkov skozi čas in z grafikonom sestave vhodnih podatkov primerjajte predpomnjene in nepredpomnjene žetone. Ti prikazi vam pomagajo odkriti upad zadetkov v predpomnilniku in oceniti, kako spremembe aplikacije vplivajo na učinkovitost predpomnjenja.

Nadzorna plošča za predpomnjenje pozivov, ki prikazuje delež zadetkov, učinkovitost predpomnilnika skozi čas in sestavo vhodnih žetonov.

Ko opazite nepričakovan zgrešen dostop do predpomnilnika, z diagnostičnim orodjem za predpomnjenje pozivov(odpre se v novem oknu) ugotovite, kaj se je zgodilo. Zahtevo primerjajte z nedavnim odgovorom ter poiščite spremembe modela, orodij, nastavitev ali vhodnih podatkov, ki so preprečile ponovno uporabo. Ocenjeno število prizadetih žetonov vam pomaga presoditi obseg vpliva in se odločiti, kako optimizirati integracijo, da bo delež zadetkov v predpomnilniku čim večji.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Optimizirajte predpomnjenje za svojo aplikacijo

Izberite, kaj želite predpomniti. Z izrecnimi prekinitvenimi točkami predpomnjenja lahko izberete, katere predpone poziva želite znova uporabiti. Posodobljen vodnik za predpomnjenje pozivov(odpre se v novem oknu) pojasnjuje, kako jih uporabljati, kako dolgo predpomnjene predpone ostanejo upravičene do ponovne uporabe ter kako spremembe orodij in vhodnih podatkov vplivajo nanjo.

Prilagodite intenzivnost sklepanja, ne da bi prekinili predpomnjenje. Pri modelih GPT‑6 lahko zdaj med odgovori spreminjate intenzivnost sklepanja(odpre se v novem oknu), ne da bi prekinili predpomnjenje. Za zahtevnejše opravilo intenzivnost povečajte, za rutinsko nadaljevanje pa jo zmanjšajte tako, da dodate configuration_update, medtem ko intenzivnost sklepanja na ravni zahteve ostane nespremenjena. Tako lahko prilagodite količino sklepanja, ki jo zahteva opravilo, in obenem ohranite kontekst za ponovno uporabo.

Ohranite predpomnilnik tudi ob spremembah orodij in navodil. Ko se potrebe agenta glede uporabe orodij spreminjajo, ohranite definicije in sheme orodij ter njihov vrstni red nespremenjene, da bo prejšnji kontekst še naprej mogoče znova uporabiti. S allowed_tools omogočite klicanje samo ustreznih orodij, kadar orodja niso potrebna, pa namesto odstranjevanja definicij nastavite tool_choice na none. Z novimi sporočili razvijalca dodajte nova navodila proti koncu konteksta, da preglasijo starejša. Oglejte si naša navodila za upravljanje sprememb orodij(odpre se v novem oknu).

Vnaprej ogrejte predpomnilnik in skrajšajte zakasnitev. Vnaprejšnje ogrevanje(odpre se v novem oknu) vnaprej pripravi znani kontekst, da se lahko model ob prejemu zahteve začne hitreje odzivati. Aplikacija lahko na primer med zagonom, še preden uporabnik zastavi prvo vprašanje, vnaprej ogreje skupna navodila, definicije orodij ali referenčno gradivo. Obdelava tako ne poteka med uporabnikovim čakanjem.

Ti izbirni kontrolniki nadgrajujejo privzeto učinkovitost mehanizma in vam pomagajo prilagoditi predpomnjenje svoji delovni obremenitvi.

1 od 3
Diagnostika in nadzorna plošča za predpomnjenje pozivov OpenAI sta nam pomagali povečati delež zadetkov v predpomnilniku za nekaj odstotnih točk ter znižati stroške za 20 %. Zdaj prejmemo opozorilo, ko se predpomnjenje nepričakovano prekine, za odkrivanje temeljnega vzroka pa uporabljamo agente Codex. Izrecne prekinitvene točke nam omogočajo tudi predpomnjenje stabilnega konteksta, medtem ko vsebino, ki se pogosto spreminja, ohranimo na koncu poziva. Tako je postalo ekonomsko smiselno osamiti pogovore za opravila v ozadju in pri tem znova uporabiti skoraj ves skupni kontekst.
—Arian Hanifi, direktor tehnologije

Začnite

Avtorji

OpenAI