Preskočite na glavni sadržaj
OpenAI

22. septembar 2026.

Product

Bolje keširanje promptova za GPT‑6

Više stope pogodaka u kešu i novi alati koji trajnim agentima omogućavaju brži rad uz niže troškove.

Učitavanje…

GPT‑6 omogućava trajnim agentima da satima rade na složenim zadacima, od refaktoriranja baza koda do izrade temeljito istraženih dokumenata i prezentacija. Aplikacije koje pokreću ove agente šalju niz međusobno povezanih API zahtjeva, često prenoseći iste upute, definicije alata i kontekst iz prethodnih koraka. OpenAI kešira taj zajednički kontekst kako bi ponovo koristio izračune u različitim zahtjevima, skratio vrijeme odgovora i programerima omogućio popust do 90% na keširane ulazne tokene.

S porodicom GPT‑6 predstavili smo poboljšani sistem keširanja promptova koji podrazumijevano ostvaruje više stope pogodaka u kešu. Sada odobravamo popuste za prihvatljive zajedničke prefikse koji se ponovo koriste unutar perioda od 30 minuta. Predstavljamo i nove alate koji programerima pomažu da prate performanse keša, dijagnosticiraju promašaje i odaberu koji dio upita žele keširati.

Keširanje promptova kompanije OpenAI ima ključnu ulogu u tome da GitHub Copilot pruža brza i efikasna iskustva u velikom obimu. Tokom proteklih nekoliko mjeseci smanjili smo za više od 50% udio tokena upita koji zahtijevaju novu obradu u milijardama zahtjeva prema OpenAI modelima, u odnosu na našu prethodnu polaznu vrijednost. Rezultat su efikasniji sistem za inferenciju i kraće vrijeme do prvog odgovora za programere.
—Mario Rodriguez, direktor proizvoda

Pratite keširanje i dijagnosticirajte promašaje keša

Nova Kontrolna tabla za keširanje promptova(otvara se u novom prozoru) prikazuje koliki se dio ulaznih podataka vaše aplikacije poslužuje iz keša. Pratite stope pogodaka tokom vremena i koristite grafikon sastava ulaznih podataka da uporedite keširane i nekeširane tokene. Ovi prikazi pomažu vam da uočite pad stope pogodaka u kešu i procijenite kako promjene u aplikaciji utječu na performanse keširanja.

Kontrolna tabla za keširanje promptova prikazuje stopu pogodaka u kešu, performanse keša tokom vremena i sastav ulaznih tokena.

Kada uočite neočekivani promašaj keša, upotrijebite alat za dijagnostiku keširanja promptova(otvara se u novom prozoru) da saznate šta se dogodilo. Uporedite zahtjev s nedavnim odgovorom kako biste utvrdili koje su promjene modela, alata, postavki ili ulaznih podataka spriječile ponovnu upotrebu. Procijenjeni broj zahvaćenih tokena pomaže vam da procijenite razmjere utjecaja i odlučite kako optimizirati integraciju da biste povećali stopu pogodaka u kešu.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Optimizirajte keširanje za svoju aplikaciju

Odaberite šta želite keširati. Eksplicitne prijelomne tačke keša omogućavaju vam da odaberete koje ćete prefikse upita ponovo koristiti. Ažurirani vodič za keširanje promptova(otvara se u novom prozoru) objašnjava kako ih koristiti, koliko dugo keširani prefiksi ostaju prihvatljivi i kako promjene alata i ulaznih podataka utječu na ponovnu upotrebu.

Prilagodite intenzitet rezonovanja bez prekidanja keša. Na GPT‑6 modelima sada možete mijenjati intenzitet rezonovanja(otvara se u novom prozoru) između odgovora bez prekidanja keša. Povećajte intenzitet za teži zadatak ili ga smanjite za rutinsko dodatno pitanje dodavanjem vrijednosti configuration_update, a da pritom intenzitet rezonovanja na nivou zahtjeva ostane nepromijenjen. Tako možete prilagoditi količinu rezonovanja potrebnu za zadatak, a istovremeno sačuvati kontekst za ponovnu upotrebu.

Sačuvajte keš dok se alati i upute mijenjaju. Kako se potrebe vašeg agenta za korištenjem alata mijenjaju, održavajte definicije, sheme i redoslijed alata stabilnim kako bi raniji kontekst ostao pogodan za ponovnu upotrebu. Koristite allowed_tools da omogućite pozivanje samo relevantnih alata ili postavite tool_choice na none kada alati nisu potrebni, umjesto uklanjanja definicija. Koristite nove poruke programera da pri kraju konteksta dodate nove upute koje će zamijeniti starije. Pogledajte naše smjernice za upravljanje promjenama alata(otvara se u novom prozoru).

Unaprijed zagrijte keš da biste smanjili kašnjenje. Unaprijed zagrijavanje(otvara se u novom prozoru) priprema poznati kontekst prije vremena kako bi model mogao ranije početi odgovarati kada zahtjev stigne. Naprimjer, aplikacija tokom pokretanja može unaprijed zagrijati zajedničke upute, definicije alata ili referentni materijal, prije nego što korisnik postavi prvo pitanje. Time se obrada izmješta iz vremena koje korisnik provodi čekajući.

Ove opcionalne kontrole nadograđuju podrazumijevane performanse sistema i pomažu vam da keširanje prilagodite svom radnom opterećenju.

1 od 3
Dijagnostika i kontrolna tabla kompanije OpenAI za keširanje promptova pomogle su nam da stopu pogodaka u kešu povećamo za nekoliko postotnih bodova i smanjimo troškove za 20%. Sada primamo upozorenja kada se keširanje neočekivano prekine i koristimo Codex agente da utvrdimo osnovni uzrok. Eksplicitne prijelomne tačke omogućavaju nam i da keširamo stabilan kontekst, a sadržaj koji se često mijenja zadržimo na kraju upita. Zahvaljujući tome, fork razgovora za pozadinske zadatke postao je ekonomski isplativ, uz ponovnu upotrebu gotovo cijelog zajedničkog konteksta.
—Arian Hanifi, direktor tehnologije

Započnite

Autor

OpenAI