Memorarea mai eficientă în cache a prompturilor pentru GPT‑6
Rate mai mari de accesări reușite din cache și instrumente noi care ajută agenții persistenți să ruleze mai rapid și cu costuri mai mici.
GPT‑6 le permite agenților persistenți să lucreze ore întregi la sarcini complexe, de la refactorizarea bazelor de cod până la realizarea unor documente și prezentări documentate temeinic. Aplicațiile din spatele acestor agenți efectuează o serie de cereri API care se bazează unele pe altele și reutilizează adesea aceleași instrucțiuni, definiții ale instrumentelor și același context din interacțiunile anterioare. OpenAI memorează în cache acest context comun pentru a reutiliza calculele între cereri, reducând timpii de răspuns și oferindu-le dezvoltatorilor reduceri de până la 90% pentru tokenurile de intrare memorate în cache.
Odată cu familia GPT‑6, am lansat un sistem îmbunătățit de memorare în cache a prompturilor, care oferă implicit rate mai mari de accesări reușite din cache. Acum oferim reduceri pentru prefixele comune eligibile, reutilizate într-un interval de 30 de minute. Introducem și instrumente noi care îi ajută pe dezvoltatori să monitorizeze performanța cache-ului, să diagnosticheze ratările și să aleagă cât dintr-o solicitare să memoreze în cache.
Noul Tablou de bord pentru memorarea în cache a prompturilor(se deschide într-o fereastră nouă) arată cât din conținutul de intrare al aplicației este furnizat din cache. Urmărește în timp rata accesărilor reușite și folosește graficul componenței datelor de intrare pentru a compara tokenurile memorate și nememorate în cache. Aceste vizualizări te ajută să identifici scăderile accesărilor reușite din cache și să evaluezi modul în care modificările aplicației afectează performanța memorării în cache.

Când observi o ratare neașteptată, folosește instrumentul de diagnosticare pentru memorarea în cache a prompturilor(se deschide într-o fereastră nouă) ca să înțelegi ce s-a întâmplat. Compară o cerere cu un răspuns recent pentru a identifica modificările aduse modelului, instrumentelor, setărilor sau datelor de intrare care au împiedicat reutilizarea. Numărul estimat de tokenuri afectate te ajută să evaluezi amploarea impactului și să decizi cum îți poți optimiza integrarea pentru a maximiza rata accesărilor reușite din cache.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Alege ce memorezi în cache. Punctele explicite de întrerupere a memoriei cache îți permit să alegi ce prefixe ale solicitării să reutilizezi. Ghidul actualizat despre memorarea în cache a prompturilor(se deschide într-o fereastră nouă) explică modul de utilizare a acestora, perioada în care prefixele din cache rămân eligibile și felul în care modificările aduse instrumentelor și datelor de intrare afectează reutilizarea.
Ajustează efortul de raţionament fără a invalida memoria cache. Pe modelele GPT‑6, acum poți modifica efortul de raţionament(se deschide într-o fereastră nouă) între răspunsuri fără a invalida memoria cache. Mărește efortul pentru o sarcină mai dificilă sau redu-l pentru o continuare de rutină, adăugând un configuration_update și lăsând neschimbat efortul de raţionament la nivelul cererii. Astfel, poți ajusta efortul de raţionament necesar unei sarcini, păstrând totodată contextul reutilizabil.
Păstrează memoria cache când instrumentele și instrucțiunile se schimbă. Pe măsură ce se schimbă nevoile agentului privind utilizarea instrumentelor, păstrează stabile definițiile, schemele și ordinea acestora, astfel încât contextul anterior să rămână reutilizabil. Folosește allowed_tools pentru a permite apelarea doar a instrumentelor relevante sau setează tool_choice la none când nu este necesar niciun instrument, în loc să elimini definițiile. Folosește mesaje noi pentru dezvoltatori ca să adaugi instrucțiuni noi spre sfârșitul contextului, înlocuindu-le pe cele mai vechi. Consultă recomandările noastre pentru gestionarea modificărilor instrumentelor(se deschide într-o fereastră nouă).
Preîncălzește memoria cache pentru a reduce latența. Preîncălzirea(se deschide într-o fereastră nouă) pregătește din timp contextul cunoscut, astfel încât modelul să poată începe să răspundă mai repede la sosirea unei cereri. De exemplu, la pornire și înainte ca utilizatorul să adreseze prima întrebare, o aplicație poate preîncălzi instrucțiunile comune, definițiile instrumentelor sau materialele de referință. Astfel, procesarea nu mai are loc în timpul de așteptare al utilizatorului.
Aceste opțiuni de control se bazează pe performanța implicită a motorului și te ajută să adaptezi memorarea în cache la volumul tău de lucru.
Monitorizează rata accesărilor reușite din cache în Tabloul de bord pentru memorarea în cache a prompturilor(se deschide într-o fereastră nouă).
Investighează ratările neașteptate cu instrumentul de diagnosticare(se deschide într-o fereastră nouă).
Urmează ghidul pentru memorarea în cache a prompturilor(se deschide într-o fereastră nouă) ca să-ți îmbunătățești configurația sau folosește Codex(se deschide într-o fereastră nouă) pentru a-ți analiza codul, a aplica îmbunătățiri și a măsura rezultatele.


