Sari la conținutul principal
OpenAI

22 septembrie 2026

Produs

Memorarea mai eficientă în cache a prompturilor pentru GPT‑6

Rate mai mari de accesări reușite din cache și instrumente noi care ajută agenții persistenți să ruleze mai rapid și cu costuri mai mici.

Se încarcă…

GPT‑6 le permite agenților persistenți să lucreze ore întregi la sarcini complexe, de la refactorizarea bazelor de cod până la realizarea unor documente și prezentări documentate temeinic. Aplicațiile din spatele acestor agenți efectuează o serie de cereri API care se bazează unele pe altele și reutilizează adesea aceleași instrucțiuni, definiții ale instrumentelor și același context din interacțiunile anterioare. OpenAI memorează în cache acest context comun pentru a reutiliza calculele între cereri, reducând timpii de răspuns și oferindu-le dezvoltatorilor reduceri de până la 90% pentru tokenurile de intrare memorate în cache.

Odată cu familia GPT‑6, am lansat un sistem îmbunătățit de memorare în cache a prompturilor, care oferă implicit rate mai mari de accesări reușite din cache. Acum oferim reduceri pentru prefixele comune eligibile, reutilizate într-un interval de 30 de minute. Introducem și instrumente noi care îi ajută pe dezvoltatori să monitorizeze performanța cache-ului, să diagnosticheze ratările și să aleagă cât dintr-o solicitare să memoreze în cache.

Memorarea în cache a prompturilor oferită de OpenAI este esențială pentru ca GitHub Copilot să asigure experiențe rapide și eficiente la scară largă. În ultimele luni, am redus cu peste 50%, față de nivelul de referință anterior, ponderea tokenurilor solicitărilor care necesită procesare nouă în miliardele de cereri trimise modelelor OpenAI. Rezultatul este o infrastructură de inferență mai eficientă și un timp mai scurt până la primul răspuns pentru dezvoltatori.
—Mario Rodriguez, director de produs

Monitorizează memorarea în cache și diagnostichează ratările

Noul Tablou de bord pentru memorarea în cache a prompturilor(se deschide într-o fereastră nouă) arată cât din conținutul de intrare al aplicației este furnizat din cache. Urmărește în timp rata accesărilor reușite și folosește graficul componenței datelor de intrare pentru a compara tokenurile memorate și nememorate în cache. Aceste vizualizări te ajută să identifici scăderile accesărilor reușite din cache și să evaluezi modul în care modificările aplicației afectează performanța memorării în cache.

Tablou de bord pentru memorarea în cache a prompturilor, care afișează rata accesărilor reușite, performanța cache-ului în timp și componența tokenurilor de intrare.

Când observi o ratare neașteptată, folosește instrumentul de diagnosticare pentru memorarea în cache a prompturilor(se deschide într-o fereastră nouă) ca să înțelegi ce s-a întâmplat. Compară o cerere cu un răspuns recent pentru a identifica modificările aduse modelului, instrumentelor, setărilor sau datelor de intrare care au împiedicat reutilizarea. Numărul estimat de tokenuri afectate te ajută să evaluezi amploarea impactului și să decizi cum îți poți optimiza integrarea pentru a maximiza rata accesărilor reușite din cache.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Optimizează memorarea în cache pentru aplicația ta

Alege ce memorezi în cache. Punctele explicite de întrerupere a memoriei cache îți permit să alegi ce prefixe ale solicitării să reutilizezi. Ghidul actualizat despre memorarea în cache a prompturilor(se deschide într-o fereastră nouă) explică modul de utilizare a acestora, perioada în care prefixele din cache rămân eligibile și felul în care modificările aduse instrumentelor și datelor de intrare afectează reutilizarea.

Ajustează efortul de raţionament fără a invalida memoria cache. Pe modelele GPT‑6, acum poți modifica efortul de raţionament(se deschide într-o fereastră nouă) între răspunsuri fără a invalida memoria cache. Mărește efortul pentru o sarcină mai dificilă sau redu-l pentru o continuare de rutină, adăugând un configuration_update și lăsând neschimbat efortul de raţionament la nivelul cererii. Astfel, poți ajusta efortul de raţionament necesar unei sarcini, păstrând totodată contextul reutilizabil.

Păstrează memoria cache când instrumentele și instrucțiunile se schimbă. Pe măsură ce se schimbă nevoile agentului privind utilizarea instrumentelor, păstrează stabile definițiile, schemele și ordinea acestora, astfel încât contextul anterior să rămână reutilizabil. Folosește allowed_tools pentru a permite apelarea doar a instrumentelor relevante sau setează tool_choice la none când nu este necesar niciun instrument, în loc să elimini definițiile. Folosește mesaje noi pentru dezvoltatori ca să adaugi instrucțiuni noi spre sfârșitul contextului, înlocuindu-le pe cele mai vechi. Consultă recomandările noastre pentru gestionarea modificărilor instrumentelor(se deschide într-o fereastră nouă).

Preîncălzește memoria cache pentru a reduce latența. Preîncălzirea(se deschide într-o fereastră nouă) pregătește din timp contextul cunoscut, astfel încât modelul să poată începe să răspundă mai repede la sosirea unei cereri. De exemplu, la pornire și înainte ca utilizatorul să adreseze prima întrebare, o aplicație poate preîncălzi instrucțiunile comune, definițiile instrumentelor sau materialele de referință. Astfel, procesarea nu mai are loc în timpul de așteptare al utilizatorului.

Aceste opțiuni de control se bazează pe performanța implicită a motorului și te ajută să adaptezi memorarea în cache la volumul tău de lucru.

1 din 3
Instrumentele de diagnosticare și tabloul de bord OpenAI pentru memorarea în cache a prompturilor ne-au ajutat să creștem cu câteva puncte procentuale rata accesărilor reușite din cache, reducând costurile cu 20%. Acum primim alerte când memorarea în cache se întrerupe neașteptat și folosim agenți Codex pentru a diagnostica sursa problemei. Punctele explicite de întrerupere ne permit și să memorăm în cache contextul stabil, păstrând la sfârșitul solicitării conținutul care se schimbă frecvent. Astfel, a devenit rentabil să facem fork conversațiilor pentru activități de fundal, reutilizând aproape integral contextul comun.
—Arian Hanifi, director tehnic

Începe acum

Autor

OpenAI