Salta al contingut principal
OpenAI

22 de setembre del 2026

Producte

Millor emmagatzematge en memòria cau d'indicacions per a GPT‑6

Més encerts de memòria cau i eines noves perquè els agents persistents funcionin més de pressa i amb menys costos.

S'està carregant…

GPT‑6 permet que els agents persistents treballin durant hores en tasques complexes, des de refactoritzar bases de codi fins a crear documents i presentacions ben documentats. Les aplicacions que hi ha darrere d'aquests agents fan una sèrie de sol·licituds a l'API que es basen les unes en les altres i que sovint reutilitzen les mateixes instruccions, definicions d'eines i context d'interaccions anteriors. OpenAI desa aquest context compartit en memòria cau per reutilitzar el càlcul entre sol·licituds, reduir els temps de resposta i oferir als desenvolupadors descomptes de fins al 90 % en els segments textuals d'entrada desats en memòria cau.

Amb la família GPT‑6, hem llançat un sistema millorat d'emmagatzematge en memòria cau d'indicacions que ofereix, per defecte, una taxa d'encerts més alta. Ara oferim descomptes de memòria cau per als prefixos compartits aptes que es reutilitzin en un interval de 30 minuts. També presentem eines noves perquè els desenvolupadors puguin supervisar el rendiment de la memòria cau, diagnosticar errors i triar quina part d'una indicació volen desar-hi.

L'emmagatzematge en memòria cau d'indicacions d'OpenAI és fonamental perquè GitHub Copilot ofereixi experiències ràpides i eficients a gran escala. Durant els darrers mesos, hem reduït més d'un 50 % la proporció de segments textuals d'indicació que requereixen un processament nou en milers de milions de sol·licituds als models d'OpenAI, respecte del valor de referència anterior. El resultat és una infraestructura d'inferència més eficient i una primera resposta més ràpida per als desenvolupadors.
Mario Rodriguez, director de Producte

Supervisa l'emmagatzematge en memòria cau i diagnostica'n els errors

El nou Tauler d'emmagatzematge en memòria cau d'indicacions(s'obre en una finestra nova) mostra quina part de l'entrada de l'aplicació se serveix des de la memòria cau. Fes un seguiment de la taxa d'encerts al llarg del temps i utilitza el gràfic de composició de l'entrada per comparar els segments textuals desats i no desats en memòria cau. Aquestes vistes t'ajuden a detectar davallades dels encerts de memòria cau i a avaluar com afecten el rendiment de l'emmagatzematge en memòria cau els canvis a l'aplicació.

Tauler d'emmagatzematge en memòria cau d'indicacions que mostra la taxa d'encerts, el rendiment de la memòria cau al llarg del temps i la composició dels segments d'entrada.

Quan detectis un error inesperat de memòria cau, utilitza l'eina de diagnòstic de l'emmagatzematge en memòria cau d'indicacions(s'obre en una finestra nova) per entendre què ha passat. Compara una sol·licitud amb una resposta recent per identificar canvis al model, les eines, la configuració o l'entrada que hagin impedit reutilitzar-la. El nombre estimat de segments textuals afectats t'ajuda a valorar la magnitud de l'impacte i a decidir com pots optimitzar la integració per maximitzar la taxa d'encerts de memòria cau.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Optimitza l'emmagatzematge en memòria cau per a la teva aplicació

Tria què vols desar en memòria cau. Els punts d'interrupció explícits de la memòria cau et permeten triar quins prefixos de la indicació vols reutilitzar. La guia actualitzada d'emmagatzematge en memòria cau d'indicacions(s'obre en una finestra nova) explica com es poden utilitzar, quant de temps continuen sent aptes els prefixos desats i com afecten la reutilització els canvis a les eines i les entrades.

Ajusta l'esforç de raonament sense invalidar la memòria cau. Als models GPT‑6, ara pots canviar l'esforç de raonament(s'obre en una finestra nova) entre respostes sense invalidar la memòria cau. Augmenta l'esforç per a una tasca més difícil o redueix-lo per a un seguiment rutinari afegint un configuration_update i mantenint sense canvis l'esforç de raonament de la sol·licitud. Això et permet ajustar el raonament que necessita una tasca i conservar alhora el context reutilitzable.

Conserva la memòria cau quan canviïn les eines i les instruccions. A mesura que canviïn les necessitats d'ús d'eines de l'agent, mantén estables les definicions, els esquemes i l'ordre de les eines perquè el context anterior continuï sent reutilitzable. Utilitza allowed_tools perquè només es puguin cridar les eines pertinents, o defineix tool_choice com a none quan no calgui cap eina, en comptes d'eliminar-ne les definicions. Utilitza missatges de desenvolupador nous per afegir instruccions noves cap al final del context i substituir les anteriors. Consulta les nostres recomanacions per gestionar els canvis d'eines(s'obre en una finestra nova).

Preescalfeu la memòria cau per reduir la latència. El preescalfament(s'obre en una finestra nova) prepara amb antelació el context conegut perquè el model pugui començar a respondre abans quan arribi una sol·licitud. Per exemple, una aplicació pot preescalfar les instruccions compartides, les definicions d'eines o el material de referència durant l'inici, abans que l'usuari faci la primera pregunta. Això evita que el processament formi part del temps d'espera de l'usuari.

Aquests controls opcionals complementen el rendiment predeterminat del motor i t'ajuden a adaptar l'emmagatzematge en memòria cau a la teva càrrega de treball.

1 de 3
Els diagnòstics i el tauler d'emmagatzematge en memòria cau d'indicacions d'OpenAI ens van ajudar a augmentar uns quants punts percentuals la taxa d'encerts de memòria cau i a reduir els costos un 20 %. Ara rebem alertes quan l'emmagatzematge en memòria cau falla inesperadament i fem servir agents del Codex per diagnosticar-ne la causa principal. Els punts d'interrupció explícits també ens permeten desar en memòria cau el context estable i mantenir al final de la indicació el contingut que canvia sovint. Això ha fet econòmicament viable bifurcar converses per a tasques en segon pla i reutilitzar gairebé tot el context compartit.
Arian Hanifi, director de Recnologia

Comença

Autor

OpenAI