Gå til hovedindhold
OpenAI

22. september 2026

Produkt

Bedre prompt caching til GPT‑6

Flere cachetræf og nye værktøjer, der hjælper vedvarende agenter med at køre hurtigere og billigere.

Indlæser ...

GPT‑6 gør det muligt for vedvarende agenter at arbejde i timevis på komplekse opgaver – fra refaktorering af kodebaser til udarbejdelse af veldokumenterede dokumenter og præsentationer. Applikationerne bag disse agenter foretager en række API-anmodninger, der bygger videre på hinanden og ofte viderefører de samme instruktioner, værktøjsdefinitioner og kontekst fra tidligere interaktioner. OpenAI cachelagrer den fælles kontekst, så beregninger kan genbruges på tværs af anmodninger. Det reducerer svartiden og giver udviklere op til 90 % rabat på cachelagrede inputtokens.

Med GPT‑6‑familien lancerede vi et forbedret system til prompt caching, som som standard giver en højere cachetræfprocent. Vi giver nu cacherabat på kvalificerede fælles præfikser, der genbruges inden for et tidsrum på 30 minutter. Vi introducerer også nye værktøjer, der hjælper udviklere med at overvåge cacheydelsen, diagnosticere cache-miss og vælge, hvor stor en del af en prompt der skal cachelagres.

OpenAI's prompt caching spiller en afgørende rolle i GitHub Copilots levering af hurtige og effektive oplevelser i stor skala. I løbet af de seneste måneder har vi reduceret andelen af prompttokens, der kræver ny behandling, med over 50 % på tværs af milliarder af anmodninger til OpenAI-modeller sammenlignet med vores tidligere udgangspunkt. Resultatet er en mere effektiv inferensstak og kortere tid til første svar for udviklere.
—Mario Rodriguez, produktdirektør

Overvåg cachelagring, og diagnosticer cache-miss

Det nye dashboard til prompt caching(åbner i et nyt vindue) viser, hvor stor en del af din applikations input der leveres fra cachen. Følg cachetræfprocenten over tid, og brug diagrammet over inputsammensætningen til at sammenligne cachelagrede og ikke-cachelagrede tokens. Disse visninger hjælper dig med at opdage fald i antallet af cachetræf og vurdere, hvordan ændringer i din applikation påvirker cacheydelsen.

Dashboard til prompt caching, der viser cachetræfprocent, cacheydelse over tid og sammensætningen af inputtokens.

Når du ser et uventet cache-miss, kan du bruge diagnosticeringsværktøjet til prompt caching(åbner i et nyt vindue) til at forstå, hvad der skete. Sammenlign en anmodning med et nyligt svar for at finde ændringer i modellen, værktøjerne, indstillingerne eller inputtet, som forhindrede genbrug. Det anslåede antal berørte tokens hjælper dig med at vurdere konsekvensernes omfang og beslutte, hvordan du kan optimere integrationen for at opnå flest mulige cachetræf.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Optimer cachelagringen til din applikation

Vælg, hvad der skal cachelagres. Med eksplicitte cachebrydepunkter kan du vælge, hvilke promptpræfikser der skal genbruges. Den opdaterede vejledning til prompt caching(åbner i et nyt vindue) forklarer, hvordan de bruges, hvor længe cachelagrede præfikser kan genbruges, og hvordan ændringer i værktøjer og input påvirker genbrugen.

Juster ræsonneringsindsatsen uden at bryde cachen. På GPT‑6‑modeller kan du nu ændre ræsonneringsindsatsen(åbner i et nyt vindue) mellem svar uden at bryde cachen. Øg indsatsen ved en sværere opgave, eller sænk den ved en rutinemæssig opfølgning ved at tilføje en configuration_update, mens ræsonneringsindsatsen på anmodningsniveau forbliver uændret. På den måde kan du tilpasse, hvor meget ræsonnering en opgave kræver, uden at miste kontekst, der kan genbruges.

Bevar cachen, når værktøjer og instruktioner ændres. Når din agents behov for værktøjer ændrer sig, skal du holde værktøjsdefinitioner, skemaer og rækkefølge stabile, så tidligere kontekst fortsat kan genbruges. Brug allowed_tools til kun at gøre de relevante værktøjer tilgængelige for kald, eller indstil tool_choice til none, når der ikke er brug for værktøjer, i stedet for at fjerne definitioner. Brug nye udviklermeddelelser til at føje nye instruktioner til slutningen af konteksten, så de tilsidesætter ældre instruktioner. Se vores vejledning i håndtering af værktøjsændringer(åbner i et nyt vindue).

Forvarm cachen for at reducere ventetiden. Forvarmning(åbner i et nyt vindue) klargør kendt kontekst på forhånd, så modellen kan begynde at svare hurtigere, når en anmodning modtages. En applikation kan eksempelvis forvarme fælles instruktioner, værktøjsdefinitioner eller referencemateriale under opstarten, før brugeren stiller sit første spørgsmål. Dermed flyttes behandlingen væk fra brugerens ventetid.

Disse valgfrie styringsmuligheder bygger videre på systemets standardydelse og hjælper dig med at tilpasse cachelagringen til din arbejdsbelastning.

1 af 3
OpenAI's diagnosticering og dashboard til prompt caching hjalp os med at øge cachetræfprocenten med nogle få procentpoint og reducere omkostningerne med 20 %. Vi får nu advarsler, når cachelagringen uventet holder op med at virke, og bruger Codex-agenter til at diagnosticere den bagvedliggende årsag. Med eksplicitte brydepunkter kan vi også cachelagre stabil kontekst og samtidig placere indhold, der ofte ændres, sidst i prompten. Det har gjort det økonomisk rentabelt at dele samtaler op i kopier til baggrundsopgaver og samtidig genbruge næsten hele den fælles kontekst.
—Arian Hanifi, teknologidirektør

Kom i gang

Forfatter

OpenAI