Bedre prompt caching til GPT‑6
Flere cachetræf og nye værktøjer, der hjælper vedvarende agenter med at køre hurtigere og billigere.
GPT‑6 gør det muligt for vedvarende agenter at arbejde i timevis på komplekse opgaver – fra refaktorering af kodebaser til udarbejdelse af veldokumenterede dokumenter og præsentationer. Applikationerne bag disse agenter foretager en række API-anmodninger, der bygger videre på hinanden og ofte viderefører de samme instruktioner, værktøjsdefinitioner og kontekst fra tidligere interaktioner. OpenAI cachelagrer den fælles kontekst, så beregninger kan genbruges på tværs af anmodninger. Det reducerer svartiden og giver udviklere op til 90 % rabat på cachelagrede inputtokens.
Med GPT‑6‑familien lancerede vi et forbedret system til prompt caching, som som standard giver en højere cachetræfprocent. Vi giver nu cacherabat på kvalificerede fælles præfikser, der genbruges inden for et tidsrum på 30 minutter. Vi introducerer også nye værktøjer, der hjælper udviklere med at overvåge cacheydelsen, diagnosticere cache-miss og vælge, hvor stor en del af en prompt der skal cachelagres.
Det nye dashboard til prompt caching(åbner i et nyt vindue) viser, hvor stor en del af din applikations input der leveres fra cachen. Følg cachetræfprocenten over tid, og brug diagrammet over inputsammensætningen til at sammenligne cachelagrede og ikke-cachelagrede tokens. Disse visninger hjælper dig med at opdage fald i antallet af cachetræf og vurdere, hvordan ændringer i din applikation påvirker cacheydelsen.

Når du ser et uventet cache-miss, kan du bruge diagnosticeringsværktøjet til prompt caching(åbner i et nyt vindue) til at forstå, hvad der skete. Sammenlign en anmodning med et nyligt svar for at finde ændringer i modellen, værktøjerne, indstillingerne eller inputtet, som forhindrede genbrug. Det anslåede antal berørte tokens hjælper dig med at vurdere konsekvensernes omfang og beslutte, hvordan du kan optimere integrationen for at opnå flest mulige cachetræf.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Vælg, hvad der skal cachelagres. Med eksplicitte cachebrydepunkter kan du vælge, hvilke promptpræfikser der skal genbruges. Den opdaterede vejledning til prompt caching(åbner i et nyt vindue) forklarer, hvordan de bruges, hvor længe cachelagrede præfikser kan genbruges, og hvordan ændringer i værktøjer og input påvirker genbrugen.
Juster ræsonneringsindsatsen uden at bryde cachen. På GPT‑6‑modeller kan du nu ændre ræsonneringsindsatsen(åbner i et nyt vindue) mellem svar uden at bryde cachen. Øg indsatsen ved en sværere opgave, eller sænk den ved en rutinemæssig opfølgning ved at tilføje en configuration_update, mens ræsonneringsindsatsen på anmodningsniveau forbliver uændret. På den måde kan du tilpasse, hvor meget ræsonnering en opgave kræver, uden at miste kontekst, der kan genbruges.
Bevar cachen, når værktøjer og instruktioner ændres. Når din agents behov for værktøjer ændrer sig, skal du holde værktøjsdefinitioner, skemaer og rækkefølge stabile, så tidligere kontekst fortsat kan genbruges. Brug allowed_tools til kun at gøre de relevante værktøjer tilgængelige for kald, eller indstil tool_choice til none, når der ikke er brug for værktøjer, i stedet for at fjerne definitioner. Brug nye udviklermeddelelser til at føje nye instruktioner til slutningen af konteksten, så de tilsidesætter ældre instruktioner. Se vores vejledning i håndtering af værktøjsændringer(åbner i et nyt vindue).
Forvarm cachen for at reducere ventetiden. Forvarmning(åbner i et nyt vindue) klargør kendt kontekst på forhånd, så modellen kan begynde at svare hurtigere, når en anmodning modtages. En applikation kan eksempelvis forvarme fælles instruktioner, værktøjsdefinitioner eller referencemateriale under opstarten, før brugeren stiller sit første spørgsmål. Dermed flyttes behandlingen væk fra brugerens ventetid.
Disse valgfrie styringsmuligheder bygger videre på systemets standardydelse og hjælper dig med at tilpasse cachelagringen til din arbejdsbelastning.
Overvåg cachetræfprocenten i dashboardet til prompt caching(åbner i et nyt vindue).
Undersøg uventede cache-miss med diagnosticeringsværktøjet(åbner i et nyt vindue).
Følg vejledningen til prompt caching(åbner i et nyt vindue) for at forbedre din opsætning, eller brug Codex(åbner i et nyt vindue) til at gennemgå din kode, implementere forbedringer og måle resultaterne.


