Bedre promptcaching for GPT‑6
Flere hurtigbuffertreff og nye verktøy som gjør vedvarende agenter raskere og rimeligere i drift.
GPT‑6 gjør at vedvarende agenter kan arbeide i timevis med komplekse oppgaver, fra refaktorering av kodebaser til utarbeiding av grundig dokumenterte dokumenter og presentasjoner. Applikasjonene bak disse agentene sender en rekke API-forespørsler som bygger på hverandre, ofte med de samme instruksjonene, verktøydefinisjonene og konteksten fra tidligere utvekslinger. OpenAI bufrer denne delte konteksten for å gjenbruke beregninger på tvers av forespørsler. Det reduserer svartiden og gir utviklere opptil 90 % rabatt på bufrede inndatatokener.
Med GPT‑6‑familien lanserte vi et forbedret system for promptcaching som gir høyere treffprosent i hurtigbufferen som standard. Nå gir vi rabatt på kvalifiserte, delte prefikser som gjenbrukes innenfor et tidsvindu på 30 minutter. Vi lanserer også nye verktøy som hjelper utviklere med å overvåke hurtigbufferens ytelse, diagnostisere bom og velge hvor mye av en prompt som skal bufres.
Det nye dashbordet for promptcaching(åpnes i et nytt vindu) viser hvor mye av applikasjonens inndata som hentes fra hurtigbufferen. Følg treffprosenten over tid, og bruk diagrammet for inndatasammensetning til å sammenligne bufrede og ikke-bufrede tokener. Disse visningene gjør det enklere å oppdage fall i antall hurtigbuffertreff og vurdere hvordan endringer i applikasjonen påvirker bufringsytelsen.

Når du oppdager et uventet bom i hurtigbufferen, kan du bruke diagnostikkverktøyet for promptcaching(åpnes i et nytt vindu) til å finne ut hva som skjedde. Sammenlign en forespørsel med et nylig svar for å finne endringer i modellen, verktøyene, innstillingene eller inndataene som hindret gjenbruk. Det anslåtte antallet berørte tokener hjelper deg med å vurdere omfanget og finne ut hvordan integrasjonen kan optimaliseres for flest mulig hurtigbuffertreff.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Velg hva som skal bufres. Med eksplisitte bruddpunkter i hurtigbufferen kan du velge hvilke promptprefikser som skal gjenbrukes. Den oppdaterte veiledningen for promptcaching(åpnes i et nytt vindu) forklarer hvordan de brukes, hvor lenge bufrede prefikser kan gjenbrukes, og hvordan endringer i verktøy og inndata påvirker gjenbruken.
Juster resonneringsinnsatsen uten å bryte hurtigbufferen. På GPT‑6‑modeller kan du nå endre resonneringsinnsatsen(åpnes i et nytt vindu) mellom svar uten å bryte hurtigbufferen. Øk innsatsen for en vanskeligere oppgave, eller reduser den for en rutinemessig oppfølging, ved å legge til en configuration_update uten å endre resonneringsinnsatsen på forespørselsnivå. Dermed kan du tilpasse hvor mye resonnering en oppgave krever, samtidig som den gjenbrukbare konteksten bevares.
Bevar hurtigbufferen når verktøy og instruksjoner endres. Når agentens behov for verktøybruk endres, bør du holde verktøydefinisjoner, skjemaer og rekkefølge stabile, slik at tidligere kontekst fortsatt kan gjenbrukes. Bruk allowed_tools til å gjøre bare de relevante verktøyene tilgjengelige for kall, eller sett tool_choice til none når ingen verktøy trengs, i stedet for å fjerne definisjonene. Bruk nye utviklermeldinger til å legge til nye instruksjoner mot slutten av konteksten, slik at de overstyrer eldre instruksjoner. Se veiledningen vår om håndtering av verktøyendringer(åpnes i et nytt vindu).
Forvarm hurtigbufferen for å redusere ventetiden. Forvarming(åpnes i et nytt vindu) klargjør kjent kontekst på forhånd, slik at modellen kan begynne å svare raskere når en forespørsel kommer. En applikasjon kan for eksempel forvarme delte instruksjoner, verktøydefinisjoner eller referansemateriale ved oppstart, før brukeren stiller sitt første spørsmål. Dermed utføres behandlingen før brukeren begynner å vente.
Disse valgfrie kontrollene bygger videre på motorens standardytelse og hjelper deg med å tilpasse bufringen til arbeidsmengden.
Overvåk treffprosenten i dashbordet for promptcaching(åpnes i et nytt vindu).
Undersøk uventede bom med diagnostikkverktøyet(åpnes i et nytt vindu).
Følg veiledningen for promptcaching(åpnes i et nytt vindu) for å forbedre oppsettet, eller bruk Codex(åpnes i et nytt vindu) til å gjennomgå koden, utføre forbedringer og måle resultatene.


