Betere promptcaching voor GPT‑6
Meer cachetreffers en nieuwe tools waarmee persistente agenten sneller en goedkoper werken.
Met GPT‑6 kunnen persistente agenten urenlang aan complexe taken werken, van het herstructureren van codebases tot het maken van goed onderbouwde documenten en presentaties. De applicaties achter deze agenten voeren een reeks API-verzoeken uit die op elkaar voortbouwen en nemen daarbij vaak dezelfde instructies, tooldefinities en context uit eerdere beurten over. OpenAI cachet die gedeelde context om berekeningen voor meerdere verzoeken te hergebruiken. Dit verkort de reactietijd en geeft ontwikkelaars tot 90% korting op gecachte invoertokens.
Met de GPT‑6‑familie hebben we een verbeterd systeem voor promptcaching geïntroduceerd dat standaard hogere cache-hitpercentages biedt. We geven nu cachekorting voor geschikte gedeelde voorvoegsels die binnen een periode van 30 minuten opnieuw worden gebruikt. Daarnaast introduceren we nieuwe tools waarmee ontwikkelaars de cacheprestaties kunnen bewaken, cachemissers kunnen onderzoeken en kunnen bepalen welk deel van een prompt wordt gecachet.
Het nieuwe dashboard voor promptcaching(opent in een nieuw venster) laat zien welk deel van de invoer van je applicatie uit de cache wordt geleverd. Volg het cache-hitpercentage in de loop van de tijd en gebruik de grafiek met de invoersamenstelling om gecachte en niet-gecachete tokens te vergelijken. Met deze overzichten kun je dalingen in het aantal cachetreffers opsporen en beoordelen hoe wijzigingen in je applicatie de cacheprestaties beïnvloeden.

Zie je een onverwachte cachemisser, gebruik dan de diagnostische tool voor promptcaching(opent in een nieuw venster) om te achterhalen wat er is gebeurd. Vergelijk een verzoek met een recent antwoord om wijzigingen in het model, de tools, instellingen of invoer te vinden die hergebruik hebben verhinderd. Het geschatte aantal betrokken tokens helpt je de omvang van de gevolgen te beoordelen en te bepalen hoe je de integratie kunt optimaliseren voor een zo hoog mogelijk cache-hitpercentage.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Kies wat je cachet. Met expliciete cachebreekpunten kies je welke promptvoorvoegsels opnieuw worden gebruikt. In de vernieuwde handleiding voor promptcaching(opent in een nieuw venster) lees je hoe je deze gebruikt, hoelang gecachte voorvoegsels in aanmerking blijven komen en hoe wijzigingen in tools en invoer het hergebruik beïnvloeden.
Pas de redeneringsinspanning aan zonder de cache te onderbreken. Bij GPT‑6‑modellen kun je nu de redeneringsinspanning wijzigen(opent in een nieuw venster) tussen antwoorden zonder de cache te onderbreken. Verhoog de inspanning voor een moeilijkere taak of verlaag die voor een routinematige vervolgvraag door een configuration_update toe te voegen, terwijl de redeneringsinspanning op verzoekniveau ongewijzigd blijft. Zo kun je de benodigde hoeveelheid redenering voor een taak aanpassen en tegelijk herbruikbare context behouden.
Behoud de cache wanneer tools en instructies veranderen. Als de behoeften rond het toolgebruik van je agent veranderen, houd je de tooldefinities, schema's en volgorde stabiel, zodat eerdere context herbruikbaar blijft. Gebruik allowed_tools om alleen de relevante tools aanroepbaar te maken, of stel tool_choice in op none als er geen tools nodig zijn, in plaats van definities te verwijderen. Gebruik nieuwe ontwikkelaarsberichten om nieuwe instructies aan het einde van de context toe te voegen en oudere instructies te overschrijven. Bekijk onze richtlijnen voor het beheren van toolwijzigingen(opent in een nieuw venster).
Warm de cache vooraf op om de latentie te verlagen. Met vooraf opwarmen(opent in een nieuw venster) wordt bekende context vooraf voorbereid, zodat het model sneller kan reageren wanneer een verzoek binnenkomt. Een applicatie kan bijvoorbeeld tijdens het opstarten gedeelde instructies, tooldefinities of referentiemateriaal vooraf opwarmen, voordat de gebruiker de eerste vraag stelt. Daardoor valt deze verwerking buiten de wachttijd van de gebruiker.
Deze optionele instellingen bouwen voort op de standaardprestaties van de engine en helpen je caching af te stemmen op je werklast.
Bewaak cache-hitpercentages in het dashboard voor promptcaching(opent in een nieuw venster).
Onderzoek onverwachte cachemissers met de diagnostische tool(opent in een nieuw venster).
Volg de handleiding voor promptcaching(opent in een nieuw venster) om je configuratie te verbeteren, of gebruik Codex(opent in een nieuw venster) om je code te beoordelen, verbeteringen toe te passen en de resultaten te meten.


