Overslaan naar hoofdinhoud
OpenAI

22 september 2026

Product

Betere promptcaching voor GPT‑6

Meer cachetreffers en nieuwe tools waarmee persistente agenten sneller en goedkoper werken.

Bezig met laden...

Met GPT‑6 kunnen persistente agenten urenlang aan complexe taken werken, van het herstructureren van codebases tot het maken van goed onderbouwde documenten en presentaties. De applicaties achter deze agenten voeren een reeks API-verzoeken uit die op elkaar voortbouwen en nemen daarbij vaak dezelfde instructies, tooldefinities en context uit eerdere beurten over. OpenAI cachet die gedeelde context om berekeningen voor meerdere verzoeken te hergebruiken. Dit verkort de reactietijd en geeft ontwikkelaars tot 90% korting op gecachte invoertokens.

Met de GPT‑6‑familie hebben we een verbeterd systeem voor promptcaching geïntroduceerd dat standaard hogere cache-hitpercentages biedt. We geven nu cachekorting voor geschikte gedeelde voorvoegsels die binnen een periode van 30 minuten opnieuw worden gebruikt. Daarnaast introduceren we nieuwe tools waarmee ontwikkelaars de cacheprestaties kunnen bewaken, cachemissers kunnen onderzoeken en kunnen bepalen welk deel van een prompt wordt gecachet.

De promptcaching van OpenAI speelt een cruciale rol bij het vermogen van GitHub Copilot om op grote schaal snelle, efficiënte ervaringen te bieden. De afgelopen maanden hebben we, ten opzichte van onze eerdere uitgangswaarde, het aandeel prompttokens dat opnieuw moest worden verwerkt met meer dan 50% verlaagd voor miljarden verzoeken aan OpenAI-modellen. Het resultaat is een efficiëntere inferentiestack en een kortere wachttijd tot de eerste reactie voor ontwikkelaars.
—Mario Rodriguez, Chief Product Officer

Caching bewaken en cachemissers onderzoeken

Het nieuwe dashboard voor promptcaching(opent in een nieuw venster) laat zien welk deel van de invoer van je applicatie uit de cache wordt geleverd. Volg het cache-hitpercentage in de loop van de tijd en gebruik de grafiek met de invoersamenstelling om gecachte en niet-gecachete tokens te vergelijken. Met deze overzichten kun je dalingen in het aantal cachetreffers opsporen en beoordelen hoe wijzigingen in je applicatie de cacheprestaties beïnvloeden.

Dashboard voor promptcaching met het cache-hitpercentage, de cacheprestaties in de loop van de tijd en de samenstelling van invoertokens.

Zie je een onverwachte cachemisser, gebruik dan de diagnostische tool voor promptcaching(opent in een nieuw venster) om te achterhalen wat er is gebeurd. Vergelijk een verzoek met een recent antwoord om wijzigingen in het model, de tools, instellingen of invoer te vinden die hergebruik hebben verhinderd. Het geschatte aantal betrokken tokens helpt je de omvang van de gevolgen te beoordelen en te bepalen hoe je de integratie kunt optimaliseren voor een zo hoog mogelijk cache-hitpercentage.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Caching voor je applicatie optimaliseren

Kies wat je cachet. Met expliciete cachebreekpunten kies je welke promptvoorvoegsels opnieuw worden gebruikt. In de vernieuwde handleiding voor promptcaching(opent in een nieuw venster) lees je hoe je deze gebruikt, hoelang gecachte voorvoegsels in aanmerking blijven komen en hoe wijzigingen in tools en invoer het hergebruik beïnvloeden.

Pas de redeneringsinspanning aan zonder de cache te onderbreken. Bij GPT‑6‑modellen kun je nu de redeneringsinspanning wijzigen(opent in een nieuw venster) tussen antwoorden zonder de cache te onderbreken. Verhoog de inspanning voor een moeilijkere taak of verlaag die voor een routinematige vervolgvraag door een configuration_update toe te voegen, terwijl de redeneringsinspanning op verzoekniveau ongewijzigd blijft. Zo kun je de benodigde hoeveelheid redenering voor een taak aanpassen en tegelijk herbruikbare context behouden.

Behoud de cache wanneer tools en instructies veranderen. Als de behoeften rond het toolgebruik van je agent veranderen, houd je de tooldefinities, schema's en volgorde stabiel, zodat eerdere context herbruikbaar blijft. Gebruik allowed_tools om alleen de relevante tools aanroepbaar te maken, of stel tool_choice in op none als er geen tools nodig zijn, in plaats van definities te verwijderen. Gebruik nieuwe ontwikkelaarsberichten om nieuwe instructies aan het einde van de context toe te voegen en oudere instructies te overschrijven. Bekijk onze richtlijnen voor het beheren van toolwijzigingen(opent in een nieuw venster).

Warm de cache vooraf op om de latentie te verlagen. Met vooraf opwarmen(opent in een nieuw venster) wordt bekende context vooraf voorbereid, zodat het model sneller kan reageren wanneer een verzoek binnenkomt. Een applicatie kan bijvoorbeeld tijdens het opstarten gedeelde instructies, tooldefinities of referentiemateriaal vooraf opwarmen, voordat de gebruiker de eerste vraag stelt. Daardoor valt deze verwerking buiten de wachttijd van de gebruiker.

Deze optionele instellingen bouwen voort op de standaardprestaties van de engine en helpen je caching af te stemmen op je werklast.

1 van 3
De diagnostiek en het dashboard voor promptcaching van OpenAI hielpen ons het cache-hitpercentage met enkele procentpunten te verhogen, waardoor de kosten met 20% daalden. We krijgen nu meldingen wanneer caching onverwacht wordt onderbroken en gebruiken Codex-agenten om de hoofdoorzaak vast te stellen. Met expliciete breekpunten kunnen we bovendien stabiele context cachen en vaak veranderende inhoud aan het einde van de prompt houden. Daardoor is het economisch haalbaar geworden om voor achtergrondtaken een fork van gesprekken te maken en vrijwel de volledige gedeelde context opnieuw te gebruiken.
—Arian Hanifi, Chief Technology Officer

Aan de slag

Auteurs

OpenAI