Bättre promptcachning för GPT‑6
Fler cacheträffar och nya verktyg som gör beständiga agenter snabbare och billigare att köra.
GPT‑6 gör det möjligt för beständiga agenter att arbeta i timmar med komplexa uppgifter, från att omstrukturera kodbaser till att ta fram välunderbyggda dokument och presentationer. Applikationerna bakom dessa agenter gör en serie API-begäranden som bygger vidare på varandra och ofta för med sig samma instruktioner, verktygsdefinitioner och kontext från tidigare turer. OpenAI cachar den gemensamma kontexten så att beräkningar kan återanvändas mellan begäranden. Det kortar svarstiderna och ger utvecklare upp till 90 % rabatt på cachade indatatoken.
Med GPT‑6‑familjen lanserade vi ett förbättrat system för promptcachning som ger högre cacheträffgrad som standard. Nu ger vi cacherabatt för kvalificerade gemensamma prefix som återanvänds inom 30 minuter. Vi lanserar också nya verktyg som hjälper utvecklare att övervaka cacheprestanda, diagnostisera missar och välja hur stor del av en prompt som ska cachas.
Den nya kontrollpanelen för promptcachning(öppnas i ett nytt fönster) visar hur stor del av applikationens indata som hämtas från cachen. Följ träffgraden över tid och använd diagrammet över indatasammansättning för att jämföra cachade och ocachade token. Dessa vyer hjälper dig att upptäcka minskningar i antalet cacheträffar och bedöma hur ändringar i applikationen påverkar cacheprestandan.

Om en oväntad cachemiss inträffar kan du använda diagnostikverktyget för promptcachning(öppnas i ett nytt fönster) för att förstå vad som hände. Jämför en begäran med ett nyligen mottaget svar för att identifiera ändringar i modellen, verktygen, inställningarna eller indata som förhindrade återanvändning. Det uppskattade antalet berörda token hjälper dig att bedöma påverkans omfattning och avgöra hur integreringen kan optimeras för att maximera cacheträffgraden.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Välj vad som ska cachas. Med explicita cachebrytpunkter kan du välja vilka promptprefix som ska återanvändas. Den uppdaterade guiden om promptcachning(öppnas i ett nytt fönster) förklarar hur du använder dem, hur länge cachade prefix kan återanvändas och hur ändringar i verktyg och indata påverkar återanvändningen.
Justera resonemangsnivån utan att bryta cachen. På GPT‑6‑modeller kan du nu ändra resonemangsnivån(öppnas i ett nytt fönster) mellan svar utan att bryta cachen. Höj nivån för en svårare uppgift eller sänk den för en rutinmässig följdfråga genom att lägga till en configuration_update, utan att ändra resonemangsnivån på begärandenivå. På så sätt kan du anpassa hur mycket resonemang en uppgift kräver och samtidigt bevara återanvändbar kontext.
Bevara cachen när verktyg och instruktioner ändras. När agentens behov av verktyg ändras bör du hålla verktygsdefinitioner, scheman och ordningsföljd stabila så att tidigare kontext förblir återanvändbar. Använd allowed_tools för att endast göra relevanta verktyg anropbara, eller ställ in tool_choice på none när inga verktyg behövs, i stället för att ta bort definitioner. Lägg till nya instruktioner mot slutet av kontexten via nya utvecklarmeddelanden för att åsidosätta äldre instruktioner. Läs vår vägledning om att hantera verktygsändringar(öppnas i ett nytt fönster).
Förvärm cachen för att minska latensen. Förvärmning(öppnas i ett nytt fönster) förbereder känd kontext i förväg så att modellen kan börja svara snabbare när en begäran kommer in. En applikation kan till exempel förvärma gemensamma instruktioner, verktygsdefinitioner eller referensmaterial vid start, innan användaren ställer sin första fråga. Då sker bearbetningen utanför användarens väntetid.
Dessa valfria kontroller bygger vidare på motorns standardprestanda och hjälper dig att anpassa cachningen efter arbetsbelastningen.
Övervaka cacheträffgraden i kontrollpanelen för promptcachning(öppnas i ett nytt fönster).
Undersök oväntade missar med diagnostikverktyget(öppnas i ett nytt fönster).
Följ guiden om promptcachning(öppnas i ett nytt fönster) för att förbättra konfigurationen, eller använd Codex(öppnas i ett nytt fönster) för att granska koden, genomföra förbättringar och mäta resultaten.


