Gå direkt till huvudinnehåll
OpenAI

22 september 2026

Produkt

Bättre promptcachning för GPT‑6

Fler cacheträffar och nya verktyg som gör beständiga agenter snabbare och billigare att köra.

Laddar …

GPT‑6 gör det möjligt för beständiga agenter att arbeta i timmar med komplexa uppgifter, från att omstrukturera kodbaser till att ta fram välunderbyggda dokument och presentationer. Applikationerna bakom dessa agenter gör en serie API-begäranden som bygger vidare på varandra och ofta för med sig samma instruktioner, verktygsdefinitioner och kontext från tidigare turer. OpenAI cachar den gemensamma kontexten så att beräkningar kan återanvändas mellan begäranden. Det kortar svarstiderna och ger utvecklare upp till 90 % rabatt på cachade indatatoken.

Med GPT‑6‑familjen lanserade vi ett förbättrat system för promptcachning som ger högre cacheträffgrad som standard. Nu ger vi cacherabatt för kvalificerade gemensamma prefix som återanvänds inom 30 minuter. Vi lanserar också nya verktyg som hjälper utvecklare att övervaka cacheprestanda, diagnostisera missar och välja hur stor del av en prompt som ska cachas.

OpenAI:s promptcachning är avgörande för att GitHub Copilot ska kunna leverera snabba och effektiva upplevelser i stor skala. Under de senaste månaderna har vi, jämfört med vår tidigare baslinje, minskat andelen prompttoken som måste bearbetas på nytt med över 50 % i miljarder begäranden till OpenAI-modeller. Resultatet är en effektivare inferensstack och kortare tid till första svar för utvecklare.
—Mario Rodriguez, produktchef

Övervaka cachning och diagnostisera cachemissar

Den nya kontrollpanelen för promptcachning(öppnas i ett nytt fönster) visar hur stor del av applikationens indata som hämtas från cachen. Följ träffgraden över tid och använd diagrammet över indatasammansättning för att jämföra cachade och ocachade token. Dessa vyer hjälper dig att upptäcka minskningar i antalet cacheträffar och bedöma hur ändringar i applikationen påverkar cacheprestandan.

Kontrollpanel för promptcachning som visar cacheträffgrad, cacheprestanda över tid och indata­tokenens sammansättning.

Om en oväntad cachemiss inträffar kan du använda diagnostikverktyget för promptcachning(öppnas i ett nytt fönster) för att förstå vad som hände. Jämför en begäran med ett nyligen mottaget svar för att identifiera ändringar i modellen, verktygen, inställningarna eller indata som förhindrade återanvändning. Det uppskattade antalet berörda token hjälper dig att bedöma påverkans omfattning och avgöra hur integreringen kan optimeras för att maximera cacheträffgraden.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Optimera cachningen för din applikation

Välj vad som ska cachas. Med explicita cachebrytpunkter kan du välja vilka promptprefix som ska återanvändas. Den uppdaterade guiden om promptcachning(öppnas i ett nytt fönster) förklarar hur du använder dem, hur länge cachade prefix kan återanvändas och hur ändringar i verktyg och indata påverkar återanvändningen.

Justera resonemangsnivån utan att bryta cachen. På GPT‑6‑modeller kan du nu ändra resonemangsnivån(öppnas i ett nytt fönster) mellan svar utan att bryta cachen. Höj nivån för en svårare uppgift eller sänk den för en rutinmässig följdfråga genom att lägga till en configuration_update, utan att ändra resonemangsnivån på begärandenivå. På så sätt kan du anpassa hur mycket resonemang en uppgift kräver och samtidigt bevara återanvändbar kontext.

Bevara cachen när verktyg och instruktioner ändras. När agentens behov av verktyg ändras bör du hålla verktygsdefinitioner, scheman och ordningsföljd stabila så att tidigare kontext förblir återanvändbar. Använd allowed_tools för att endast göra relevanta verktyg anropbara, eller ställ in tool_choice på none när inga verktyg behövs, i stället för att ta bort definitioner. Lägg till nya instruktioner mot slutet av kontexten via nya utvecklarmeddelanden för att åsidosätta äldre instruktioner. Läs vår vägledning om att hantera verktygsändringar(öppnas i ett nytt fönster).

Förvärm cachen för att minska latensen. Förvärmning(öppnas i ett nytt fönster) förbereder känd kontext i förväg så att modellen kan börja svara snabbare när en begäran kommer in. En applikation kan till exempel förvärma gemensamma instruktioner, verktygsdefinitioner eller referensmaterial vid start, innan användaren ställer sin första fråga. Då sker bearbetningen utanför användarens väntetid.

Dessa valfria kontroller bygger vidare på motorns standardprestanda och hjälper dig att anpassa cachningen efter arbetsbelastningen.

1 av 3
OpenAI:s diagnostik och kontrollpanel för promptcachning hjälpte oss att öka cacheträffgraden med några procentenheter och sänka kostnaderna med 20 %. Nu får vi aviseringar när cachningen oväntat slutar fungera och använder Codex-agenter för att fastställa grundorsaken. Med explicita brytpunkter kan vi dessutom cacha stabil kontext och samtidigt lägga innehåll som ändras ofta sist i prompten. Därmed har det blivit ekonomiskt hållbart att kopiera konversationer för bakgrundsuppgifter och samtidigt återanvända nästan all gemensam kontext.
—Arian Hanifi, teknikchef

Kom igång

Författare

OpenAI