Lumaktaw sa pangunahing content
OpenAI

Setyembre 22, 2026

Produkto

Mas mahusay na prompt caching para sa GPT‑6

Mas matataas na cache hit rate at mga bagong tool upang mas mabilis at mas matipid na tumakbo ang mga persistent agent.

Naglo-load…

Binibigyang-daan ng GPT‑6 ang mga persistent agent na magtrabaho nang ilang oras sa mga kumplikadong gawain, mula sa pag-refactor ng mga codebase hanggang sa paggawa ng masusing sinaliksik na mga dokumento at presentasyon. Sunod-sunod na API request ang ginagawa ng mga application sa likod ng mga agent na ito, kung saan nakabatay ang bawat isa sa nauna at madalas na ginagamit muli ang parehong mga tagubilin, depinisyon ng tool, at konteksto mula sa mga naunang turn. Kino-cache ng OpenAI ang pinagsasaluhang kontekstong iyon upang muling magamit ang computation sa iba’t ibang request, na nagpapabilis sa pagtugon at nagbibigay sa mga developer ng hanggang 90% diskuwento sa mga naka-cache na input token.

Kasabay ng pamilya ng GPT‑6, inilunsad namin ang pinahusay na prompt caching system na nagbibigay ng mas matataas na cache hit rate bilang default. Nagbibigay na kami ngayon ng mga diskuwento sa cache para sa mga kwalipikadong pinagsasaluhang prefix na muling ginagamit sa loob ng 30 minuto. Naglulunsad din kami ng mga bagong tool upang tulungan ang mga developer na subaybayan ang performance ng cache, tukuyin ang sanhi ng mga miss, at piliin kung gaano kalaking bahagi ng prompt ang ika-cache.

Mahalaga ang prompt caching ng OpenAI sa pagtulong sa GitHub Copilot na makapaghatid ng mabilis at mahusay na karanasan sa malawakang paggamit. Sa nakalipas na ilang buwan, nabawasan namin nang mahigit 50% ang bahagi ng mga token ng prompt na kailangang muling iproseso sa bilyun-bilyong request sa mga modelo ng OpenAI, kumpara sa dati naming baseline. Ang resulta ay mas mahusay na inference stack at mas mabilis na unang tugon para sa mga developer.
—Mario Rodriguez, Punong Opisyal ng Produkto

Subaybayan ang caching at tukuyin ang sanhi ng mga cache miss

Ipinapakita ng bagong Dashboard ng Prompt Caching(magbubukas sa bagong window) kung gaano kalaking bahagi ng input ng iyong application ang nagmumula sa cache. Subaybayan ang mga hit rate sa paglipas ng panahon at gamitin ang chart ng komposisyon ng input upang ihambing ang mga naka-cache at hindi naka-cache na token. Tinutulungan ka ng mga view na ito na makita ang pagbaba ng mga cache hit at suriin kung paano nakaaapekto sa performance ng caching ang mga pagbabago sa iyong application.

Dashboard ng prompt caching na nagpapakita ng cache hit rate, performance ng cache sa paglipas ng panahon, at komposisyon ng mga input token.

Kapag may nakita kang hindi inaasahang cache miss, gamitin ang diagnostic tool ng prompt caching(magbubukas sa bagong window) upang maunawaan kung ano ang nangyari. Ihambing ang isang request sa kamakailang tugon upang matukoy ang mga pagbabago sa modelo, mga tool, setting, o input na humadlang sa muling paggamit. Tinutulungan ka ng tinatayang bilang ng mga apektadong token na suriin ang laki ng epekto at magpasya kung paano io-optimize ang iyong integration upang mapataas nang husto ang mga cache hit rate.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

I-optimize ang caching para sa iyong application

Piliin kung ano ang ika-cache. Hinahayaan ka ng mga tahasang cache breakpoint na piliin kung aling mga prefix ng prompt ang muling gagamitin. Ipinapaliwanag ng na-update na gabay sa prompt caching(magbubukas sa bagong window) kung paano gamitin ang mga ito, gaano katagal nananatiling kwalipikado ang mga naka-cache na prefix, at paano nakaaapekto sa muling paggamit ang mga pagbabago sa mga tool at input.

Ayusin ang pagsisikap sa pangangatwiran nang hindi sinisira ang cache. Sa mga modelo ng GPT‑6, maaari mo na ngayong baguhin ang pagsisikap sa pangangatwiran(magbubukas sa bagong window) sa pagitan ng mga tugon nang hindi sinisira ang cache. Dagdagan ang pagsisikap para sa mas mahirap na gawain o bawasan ito para sa karaniwang follow-up sa pamamagitan ng pagdaragdag ng configuration_update, habang hindi binabago ang pagsisikap sa pangangatwiran sa antas ng request. Hinahayaan ka nitong ayusin kung gaano karaming pangangatwiran ang kailangan ng isang gawain habang pinananatili ang kontekstong maaaring muling gamitin.

Panatilihin ang cache habang nagbabago ang mga tool at tagubilin. Habang nagbabago ang mga pangangailangan sa paggamit ng tool ng iyong agent, panatilihing hindi nagbabago ang mga depinisyon, schema, at pagkakasunod-sunod ng tool upang muling magamit ang naunang konteksto. Gamitin ang allowed_tools upang ang mga nauugnay na tool lang ang maaaring tawagin, o itakda ang tool_choice sa none kapag walang kailangang tool, sa halip na alisin ang mga depinisyon. Gumamit ng mga bagong developer message upang idagdag ang mga bagong tagubilin sa dulo ng konteksto at manaig ang mga ito sa mas lumang tagubilin. Tingnan ang aming gabay sa pamamahala ng mga pagbabago sa tool(magbubukas sa bagong window).

I-prewarm ang cache upang mabawasan ang latency. Inihahanda nang maaga ng prewarming(magbubukas sa bagong window) ang kilalang konteksto upang mas maagang makapagsimulang tumugon ang modelo kapag dumating ang isang request. Halimbawa, maaaring i-prewarm ng isang application ang mga pinagsasaluhang tagubilin, depinisyon ng tool, o materyal na sanggunian habang nagsisimula ito, bago itanong ng user ang unang tanong. Dahil dito, hindi na kasama ang pagproseso sa oras ng paghihintay ng user.

Nakabatay ang mga opsyonal na kontrol na ito sa default na performance ng engine, kaya maiaangkop mo ang caching sa iyong workload.

1 sa 3
Nakatulong sa amin ang mga diagnostic at dashboard ng prompt caching ng OpenAI na mapataas nang ilang percentage point ang mga cache hit rate, kaya nabawasan nang 20% ang gastos. Nakatatanggap na kami ngayon ng mga alerto kapag hindi inaasahang nasisira ang caching, at gumagamit kami ng mga Codex agent upang matukoy ang ugat ng problema. Nagbibigay-daan din sa amin ang mga tahasang breakpoint na i-cache ang matatag na konteksto habang pinananatili sa dulo ng prompt ang content na madalas magbago. Dahil dito, naging matipid ang pag-fork ng mga pag-uusap para sa mga background task habang muling ginagamit ang halos lahat ng pinagsasaluhang konteksto.
—Arian Hanifi, Punong Opisyal ng Teknolohiya

Magsimula

May-akda

OpenAI