Mas mahusay na prompt caching para sa GPT‑6
Mas matataas na cache hit rate at mga bagong tool upang mas mabilis at mas matipid na tumakbo ang mga persistent agent.
Binibigyang-daan ng GPT‑6 ang mga persistent agent na magtrabaho nang ilang oras sa mga kumplikadong gawain, mula sa pag-refactor ng mga codebase hanggang sa paggawa ng masusing sinaliksik na mga dokumento at presentasyon. Sunod-sunod na API request ang ginagawa ng mga application sa likod ng mga agent na ito, kung saan nakabatay ang bawat isa sa nauna at madalas na ginagamit muli ang parehong mga tagubilin, depinisyon ng tool, at konteksto mula sa mga naunang turn. Kino-cache ng OpenAI ang pinagsasaluhang kontekstong iyon upang muling magamit ang computation sa iba’t ibang request, na nagpapabilis sa pagtugon at nagbibigay sa mga developer ng hanggang 90% diskuwento sa mga naka-cache na input token.
Kasabay ng pamilya ng GPT‑6, inilunsad namin ang pinahusay na prompt caching system na nagbibigay ng mas matataas na cache hit rate bilang default. Nagbibigay na kami ngayon ng mga diskuwento sa cache para sa mga kwalipikadong pinagsasaluhang prefix na muling ginagamit sa loob ng 30 minuto. Naglulunsad din kami ng mga bagong tool upang tulungan ang mga developer na subaybayan ang performance ng cache, tukuyin ang sanhi ng mga miss, at piliin kung gaano kalaking bahagi ng prompt ang ika-cache.
Ipinapakita ng bagong Dashboard ng Prompt Caching(magbubukas sa bagong window) kung gaano kalaking bahagi ng input ng iyong application ang nagmumula sa cache. Subaybayan ang mga hit rate sa paglipas ng panahon at gamitin ang chart ng komposisyon ng input upang ihambing ang mga naka-cache at hindi naka-cache na token. Tinutulungan ka ng mga view na ito na makita ang pagbaba ng mga cache hit at suriin kung paano nakaaapekto sa performance ng caching ang mga pagbabago sa iyong application.

Kapag may nakita kang hindi inaasahang cache miss, gamitin ang diagnostic tool ng prompt caching(magbubukas sa bagong window) upang maunawaan kung ano ang nangyari. Ihambing ang isang request sa kamakailang tugon upang matukoy ang mga pagbabago sa modelo, mga tool, setting, o input na humadlang sa muling paggamit. Tinutulungan ka ng tinatayang bilang ng mga apektadong token na suriin ang laki ng epekto at magpasya kung paano io-optimize ang iyong integration upang mapataas nang husto ang mga cache hit rate.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Piliin kung ano ang ika-cache. Hinahayaan ka ng mga tahasang cache breakpoint na piliin kung aling mga prefix ng prompt ang muling gagamitin. Ipinapaliwanag ng na-update na gabay sa prompt caching(magbubukas sa bagong window) kung paano gamitin ang mga ito, gaano katagal nananatiling kwalipikado ang mga naka-cache na prefix, at paano nakaaapekto sa muling paggamit ang mga pagbabago sa mga tool at input.
Ayusin ang pagsisikap sa pangangatwiran nang hindi sinisira ang cache. Sa mga modelo ng GPT‑6, maaari mo na ngayong baguhin ang pagsisikap sa pangangatwiran(magbubukas sa bagong window) sa pagitan ng mga tugon nang hindi sinisira ang cache. Dagdagan ang pagsisikap para sa mas mahirap na gawain o bawasan ito para sa karaniwang follow-up sa pamamagitan ng pagdaragdag ng configuration_update, habang hindi binabago ang pagsisikap sa pangangatwiran sa antas ng request. Hinahayaan ka nitong ayusin kung gaano karaming pangangatwiran ang kailangan ng isang gawain habang pinananatili ang kontekstong maaaring muling gamitin.
Panatilihin ang cache habang nagbabago ang mga tool at tagubilin. Habang nagbabago ang mga pangangailangan sa paggamit ng tool ng iyong agent, panatilihing hindi nagbabago ang mga depinisyon, schema, at pagkakasunod-sunod ng tool upang muling magamit ang naunang konteksto. Gamitin ang allowed_tools upang ang mga nauugnay na tool lang ang maaaring tawagin, o itakda ang tool_choice sa none kapag walang kailangang tool, sa halip na alisin ang mga depinisyon. Gumamit ng mga bagong developer message upang idagdag ang mga bagong tagubilin sa dulo ng konteksto at manaig ang mga ito sa mas lumang tagubilin. Tingnan ang aming gabay sa pamamahala ng mga pagbabago sa tool(magbubukas sa bagong window).
I-prewarm ang cache upang mabawasan ang latency. Inihahanda nang maaga ng prewarming(magbubukas sa bagong window) ang kilalang konteksto upang mas maagang makapagsimulang tumugon ang modelo kapag dumating ang isang request. Halimbawa, maaaring i-prewarm ng isang application ang mga pinagsasaluhang tagubilin, depinisyon ng tool, o materyal na sanggunian habang nagsisimula ito, bago itanong ng user ang unang tanong. Dahil dito, hindi na kasama ang pagproseso sa oras ng paghihintay ng user.
Nakabatay ang mga opsyonal na kontrol na ito sa default na performance ng engine, kaya maiaangkop mo ang caching sa iyong workload.
Subaybayan ang mga cache hit rate sa Dashboard ng Prompt Caching(magbubukas sa bagong window).
Siyasatin ang mga hindi inaasahang miss gamit ang diagnostic tool(magbubukas sa bagong window).
Sundin ang gabay sa prompt caching(magbubukas sa bagong window) upang pahusayin ang iyong setup, o gamitin ang Codex(magbubukas sa bagong window) upang suriin ang iyong code, ilapat ang mga pagpapahusay, at sukatin ang mga resulta.


