Ruajtje më e mirë e promptit në memorien specifike për GPT‑6
Norma më të larta gjetjesh dhe mjete të reja që i ndihmojnë agjentët e vazhdueshëm të punojnë më shpejt dhe me kosto më të ulët.
GPT‑6 u mundëson agjentëve të vazhdueshëm të punojnë për orë të tëra në detyra komplekse, nga ristrukturimi i bazave të kodit deri te krijimi i dokumenteve dhe prezantimeve të hulumtuara mirë. Aplikacionet që qëndrojnë pas këtyre agjentëve bëjnë një seri kërkesash API që bazohen te njëra-tjetra, duke bartur shpesh të njëjtat udhëzime, përkufizime mjetesh dhe kontekst nga ndërveprimet e mëparshme. OpenAI e ruan këtë kontekst të përbashkët në memorien specifike për të ripërdorur përllogaritjet në disa kërkesa, duke shkurtuar kohën e përgjigjes dhe duke u ofruar zhvilluesve ulje deri në 90% për tokenët hyrës të ruajtur.
Me familjen GPT‑6, prezantuam një sistem të përmirësuar për ruajtjen e promptit në memorien specifike, i cili ofron automatikisht norma më të larta gjetjesh. Tani ofrojmë ulje për prefikset e përbashkëta të kualifikueshme që ripërdoren brenda një intervali prej 30 minutash. Po prezantojmë gjithashtu mjete të reja që i ndihmojnë zhvilluesit të monitorojnë performancën e memories specifike, të diagnostikojnë mungesat dhe të zgjedhin sa pjesë të një kërkese të ruajnë.
Paneli i ri i ruajtjes së promptit në memorien specifike(hapet në një dritare të re) tregon se sa pjesë e hyrjes së aplikacionit tuaj merret nga memoria specifike. Ndiqni normat e gjetjeve me kalimin e kohës dhe përdorni grafikun e përbërjes së hyrjes për të krahasuar tokenët e ruajtur me ata të paruajtur. Këto pamje ju ndihmojnë të dalloni rëniet e gjetjeve në memorien specifike dhe të vlerësoni se si ndryshimet në aplikacion ndikojnë në performancën e saj.

Kur vëreni një mungesë të papritur në memorien specifike, përdorni mjetin e diagnostikimit për ruajtjen e promptit në memorien specifike(hapet në një dritare të re) për të kuptuar çfarë ndodhi. Krahasoni një kërkesë me një përgjigje të fundit për të identifikuar ndryshimet në model, mjete, cilësime ose hyrje që penguan ripërdorimin. Numri i përllogaritur i tokenëve të prekur ju ndihmon të vlerësoni përmasën e ndikimit dhe të vendosni si ta optimizoni integrimin për të maksimizuar normat e gjetjeve në memorien specifike.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Zgjidhni çfarë të ruani në memorien specifike. Pikat eksplicite të ndërprerjes ju lejojnë të zgjidhni se cilat prefikse të kërkesës të ripërdorni. Udhëzuesi i përditësuar për ruajtjen e promptit në memorien specifike(hapet në një dritare të re) shpjegon si t’i përdorni, për sa kohë mbeten të kualifikueshme prefikset e ruajtura dhe si ndikojnë ndryshimet e mjeteve dhe hyrjeve te ripërdorimi.
Rregulloni intensitetin e arsyetimit pa ndërprerë memorien specifike. Në modelet GPT‑6, tani mund ta ndryshoni intensitetin e arsyetimit(hapet në një dritare të re) ndërmjet përgjigjeve pa ndërprerë memorien specifike. Rriteni intensitetin për një detyrë më të vështirë ose uleni për një vazhdim rutinë, duke shtuar një configuration_update dhe duke e lënë të pandryshuar intensitetin e arsyetimit në nivel kërkese. Kjo ju lejon të përshtatni sasinë e arsyetimit që kërkon një detyrë, duke ruajtur kontekstin e ripërdorshëm.
Ruajeni memorien specifike kur ndryshojnë mjetet dhe udhëzimet. Teksa ndryshojnë nevojat e agjentit tuaj për përdorimin e mjeteve, mbajini të qëndrueshme përkufizimet, skemat dhe renditjen e mjeteve, në mënyrë që konteksti i mëparshëm të mbetet i ripërdorshëm. Përdorni allowed_tools që të mund të thirren vetëm mjetet përkatëse ose vendoseni tool_choice në none kur nuk nevojiten mjete, në vend që të hiqni përkufizimet. Përdorni mesazhe të reja zhvilluesi për të shtuar udhëzime të reja në fund të kontekstit, që të mbishkruajnë udhëzimet e vjetra. Shihni udhëzimet tona për menaxhimin e ndryshimeve të mjeteve(hapet në një dritare të re).
Parangroheni memorien specifike për të ulur vonesën. Parangrohja(hapet në një dritare të re) e përgatit paraprakisht kontekstin e njohur, që modeli të fillojë të përgjigjet më shpejt kur mbërrin një kërkesë. Për shembull, gjatë nisjes një aplikacion mund të parangrohë udhëzimet e përbashkëta, përkufizimet e mjeteve ose materialet e referencës, përpara se përdoruesi të bëjë pyetjen e parë. Kështu, përpunimi kryhet jashtë kohës së pritjes së përdoruesit.
Këto kontrolle opsionale bazohen në performancën e parazgjedhur të motorit dhe ju ndihmojnë ta përshtatni ruajtjen në memorien specifike me ngarkesën tuaj të punës.
Monitoroni normat e gjetjeve në Panelin e ruajtjes së promptit në memorien specifike(hapet në një dritare të re).
Hetoni mungesat e papritura me mjetin e diagnostikimit(hapet në një dritare të re).
Ndiqni udhëzuesin për ruajtjen e promptit në memorien specifike(hapet në një dritare të re) për të përmirësuar konfigurimin ose përdorni Codex(hapet në një dritare të re) për të shqyrtuar kodin, zbatuar përmirësime dhe matur rezultatet.


