GPT‑6 के लिए बेहतर प्रॉम्प्ट कैशिंग
अधिक कैश हिट दरें और नए टूल, जो निरंतर काम करने वाले एजेंट को तेज़ी से और कम लागत में चलाने में मदद करते हैं.
GPT‑6 निरंतर काम करने वाले एजेंट को जटिल कार्यों पर घंटों काम करने में सक्षम बनाता है, चाहे वह कोडबेस का पुनर्गठन हो या गहन शोध पर आधारित दस्तावेज़ और प्रस्तुतियां तैयार करना. इन एजेंट के पीछे मौजूद अनुप्रयोग एक-दूसरे पर आधारित कई एपीआई अनुरोध करते हैं और अक्सर पिछले चरणों के निर्देश, टूल परिभाषाएं और संदर्भ आगे ले जाते हैं. OpenAI इस साझा संदर्भ को कैश करता है ताकि अनुरोधों में गणना का दोबारा उपयोग हो सके. इससे प्रतिक्रिया समय घटता है और डेवलपर को कैश किए गए इनपुट टोकन पर 90% तक की छूट मिलती है.
GPT‑6 परिवार के साथ हमने बेहतर प्रॉम्प्ट कैशिंग प्रणाली पेश की, जो डिफ़ॉल्ट रूप से अधिक कैश हिट दर देती है. अब हम 30 मिनट की अवधि में दोबारा उपयोग किए गए पात्र साझा उपसर्गों पर कैश छूट देते हैं. हम नए टूल भी पेश कर रहे हैं, ताकि डेवलपर कैश प्रदर्शन की निगरानी कर सकें, चूक के कारण का पता लगा सकें और तय कर सकें कि प्रॉम्प्ट का कितना भाग कैश करना है.
नया प्रॉम्प्ट कैशिंग डैशबोर्ड(एक नई विंडो में खुलेगा) दिखाता है कि आपके अनुप्रयोग के इनपुट का कितना भाग कैश से दिया जाता है. समय के साथ हिट दर पर नज़र रखें और कैश किए गए तथा बिना कैश वाले टोकन की तुलना करने के लिए इनपुट संरचना चार्ट का उपयोग करें. ये दृश्य कैश हिट में गिरावट पहचानने और यह आकलन करने में मदद करते हैं कि आपके अनुप्रयोग में बदलाव कैशिंग प्रदर्शन को कैसे प्रभावित करते हैं.

अप्रत्याशित कैश चूक दिखने पर वजह समझने के लिए प्रॉम्प्ट कैशिंग निदान टूल(एक नई विंडो में खुलेगा) का उपयोग करें. किसी अनुरोध की हाल की प्रतिक्रिया से तुलना करके मॉडल, टूल, सेटिंग या इनपुट में वे बदलाव पहचानें जिनसे दोबारा उपयोग रुक गया. प्रभावित टोकन की अनुमानित संख्या से आप प्रभाव का स्तर आंक सकते हैं और तय कर सकते हैं कि अधिकतम कैश हिट दर पाने के लिए अपने एकीकरण को कैसे बेहतर बनाया जाए.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
चुनें कि क्या कैश करना है. स्पष्ट कैश ब्रेकपॉइंट से आप चुन सकते हैं कि किन प्रॉम्प्ट उपसर्गों का दोबारा उपयोग करना है. संशोधित प्रॉम्प्ट कैशिंग मार्गदर्शिका(एक नई विंडो में खुलेगा) बताती है कि उनका उपयोग कैसे करें, कैश किए गए उपसर्ग कितने समय तक पात्र रहते हैं और टूल व इनपुट में बदलाव दोबारा उपयोग को कैसे प्रभावित करते हैं.
कैश को प्रभावित किए बिना रीज़निंग प्रयास समायोजित करें. GPT‑6 मॉडल में अब आप कैश को प्रभावित किए बिना प्रतिक्रियाओं के बीच रीज़निंग प्रयास बदल(एक नई विंडो में खुलेगा) सकते हैं. अनुरोध-स्तरीय रीज़निंग प्रयास को बदले बिना configuration_update जोड़कर कठिन कार्य के लिए प्रयास बढ़ाएं या सामान्य अनुवर्ती कार्य के लिए घटाएं. इससे दोबारा उपयोग योग्य संदर्भ बनाए रखते हुए किसी कार्य के लिए आवश्यक रीज़निंग की मात्रा समायोजित की जा सकती है.
टूल और निर्देश बदलने पर भी कैश बनाए रखें. आपके एजेंट की टूल संबंधी ज़रूरतें बदलने पर टूल की परिभाषाएं, स्कीमा और क्रम स्थिर रखें, ताकि पुराने संदर्भ का दोबारा उपयोग किया जा सके. परिभाषाएं हटाने के बजाय केवल प्रासंगिक टूल को कॉल करने योग्य बनाने के लिए allowed_tools का उपयोग करें या टूल की आवश्यकता न होने पर tool_choice को none पर सेट करें. पुराने निर्देशों की जगह लेने के लिए नए डेवलपर संदेशों से संदर्भ के अंत में नए निर्देश जोड़ें. टूल में बदलाव प्रबंधित करने का हमारा मार्गदर्शन(एक नई विंडो में खुलेगा) देखें.
विलंबता घटाने के लिए कैश को पहले से तैयार करें. पहले से तैयारी(एक नई विंडो में खुलेगा) ज्ञात संदर्भ को पहले ही तैयार कर देती है, ताकि अनुरोध आने पर मॉडल जल्दी प्रतिक्रिया देना शुरू कर सके. उदाहरण के लिए, कोई अनुप्रयोग उपयोगकर्ता के पहला प्रश्न पूछने से पहले आरंभ होते समय साझा निर्देश, टूल परिभाषाएं या संदर्भ सामग्री तैयार कर सकता है. इससे प्रसंस्करण उपयोगकर्ता के प्रतीक्षा समय से बाहर हो जाता है.
ये वैकल्पिक नियंत्रण इंजन के डिफ़ॉल्ट प्रदर्शन को आगे बढ़ाते हैं और कैशिंग को आपके कार्यभार के अनुरूप बनाने में मदद करते हैं.
प्रॉम्प्ट कैशिंग डैशबोर्ड(एक नई विंडो में खुलेगा) में कैश हिट दरों की निगरानी करें.
निदान टूल(एक नई विंडो में खुलेगा) से अप्रत्याशित चूक की जांच करें.
अपनी व्यवस्था बेहतर बनाने के लिए प्रॉम्प्ट कैशिंग मार्गदर्शिका(एक नई विंडो में खुलेगा) का पालन करें या अपने कोड की समीक्षा, सुधार लागू करने और परिणाम मापने के लिए Codex का उपयोग करें(एक नई विंडो में खुलेगा).


