ذخیرهسازی بهتر پرامپت در حافظهٔ نهان برای GPT‑6
نرخ اصابت بالاتر و ابزارهای جدید برای اجرای سریعتر و کمهزینهتر عاملهای ماندگار.
GPT‑6 به عاملهای ماندگار امکان میدهد ساعتها روی وظایف پیچیده کار کنند؛ از بازآرایی پایگاههای کد گرفته تا تولید اسناد و ارائههای مبتنی بر پژوهش دقیق. برنامههای پشت این عاملها مجموعهای از درخواستهای API وابسته به یکدیگر میفرستند که اغلب همان دستورالعملها، تعریف ابزارها و بافت نوبتهای قبلی را با خود منتقل میکنند. OpenAI این بافت مشترک را برای استفادهٔ مجدد از محاسبات میان درخواستها در حافظهٔ نهان ذخیره میکند؛ در نتیجه زمان پاسخ کاهش مییابد و توسعهدهندگان برای توکنهای ورودی ذخیرهشده تا ۹۰٪ تخفیف میگیرند.
همراه با خانوادهٔ GPT‑6، سامانهای بهبودیافته برای ذخیرهسازی پرامپت در حافظهٔ نهان عرضه کردیم که بهطور پیشفرض نرخ اصابت بالاتری ارائه میدهد. اکنون برای پیشوندهای مشترک واجد شرایط که در بازهای ۳۰دقیقهای دوباره استفاده شوند، تخفیف حافظهٔ نهان ارائه میکنیم. همچنین ابزارهای جدیدی معرفی میکنیم تا توسعهدهندگان بتوانند عملکرد حافظهٔ نهان را پایش کنند، علت عدم اصابتها را بیابند و میزان ذخیرهسازی هر اعلان را تعیین کنند.
داشبورد ذخیرهسازی پرامپت در حافظهٔ نهان(در یک پنجره جدید باز میشود) جدید نشان میدهد چه میزان از ورودی برنامهٔ شما از حافظهٔ نهان تأمین میشود. نرخ اصابت را در گذر زمان دنبال کنید و با نمودار ترکیب ورودی، توکنهای ذخیرهشده و ذخیرهنشده را مقایسه کنید. این نماها به شما کمک میکنند افت نرخ اصابت را شناسایی و تأثیر تغییرات برنامه بر عملکرد حافظهٔ نهان را ارزیابی کنید.

وقتی با عدم اصابت غیرمنتظره روبهرو شدید، برای درک علت از ابزار عیبیابی ذخیرهسازی پرامپت در حافظهٔ نهان(در یک پنجره جدید باز میشود) استفاده کنید. یک درخواست را با پاسخی اخیر مقایسه کنید تا تغییرات مدل، ابزارها، تنظیمات یا ورودی را که مانع استفادهٔ مجدد شدهاند، بیابید. تعداد تخمینی توکنهای تحتتأثیر به شما کمک میکند ابعاد اثر را بسنجید و برای بهینهسازی یکپارچهسازی خود با هدف بیشینهکردن نرخ اصابت تصمیم بگیرید.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
محتوای قابل ذخیره را انتخاب کنید. نقاط شکست صریح حافظهٔ نهان به شما امکان میدهند پیشوندهای اعلان قابل استفادهٔ مجدد را انتخاب کنید. راهنمای ذخیرهسازی پرامپت در حافظهٔ نهان(در یک پنجره جدید باز میشود) بهروزشده، شیوهٔ استفاده از آنها، مدت واجد شرایط ماندن پیشوندهای ذخیرهشده و تأثیر تغییر ابزارها و ورودیها بر استفادهٔ مجدد را توضیح میدهد.
میزان تلاش برای استدلال را بدون اختلال در حافظهٔ نهان تنظیم کنید. در مدلهای GPT‑6 اکنون میتوانید بدون اختلال در حافظهٔ نهان، میزان تلاش برای استدلال را میان پاسخها تغییر دهید(در یک پنجره جدید باز میشود). برای وظیفهای دشوارتر تلاش را افزایش دهید یا برای پیگیری معمول آن را کاهش دهید؛ کافی است یک configuration_update بیفزایید و میزان تلاش برای استدلال در سطح درخواست را تغییر ندهید. به این ترتیب، ضمن حفظ بافت قابل استفادهٔ مجدد، میتوانید میزان استدلال موردنیاز هر وظیفه را تنظیم کنید.
با تغییر ابزارها و دستورالعملها، حافظهٔ نهان را حفظ کنید. با تغییر نیازهای عامل شما در استفاده از ابزارها، تعریفها، طرحوارهها و ترتیب ابزارها را ثابت نگه دارید تا بافت قبلی همچنان قابل استفادهٔ مجدد باشد. بهجای حذف تعریفها، با allowed_tools فقط ابزارهای مرتبط را قابل فراخوانی کنید یا وقتی ابزاری لازم نیست، tool_choice را روی none قرار دهید. برای نادیده گرفتن دستورالعملهای قدیمی، با پیامهای جدید توسعهدهنده دستورالعملهای تازه را به انتهای بافت بیفزایید. راهنمای مدیریت تغییرات ابزارها(در یک پنجره جدید باز میشود) را ببینید.
برای کاهش تأخیر، حافظهٔ نهان را از پیش آماده کنید. آمادهسازی از پیش(در یک پنجره جدید باز میشود)، بافت شناختهشده را پیشاپیش پردازش میکند تا مدل هنگام رسیدن درخواست، پاسخگویی را زودتر آغاز کند. برای مثال، برنامه میتواند هنگام راهاندازی و پیش از نخستین پرسش کاربر، دستورالعملهای مشترک، تعریف ابزارها یا منابع مرجع را از پیش آماده کند. به این ترتیب، پردازش دیگر بخشی از زمان انتظار کاربر نخواهد بود.
این کنترلهای اختیاری بر عملکرد پیشفرض موتور بنا شدهاند و کمک میکنند ذخیرهسازی را متناسب با حجم کاری خود تنظیم کنید.
نرخ اصابت به حافظهٔ نهان را در داشبورد ذخیرهسازی پرامپت در حافظهٔ نهان(در یک پنجره جدید باز میشود) پایش کنید.
عدم اصابتهای غیرمنتظره را با ابزار عیبیابی(در یک پنجره جدید باز میشود) بررسی کنید.
برای بهبود پیکربندی خود از راهنمای ذخیرهسازی پرامپت در حافظهٔ نهان(در یک پنجره جدید باز میشود) پیروی کنید یا برای بازبینی کد، اعمال بهبودها و سنجش نتایج، از Codex استفاده کنید(در یک پنجره جدید باز میشود).


