پرش به محتوای اصلی
OpenAI

۳۱ شهریور ۱۴۰۵

محصول

ذخیره‌سازی بهتر پرامپت در حافظهٔ نهان برای GPT‑6

نرخ اصابت بالاتر و ابزارهای جدید برای اجرای سریع‌تر و کم‌هزینه‌تر عامل‌های ماندگار.

در حال بارگذاری…

GPT‑6 به عامل‌های ماندگار امکان می‌دهد ساعت‌ها روی وظایف پیچیده کار کنند؛ از بازآرایی پایگاه‌های کد گرفته تا تولید اسناد و ارائه‌های مبتنی بر پژوهش دقیق. برنامه‌های پشت این عامل‌ها مجموعه‌ای از درخواست‌های API وابسته به یکدیگر می‌فرستند که اغلب همان دستورالعمل‌ها، تعریف ابزارها و بافت نوبت‌های قبلی را با خود منتقل می‌کنند. OpenAI این بافت مشترک را برای استفادهٔ مجدد از محاسبات میان درخواست‌ها در حافظهٔ نهان ذخیره می‌کند؛ در نتیجه زمان پاسخ کاهش می‌یابد و توسعه‌دهندگان برای توکن‌های ورودی ذخیره‌شده تا ۹۰٪ تخفیف می‌گیرند.

همراه با خانوادهٔ GPT‑6، سامانه‌ای بهبودیافته برای ذخیره‌سازی پرامپت در حافظهٔ نهان عرضه کردیم که به‌طور پیش‌فرض نرخ اصابت بالاتری ارائه می‌دهد. اکنون برای پیشوندهای مشترک واجد شرایط که در بازه‌ای ۳۰دقیقه‌ای دوباره استفاده شوند، تخفیف حافظهٔ نهان ارائه می‌کنیم. همچنین ابزارهای جدیدی معرفی می‌کنیم تا توسعه‌دهندگان بتوانند عملکرد حافظهٔ نهان را پایش کنند، علت عدم اصابت‌ها را بیابند و میزان ذخیره‌سازی هر اعلان را تعیین کنند.

ذخیره‌سازی پرامپت در حافظهٔ نهان OpenAI نقشی حیاتی در ارائهٔ تجربه‌ای سریع و کارآمد در مقیاس وسیع توسط GitHub Copilot دارد. در چند ماه گذشته، در مقایسه با خط مبنای قبلی، سهم توکن‌های اعلان نیازمند پردازش مجدد را در میان میلیاردها درخواست به مدل‌های OpenAI بیش از ۵۰٪ کاهش داده‌ایم. نتیجه، پشتهٔ استنتاج کارآمدتر و زمان کوتاه‌تر تا دریافت نخستین پاسخ برای توسعه‌دهندگان است.
—ماریو رودریگز، مدیر ارشد محصول

پایش ذخیره‌سازی و تشخیص عدم اصابت به حافظهٔ نهان

داشبورد ذخیره‌سازی پرامپت در حافظهٔ نهان(در یک پنجره جدید باز می‌شود) جدید نشان می‌دهد چه میزان از ورودی برنامهٔ شما از حافظهٔ نهان تأمین می‌شود. نرخ اصابت را در گذر زمان دنبال کنید و با نمودار ترکیب ورودی، توکن‌های ذخیره‌شده و ذخیره‌نشده را مقایسه کنید. این نماها به شما کمک می‌کنند افت نرخ اصابت را شناسایی و تأثیر تغییرات برنامه بر عملکرد حافظهٔ نهان را ارزیابی کنید.

داشبورد ذخیره‌سازی پرامپت در حافظهٔ نهان که نرخ اصابت، عملکرد حافظهٔ نهان در گذر زمان و ترکیب توکن‌های ورودی را نشان می‌دهد.

وقتی با عدم اصابت غیرمنتظره روبه‌رو شدید، برای درک علت از ابزار عیب‌یابی ذخیره‌سازی پرامپت در حافظهٔ نهان(در یک پنجره جدید باز می‌شود) استفاده کنید. یک درخواست را با پاسخی اخیر مقایسه کنید تا تغییرات مدل، ابزارها، تنظیمات یا ورودی را که مانع استفادهٔ مجدد شده‌اند، بیابید. تعداد تخمینی توکن‌های تحت‌تأثیر به شما کمک می‌کند ابعاد اثر را بسنجید و برای بهینه‌سازی یکپارچه‌سازی خود با هدف بیشینه‌کردن نرخ اصابت تصمیم بگیرید.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

بهینه‌سازی حافظهٔ نهان برای برنامهٔ شما

محتوای قابل ذخیره را انتخاب کنید. نقاط شکست صریح حافظهٔ نهان به شما امکان می‌دهند پیشوندهای اعلان قابل استفادهٔ مجدد را انتخاب کنید. راهنمای ذخیره‌سازی پرامپت در حافظهٔ نهان(در یک پنجره جدید باز می‌شود) به‌روزشده، شیوهٔ استفاده از آن‌ها، مدت واجد شرایط ماندن پیشوندهای ذخیره‌شده و تأثیر تغییر ابزارها و ورودی‌ها بر استفادهٔ مجدد را توضیح می‌دهد.

میزان تلاش برای استدلال را بدون اختلال در حافظهٔ نهان تنظیم کنید. در مدل‌های GPT‑6 اکنون می‌توانید بدون اختلال در حافظهٔ نهان، میزان تلاش برای استدلال را میان پاسخ‌ها تغییر دهید(در یک پنجره جدید باز می‌شود). برای وظیفه‌ای دشوارتر تلاش را افزایش دهید یا برای پیگیری معمول آن را کاهش دهید؛ کافی است یک configuration_update بیفزایید و میزان تلاش برای استدلال در سطح درخواست را تغییر ندهید. به این ترتیب، ضمن حفظ بافت قابل استفادهٔ مجدد، می‌توانید میزان استدلال موردنیاز هر وظیفه را تنظیم کنید.

با تغییر ابزارها و دستورالعمل‌ها، حافظهٔ نهان را حفظ کنید. با تغییر نیازهای عامل شما در استفاده از ابزارها، تعریف‌ها، طرح‌واره‌ها و ترتیب ابزارها را ثابت نگه دارید تا بافت قبلی همچنان قابل استفادهٔ مجدد باشد. به‌جای حذف تعریف‌ها، با allowed_tools فقط ابزارهای مرتبط را قابل فراخوانی کنید یا وقتی ابزاری لازم نیست، tool_choice را روی none قرار دهید. برای نادیده گرفتن دستورالعمل‌های قدیمی، با پیام‌های جدید توسعه‌دهنده دستورالعمل‌های تازه را به انتهای بافت بیفزایید. راهنمای مدیریت تغییرات ابزارها(در یک پنجره جدید باز می‌شود) را ببینید.

برای کاهش تأخیر، حافظهٔ نهان را از پیش آماده کنید. آماده‌سازی از پیش(در یک پنجره جدید باز می‌شود)، بافت شناخته‌شده را پیشاپیش پردازش می‌کند تا مدل هنگام رسیدن درخواست، پاسخ‌گویی را زودتر آغاز کند. برای مثال، برنامه می‌تواند هنگام راه‌اندازی و پیش از نخستین پرسش کاربر، دستورالعمل‌های مشترک، تعریف ابزارها یا منابع مرجع را از پیش آماده کند. به این ترتیب، پردازش دیگر بخشی از زمان انتظار کاربر نخواهد بود.

این کنترل‌های اختیاری بر عملکرد پیش‌فرض موتور بنا شده‌اند و کمک می‌کنند ذخیره‌سازی را متناسب با حجم کاری خود تنظیم کنید.

1 از 3
ابزارهای عیب‌یابی و داشبورد ذخیره‌سازی پرامپت در حافظهٔ نهان OpenAI به ما کمک کردند نرخ اصابت را چند واحد درصد بهبود دهیم و هزینه‌ها را ۲۰٪ کاهش دهیم. اکنون هنگام اختلال غیرمنتظره در ذخیره‌سازی حافظهٔ نهان هشدار دریافت می‌کنیم و برای تشخیص علت اصلی از عامل‌های Codex بهره می‌بریم. نقاط شکست صریح همچنین به ما امکان می‌دهند ضمن نگه‌داشتن محتوای پرتغییر در انتهای اعلان، بافت پایدار را در حافظهٔ نهان ذخیره کنیم. این قابلیت، فورک کردن گفتگوها برای وظایف پس‌زمینه و در عین حال استفادهٔ مجدد از تقریباً تمام بافت مشترک را از نظر اقتصادی به‌صرفه کرده است.
—آرین حنیفی، مدیر ارشد فناوری

شروع کنید

نویسنده

OpenAI