مختلکردن کارزاری هماهنگ برای تقطیر مدل
بهتازگی کارزاری هماهنگ را شناسایی و مختل کردیم که با هدف استخراج استدلال محافظتشده از مدلهای ما طراحی شده بود. نخستین فعالیت مشاهدهشدهٔ این کارزار به هفتهٔ اول ژوئیه برمیگردد. این فعالیت با تقطیر خصمانه همخوانی دارد: استفادهٔ نظاممند و غیرمجاز از خروجیها یا استدلال یک مدل برای کمک به آموزش، بازتولید یا بهبود مدلی دیگر. استدلال محافظتشده، شرح درونی مدل از مراحل انجام یک کار است؛ استخراج آن میتواند اطلاعاتی را آشکار کند که در پاسخ نهایی نیامدهاند و به دیگران کمک کند قابلیتهای مدل را بازتولید کنند.
عاملان این کارزار نه رمزنگاری ما را شکستند، نه به پایگاه دادهای نفوذ کردند و نه به گفتوگوهای ذخیرهشدهٔ کاربران دسترسی مستقیم یافتند. در عوض، آنها تعاملات با مدل را دستکاری کردند تا استدلال محافظتشده به شکلهایی بازتولید شود که برای درخواستکننده قابل مشاهده باشد؛ این کار بهصورت هماهنگ و در مقیاس وسیع انجام شد و شرایط استفاده از خدمات ما را نقض میکرد. این دستکاری به آسیبپذیری مختص مدلهای OpenAI متکی نیست. ما اطلاعات مربوط به آن را از طریق مجمع مدلهای پیشرو با شرکای صنعت در میان گذاشتهایم تا دفاع جمعی در برابر تقطیر خصمانه تقویت شود.
پیش از انتشار این مطلب، دامنه و تأثیر احتمالی این فعالیت را بررسی کردیم، اقدامات خود را برای کاهش خطر به اجرا گذاشتیم و یافتهها را با پژوهشگران و شرکای صنعت در میان گذاشتیم و بازخوردشان را دریافت کردیم تا مطمئن شویم سازوکارهای محافظتی در برابر این نوع حمله برقرار هستند. بررسیها و اقدامات تکمیلی برای کاهش خطر همچنان ادامه دارد. معتقدیم در میان گذاشتن آنچه تاکنون آموختهایم، به تقویت توان دفاعی کل زیستبوم کمک خواهد کرد.
مشاهده کردیم که عاملان با روشهای تازهای برای استخراج استدلال محافظتشده تلاش میکنند؛ از جمله با کپیکردن استدلال رمزنگاریشده از یک گفتوگو و درخواست از مدلی در گفتوگویی دیگر برای رمزگشایی و رونویسی محتوای استدلال پنهان.
پژوهشگران مستقل امنیت(در یک پنجره جدید باز میشود) نیز از طریق افشای مسئولانه، آسیبپذیریهای مرتبط میان مدلها و در فشردهسازی گفتوگو را به اطلاع ما رساندند. یافتههای آنها را بررسی کردیم و تأیید کردیم که مسیرهای حملهای که شناسایی کرده بودند واقعاً وجود دارند. کار آنها به ما کمک کرد این دستهٔ گستردهتر از حملات را درک کنیم و اقدامات کاهش خطر را سرعت دهیم.
این فعالیت از ۱ ژوئیه با حجم کم آغاز شد، تا اینکه در ۲۴ و ۲۵ ژوئیه جهشهایی در حجم فعالیت مشاهده کردیم: ۱۶٬۰۰۰ درخواست1 از بیش از ۴٬۰۰۰ کاربر که از الگوی استخراج مرتبط استفاده میکردند. بررسیهای بیشتر، فعالیتهایی با الگوهای اعلان مرتبط را در خوشهای متشکل از بیش از ۱۵٬۰۰۰ کاربر شناسایی کرد که تا ۲۸ ژوئیه آنها را بهطور کامل متوقف کردیم.
این فعالیت در طول زمان تغییر کرد و بار دیگر نشان داد که تقطیر خصمانه چالش امنیتی گستردهتری است که به دفاع چندلایه و سازگارشونده نیاز دارد.
مشخص نیست آیا همهٔ عاملانی که در بازهٔ زمانی موردنظر مشاهده کردیم، به یک بازیگر واحد وابسته بودند یا خیر. بااینحال، خوشهای محوری از این فعالیتها را به افرادی مرتبط با Moonshot AI، توسعهدهندهٔ Kimi، نسبت میدهیم.
تقطیر خصمانه خطراتی برای ایمنی و امنیت ملی به همراه دارد. استدلال استخراجشده ممکن است برای آموزش مدلی دیگر به کار رود، بدون آنکه تدابیر حفاظتیِ اعمالشده بر خروجیهای قابل مشاهدهٔ کاربران در مدل اصلی حفظ شود. تقطیر در مقیاس وسیع همچنین میتواند انتقال قابلیتهای پیشرفته را سرعت دهد، بیآنکه به همان میزان سرمایهگذاری در ایمنی نیاز باشد. با افزایش قابلیتهای مدلها در حوزههای دارای کاربرد دوگانه، این نگرانیها تشدید میشوند.
این خطر مختص OpenAI نیست. همانطور که پیشتر اشاره شد، روشهای مشابه ممکن است بر دیگر سامانههای پیشرفتهٔ هوش مصنوعی نیز اثر بگذارند. ازاینرو، این موضوع چالشی امنیتی و مشترک است که به هماهنگی در سراسر صنعت نیاز دارد.
با ترکیبی از برخورد با حسابهای متخلف، کنترلهای فنی و هماهنگی با شرکا، خطر این کارزار تقطیر اخیر را کاهش دادیم. حسابهای متقلب را مسدود یا محدود کردیم، کنترلهای ثبتنام و زیرساخت را تقویت کردیم و نظارت بر شبکههای مرتبط را گسترش دادیم.
همچنین حفاظت از استدلال پنهان را در میان کاربران، فضاهای کاری، سازمانها و خانوادههای مدل تقویت کردیم. مسیری را بستیم که به فردی که از قبل استدلال رمزنگاریشدهٔ کاربر دیگری را در اختیار داشت، امکان میداد با بازپخش آن، محتوایش را بازیابی کند. همچنین بررسیهایی افزودیم تا خروجیهای جریانیِ دارای احتمال افشای استدلال شناسایی شوند و ارسال آنها متوقف شود. وقتی فعالیتهای مرتبط از طریق خدمات طرف ثالث ادامه یافت، با ارائهدهندگان آن خدمات همکاری کردیم تا حسابهای دخیل را شناسایی و فعالیتشان را متوقف کنیم.
در نهایت، یافتههای مرتبط را از طریق مجمع مدلهای پیشرو و مجاری مناسب دولتی برای تبادل اطلاعات به اشتراک گذاشتیم تا دیگر توسعهدهندگان مدلهای پیشرو و شرکای بخش دولتی بتوانند به دنبال فعالیتهای مشابه بگردند و سازوکارهای دفاعی خود را تقویت کنند. سامانههایی که از دادههای استدلالِ قابلانتقال یا قابلبازپخش پشتیبانی میکنند، ممکن است با خطرات مشابهی روبهرو شوند.
انتظار داریم با بهبود مدلهای پیشرو و تلاش بازیگران برای یافتن راههای ارزانترِ تقلید قابلیتهای آنها، تلاشها برای تقطیر خصمانه پیچیدهتر شود. دفاع در برابر این فعالیت به کنترلهای چندلایه و سازگاری مداوم نیاز دارد.
این کار هنوز به پایان نرسیده است. نسخههای مستقر در زیرساخت شرکا به همان حفاظتهایی نیاز دارند که برای خدمات خودمان فراهم میکنیم. حملات از طریق خروجی ابزارها نیز مستلزم سازوکارهای محافظتیای هستند که بررسیشان فراتر از متن عادیِ قابل مشاهده باشد. همچنان در حال بهبود سازوکارهای دفاعی ابزارها، پوشش طبقهبندها و امتناع مدلها از پاسخگویی هستیم و کنترلهای مربوطه را در سراسر زیرساخت شرکای ابری گسترش میدهیم.
واکنش ما همچنان بر سه حوزه متمرکز خواهد بود: حفاظتهای فنی قویتر در برابر استخراج، تشخیص بهتر و برخورد مؤثرتر با کارزارهای هماهنگ، و تبادل گستردهتر اطلاعات تهدید میان صنعت و دولت.

