پرش به محتوای اصلی
OpenAI

۸ مهر ۱۴۰۵

امنیت

مختل‌کردن کارزاری هماهنگ برای تقطیر مدل

در حال بارگذاری…

به‌تازگی کارزاری هماهنگ را شناسایی و مختل کردیم که با هدف استخراج استدلال محافظت‌شده از مدل‌های ما طراحی شده بود. نخستین فعالیت مشاهده‌شدهٔ این کارزار به هفتهٔ اول ژوئیه برمی‌گردد. این فعالیت با تقطیر خصمانه همخوانی دارد: استفادهٔ نظام‌مند و غیرمجاز از خروجی‌ها یا استدلال یک مدل برای کمک به آموزش، بازتولید یا بهبود مدلی دیگر. استدلال محافظت‌شده، شرح درونی مدل از مراحل انجام یک کار است؛ استخراج آن می‌تواند اطلاعاتی را آشکار کند که در پاسخ نهایی نیامده‌اند و به دیگران کمک کند قابلیت‌های مدل را بازتولید کنند.

عاملان این کارزار نه رمزنگاری ما را شکستند، نه به پایگاه داده‌ای نفوذ کردند و نه به گفت‌وگوهای ذخیره‌شدهٔ کاربران دسترسی مستقیم یافتند. در عوض، آن‌ها تعاملات با مدل را دست‌کاری کردند تا استدلال محافظت‌شده به شکل‌هایی بازتولید شود که برای درخواست‌کننده قابل مشاهده باشد؛ این کار به‌صورت هماهنگ و در مقیاس وسیع انجام شد و شرایط استفاده از خدمات ما را نقض می‌کرد. این دست‌کاری به آسیب‌پذیری مختص مدل‌های OpenAI متکی نیست. ما اطلاعات مربوط به آن را از طریق مجمع مدل‌های پیشرو با شرکای صنعت در میان گذاشته‌ایم تا دفاع جمعی در برابر تقطیر خصمانه تقویت شود.

پیش از انتشار این مطلب، دامنه و تأثیر احتمالی این فعالیت را بررسی کردیم، اقدامات خود را برای کاهش خطر به اجرا گذاشتیم و یافته‌ها را با پژوهشگران و شرکای صنعت در میان گذاشتیم و بازخوردشان را دریافت کردیم تا مطمئن شویم سازوکارهای محافظتی در برابر این نوع حمله برقرار هستند. بررسی‌ها و اقدامات تکمیلی برای کاهش خطر همچنان ادامه دارد. معتقدیم در میان گذاشتن آنچه تاکنون آموخته‌ایم، به تقویت توان دفاعی کل زیست‌بوم کمک خواهد کرد.

آنچه مشاهده کردیم

مشاهده کردیم که عاملان با روش‌های تازه‌ای برای استخراج استدلال محافظت‌شده تلاش می‌کنند؛ از جمله با کپی‌کردن استدلال رمزنگاری‌شده از یک گفت‌وگو و درخواست از مدلی در گفت‌وگویی دیگر برای رمزگشایی و رونویسی محتوای استدلال پنهان.

پژوهشگران مستقل امنیت⁠(در یک پنجره جدید باز می‌شود) نیز از طریق افشای مسئولانه، آسیب‌پذیری‌های مرتبط میان مدل‌ها و در فشرده‌سازی گفت‌وگو را به اطلاع ما رساندند. یافته‌های آن‌ها را بررسی کردیم و تأیید کردیم که مسیرهای حمله‌ای که شناسایی کرده بودند واقعاً وجود دارند. کار آن‌ها به ما کمک کرد این دستهٔ گسترده‌تر از حملات را درک کنیم و اقدامات کاهش خطر را سرعت دهیم.

این فعالیت از ۱ ژوئیه با حجم کم آغاز شد، تا اینکه در ۲۴ و ۲۵ ژوئیه جهش‌هایی در حجم فعالیت مشاهده کردیم: ۱۶٬۰۰۰ درخواست1 از بیش از ۴٬۰۰۰ کاربر که از الگوی استخراج مرتبط استفاده می‌کردند. بررسی‌های بیشتر، فعالیت‌هایی با الگوهای اعلان مرتبط را در خوشه‌ای متشکل از بیش از ۱۵٬۰۰۰ کاربر شناسایی کرد که تا ۲۸ ژوئیه آن‌ها را به‌طور کامل متوقف کردیم.

این فعالیت در طول زمان تغییر کرد و بار دیگر نشان داد که تقطیر خصمانه چالش امنیتی گسترده‌تری است که به دفاع چندلایه و سازگارشونده نیاز دارد.

ارزیابی ما از انتساب فعالیت‌ها

مشخص نیست آیا همهٔ عاملانی که در بازهٔ زمانی موردنظر مشاهده کردیم، به یک بازیگر واحد وابسته بودند یا خیر. بااین‌حال، خوشه‌ای محوری از این فعالیت‌ها را به افرادی مرتبط با Moonshot AI، توسعه‌دهندهٔ Kimi، نسبت می‌دهیم.

چرا این موضوع مهم است

تقطیر خصمانه خطراتی برای ایمنی و امنیت ملی به همراه دارد. استدلال استخراج‌شده ممکن است برای آموزش مدلی دیگر به کار رود، بدون آنکه تدابیر حفاظتیِ اعمال‌شده بر خروجی‌های قابل مشاهدهٔ کاربران در مدل اصلی حفظ شود. تقطیر در مقیاس وسیع همچنین می‌تواند انتقال قابلیت‌های پیشرفته را سرعت دهد، بی‌آنکه به همان میزان سرمایه‌گذاری در ایمنی نیاز باشد. با افزایش قابلیت‌های مدل‌ها در حوزه‌های دارای کاربرد دوگانه، این نگرانی‌ها تشدید می‌شوند.

این خطر مختص OpenAI نیست. همان‌طور که پیش‌تر اشاره شد، روش‌های مشابه ممکن است بر دیگر سامانه‌های پیشرفتهٔ هوش مصنوعی نیز اثر بگذارند. ازاین‌رو، این موضوع چالشی امنیتی و مشترک است که به هماهنگی در سراسر صنعت نیاز دارد.

چگونه واکنش نشان دادیم

با ترکیبی از برخورد با حساب‌های متخلف، کنترل‌های فنی و هماهنگی با شرکا، خطر این کارزار تقطیر اخیر را کاهش دادیم. حساب‌های متقلب را مسدود یا محدود کردیم، کنترل‌های ثبت‌نام و زیرساخت را تقویت کردیم و نظارت بر شبکه‌های مرتبط را گسترش دادیم.

همچنین حفاظت از استدلال پنهان را در میان کاربران، فضاهای کاری، سازمان‌ها و خانواده‌های مدل تقویت کردیم. مسیری را بستیم که به فردی که از قبل استدلال رمزنگاری‌شدهٔ کاربر دیگری را در اختیار داشت، امکان می‌داد با بازپخش آن، محتوایش را بازیابی کند. همچنین بررسی‌هایی افزودیم تا خروجی‌های جریانیِ دارای احتمال افشای استدلال شناسایی شوند و ارسال آن‌ها متوقف شود. وقتی فعالیت‌های مرتبط از طریق خدمات طرف ثالث ادامه یافت، با ارائه‌دهندگان آن خدمات همکاری کردیم تا حساب‌های دخیل را شناسایی و فعالیتشان را متوقف کنیم.

در نهایت، یافته‌های مرتبط را از طریق مجمع مدل‌های پیشرو و مجاری مناسب دولتی برای تبادل اطلاعات به اشتراک گذاشتیم تا دیگر توسعه‌دهندگان مدل‌های پیشرو و شرکای بخش دولتی بتوانند به دنبال فعالیت‌های مشابه بگردند و سازوکارهای دفاعی خود را تقویت کنند. سامانه‌هایی که از داده‌های استدلالِ قابل‌انتقال یا قابل‌بازپخش پشتیبانی می‌کنند، ممکن است با خطرات مشابهی روبه‌رو شوند.

گام‌های بعدی

انتظار داریم با بهبود مدل‌های پیشرو و تلاش بازیگران برای یافتن راه‌های ارزان‌ترِ تقلید قابلیت‌های آن‌ها، تلاش‌ها برای تقطیر خصمانه پیچیده‌تر شود. دفاع در برابر این فعالیت به کنترل‌های چندلایه و سازگاری مداوم نیاز دارد.

این کار هنوز به پایان نرسیده است. نسخه‌های مستقر در زیرساخت شرکا به همان حفاظت‌هایی نیاز دارند که برای خدمات خودمان فراهم می‌کنیم. حملات از طریق خروجی ابزارها نیز مستلزم سازوکارهای محافظتی‌ای هستند که بررسی‌شان فراتر از متن عادیِ قابل مشاهده باشد. همچنان در حال بهبود سازوکارهای دفاعی ابزارها، پوشش طبقه‌بندها و امتناع مدل‌ها از پاسخ‌گویی هستیم و کنترل‌های مربوطه را در سراسر زیرساخت شرکای ابری گسترش می‌دهیم.

واکنش ما همچنان بر سه حوزه متمرکز خواهد بود: حفاظت‌های فنی قوی‌تر در برابر استخراج، تشخیص بهتر و برخورد مؤثرتر با کارزارهای هماهنگ، و تبادل گسترده‌تر اطلاعات تهدید میان صنعت و دولت.

نویسنده

OpenAI

پانویس‌ها

  1. 1

    این ارقام نشان‌دهندهٔ تلاش برای استخراج هستند، نه لزوماً استخراج‌های موفق.