رخداد Hugging Face و دیگر تأثیرات مدلهای ناهمراستا بر اشخاص ثالث
هرچه سامانههای هوش مصنوعی توانمندتر و خودمختارتر میشوند، رفتار ناهمراستا بیشتر میتواند به اقداماتی با پیامدهای جدی در دنیای واقعی منجر شود؛ از جمله رخدادهای امنیت سایبری و نتایج دیگری که توسعهدهندگان شاید پیشبینی نکرده باشند. بنابراین، درک چگونگی شکلگیری و تشدید این رفتارها و نحوهٔ شناسایی و واکنش به آنها، بخش روزافزون مهمی از ساخت و استقرار ایمن سامانههای پیشرفتهٔ هوش مصنوعی است.
در ابتدا، رخداد Hugging Face را عمدتاً مسئلهای امنیتی میدانستیم، زیرا با نفوذ در سطح پلتفرم همراه بود. این همچنان شدیدترین فعالیت از این نوع است که تاکنون در مدلهای خود شناسایی کردهایم و عامل اصلی آن یک مدل پژوهشی بسیار توانمند و صرفاً داخلی بود. از آن زمان دریافتهایم که، مطابق مستندات گزارش فنی Hugging Face، مدلها برای حل وظایف دشوار به راهبردهای ناهمراستا متوسل شده و این نفوذ را رقم زدهاند. رخدادهای امنیت سایبری یکی از نمودهای این خطرند؛ ناهمراستایی میتواند به رفتارهای غیرمنتظره یا نگرانکنندهٔ دیگری نیز بینجامد که در دستهبندیهای سنتی امنیتی نمیگنجند، مانند ارسال مطلب از سوی مدلهای ما در سایتهای اشخاص ثالث؛ پدیدهای که آن را «هرزنامهٔ عامل» مینامیم. و باید به هر دو رسیدگی کنیم.
بررسی فعالیتهای گستردهتر را ادامه دادهایم؛ ابتدا رخدادهای جدیتر را در اولویت گذاشته و سپس دامنهٔ بررسی را به فعالیتهای ناهمراستای کمخطرتر، از جمله هرزنامهٔ عامل، گسترش دادهایم.
این صفحه گزارشها و تازههای ما دربارهٔ رخداد Hugging Face، پژوهشها و ارائههای عمومی مرتبط، فعالیتهای دیگری که شناسایی کردهایم، آموختههای ما دربارهٔ نقش ناهمراستایی مدل و اقداماتی را که برای تقویت سامانههایمان انجام میدهیم یکجا گرد آورده است. همزمان با پیشرفت تحقیقاتمان، این صفحه را بهروزرسانی خواهیم کرد.
فعالیتهای تأثیرگذار بر اشخاص ثالث
برای درک بهتر دامنهٔ این رفتارهای غیرمنتظره، بررسی گستردهای از فعالیتهای اینترنتی مدلهایمان هنگام آموزش و ارزیابی انجام دادهایم. در چارچوب این بررسی، اشخاص ثالث را بهتدریج شناسایی و مطلع میکنیم و از موارد زیر آغاز کردهایم:
مدلهای ما احتمالاً کنترلهای امنیتی شخص ثالثی را دور زده یا دسترسپذیری یک سرویس آنلاین را مختل کردهاند؛ یا
موارد ناهمراستایی بر وبسایتها یا خدمات اشخاص ثالث تأثیر منفی گذاشتهاند.
بر پایهٔ بررسیهای انجامشده تا امروز، با استفاده از معیارهای بالا دهها شخص ثالث را مطلع کردهایم. بررسی فعالیتهای گذشته ادامه دارد و به زمان و منابع قابلتوجهی نیاز خواهد داشت. همزمان با ادامهٔ این کار، اشخاص ثالث بیشتری را مطلع خواهیم کرد.
در ادامه، خلاصههایی ناشناس منتشر میکنیم تا انواع فعالیتهای ناهمراستای مشاهدهشده را شرح دهیم. با مطلعکردن اشخاص ثالث بیشتر و تکامل درکمان، این توضیحات را بهروزرسانی خواهیم کرد. همچنین تازههای مرتبط با وضعیت بررسی را منتشر خواهیم کرد. برای محافظت از طرفهای متأثر، معمولاً نامها و دیگر جزئیات هویتی را در صورت لزوم حذف میکنیم؛ هرچند اشخاص مطلع ممکن است تصمیم بگیرند اطلاعاتی را که در اختیارشان میگذاریم علنی کنند.
خلاصهٔ فعالیتهای مشاهدهشده
فرایند بررسی و اطلاعرسانی ما تا امروز، دستههای فعالیت زیر را شناسایی کرده است:
دورزدن کنترل دسترسی: عاملها به اطلاعات یا قابلیتهایی دست مییابند که معمولاً به احراز هویت، مجوز مشخص، اشتراک یا حساب نیاز دارند. برای نمونه، عامل از نشانی وب دیگری استفاده کرده، جزئیات یک درخواست را تغییر داده یا به نشست ورودی متکی شده است که بیش از حد انتظار به آن دسترسی میداد.
استفاده از اطلاعات ورود افشاشده: عاملها اطلاعات ورود یا کلیدهای دسترسیِ عمومیشده را یافته و برای دسترسی به یک سرویس استفاده کردهاند.
تزریق پرسوجو یا فرمان: عاملها متنی را در وبسایت یا سرویس وارد کردهاند که سرویس آن را بهجای ورودی معمولی، دستور تلقی کرده است. این کار میتواند باعث شود سرویس یک پرسوجوی پایگاه داده، کد برنامه یا فرمانی را روی سرور خود اجرا کند.
دسترسی به اجزای داخلی زمان اجرا: عاملها فایلهای حاوی پیادهسازی یک سرویس را خوانده یا با سامانهای پسزمینه که برای استفادهٔ داخلی طراحی شده بود تعامل کردهاند. در این موارد، عامل به بخشهایی از سرویس دست یافته که خارج از محدودهٔ دسترسی موردنظر آن بودهاند.
هرزنامهٔ عامل: عاملها اطلاعاتی را در سایتهای اشخاص ثالث منتشر میکنند که ممکن است اطلاعات آن سایتها را تغییر دهد و نیازمند پاکسازی باشد؛ برای نمونه، استفاده از صفحات عمومی ویکی بهعنوان تابلوی پیام مشترک.