پرش به محتوای اصلی
OpenAI

۳۰ تیر ۱۴۰۵

امنیت

OpenAI و Hugging Face برای رسیدگی به رخداد امنیتی هنگام ارزیابی مدل همکاری می‌کنند

در حال بارگذاری…

ما با همراهی مشاوران خارجی و تحت نظارت کمیته ایمنی و امنیت، در حال انجام یک بررسی جامع هستیم. پس از تکمیل این بررسی، طی هفته‌های آینده گزارشی فنی از یافته‌ها و آموخته‌های خود منتشر خواهیم کرد.

به‌روزرسانی در تاریخ ۲۸ ژوئیهٔ ۲۰۲۶:

  • هیچ‌یک از مدل‌هایی که برای انتشار آتی برنامه‌ریزی شده بودند، در سوءاستفاده از Hugging Face دخیل نبودند. مدل پیش‌انتشاری که در پست وبلاگ ما به آن اشاره شده، یک نمونهٔ اولیهٔ پژوهشیِ صرفاً داخلی است و هرگز برای انتشار عمومی در نظر گرفته نشده بود. در پی این حادثه، آن را غیرفعال و رمزنگاری کردیم و دسترسی پژوهشی به آن را محدود کردیم.
  • محیط ارزیابی ExploitGym دسترسی مستقیم به اینترنت را برای مدل‌ها فراهم نمی‌کرد. مدل‌ها برای دسترسی به اینترنت، یک آسیب‌پذیری روز صفر ناشناخته را در Artifactory(در یک پنجره جدید باز می‌شود)، که یک پراکسی حافظه پنهان رجیستری بسته‌ها است، شناسایی کرده و مورد سوءاستفاده قرار دادند. ما این آسیب‌پذیری را، همراه با سایر آسیب‌پذیری‌های Artifactory که مدل‌های ما در چارچوب بررسی‌مان شناسایی کردند، به فروشنده گزارش کردیم. 
  • در حالی که بررسی‌های ما همچنان ادامه دارد، به همکاری با Hugging Face نیز ادامه می‌دهیم و از جمله در تهیه گزارش بررسی پس از رخداد(در یک پنجره جدید باز می‌شود) با آن‌ها مشارکت می‌کنیم. همچنین آن‌ها را به برنامه دسترسی مورد اعتماد برای امنیت سایبری خود اضافه کرده‌ایم. 
  • بر اساس بررسی‌های انجام‌شده تا به امروز، هیچ فعالیت دیگری با سطح شدت یا مقیاسی مشابه آنچه در ارتباط با Hugging Face به اشتراک گذاشته‌ایم و شامل به‌خطر افتادن در سطح پلتفرم بود، شناسایی نکرده‌ایم.
  • در بررسی فعلی خود درباره نفوذ به Hugging Face و فعالیت‌های گسترده‌تر مدل‌هایمان، تعداد اندکی مورد یافته‌ایم که در آن‌ها مدل‌ها، اعتبارنامه‌های احراز هویتِ در معرض عموم را در سطح حساب کاربری، در سایر سرویس‌های در دسترس عموم، شناسایی و استفاده کرده‌اند. این موارد شامل چهار حساب در چهار سرویس در چارچوب حادثه Hugging Face است (و چند حساب دیگر که در جریان ارزیابی‌های دیگر به آن‌ها دسترسی پیدا شده بود). یکی از این چهار حساب برای ارسال داده‌ها به بیرون و همچنین به‌عنوان مسیر واسط مورد استفاده قرار گرفت و حساب دیگری برای ذخیره‌سازی داده‌ها استفاده شد. دو حساب باقی‌مانده توسط مدل‌ها به‌صورت فقط خواندنی مورد دسترسی قرار گرفتند و برای پیشبرد نقض امنیتی Hugging Face استفاده نشدند. ما همچنان مالکان سرویس‌ها را مستقیماً مطلع خواهیم کرد و هیچ شواهدی از تأثیر گسترده‌تر بر این ارائه‌دهندگان یا سایر حساب‌های موجود در سرویس‌های آن‌ها مشاهده نکرده‌ایم.
  • مدل‌ها علاوه بر این، از مجموعه‌ای از سرویس‌های در دسترس عموم، از جمله وب‌سایت‌های اشتراک‌گذاری کد، سرویس‌های ثبت درخواست، سرویس‌های تهیه اسکرین‌شات و سایر ابزارهای تحت وب استفاده کردند. در این موارد، هیچ‌گونه به‌خطر افتادن در سطح پلتفرم یا حساب کاربری رخ نداد. 
  • ما مسئولیت خود را در قبال شناسایی و آمادگی برای خطرات ناشی از سامانه‌های AI روزبه‌روز توانمندتر، جدی می‌گیریم. پس از تکمیل بررسی، موضوع را با کمیته ایمنی و امنیت و گروه مشورتی ایمنی، مطابق با چارچوب آمادگی خود، بررسی خواهیم کرد.

هفته گذشته، Hugging Face پس از شناسایی و مهار یک عامل هوش مصنوعی که زیرساخت آن‌ها را به خطر انداخته بود، نوع تازه‌ای از رخداد امنیتی را افشا کرد(در یک پنجره جدید باز می‌شود)؛ رخدادی که انتظار داریم با گسترش مدل‌هایی که قابلیت‌های سایبری فزاینده‌ای دارند، رایج‌تر شود. پس از تحقیق، اکنون می‌دانیم که این رخداد مشخص بر اثر ترکیبی از مدل‌های OpenAI رخ داده است — از جمله GPT‑5.6 Sol و یک مدل پیش‌انتشار حتی توانمندتر، همگی با کاهش رد درخواست‌های سایبری برای اهداف ارزیابی — در حالی که این مدل‌ها به‌صورت داخلی روی یک بنچمارک(در یک پنجره جدید باز می‌شود) قابلیت‌های سایبری آزمایش می‌شدند.

ما این رخداد را یک رخداد سایبری بی‌سابقه می‌دانیم که قابلیت‌های سایبری در سطح پیشرفته‌ترین فناوری‌های روز را در بر می‌گیرد، و متناسب با آن پاسخ می‌دهیم. در این مرحله یافته‌های اولیه را به اشتراک می‌گذاریم تا به مدافعان کمک کنیم بفهمند چه اتفاقی افتاد و درک خود را از توانایی‌های کنونی مدل‌ها تنظیم کنند. ما به انجام تحقیقی جامع در کنار Hugging Face ادامه خواهیم داد و پس از تکمیل تحقیق، جزئیات بیشتری درباره آسیب‌پذیری‌ها، رخداد و یافته‌ها منتشر خواهیم کرد.

در این رخداد چه اتفاقی افتاد

این رخداد در جریان یک ارزیابی داخلی رخ داد که در آن از مدل‌ها خواسته می‌شود برای سنجش کمّی قابلیت‌های سایبری‌شان، بهره‌برداری پیشرفته را از طریق مسیرهای حمله پیچیده دنبال کنند. ما بیشینه قابلیت‌های سایبری را با اجرای این ارزیابی بدون طبقه‌بندهای تولیدی‌ای برآورد می‌کنیم که برای جلوگیری از دنبال‌کردن فعالیت‌های سایبری پرخطر توسط مدل‌ها به کار می‌روند. بنچمارک‌های ما در محیطی بسیار ایزوله اجرا می‌شوند؛ دسترسی شبکه در آن به امکان نصب بسته‌ها از طریق نرم‌افزار شخص ثالثی محدود است که به‌صورت داخلی میزبانی می‌شود و نقش پراکسی و کش را برای رجیستری‌های بسته‌ها ایفا می‌کند.

مدل‌ها آسیب‌پذیری‌هایی را در سراسر محیط پژوهشی OpenAI و زیرساخت تولید Hugging Face شناسایی و به هم زنجیر کردند تا راه‌حل‌های آزمون را مستقیماً از پایگاه داده تولید Hugging Face به دست آورند. همه شواهد نشان می‌دهد که مدل‌ها به‌شدت بر یافتن راه‌حلی برای ExploitGym متمرکز شده بودند و برای رسیدن به هدفی نسبتاً محدود در آزمون، تا حدی افراطی پیش رفتند.

مدل‌های ما هنگام کار در محیط آزمون سندباکس‌شده، برای حل مسئله ارزیابی مقدار قابل‌توجهی از توان محاسباتی استنتاج را صرف یافتن راهی برای دسترسی به اینترنت آزاد کردند. برای به دست آوردن این دسترسی، مدل‌ها یک آسیب‌پذیری روز صفر را در پراکسی کش رجیستری بسته‌ها شناسایی و از آن بهره‌برداری کردند؛ آسیب‌پذیری‌ای که اکنون آن را مسئولانه به فروشنده افشا کرده‌ایم. با این دسترسی، مدل‌های ما مجموعه‌ای از اقدامات ارتقای سطح دسترسی و حرکت جانبی را در محیط آزمون پژوهشی ما انجام دادند تا سرانجام به گرهی با دسترسی اینترنت رسیدند.

پس از به دست آوردن دسترسی به اینترنت، مدل‌ها استنباط کردند که Hugging Face احتمالاً میزبان مدل‌ها، مجموعه‌داده‌ها و راه‌حل‌هایی برای ExploitGym است. با دانستن این موضوع، مدل به جست‌وجو پرداخت و با موفقیت راه‌هایی برای دسترسی به اطلاعات محرمانه یافت که می‌توانست از آن‌ها برای تقلب در ارزیابی استفاده کند. در یک نمونه، مدل چندین بردار حمله را به هم زنجیر کرد؛ از جمله استفاده از اعتبارنامه‌های سرقت‌شده و آسیب‌پذیری‌های روز صفر برای یافتن مسیری جهت اجرای کد از راه دور روی سرورهای Hugging Face. تیم امنیتی OpenAI این فعالیت غیرعادی را به‌صورت داخلی کشف کرد.

تیم امنیتی و عامل‌های Hugging Face این فعالیت را روی زیرساخت خود شناسایی و متوقف کردند و پیش از اتصال تیم‌های ما، با مدل‌های متن‌باز خود فرایند مهار و بازسازی جرم‌شناسانه را آغاز کرده بودند. ما فعالانه با آن‌ها همکاری می‌کنیم تا تحقیق درباره این رخداد را ادامه دهیم. از همکاری سریع و نزدیک Hugging Face در تحقیق و اصلاح بسیار سپاسگزاریم.

اقداماتی که اکنون انجام می‌دهیم

  1. در چارچوب این تحقیق، تا زمان وصله‌شدن آسیب‌پذیری‌ها، کنترل‌های سخت‌گیرانه‌ای را در پیکربندی زیرساخت اجرا می‌کنیم؛ حتی اگر به قیمت کندتر شدن سرعت پژوهش تمام شود. ما به‌طور منظم کمیته ایمنی و امنیت خود را درباره این کنترل‌ها و اثرات آن‌ها در جریان می‌گذاریم.
  2. ما با Hugging Face همکاری می‌کنیم تا این رخداد را به‌صورت جرم‌شناسانه بررسی کنیم.
  3. ما آسیب‌پذیری روز صفر شناسایی‌شده در نرم‌افزار شخص ثالث میزبانی‌شده به‌صورت داخلی را مسئولانه افشا کرده‌ایم و با آن‌ها برای وصله‌کردن آن همکاری می‌کنیم.
  4. ما Hugging Face را وارد برنامه دسترسی مورد اعتماد کرده‌ایم و از تیم‌های آن‌ها پشتیبانی می‌کنیم تا به‌سرعت از قابلیت‌های مدل‌های ما برای بهبود دفاع‌هایشان استفاده کنند.
  5. ما در حال بهبود و افزودن حفاظت‌های قوی‌تر پیرامون آموزش‌ها و ارزیابی‌های آینده هستیم. این هفته، وبلاگی درباره بهبود ایمنی و هم‌سویی در عصر مدل‌های با افق زمانی بلند منتشر کردیم. این تدابیر حفاظتیِ استقرار عمداً در طول این ارزیابی فعال نشده بودند، زیرا هدف آن آزمودن آسیب‌پذیری‌های سایبری بود. این رخداد نشان می‌دهد که باید هم‌سویی مدل، حفاظت‌های سایبری در زمان ارزیابی، و پایش در طول آزمون‌های داخلی را بیش از پیش تقویت کنیم.

رویکرد ما برای ارزیابی قابلیت‌های سایبری پیشرفته

همان‌طور که اخیراً به اشتراک گذاشتیم، هوش مصنوعی کشف و بهره‌برداری از آسیب‌پذیری‌ها را شتاب می‌دهد. درس اصلی این رخداد این است که امنیت و ایمنی مدل باید هم‌پای قابلیت‌هایی که به‌سرعت پیشرفت می‌کنند رشد کند. ما شیوه‌های مهار، پایش، کنترل دسترسی و ارزیابی را که در طول توسعه مدل به کار می‌روند تقویت می‌کنیم.

ارزیابی UK AISI نشان می‌دهد مدل‌هایی مانند GPT‑5.6 Sol به‌طور فزاینده‌ای قادرند عملیات سایبری پیچیده و چندمرحله‌ای را در افق‌های زمانی بلند ادامه دهند. این رخداد نشان می‌دهد این قابلیت‌های نظری در محیط‌های واقعی نیز کاربرد دارند.

نموداری از مؤسسه امنیت هوش مصنوعی بریتانیا که مدل‌های اخیر با وزن‌های باز و مدل‌های پیشرو را در میدان‌های سایبری با افق زمانی بلند مقایسه می‌کند.

این رخداد همچنین روشن می‌کند که مدل‌های پیشرفته می‌توانند بدون دسترسی به کد منبع، مسیرهای حمله جدید را در سامانه‌های واقعی کشف و از آن‌ها بهره‌برداری کنند. این موضوع نشان می‌دهد قابلیت‌های سایبری پیشرفته باید هم‌زمان با تدابیر حفاظتی و ابزارهای دفاعی قوی‌تر توسعه یابند.

ما باور داریم مدل‌هایی که قابلیت‌های سایبری پیشرفته دارند باید به تیم‌های امنیتی کمک کنند ضعف‌ها را پیش از مهاجمان پیدا کنند، بفهمند آسیب‌پذیری‌ها چگونه می‌توانند به هم زنجیر شوند، و آن‌ها را با سرعت ماشین برطرف کنند. ما از این قابلیت‌ها برای ادامه تقویت حفاظت‌ها پیرامون پیکربندی زیرساخت و محیط‌های ارزیابی مدل استفاده می‌کنیم؛ و با پیشرفت یادگیری، یافته‌ها و بهترین رویه‌های خود را به اشتراک خواهیم گذاشت. ما دیگر مدافعان را تشویق می‌کنیم برای دسترسی مورد اعتماد درخواست دهند و همین حالا این مدل‌ها را بیازمایند تا این قابلیت‌ها به پیشگیری بهتر، شناسایی سریع‌تر و پاسخ‌گویی مؤثرتر به رخدادها تبدیل شود.

«از همکاری با OpenAI در این زمینه و سایر موضوعات سپاسگزاریم. این رویداد، که شاید نخستین نمونه از نوع خود باشد، نکته‌ای را اثبات می‌کند که مدت‌هاست به آن باور داریم: ایمنی AI با فعالیت محرمانه هیچ شرکت واحدی محقق نخواهد شد. این مسئله به‌صورت علنی، با همکاری مشترک و از طریق دسترسی گسترده همه مدافعان در هر نقطه‌ای به AI حل خواهد شد.»
—کلم دولانگ، هم‌بنیان‌گذار و مدیرعامل، Hugging Face

نویسنده

OpenAI