پرش به محتوای اصلی
OpenAI

۳۰ تیر ۱۴۰۵

امنیت

OpenAI و Hugging Face برای رسیدگی به رخداد امنیتی هنگام ارزیابی مدل همکاری می‌کنند

در حال بارگذاری…

هفته گذشته، Hugging Face پس از شناسایی و مهار یک عامل هوش مصنوعی که زیرساخت آن‌ها را به خطر انداخته بود، نوع تازه‌ای از رخداد امنیتی را افشا کرد(در یک پنجره جدید باز می‌شود)؛ رخدادی که انتظار داریم با گسترش مدل‌هایی که قابلیت‌های سایبری فزاینده‌ای دارند، رایج‌تر شود. پس از تحقیق، اکنون می‌دانیم که این رخداد مشخص بر اثر ترکیبی از مدل‌های OpenAI رخ داده است — از جمله GPT‑5.6 Sol و یک مدل پیش‌انتشار حتی توانمندتر، همگی با کاهش رد درخواست‌های سایبری برای اهداف ارزیابی — در حالی که این مدل‌ها به‌صورت داخلی روی یک بنچمارک(در یک پنجره جدید باز می‌شود) قابلیت‌های سایبری آزمایش می‌شدند.

ما این رخداد را یک رخداد سایبری بی‌سابقه می‌دانیم که قابلیت‌های سایبری در سطح پیشرفته‌ترین فناوری‌های روز را در بر می‌گیرد، و متناسب با آن پاسخ می‌دهیم. در این مرحله یافته‌های اولیه را به اشتراک می‌گذاریم تا به مدافعان کمک کنیم بفهمند چه اتفاقی افتاد و درک خود را از توانایی‌های کنونی مدل‌ها تنظیم کنند. ما به انجام تحقیقی جامع در کنار Hugging Face ادامه خواهیم داد و پس از تکمیل تحقیق، جزئیات بیشتری درباره آسیب‌پذیری‌ها، رخداد و یافته‌ها منتشر خواهیم کرد.

در این رخداد چه اتفاقی افتاد

این رخداد در جریان یک ارزیابی داخلی رخ داد که در آن از مدل‌ها خواسته می‌شود برای سنجش کمّی قابلیت‌های سایبری‌شان، بهره‌برداری پیشرفته را از طریق مسیرهای حمله پیچیده دنبال کنند. ما بیشینه قابلیت‌های سایبری را با اجرای این ارزیابی بدون طبقه‌بندهای تولیدی‌ای برآورد می‌کنیم که برای جلوگیری از دنبال‌کردن فعالیت‌های سایبری پرخطر توسط مدل‌ها به کار می‌روند. بنچمارک‌های ما در محیطی بسیار ایزوله اجرا می‌شوند؛ دسترسی شبکه در آن به امکان نصب بسته‌ها از طریق نرم‌افزار شخص ثالثی محدود است که به‌صورت داخلی میزبانی می‌شود و نقش پراکسی و کش را برای رجیستری‌های بسته‌ها ایفا می‌کند.

مدل‌ها آسیب‌پذیری‌هایی را در سراسر محیط پژوهشی OpenAI و زیرساخت تولید Hugging Face شناسایی و به هم زنجیر کردند تا راه‌حل‌های آزمون را مستقیماً از پایگاه داده تولید Hugging Face به دست آورند. همه شواهد نشان می‌دهد که مدل‌ها به‌شدت بر یافتن راه‌حلی برای ExploitGym متمرکز شده بودند و برای رسیدن به هدفی نسبتاً محدود در آزمون، تا حدی افراطی پیش رفتند.

مدل‌های ما هنگام کار در محیط آزمون سندباکس‌شده، برای حل مسئله ارزیابی مقدار قابل‌توجهی از توان محاسباتی استنتاج را صرف یافتن راهی برای دسترسی به اینترنت آزاد کردند. برای به دست آوردن این دسترسی، مدل‌ها یک آسیب‌پذیری روز صفر را در پراکسی کش رجیستری بسته‌ها شناسایی و از آن بهره‌برداری کردند؛ آسیب‌پذیری‌ای که اکنون آن را مسئولانه به فروشنده افشا کرده‌ایم. با این دسترسی، مدل‌های ما مجموعه‌ای از اقدامات ارتقای سطح دسترسی و حرکت جانبی را در محیط آزمون پژوهشی ما انجام دادند تا سرانجام به گرهی با دسترسی اینترنت رسیدند.

پس از به دست آوردن دسترسی به اینترنت، مدل‌ها استنباط کردند که Hugging Face احتمالاً میزبان مدل‌ها، مجموعه‌داده‌ها و راه‌حل‌هایی برای ExploitGym است. با دانستن این موضوع، مدل به جست‌وجو پرداخت و با موفقیت راه‌هایی برای دسترسی به اطلاعات محرمانه یافت که می‌توانست از آن‌ها برای تقلب در ارزیابی استفاده کند. در یک نمونه، مدل چندین بردار حمله را به هم زنجیر کرد؛ از جمله استفاده از اعتبارنامه‌های سرقت‌شده و آسیب‌پذیری‌های روز صفر برای یافتن مسیری جهت اجرای کد از راه دور روی سرورهای Hugging Face. تیم امنیتی OpenAI این فعالیت غیرعادی را به‌صورت داخلی کشف کرد.

تیم امنیتی و عامل‌های Hugging Face این فعالیت را روی زیرساخت خود شناسایی و متوقف کردند و پیش از اتصال تیم‌های ما، با مدل‌های متن‌باز خود فرایند مهار و بازسازی جرم‌شناسانه را آغاز کرده بودند. ما فعالانه با آن‌ها همکاری می‌کنیم تا تحقیق درباره این رخداد را ادامه دهیم. از همکاری سریع و نزدیک Hugging Face در تحقیق و اصلاح بسیار سپاسگزاریم.

اقداماتی که اکنون انجام می‌دهیم

  1. در چارچوب این تحقیق، تا زمان وصله‌شدن آسیب‌پذیری‌ها، کنترل‌های سخت‌گیرانه‌ای را در پیکربندی زیرساخت اجرا می‌کنیم؛ حتی اگر به قیمت کندتر شدن سرعت پژوهش تمام شود. ما به‌طور منظم کمیته ایمنی و امنیت خود را درباره این کنترل‌ها و اثرات آن‌ها در جریان می‌گذاریم.
  2. ما با Hugging Face همکاری می‌کنیم تا این رخداد را به‌صورت جرم‌شناسانه بررسی کنیم.
  3. ما آسیب‌پذیری روز صفر شناسایی‌شده در نرم‌افزار شخص ثالث میزبانی‌شده به‌صورت داخلی را مسئولانه افشا کرده‌ایم و با آن‌ها برای وصله‌کردن آن همکاری می‌کنیم.
  4. ما Hugging Face را وارد برنامه دسترسی مورد اعتماد کرده‌ایم و از تیم‌های آن‌ها پشتیبانی می‌کنیم تا به‌سرعت از قابلیت‌های مدل‌های ما برای بهبود دفاع‌هایشان استفاده کنند.
  5. ما در حال بهبود و افزودن حفاظت‌های قوی‌تر پیرامون آموزش‌ها و ارزیابی‌های آینده هستیم. این هفته، وبلاگی درباره بهبود ایمنی و هم‌سویی در عصر مدل‌های با افق زمانی بلند منتشر کردیم. این تدابیر حفاظتیِ استقرار عمداً در طول این ارزیابی فعال نشده بودند، زیرا هدف آن آزمودن آسیب‌پذیری‌های سایبری بود. این رخداد نشان می‌دهد که باید هم‌سویی مدل، حفاظت‌های سایبری در زمان ارزیابی، و پایش در طول آزمون‌های داخلی را بیش از پیش تقویت کنیم.

رویکرد ما برای ارزیابی قابلیت‌های سایبری پیشرفته

همان‌طور که اخیراً به اشتراک گذاشتیم، هوش مصنوعی کشف و بهره‌برداری از آسیب‌پذیری‌ها را شتاب می‌دهد. درس اصلی این رخداد این است که امنیت و ایمنی مدل باید هم‌پای قابلیت‌هایی که به‌سرعت پیشرفت می‌کنند رشد کند. ما شیوه‌های مهار، پایش، کنترل دسترسی و ارزیابی را که در طول توسعه مدل به کار می‌روند تقویت می‌کنیم.

ارزیابی UK AISI نشان می‌دهد مدل‌هایی مانند GPT‑5.6 Sol به‌طور فزاینده‌ای قادرند عملیات سایبری پیچیده و چندمرحله‌ای را در افق‌های زمانی بلند ادامه دهند. این رخداد نشان می‌دهد این قابلیت‌های نظری در محیط‌های واقعی نیز کاربرد دارند.

نموداری از مؤسسه امنیت هوش مصنوعی بریتانیا که مدل‌های اخیر با وزن‌های باز و مدل‌های پیشرو را در میدان‌های سایبری با افق زمانی بلند مقایسه می‌کند.

این رخداد همچنین روشن می‌کند که مدل‌های پیشرفته می‌توانند بدون دسترسی به کد منبع، مسیرهای حمله جدید را در سامانه‌های واقعی کشف و از آن‌ها بهره‌برداری کنند. این موضوع نشان می‌دهد قابلیت‌های سایبری پیشرفته باید هم‌زمان با تدابیر حفاظتی و ابزارهای دفاعی قوی‌تر توسعه یابند.

ما باور داریم مدل‌هایی که قابلیت‌های سایبری پیشرفته دارند باید به تیم‌های امنیتی کمک کنند ضعف‌ها را پیش از مهاجمان پیدا کنند، بفهمند آسیب‌پذیری‌ها چگونه می‌توانند به هم زنجیر شوند، و آن‌ها را با سرعت ماشین برطرف کنند. ما از این قابلیت‌ها برای ادامه تقویت حفاظت‌ها پیرامون پیکربندی زیرساخت و محیط‌های ارزیابی مدل استفاده می‌کنیم؛ و با پیشرفت یادگیری، یافته‌ها و بهترین رویه‌های خود را به اشتراک خواهیم گذاشت. ما دیگر مدافعان را تشویق می‌کنیم برای دسترسی مورد اعتماد درخواست دهند و همین حالا این مدل‌ها را بیازمایند تا این قابلیت‌ها به پیشگیری بهتر، شناسایی سریع‌تر و پاسخ‌گویی مؤثرتر به رخدادها تبدیل شود.

«از همکاری با OpenAI در این موضوع و موضوعات دیگر سپاسگزاریم. این رخداد، که شاید نخستین نمونه از نوع خود باشد، نکته‌ای را ثابت می‌کند که مدت‌ها به آن باور داشته‌ایم: ایمنی هوش مصنوعی با کار محرمانه هیچ شرکت واحدی حل نخواهد شد. این مسئله به‌صورت باز، با همکاری جمعی و با دسترسی گسترده هر مدافع، در هر جا، به هوش مصنوعی حل خواهد شد.»
—کلم دولانگ، هم‌بنیان‌گذار و مدیرعامل، Hugging Face

نویسنده

OpenAI