OpenAI و Hugging Face برای رسیدگی به رخداد امنیتی هنگام ارزیابی مدل همکاری میکنند
هفته گذشته، Hugging Face پس از شناسایی و مهار یک عامل هوش مصنوعی که زیرساخت آنها را به خطر انداخته بود، نوع تازهای از رخداد امنیتی را افشا کرد(در یک پنجره جدید باز میشود)؛ رخدادی که انتظار داریم با گسترش مدلهایی که قابلیتهای سایبری فزایندهای دارند، رایجتر شود. پس از تحقیق، اکنون میدانیم که این رخداد مشخص بر اثر ترکیبی از مدلهای OpenAI رخ داده است — از جمله GPT‑5.6 Sol و یک مدل پیشانتشار حتی توانمندتر، همگی با کاهش رد درخواستهای سایبری برای اهداف ارزیابی — در حالی که این مدلها بهصورت داخلی روی یک بنچمارک(در یک پنجره جدید باز میشود) قابلیتهای سایبری آزمایش میشدند.
ما این رخداد را یک رخداد سایبری بیسابقه میدانیم که قابلیتهای سایبری در سطح پیشرفتهترین فناوریهای روز را در بر میگیرد، و متناسب با آن پاسخ میدهیم. در این مرحله یافتههای اولیه را به اشتراک میگذاریم تا به مدافعان کمک کنیم بفهمند چه اتفاقی افتاد و درک خود را از تواناییهای کنونی مدلها تنظیم کنند. ما به انجام تحقیقی جامع در کنار Hugging Face ادامه خواهیم داد و پس از تکمیل تحقیق، جزئیات بیشتری درباره آسیبپذیریها، رخداد و یافتهها منتشر خواهیم کرد.
این رخداد در جریان یک ارزیابی داخلی رخ داد که در آن از مدلها خواسته میشود برای سنجش کمّی قابلیتهای سایبریشان، بهرهبرداری پیشرفته را از طریق مسیرهای حمله پیچیده دنبال کنند. ما بیشینه قابلیتهای سایبری را با اجرای این ارزیابی بدون طبقهبندهای تولیدیای برآورد میکنیم که برای جلوگیری از دنبالکردن فعالیتهای سایبری پرخطر توسط مدلها به کار میروند. بنچمارکهای ما در محیطی بسیار ایزوله اجرا میشوند؛ دسترسی شبکه در آن به امکان نصب بستهها از طریق نرمافزار شخص ثالثی محدود است که بهصورت داخلی میزبانی میشود و نقش پراکسی و کش را برای رجیستریهای بستهها ایفا میکند.
مدلها آسیبپذیریهایی را در سراسر محیط پژوهشی OpenAI و زیرساخت تولید Hugging Face شناسایی و به هم زنجیر کردند تا راهحلهای آزمون را مستقیماً از پایگاه داده تولید Hugging Face به دست آورند. همه شواهد نشان میدهد که مدلها بهشدت بر یافتن راهحلی برای ExploitGym متمرکز شده بودند و برای رسیدن به هدفی نسبتاً محدود در آزمون، تا حدی افراطی پیش رفتند.
مدلهای ما هنگام کار در محیط آزمون سندباکسشده، برای حل مسئله ارزیابی مقدار قابلتوجهی از توان محاسباتی استنتاج را صرف یافتن راهی برای دسترسی به اینترنت آزاد کردند. برای به دست آوردن این دسترسی، مدلها یک آسیبپذیری روز صفر را در پراکسی کش رجیستری بستهها شناسایی و از آن بهرهبرداری کردند؛ آسیبپذیریای که اکنون آن را مسئولانه به فروشنده افشا کردهایم. با این دسترسی، مدلهای ما مجموعهای از اقدامات ارتقای سطح دسترسی و حرکت جانبی را در محیط آزمون پژوهشی ما انجام دادند تا سرانجام به گرهی با دسترسی اینترنت رسیدند.
پس از به دست آوردن دسترسی به اینترنت، مدلها استنباط کردند که Hugging Face احتمالاً میزبان مدلها، مجموعهدادهها و راهحلهایی برای ExploitGym است. با دانستن این موضوع، مدل به جستوجو پرداخت و با موفقیت راههایی برای دسترسی به اطلاعات محرمانه یافت که میتوانست از آنها برای تقلب در ارزیابی استفاده کند. در یک نمونه، مدل چندین بردار حمله را به هم زنجیر کرد؛ از جمله استفاده از اعتبارنامههای سرقتشده و آسیبپذیریهای روز صفر برای یافتن مسیری جهت اجرای کد از راه دور روی سرورهای Hugging Face. تیم امنیتی OpenAI این فعالیت غیرعادی را بهصورت داخلی کشف کرد.
تیم امنیتی و عاملهای Hugging Face این فعالیت را روی زیرساخت خود شناسایی و متوقف کردند و پیش از اتصال تیمهای ما، با مدلهای متنباز خود فرایند مهار و بازسازی جرمشناسانه را آغاز کرده بودند. ما فعالانه با آنها همکاری میکنیم تا تحقیق درباره این رخداد را ادامه دهیم. از همکاری سریع و نزدیک Hugging Face در تحقیق و اصلاح بسیار سپاسگزاریم.
- در چارچوب این تحقیق، تا زمان وصلهشدن آسیبپذیریها، کنترلهای سختگیرانهای را در پیکربندی زیرساخت اجرا میکنیم؛ حتی اگر به قیمت کندتر شدن سرعت پژوهش تمام شود. ما بهطور منظم کمیته ایمنی و امنیت خود را درباره این کنترلها و اثرات آنها در جریان میگذاریم.
- ما با Hugging Face همکاری میکنیم تا این رخداد را بهصورت جرمشناسانه بررسی کنیم.
- ما آسیبپذیری روز صفر شناساییشده در نرمافزار شخص ثالث میزبانیشده بهصورت داخلی را مسئولانه افشا کردهایم و با آنها برای وصلهکردن آن همکاری میکنیم.
- ما Hugging Face را وارد برنامه دسترسی مورد اعتماد کردهایم و از تیمهای آنها پشتیبانی میکنیم تا بهسرعت از قابلیتهای مدلهای ما برای بهبود دفاعهایشان استفاده کنند.
- ما در حال بهبود و افزودن حفاظتهای قویتر پیرامون آموزشها و ارزیابیهای آینده هستیم. این هفته، وبلاگی درباره بهبود ایمنی و همسویی در عصر مدلهای با افق زمانی بلند منتشر کردیم. این تدابیر حفاظتیِ استقرار عمداً در طول این ارزیابی فعال نشده بودند، زیرا هدف آن آزمودن آسیبپذیریهای سایبری بود. این رخداد نشان میدهد که باید همسویی مدل، حفاظتهای سایبری در زمان ارزیابی، و پایش در طول آزمونهای داخلی را بیش از پیش تقویت کنیم.
همانطور که اخیراً به اشتراک گذاشتیم، هوش مصنوعی کشف و بهرهبرداری از آسیبپذیریها را شتاب میدهد. درس اصلی این رخداد این است که امنیت و ایمنی مدل باید همپای قابلیتهایی که بهسرعت پیشرفت میکنند رشد کند. ما شیوههای مهار، پایش، کنترل دسترسی و ارزیابی را که در طول توسعه مدل به کار میروند تقویت میکنیم.
ارزیابی UK AISI نشان میدهد مدلهایی مانند GPT‑5.6 Sol بهطور فزایندهای قادرند عملیات سایبری پیچیده و چندمرحلهای را در افقهای زمانی بلند ادامه دهند. این رخداد نشان میدهد این قابلیتهای نظری در محیطهای واقعی نیز کاربرد دارند.

این رخداد همچنین روشن میکند که مدلهای پیشرفته میتوانند بدون دسترسی به کد منبع، مسیرهای حمله جدید را در سامانههای واقعی کشف و از آنها بهرهبرداری کنند. این موضوع نشان میدهد قابلیتهای سایبری پیشرفته باید همزمان با تدابیر حفاظتی و ابزارهای دفاعی قویتر توسعه یابند.
ما باور داریم مدلهایی که قابلیتهای سایبری پیشرفته دارند باید به تیمهای امنیتی کمک کنند ضعفها را پیش از مهاجمان پیدا کنند، بفهمند آسیبپذیریها چگونه میتوانند به هم زنجیر شوند، و آنها را با سرعت ماشین برطرف کنند. ما از این قابلیتها برای ادامه تقویت حفاظتها پیرامون پیکربندی زیرساخت و محیطهای ارزیابی مدل استفاده میکنیم؛ و با پیشرفت یادگیری، یافتهها و بهترین رویههای خود را به اشتراک خواهیم گذاشت. ما دیگر مدافعان را تشویق میکنیم برای دسترسی مورد اعتماد درخواست دهند و همین حالا این مدلها را بیازمایند تا این قابلیتها به پیشگیری بهتر، شناسایی سریعتر و پاسخگویی مؤثرتر به رخدادها تبدیل شود.
«از همکاری با OpenAI در این موضوع و موضوعات دیگر سپاسگزاریم. این رخداد، که شاید نخستین نمونه از نوع خود باشد، نکتهای را ثابت میکند که مدتها به آن باور داشتهایم: ایمنی هوش مصنوعی با کار محرمانه هیچ شرکت واحدی حل نخواهد شد. این مسئله بهصورت باز، با همکاری جمعی و با دسترسی گسترده هر مدافع، در هر جا، به هوش مصنوعی حل خواهد شد.»


