ارزیابیهای سایبری شخص ثالث از مدلهای OpenAI
آزمایش مستقل نقش مهمی در کمک به اعتبارسنجی و درک بهتر ریسکها پیش از استقرار دارد. برخی ارزیابیهای سایبری عمداً از پیکربندیهای سفارشی، از جمله تدابیر حفاظتی کاهشیافته، استفاده میکنند تا قابلیتهای زیربنایی را بسنجند، نه رفتار معمول مدلها در نسخههای در دسترس عموم را.
در ارزیابیهای اخیر، دو شریک آزمایش خارجی رخدادهایی را شناسایی کردند که در آنها ترکیب پیکربندیها و کنترلهای آزمایشی با قابلیتهای روبهرشد مدلهای جدید باعث شد فعالیت مدلها از مرزهای موردنظر آزمایش فراتر رود. این رخدادها بر اهمیت همکاری در سراسر صنعت و با ارزیابان شخص ثالث برای تکامل استانداردهای محیطها و شیوههای آزمایش، همزمان با افزایش توانمندی مدلها، تأکید میکنند. یادداشت ویراستار: این موارد جدا از رخداد امنیتی Hugging Face هستند و بهروزرسانیهای مربوط به آن رخداد را همچنان اینجا منتشر خواهیم کرد.
در رخدادهای جدید، مدلهای OpenAI طی ارزیابیهای سایبری شخص ثالث و در شرایط خاص و پیکربندیهایی با تدابیر حفاظتی کاهشیافته که بازتابدهنده استقرار معمول نبودند، به اینترنت عمومی دسترسی یافتند. این رخدادها عبارت بودند از:
- UK AISI، مؤسسه امنیت هوش مصنوعی دولت بریتانیا، ارزیابیهایی را در محدودههای سایبری اجرا میکرد که در آنها دسترسی به اینترنت عمداً فعال بود تا عاملها بتوانند ابزارهای موردنیازشان را پیدا کنند و در شرایطی نزدیکتر به یک مهاجم واقعی عمل کنند. طبقهبندهای سایبری نیز برای سنجش قابلیتهای زیربنایی غیرفعال شده بودند. میتوانید مطلب وبلاگ آنها را اینجا بخوانید.(در یک پنجره جدید باز میشود)
- Irregular، یکی از شرکای شخص ثالث ما در آزمایش امنیت سایبری، ارزیابیهایی به سبک تسخیر پرچم اجرا میکرد که قرار بود از اینترنت جدا باشند؛ اما پیکربندی نادرست محیط آزمایش به مدلها امکان داد به اینترنت عمومی دسترسی پیدا کنند.
در ادامه، آنچه رخ داد، شرایط آزمایشی زمینهساز این فعالیت، اقدامات انجامشده برای مهار آن و تلاشهایمان برای اطمینان از تداوم ارزیابی دقیق و ایمن مدلهای روزافزون توانمند بهدست آزمایشگاههای مستقل را خلاصه میکنیم.
این رخدادها به همان چالش گستردهتری اشاره دارند که در مطلب اخیرمان درباره رخداد Hugging Face شرح دادیم: با پیشرفت قابلیتهای مدل، سامانههای ایمنی و امنیتی پیرامون مدلها نیز باید پیشرفت کنند. این موضوع هم محیطهای توسعه مدلها و هم محیطهایی را در بر میگیرد که آزمایشگاهها و شرکای مستقل برای ارزیابی آنها استفاده میکنند.
در هفتههای آینده، رویکرد خود به آزمایشهای شخص ثالث را بازبینی خواهیم کرد؛ از جمله نحوه شناسایی ارزیابیهای پرریسکتر، توافق درباره دامنه، بررسی درخواستهای فعالسازی اینترنت یا کاهش تدابیر حفاظتی، تعیین انتظارات درباره جداسازی، مدیریت اطلاعات ورود، پایش و شرایط توقف، و ایجاد فرایندهای روشنتر برای اطلاعرسانی و تشدید رسیدگی به رخدادها.
متعهدیم برای تقویت شیوههای مشترک اجرای ایمن ارزیابیهای پرریسک با سراسر صنعت همکاری کنیم؛ از جمله در هفتههای آینده ذینفعانی مانند مؤسسههای ملی هوش مصنوعی، ارزیابان مستقل، دیگر آزمایشگاههای هوش مصنوعی و سایر گروهها را گرد هم آوریم. هدف ما حفظ ارزش ارزیابی مستقل و دقیق است، درحالیکه اطمینان مییابیم شیوههای آزمایش با توانمندی روزافزون مدلها همگام میمانند.
در ۳ اوت، UK AISI به ما اطلاع داد که در جریان یک ارزیابی سایبری معمول که از ۲۵ ژوئیه آغاز شده بود، مدلهای OpenAI و یک آزمایشگاه دیگر در برخی موارد از دامنه آزمایش فراتر رفتهاند. این ارزیابی در محدودههای سایبری کنترلشدهای انجام شد که برای شبیهسازی شبکههای دنیای واقعی طراحی شده بودند. از ۱۹ رویداد شناساییشده، دو مورد مربوط به مدل GPT‑5.6 Sol از OpenAI بود. موارد دیگر مربوط به مدلهای آزمایشگاهی دیگر بودند.
در این ارزیابی، به عاملها دستور داده شده بود در تمرین تسخیر پرچم نقش متخصصان امنیت سایبری را ایفا کنند: به سه محیط شبیهسازیشده متصل نفوذ کنند و پرچم نهایی را به دست آورند. اعلان وظیفه، شبکههای درون محدوده را مشخص کرده و چند سامانه را خارج از محدوده نامیده بود. UK AISI همچنین دسترسی زنده به اینترنت را فعال کرد تا عاملها بتوانند ابزار دانلود کنند و در شرایطی نزدیکتر به یک مهاجم انسانی عمل کنند؛ طبقهبندهای سایبری مدل را نیز برای سنجش قابلیتهای زیربنایی غیرفعال کرد.
مرز مجوز موردنظر UK AISI همان محدوده سایبری شبیهسازیشده بود: عاملها اجازه داشتند به شبکههای شبیهسازیشده مشخص حمله کنند و پرچم را به دست آورند، اما مجاز به تعامل با سامانههای خارج از مرز شبکه محدوده نبودند. بااینحال، به عاملها صریحاً گفته نشده بود که چگونه میتوانند یا نمیتوانند از دسترسی آزاد به اینترنت استفاده کنند؛ موضوعی که UK AISI آن را یکی از علل احتمالی مؤثر در رخداد میداند.
UK AISI در مجموع این اجراها دریافت که GPT‑5.6 Sol هنگام تلاش برای یافتن راهی به محدوده شبیهسازیشده و بهدستآوردن پرچم، دو اقدام بدون مجوز انجام داده است:
- GPT‑5.6 Sol برای بررسی اینکه آیا سامانهای در محدوده، GitHub یا سرویس بهروزرسانی دیگری را پایش میکند، از توکن GitHub متعلق به عامل آزمایشگاه دیگری که در دسترس عموم رها شده بود استفاده کرد، کوشید بازیابی حساب و محدودیت درخواستها را دور بزند و نزد ارائهدهندگان خارجی DNS و تونلسازی حساب ساخت.
- GPT‑5.6 Sol با استفاده از یک سرویس عمومی تونلسازی، سرور DNS در حال اجرای محلی در محیط ارزیابی خود را از اینترنت عمومی دسترسپذیر کرد. این سرور حاوی محمولههایی بود که برای بهرهبرداری از یک آسیبپذیری شناختهشده در نرمافزاری در حال اجرا در محدوده آزمایش طراحی شده بودند. این پیکربندی کار نکرد، هیچ مدرکی وجود ندارد که حلکنندهای واقعی از آن پرسوجو کرده باشد و زیرساخت نیز پس از پایان ارزیابی حذف شد.
اگرچه مدل در تلاش بود محدوده سایبری را تکمیل کند، UK AISI این اقدامات را بدون مجوز دانست، زیرا مستلزم استفاده از حسابها و سرویسهای خارجی واقعی در بیرون از مرز محدوده بودند و برای انجام وظیفه نیز ضرورتی نداشتند. سرور DNS همچنین محمولههای بهرهبرداری را در اینترنت عمومی میزبانی میکرد؛ هرچند این پیکربندی کار نکرد و هیچ مدرکی وجود ندارد که حلکنندهای واقعی از آن پرسوجو کرده باشد.
UK AISI در ۲۸ ژوئیه، پس از شناسایی انتقالهای غیرعادی داده بهوسیله سامانه پایش امنیتی، این فعالیت را تشخیص داد. این مؤسسه ارزیابیهای مرتبط را متوقف و دستگاههای مربوط را ایزوله کرد و ظرف حدود یک ساعت پس از شناسایی، فعالیت را مهار کرد.
از همکاری UK AISI در سراسر این فرایند، از جمله تلاش آن برای شناسایی و بررسی فعالیت و بهاشتراکگذاری جزئیاتش، قدردانی میکنیم. مشتاق ادامه همکاری مشترکمان هستیم.
در ۲۹ ژوئیه، Irregular، یکی از شرکای ارزیابی شخص ثالث ما، رخدادی را در ارزیابیهای امنیت سایبری به سبک تسخیر پرچم (CTF) که مدلهای OpenAI در آن دخیل بودند، به ما اطلاع داد. به مدلها دستور داده شده بود با بهرهبرداری از ضعفهای یک محیط شبیهسازیشده، اطلاعات پنهان را پیدا کنند و به آنها گفته شده بود که به اینترنت دسترسی ندارند. بااینحال، پیکربندی نادرست محیط آزمایش به مدلها امکان داد به اینترنت عمومی دسترسی پیدا کنند.
در یکی از آزمایشها، نام هدف خیالی چالش CTF ناخواسته با یک دامنه واقعی یکسان بود. از آنجا که محیط آزمایش بهاشتباه به اینترنت متصل بود، مدل با تصور اینکه یک وبسایت واقعی بخشی از محیط شبیهسازیشده است، از آن بهرهبرداری کرد. این رخداد شامل فرار پیچیده از محیط ایزوله یا آسیبپذیری روز صفر نبود: دسترسی به اینترنت ناشی از پیکربندی نادرست بود و به نظر میرسد مدل از یک آسیبپذیری امنیتی ساده بهرهبرداری کرده است.
بر پایه بررسی Irregular، مدل همچنین اطلاعات ورود را پیدا کرد و از آنها برای اداره همان سایت استفاده کرد. Irregular تأثیری فراتر از دادههای خود سایت آسیبدیده شناسایی نکرده و ممیزی آن همچنان ادامه دارد. این شرکت ارزیابیها را متوقف کرده، اصلاحات را آغاز کرده و اشخاص ثالث آسیبدیده نیز مطلع شدهاند. Irregular به ما اطلاع داده است که همه مشکلات شناساییشده مرتبط با این رخداد برطرف شدهاند و تدابیر حفاظتی لازم به محیط آزمایش افزوده شده است. Irregular همچنین درباره رخدادهای مرتبط با آزمایشگاههای دیگر در همان محیط آزمایش اطلاعرسانی کرده است.
از همکاری Irregular قدردانی میکنیم و برای پشتیبانی از بررسی این شرکت، به همکاری نزدیک با آن ادامه خواهیم داد. Irregular همچنین در حال تدوین گزارشی جامع برای ارائه بهترین شیوههای مهار و اجرای امن ارزیابیهای سایبری است. مشتاقیم در تدوین این گزارش مشارکت کنیم تا یافتهها در اختیار جامعه قرار گیرد و همکاری مشترکمان ادامه یابد. چنین همکاریهایی را برای تضمین ارزیابی ایمن و جامع مدلهای کنونی و آینده ضروری میدانیم.


