پرش به محتوای اصلی
OpenAI

۲۷ مرداد ۱۴۰۵

شرکتمقالات

تنظیم سرعت توسعه مدل در عصر قابلیت‌های سایبری بحرانی

در حال بارگذاری…

در چند هفتهٔ گذشته، دو تحول بر خطرات رو‌به‌رشد مرتبط با سامانه‌های هوش مصنوعی با توانمندی‌های فزاینده تأکید کرده‌اند: رویداد OpenAI-Hugging Face و، به‌طور جداگانه، شواهد اولیه‌ای مبنی بر اینکه یکی از مدل‌های آتی ما، Astra، ممکن است به آستانهٔ قابلیت حیاتی امنیت سایبری طبق چارچوب آمادگیما برسد. این دو تحول، همراه با پیشرفت سریع در پژوهش‌های داخلی ما، فوریت تلاش‌هایمان برای تقویت سازوکارهای حفاظتیِ پایش، هم‌راستاسازی و مهار را در تمام مراحل فرایند آموزش افزایش داده‌اند.

هرچه مدل‌ها توانمندتر می‌شوند، خطرات مرتبط با توسعه و آزمایش داخلی آن‌ها نیز افزایش می‌یابد. استانداردهای ما برای پایش، هم‌راستایی و امنیت باید همواره از این خطرات جلوتر باشند. می‌خواستیم زمان لازم را برای برآورده‌کردن این استانداردها صرف کنیم، بنابراین موقتاً سرعت مقیاس‌دهی را کاهش دادیم. این اقدام شامل توقف دوهفته‌ای آموزش یادگیری تقویتی (RL) روی جدیدترین مدل‌هایمان که برای استقرار در نظر گرفته شده‌اند نیز بود؛ در این مدت، محیط‌های پژوهشی خود را بیشتر مقاوم‌سازی امنیتی کردیم و به روش تیم قرمز ارزیابی کردیم و دامنهٔ پوشش سامانه‌های پایش را گسترش دادیم. بزرگ‌ترین اجرای برنامه‌ریزی‌شدهٔ یادگیری تقویتی برای مدل‌های پیشروی ما همچنان متوقف است و در همین حین، آموزش‌ها و ارزیابی‌هایی در مقیاس کوچک‌تر انجام می‌دهیم تا رفتار مدل را بررسی کنیم، اثربخشی سازوکارهای حفاظتی خود را اعتبارسنجی کنیم و پیش از ادامه، شواهد بیشتری از هم‌راستایی به دست آوریم.

هم‌راستاسازی—یعنی تلاش برای اطمینان از اینکه سامانه‌های هوش مصنوعی مطابق انتظار رفتار می‌کنند و به نظارت انسانی پاسخ‌گو هستند—از دیرباز در کانون برنامه پژوهشی ما بوده است. اکنون با تکیه بر پژوهش‌ها و ارزیابی‌های در حال انجام، در تمام مراحل آموزش به شواهد محکم‌تری از رفتار هم‌راستا نیاز داریم. حفظ هم‌راستایی سامانه‌های روزافزون توانمند، چالشی است که کل این حوزه باید به آن بپردازد. نشانه‌هایی که از پیشرفت مدل‌های آتی می‌بینیم، روشن می‌کنند که به رویکردی فراگیرتر نیاز داریم؛ رویکردی که بر چارچوب آمادگی کنونی بنا شود و از آن فراتر رود.

به باور ما، شفافیت درباره چگونگی تغییر رویکردمان اهمیت دارد. در ادامه، تغییراتی را که تاکنون در فرایندها و زیرساخت پژوهشی خود ایجاد کرده‌ایم و نیز کارهای در حال انجام را شرح می‌دهیم.

تقویت سازوکارهای حفاظتی برای مدل‌های توانمندتر

رویکرد ما برای توسعه مدل‌های توانمندتر بر سه سازوکار حفاظتی متقابلاً تقویت‌کننده استوار است:

  1. پایش که رفتارهای نگران‌کننده را شناسایی می‌کند و امکان واکنش به آن‌ها را می‌دهد.
  2. هم‌راستاسازی که احتمال اقدامات زیان‌بار یا غیرمجاز را کاهش می‌دهد.
  3. تدابیر امنیتی که دسترسی و دامنه اثرگذاری سامانه‌های هوش مصنوعی را محدود می‌کنند.

انتظار داریم مدل‌ها به‌زودی بخش عمده فعالیت‌های امنیتی، از جمله دفاع در برابر مدل‌های دیگر، را انجام دهند. این امر امکان می‌دهد هر سه سازوکار حفاظتی همگام با توانمندی مدل گسترش یابند؛ موضوعی که آن را حیاتی می‌دانیم.

این سازوکارهای حفاظتی را در پژوهش و استقرار به کار می‌گیریم و آن‌ها را با توانمندی‌ها، محیط عملیاتی و سطح خطر هر مدل تطبیق می‌دهیم.

ایمن‌سازی محیط‌های پژوهشی ما

با افزایش قابلیت‌های امنیت سایبری مدل‌های پیشرو، استانداردهای امنیتی محیط‌های آموزش و ارزیابی آن‌ها را ارتقا می‌دهیم. دستیابی به این استانداردها مستلزم فعالیت مهندسی گسترده بوده و هزینه و تأخیر قابل‌توجهی بر پژوهش‌های پیشرو تحمیل کرده است. بلافاصله پس از حادثه OpenAI و Hugging Face*، استنتاج مدل‌های پیشرو را در خوشه‌های پژوهشی برای اجراهایی متوقف کردیم که می‌توانستند کد اجرا کنند یا از ابزارهای دارای دسترسی به اینترنت استفاده کنند. نسبتاً سریع مسیری محدودتر و ایمن‌تر برای اجرای کد برقرار کردیم و سپس هر بار کاری را جداگانه بررسی کردیم تا مشخص شود آیا می‌تواند با ایمنی از سر گرفته شود یا نه. برخی بارهای کاری پژوهشی تحت کنترل‌های جدید از سر گرفته شدند، اما برخی دیگر به تغییرات بیشتری نیاز داشتند.

در هفته‌های بعد، الزامات امنیتی سخت‌گیرانه‌تری برای بارهای کاری پژوهشی پیشرو تعریف کردیم و اجرای آن‌ها را آغاز کردیم. برای مثال:

  • جداسازی بار کاری: اکنون برای بارهای کاری‌ای که کد تولیدشده توسط مدل یا هر کد نامطمئن دیگری را اجرا می‌کنند، جداسازی قوی‌تری («محیط‌های ایزوله») الزامی است. این الزام همچنین درباره نرم‌افزارهایی صدق می‌کند که ممکن است هنگام پردازش خروجی مدل به خطر بیفتند.
  • جداسازی شبکه: کنترل‌های بیشتری برای جداسازی بارهای کاری پرخطر و نامطمئن از اینترنت اجرا کرده‌ایم. این کنترل‌ها را به‌گونه‌ای طراحی کرده‌ایم که به خطر افتادن یک بار کاری یا سرویس پشتیبان، به‌تنهایی امکان دسترسی غیرمجاز به اینترنت یا دیگر شبکه‌های داخلی را فراهم نکند.
  • آزمایش امنیتی مستمر: محیط خود را بازپیکربندی کرده‌ایم تا سرویس‌های مشترک احتمالاً آسیب‌پذیر را حذف کنیم، دسترسی‌های دائمی را کاهش دهیم و مرزهای امنیتی و اعتماد را بهبود بخشیم. همچنین توانایی خود را برای گردآوری و پایش گزارش‌های امنیتی بهبود می‌دهیم. در نهایت، برای خودکارسازی آزمایش مستمر این مرزها در برابر حملات شبیه‌سازی‌شده، با استفاده از مدل‌های خود سرمایه‌گذاری می‌کنیم.

این کنترل‌ها در کنار هم دفاعی چندلایه فراهم می‌کنند و به محافظت از محیط پژوهشی ما در برابر حملات کمک می‌کنند. اکنون سخت‌گیرانه‌ترین سطح سازوکارهای امنیتی را برای بارهای کاری مرتبط با Astra یا مدل‌های سایبری الزامی می‌دانیم، زیرا تشخیص داده‌ایم که مدل‌های Astra ممکن است قابلیت سایبری در سطح بحرانی داشته باشند. این سازوکارهای حفاظتی درباره همه بارهای کاری مرتبط با حوزه سایبری نیز اعمال می‌شوند.

هرچند بخشی از آموزش‌ها و ارزیابی‌های Astra این الزامات را برآورده می‌کنند، شمار قابل‌توجهی از بارهای کاری تا زمان انتقال کامل و ارتقای آن‌ها برای دستیابی به استاندارد امنیتی جدید همچنان متوقف خواهند ماند. در انتقال به این محیط‌های جدید، ابتدا بارهای کاری ایمنی و هم‌راستاسازی را در اولویت قرار داده‌ایم.

گسترش پایش زنجیره تفکر

پایش از دیرباز بخش مهمی از فرایند توسعه مدل ما بوده است؛ از جمله پایش عامل‌های کدنویسی داخلی و نشست‌های طولانی‌مدت. فعالیت‌های پایشی ما به‌ویژه بر استقرارهای داخلی مدل‌های پیشرو و اجراهای آموزش یادگیری تقویتی پیشرو متمرکز بود. این موارد را پرخطرترین بارهای کاری می‌دانستیم، زیرا می‌توانند توانمندی‌های پیشرفته مدل را با دسترسی به ابزارها، سامانه‌های حساس و شبکه‌های داخلی یا خارجی ترکیب کنند. این پایش برای همه اجراهای استنتاج و آموزشِ استفاده‌کننده از ابزار اعمال نمی‌شد. با راه‌اندازی سامانه پایش جدید، رویکرد خود را بازنگری و گسترش داده‌ایم.

سامانه پایش جدید چندمرحله‌ای است. این فرایند با دسته‌بندهای فعال‌سازی—آشکارسازهایی که فعالیت داخلی مدل را بررسی می‌کنند—آغاز می‌شود؛ آن‌ها برای هر توکن نمونه‌برداری‌شده اجرا می‌شوند و موارد بالقوه نگران‌کننده را به بررسی‌کننده‌های خودکارِ به‌تدریج پیشرفته‌تر و پرمحاسبه‌تر ارجاع می‌دهند. این سامانه‌ها اقدامات ابزارها، استدلال در دسترس و توالی کامل فعالیت را برای شناسایی دسترسی غیرمجاز، سرقت داده، رفتار مخرب و تلاش برای خنثی‌کردن سازوکارهای حفاظتی بررسی می‌کنند. هدف ما این است که حداکثر ظرف ۳۰ دقیقه پس از آشکارشدن فعالیت نگران‌کننده در سامانه پایش، هشدار صادر کنیم. اگر سامانه پایش نقض احتمالی یکی از مرزهای امنیتی حیاتی را شناسایی کند، هشداری با بالاترین اولویت ایجاد می‌کند. در پیاده‌سازی کنونی، تیم‌های ایمنی، امنیت و پژوهش فوراً فراخوانده می‌شوند. اگر این تیم‌ها نتوانند ظرف ۳۰ دقیقه به‌طور قطعی مشخص کنند که هشدار مثبت کاذب است، باید فعالیت را متوقف کنند.

این پایش برای همه آموزش‌ها و ارزیابی‌های یادگیری تقویتیِ شامل ابزار، در مدل‌هایی با توانمندی Sol یا بالاتر، الزامی است. پس از آنکه در ۷ اوت تشخیص دادیم Astra ممکن است قابلیت‌های سایبری بحرانی داشته باشد، الزام پایشی دیگری برای تمام استنتاج‌های Astra همراه با ابزار—و نه فقط آموزش‌ها و ارزیابی‌های یادگیری تقویتی—افزودیم.

این سازوکارهای حفاظتی به توان محاسباتی قابل‌توجهی نیاز دارند. طبق برآوردهای کنونی ما، سربار پایش حدود ۲۰٪ از توان محاسباتی استنتاجِ تحت پایش است؛ هرچند هزینه آن در بارهای کاری آموزش و ارزیابی تفاوت چشمگیری دارد. جزئیات بیشتری درباره این سامانه در یکی از مطالب آتی وبلاگ منتشر خواهیم کرد.

پیشبرد پژوهش هم‌راستاسازی

پژوهش هم‌راستاسازی در کانون مأموریت ما قرار دارد. مأموریت ما تضمین این است که هوش مصنوعی عمومی به سود همه بشریت باشد. با دستیابی مدل‌ها به توانمندی‌های پیشرفته‌ای مانند اجرای حملات سایبری و فعالیت آن‌ها در محیط‌های پیچیده‌تر، رفتارهای ناهم‌راستا مانند سوءاستفاده از سازوکار پاداش (یافتن راه‌هایی برای دریافت پاداش بالا در آموزش بدون دستیابی واقعی به نتیجه موردنظر)، فریب یا دسترسی غیرمجاز، خطرات روزافزون و جدی‌تری ایجاد خواهند کرد.

اکنون در اجراهای یادگیری تقویتیِ توانمندترین مدل‌ها، روش‌های اصلی هم‌راستاسازی خود را در مراحل بیشتری از فرایند آموزش به کار می‌گیریم. این اقدامات شامل بهبود مدل‌های پاداش برای شناسایی و بازداشتن بهتر رفتارهای ناایمن در وظایف و محیط‌های مختلف؛ آموزش مدل‌ها برای صداقت بیشتر درباره اقدامات، توانمندی‌ها و محدودیت‌هایشان؛ و کاهش رفتارهایی است که از ضعف‌های پاداش‌ها، ارزیاب‌ها، ابزارها یا نظارت بهره‌برداری می‌کنند. همچنین پوشش آموزشی رفتارهایی را افزایش می‌دهیم که هنگام تعامل مدل‌ها با سامانه‌ها یا منابع خارجی می‌توانند زیان‌بار باشند.

همچنان به‌شدت در پژوهش هم‌راستاسازی سرمایه‌گذاری می‌کنیم، پوشش ارزیابی را افزایش می‌دهیم و از آموخته‌هایمان برای بهبود آموزش و سازوکارهای حفاظتی بهره می‌بریم. قصد داریم در آینده نزدیک اطلاعات بسیار بیشتری درباره پژوهش هم‌راستاسازی خود منتشر کنیم؛ از جمله یافته‌هایمان درباره رفتار مدل و چالش‌های تازه‌ای که کشف می‌کنیم.

گام بعدی چیست؟

چارچوب آمادگی خود را تکامل خواهیم داد تا این سازوکارهای حفاظتی را در سراسر آموزش و استقرار یکپارچه کند و توانمندی‌های مدل‌های آینده و محیط‌های عملیاتی آن‌ها را بهتر بازتاب دهد. توسعه روش‌هایی که بتوانند همگام با این توانمندی‌ها گسترش یابند، به سرمایه‌گذاری مستمر در امنیت با کمک مدل، پایش مؤثرتر و پیشرفت مداوم در پژوهش هم‌راستاسازی نیاز دارد. قصد داریم سازمان‌های بیرونی را مشارکت دهیم و با تکامل رویکردمان، آموخته‌های بیشتری را به اشتراک بگذاریم.

توانمندی‌های مدل‌های پیشرو به‌سرعت در حال افزایش است. توانایی ما برای درک، هم‌راستاسازی و ایمن‌سازی آن‌ها باید همواره جلوتر باشد.


*در هفته‌های آینده، گزارشی فنی از آموخته‌های خود منتشر خواهیم کرد.

نویسنده

OpenAI