پرش به محتوای اصلی
OpenAI

۶ مهر ۱۴۰۵

ایمنی

به‌سوی پرونده‌های ایمنی برای آموزش هوش مصنوعی پیشرو

در حال بارگذاری…

معتقدیم در آستانه دورانی تازه هستیم که در آن، پیش از ادامه هر دوره آموزش یادگیری تقویتی مدل‌های پیشرو، ارائه مستندات ساختاریافته ایمنی باید الزامی باشد. در حالت مطلوب، این مستندات باید به سطح «پرونده‌های ایمنی» برسند؛ یعنی استدلال‌های جامع، ساختاریافته و مبتنی بر شواهد درباره ریسک که در دیگر صنایع با حساسیت بالای ایمنی به کار می‌روند. پرونده‌های ایمنی را هدفی آرمانی و راهنمای مسیر خود می‌دانیم و برای رسیدن به آن تلاش می‌کنیم. در عین حال، اذعان داریم که به‌دلیل پیچیدگی‌های نوظهور در هر سطح تازه از توانمندی هوش مصنوعی، دستیابی به همان میزان استحکام و دقتِ پرونده‌های ایمنی هوانوردی یا انرژی هسته‌ای برای مدل‌های هوش مصنوعی چالش‌برانگیز است. در حال کار روی چارچوبی برای مدون‌کردن این رویه‌ها هستیم.

در ادامه، چند دستورالعمل اولیه آمده است که به‌نظر ما باید بخشی از این پرونده‌های ایمنی برای آموزش هوش مصنوعی پیشرو باشند. این بهترین رویه‌ها بازتاب آموخته‌های فعلی ما هستند و انتظار داریم هم‌زمان با اصلاح مداوم فرایندهای داخلی برای توسعه محتاطانه، تکامل یابند. اکنون آن‌ها را منتشر می‌کنیم تا دیدگاه فعلی ما شفاف باشد و از جامعه دعوت کنیم بازخورد بدهد. توجه داشته باشید که تمرکز این سند بر آموزش یادگیری تقویتی مدل‌های پیشرو است؛ استقرار داخلی و خارجی مستلزم توجه به مجموعه بسیار گسترده‌تری از ویژگی‌های همسویی است.

۱. تدابیر حفاظتی فنی

پرونده‌های ایمنی باید سه جنبه از پشته فنی را پوشش دهند: آموزش همسویی، محصورسازی و پایش. این تدابیر کمک می‌کنند اطمینان یابیم مدل برای انجام اقدامات ناهمسو تلاش نمی‌کند؛ و حتی اگر چنین کند، خروج از محیط محصور برایش دشوار خواهد بود و پایش، پیش از بروز آسیب آن را شناسایی خواهد کرد.

  • همسویی مدل: نخستین خط دفاعی باید آموزش مدل‌ها برای همسویی باشد؛ یعنی به‌گونه‌ای قابل‌اعتماد، مطابق خواست ما عمل کنند. این کار می‌تواند شامل موارد زیر باشد:

    • محیط‌های آموزش و نمره‌دهی: با جلوگیری از تقویت مثبت سوءاستفاده از سازوکار پاداش در طول آموزش، خطر شکل‌گیری رفتار ناهمسو در مدل‌ها را کاهش دهید. این کار می‌تواند شامل موارد زیر باشد:

      • بازبینی خودکار مجموعه‌داده‌ها: از عامل‌ها برای یافتن و اصلاح محیط‌های معیوب یادگیری تقویتی استفاده کنید؛ محیط‌هایی که ممکن است در آن‌ها مسیرهای ناهمسو به‌جای رفتار مطلوب، با بهره‌برداری از نقص‌ها پاداش زیادی بگیرند. با این کار فرصت تقویت ناهمسویی در طول آموزش کاهش می‌یابد.

      • بازبینی دستی مجموعه‌داده‌ها: آزمون‌های خودکار تیم قرمز را با بازبینی دستی و کنترل کیفیت مجموعه‌داده‌ها تکمیل کنید تا وظایف معیوبی شناسایی شوند که ممکن است ناخواسته رفتار ناهمسو را تقویت کنند.

      • تنظیم نمره‌دهنده‌ها: نمره‌دهنده‌ها را طوری تنظیم کنید که تلاش مدل برای سوءاستفاده از نقص‌ها یا هک محیط‌های یادگیری تقویتی در طول آموزش را جریمه کنند.

      • تحلیل دوره‌های قبلی: طبقه‌بندها را روی ردپاهای ثبت‌شده از آزمایش‌های قبلی اجرا کنید تا از عملکرد مطلوب نمره‌دهنده‌ها مطمئن شوید.

    • سنجش همسویی: ارزیابی‌هایی انجام دهید که گرایش مدل به ناهمسویی را رصد کنند تا اثربخشی آموزش همسویی سنجیده شود. این کار می‌تواند شامل موارد زیر باشد:

      • ارزیابی‌های آفلاین همسویی: در طول دوره‌های آموزش مدل‌های پیشرو، ارزیابی همسویی انجام دهید تا مشخص شود آموزش طبق انتظار پیش می‌رود یا نه، و هر افت معناداری را بررسی کنید.

      • آزمون بر داده‌های گذشته: ارزیابی‌های همسویی را با حوادث قبلی بیازمایید تا مطمئن شوید مدل‌های ناهمسوی پیشین را تشخیص می‌دهند و دچار بیش‌برازش به حوادث خاص نمی‌شوند.

      • رصد فریب ارزیابی: آگاهی ارزیابی یا بازی‌دادن آزمون (تشخیص مدل‌ها که در حال آزموده‌شدن هستند) را که می‌تواند باعث تغییر رفتار شود رصد کنید و آستانه‌های مشخصی برای توقف تعیین کنید (مثلاً سامانه‌های پایش آگاهی ارزیابی و بازی‌دادن آزمون را در ارزیابی‌های همسویی فعال کنید).

      • آزمون‌های فشار در بدترین حالت: بدترین رفتار نامطلوب را در مدل برانگیزید و بررسی کنید که دست‌کم یک ارزیابی آن را تشخیص می‌دهد.

    • جلوگیری از آموزش بر مبنای زنجیره تفکر: در یادگیری تقویتی، اجازه ندهید نمره‌دهنده‌های خودکار زنجیره تفکر را ببینند تا مدل‌ها در مسیر فرار از سامانه‌های پایش زنجیره تفکر تکامل نیابند.

  • محصورسازی: جداسازی محیط اجرا و تدابیر امنیتی را آن‌قدر تقویت کنید که اگر مدلی ناهمسو شد، نتواند اقدامات آسیب‌زا انجام دهد. این کار می‌تواند شامل موارد زیر باشد:

    • چند لایه امنیت زیرساخت: برای مقاوم‌سازی محیط ایزوله‌ای که مدل در آن اجرا می‌شود و زیرساخت پژوهشی میزبان آن، سرمایه‌گذاری قابل‌توجهی انجام دهید تا در صورت خروج از محیط ایزوله، لایه حفاظتی دیگری نیز وجود داشته باشد.

    • آزمون‌های تیم قرمز برای محصورسازی: با استفاده از نسخه‌های ذخیره‌شده مدل در دوره‌های آموزش پیشرو و مشروط به تحلیل ایمنی، آزمون‌های تیم قرمز را به‌طور تکرارشونده روی این سامانه‌ها انجام دهید تا شکاف‌ها را بیابید و برطرف کنید و امنیت محیط ایزوله، زیرساخت پژوهشی و مرزهای شبکه را بهبود دهید. همچنین همه سرویس‌هایی را که مدل در طول آموزش می‌تواند با آن‌ها تعامل داشته باشد (مثلاً حافظه نهان اینترنت) تحت آزمون‌های تیم قرمز قرار دهید.

    • ارتباط بین نمونه‌ها: ارتباط با پهنای باند بالا بین نمونه‌ها را به مسیرهای تأییدشده، مانند ابزارهای چندعاملی، محدود کنید و کانال‌های جانبی زیرساخت را که پهنای باند بالایی دارند و عامل‌ها به‌آسانی کشفشان می‌کنند ببندید.

    • متن تغییرناپذیر تعاملات: متن تعاملات عامل‌ها را در همه فرایندهای آموزش یادگیری تقویتی، ارزیابی و استقرار داخلی، برای مدتی معقول به‌شکلی تغییرناپذیر ذخیره کنید (مثلاً در حساب‌های ذخیره‌سازی با قابلیت نوشتن فقط یک‌بار) تا بررسی قابل‌اعتماد حوادث ممکن شود و از ویرایش ناخواسته جلوگیری شود.

  • پایش: سامانه پایش زنده‌ای داشته باشید تا اگر مدل‌ها شروع به اقدامات ناهمسو کردند، هرگونه ناهمسویی احتمالی را شناسایی کند و مشکلات دارای اولویت، پیش از وقوع حادثه‌ای جدی، به‌سرعت برطرف شوند. این کار می‌تواند شامل موارد زیر باشد:

    • الزام پایش‌پذیری: با ارزیابی‌های پایش‌پذیری و گریز از پایش و با آستانه‌های روشن، مطمئن شوید مدل‌ها همچنان پایش‌پذیر می‌مانند تا رفتار نگران‌کننده زود شناسایی شود.

    • نرخ بازیابی بالا برای مشکلات شناخته‌شده: مطمئن شوید سامانه پایش در ارزیابی روی داده‌های کنارگذاشته‌شده، نرخ بازیابی بالایی برای حوادث گذشته دارد.

    • به‌روز بودن ارزیابی سامانه‌های پایش: برای دوره‌های جدید، نمونه‌های ارزیابی نماینده ریسک‌های کاملاً تازه بسازید تا سنجه‌های نرخ بازیابی و دقت سامانه پایش به‌روز بمانند.

    • واکنش سریع: هشدارهای دارای اولویتی پیاده‌سازی کنید که پیش از آسیب‌رساندن مدل و در مهلت توافق‌نامه سطح خدمت مشخص، به اقدام منجر شوند؛ یا با فراخواندن مسئول کشیک یا با توقف موقت خودکار دوره درگیر (مثلاً در حوادث روزانه، به مسئول کشیک امنیت و مسئول دوره هشدار فوری دهید و شب‌ها، در صورت تأییدنشدن دریافت هشدار، دوره‌ها را خودکار متوقف کنید).

۲. دستورالعمل‌های عملیاتی

در کنار توصیه‌های مربوط به تدابیر حفاظتی فنی، در حال تدوین بهترین رویه‌های عملیاتی برای پرونده‌های ایمنی دوره‌های آموزش هوش مصنوعی پیشرو بوده‌ایم. این رویه‌ها می‌توانند شامل موارد زیر باشند:

  • نقدهای مخالف (تحلیل پیشاپیش شکست): پس از تدوین پیش‌نویس پرونده ایمنی، یکی از اعضای تیمی دیگر باید نقدی مخالف بنویسد تا کاستی‌های احتمالی پرونده مشخص شود و برآوردی سنجیده از ریسک ارائه دهد. سپس تیم آموزش باید به این نقد پاسخ دهد تا پرونده ایمنی تقویت شود.

  • تأییدها: اعضای مدیریت ارشد باید پرونده ایمنی را بررسی کنند و هر یک اختیار وتوی دوره آموزش را داشته باشند تا چند لایه نظارت داخلی بر آن وجود داشته باشد (مثلاً مدیر یا معاون بخش پژوهش، رئیس ایمنی و دانشمند ارشد).

  • پاسخ‌گویی: مدیر ارشد مسئول دوره آموزش (مثلاً مدیر یا معاون بخش پژوهش) باید در قبال پرونده ایمنی و هرگونه واکنش به حادثه پاسخ‌گو باشد؛ این مسئولیت باید در ارزیابی عملکرد او نیز لحاظ شود تا تیم‌های آموزش برای پیشبرد ایمنی و همسویی هم انگیزه داشته باشند.

  • توقف موقت: اگر مشکلاتی یافت شد که اعتبار پرونده ایمنی را زیر سؤال می‌برد (مثلاً یک مشکل امنیتی جدید)، باید دستورالعمل‌های اجرایی، کنترل‌های فنی و توافق‌نامه‌های سطح خدمت برای توقف موقت همه دوره‌های مشمول وجود داشته باشد.

  • شفافیت داخلی: پرونده‌های ایمنی باید در اختیار گروه‌های نظارت داخلی (مثلاً کمیتهٔ ایمنی و امنیت) قرار گیرند.

  • ممیزی‌ها: باید دسترسی کافی به ممیزان داده شود تا اعتبار و استحکام ادعاهای پرونده ایمنی را راستی‌آزمایی کنند و کاستی‌های احتمالی را گزارش دهند.

  • ارجاع به سطوح بالاتر: باید فرایند روشنی برای ارجاع موارد ناهمسویی به سطوح بالاتر، جدولی از سطوح تعریف‌شده شدت ناهمسویی و مسئول کشیک ناهمسویی وجود داشته باشد که وقتی دوره آموزش به سطح مشخصی از شدت می‌رسد، بتواند به مدیران ارشد (مثلاً مدیرعامل) هشدار فوری بدهد.

  • کنترل‌های فنی: شروع دوره‌های آموزش مغایر با الزامات باید برای انسان‌ها و عامل‌ها دشوار باشد. قابلیت‌های ایمنی مانند پایش و توقف موقت خودکار باید در صورت خرابی، جلوی ادامه فعالیت را بگیرند (مثلاً نباید بتوان دوره‌ها را بدون فعال‌بودن پایش مناسب آغاز کرد یا سامانه پایش را از داخل محیط آموزش یادگیری تقویتی، ارزیابی یا استقرار داخلی غیرفعال کرد).

  • امکان بازگردانی: شناسایی همه کاربردهای پایین‌دستی یک مدل ناهمسو در فرایند آموزش (مثلاً تولید داده یا نمره‌دهی) باید آسان باشد تا در صورت نیاز بتوان اثر خروجی‌های ناهمسو را خنثی کرد.

  • جامعیت ریسک‌های باقی‌مانده: پرونده‌های ایمنی باید تا حد امکان فهرست جامعی از ریسک‌های باقی‌مانده‌ای ارائه دهند که تدابیر کاهشی فعلی آن‌ها را پوشش نمی‌دهند تا تصمیم‌گیری آگاهانه درباره پذیرش ریسک ممکن شود.

این موارد توصیه‌های فعلی ما هستند و در OpenAI در حال اجرا شدن‌اند. انتظار داریم رویه‌های ما در هفته‌های آینده همچنان تکامل یابند.

۳. بررسی حوادث ناهمسویی

همچنین در حال تدوین بهترین رویه‌ها برای بررسی حوادث شدید ناهمسویی هوش مصنوعی بوده‌ایم. آزمایشگاه‌ها باید بکوشند از هر حادثه تا حد ممکن بیاموزند (مشابه رویه‌های بررسی حوادث⁠(در یک پنجره جدید باز می‌شود) در دیگر صنایع حساس) تا بتوانند از تکرار چنین مواردی در آینده جلوگیری کنند. نمونه‌هایی از این اقدامات عبارت‌اند از:

  • شفافیت داخلی: از آنجا که تکمیل بررسی ممکن است زمان زیادی ببرد، باید گزارش‌های دوره‌ای از روند بررسی حوادث در داخل سازمان ارائه شود (مثلاً گزارش‌های روزانه برای بررسی‌های در حال انجام). کارکنان باید مسیرهای مشخصی برای دریافت دسترسی بیشتر، از جمله دسترسی به متن خام تعاملات و نمونه‌گیری از مدل‌های ناهمسو، داشته باشند؛ مشروط به اینکه این دسترسی ایمن و با کارشان مرتبط باشد.

  • ریشه‌یابی ناهمسویی: پژوهشگران باید پویایی‌های آموزش را ریشه‌یابی کنند (مثلاً با آزمایش‌های حذف هدفمند مؤلفه‌ها یا نمونه‌گیری مجدد) تا دریابند رفتارهای ناهمسو چگونه پدید آمده‌اند؛ این کار به درک بهتر مبانی علمی ناهمسویی و پیشگیری بهتر از آن در آینده کمک می‌کند.

  • تحلیل پس از حادثه: باید تحلیلی از جنبه‌های عملیاتی و فرهنگ سازمانی انجام شود تا همه علل مؤثر در حادثه روشن شوند؛ از جمله اینکه چرا مشکلات ایجاد شدند و پیش از حادثه شناسایی نشدند یا به سطوح بالاتر ارجاع داده نشدند.

  • تشخیص: باید روش‌های آزمون همسویی را به‌گونه‌ای توسعه دهیم که بتوانند گرایش به ایجاد حادثه را کشف کنند، بدون اینکه مستقیماً بر مبنای اطلاعات حاصل از حادثه (مثلاً متن تعاملات یا خلاصه حادثه) بهینه‌سازی شوند. باید ارزیابی‌هایی برگرفته از حوادث به‌عنوان «آزمون‌های پسرفت» ساخته شوند تا اطمینان یابیم مدل‌های آینده در حوادث بسیار مشابه، گرایش به ناهمسویی نشان نمی‌دهند.

  • اطلاع‌رسانی عمومی: پس از پایان بررسی، نتایج آن، تحلیل‌های پس از حادثه و تغییرات عملیاتی باید با عموم به اشتراک گذاشته شوند. باید در اسرع وقت به اشخاص ثالثی که تحت تأثیر قرار گرفته‌اند اطلاع داده شود.

نویسنده

OpenAI