بهسوی پروندههای ایمنی برای آموزش هوش مصنوعی پیشرو
معتقدیم در آستانه دورانی تازه هستیم که در آن، پیش از ادامه هر دوره آموزش یادگیری تقویتی مدلهای پیشرو، ارائه مستندات ساختاریافته ایمنی باید الزامی باشد. در حالت مطلوب، این مستندات باید به سطح «پروندههای ایمنی» برسند؛ یعنی استدلالهای جامع، ساختاریافته و مبتنی بر شواهد درباره ریسک که در دیگر صنایع با حساسیت بالای ایمنی به کار میروند. پروندههای ایمنی را هدفی آرمانی و راهنمای مسیر خود میدانیم و برای رسیدن به آن تلاش میکنیم. در عین حال، اذعان داریم که بهدلیل پیچیدگیهای نوظهور در هر سطح تازه از توانمندی هوش مصنوعی، دستیابی به همان میزان استحکام و دقتِ پروندههای ایمنی هوانوردی یا انرژی هستهای برای مدلهای هوش مصنوعی چالشبرانگیز است. در حال کار روی چارچوبی برای مدونکردن این رویهها هستیم.
در ادامه، چند دستورالعمل اولیه آمده است که بهنظر ما باید بخشی از این پروندههای ایمنی برای آموزش هوش مصنوعی پیشرو باشند. این بهترین رویهها بازتاب آموختههای فعلی ما هستند و انتظار داریم همزمان با اصلاح مداوم فرایندهای داخلی برای توسعه محتاطانه، تکامل یابند. اکنون آنها را منتشر میکنیم تا دیدگاه فعلی ما شفاف باشد و از جامعه دعوت کنیم بازخورد بدهد. توجه داشته باشید که تمرکز این سند بر آموزش یادگیری تقویتی مدلهای پیشرو است؛ استقرار داخلی و خارجی مستلزم توجه به مجموعه بسیار گستردهتری از ویژگیهای همسویی است.
پروندههای ایمنی باید سه جنبه از پشته فنی را پوشش دهند: آموزش همسویی، محصورسازی و پایش. این تدابیر کمک میکنند اطمینان یابیم مدل برای انجام اقدامات ناهمسو تلاش نمیکند؛ و حتی اگر چنین کند، خروج از محیط محصور برایش دشوار خواهد بود و پایش، پیش از بروز آسیب آن را شناسایی خواهد کرد.
همسویی مدل: نخستین خط دفاعی باید آموزش مدلها برای همسویی باشد؛ یعنی بهگونهای قابلاعتماد، مطابق خواست ما عمل کنند. این کار میتواند شامل موارد زیر باشد:
محیطهای آموزش و نمرهدهی: با جلوگیری از تقویت مثبت سوءاستفاده از سازوکار پاداش در طول آموزش، خطر شکلگیری رفتار ناهمسو در مدلها را کاهش دهید. این کار میتواند شامل موارد زیر باشد:
بازبینی خودکار مجموعهدادهها: از عاملها برای یافتن و اصلاح محیطهای معیوب یادگیری تقویتی استفاده کنید؛ محیطهایی که ممکن است در آنها مسیرهای ناهمسو بهجای رفتار مطلوب، با بهرهبرداری از نقصها پاداش زیادی بگیرند. با این کار فرصت تقویت ناهمسویی در طول آموزش کاهش مییابد.
بازبینی دستی مجموعهدادهها: آزمونهای خودکار تیم قرمز را با بازبینی دستی و کنترل کیفیت مجموعهدادهها تکمیل کنید تا وظایف معیوبی شناسایی شوند که ممکن است ناخواسته رفتار ناهمسو را تقویت کنند.
تنظیم نمرهدهندهها: نمرهدهندهها را طوری تنظیم کنید که تلاش مدل برای سوءاستفاده از نقصها یا هک محیطهای یادگیری تقویتی در طول آموزش را جریمه کنند.
تحلیل دورههای قبلی: طبقهبندها را روی ردپاهای ثبتشده از آزمایشهای قبلی اجرا کنید تا از عملکرد مطلوب نمرهدهندهها مطمئن شوید.
سنجش همسویی: ارزیابیهایی انجام دهید که گرایش مدل به ناهمسویی را رصد کنند تا اثربخشی آموزش همسویی سنجیده شود. این کار میتواند شامل موارد زیر باشد:
ارزیابیهای آفلاین همسویی: در طول دورههای آموزش مدلهای پیشرو، ارزیابی همسویی انجام دهید تا مشخص شود آموزش طبق انتظار پیش میرود یا نه، و هر افت معناداری را بررسی کنید.
آزمون بر دادههای گذشته: ارزیابیهای همسویی را با حوادث قبلی بیازمایید تا مطمئن شوید مدلهای ناهمسوی پیشین را تشخیص میدهند و دچار بیشبرازش به حوادث خاص نمیشوند.
رصد فریب ارزیابی: آگاهی ارزیابی یا بازیدادن آزمون (تشخیص مدلها که در حال آزمودهشدن هستند) را که میتواند باعث تغییر رفتار شود رصد کنید و آستانههای مشخصی برای توقف تعیین کنید (مثلاً سامانههای پایش آگاهی ارزیابی و بازیدادن آزمون را در ارزیابیهای همسویی فعال کنید).
آزمونهای فشار در بدترین حالت: بدترین رفتار نامطلوب را در مدل برانگیزید و بررسی کنید که دستکم یک ارزیابی آن را تشخیص میدهد.
جلوگیری از آموزش بر مبنای زنجیره تفکر: در یادگیری تقویتی، اجازه ندهید نمرهدهندههای خودکار زنجیره تفکر را ببینند تا مدلها در مسیر فرار از سامانههای پایش زنجیره تفکر تکامل نیابند.
محصورسازی: جداسازی محیط اجرا و تدابیر امنیتی را آنقدر تقویت کنید که اگر مدلی ناهمسو شد، نتواند اقدامات آسیبزا انجام دهد. این کار میتواند شامل موارد زیر باشد:
چند لایه امنیت زیرساخت: برای مقاومسازی محیط ایزولهای که مدل در آن اجرا میشود و زیرساخت پژوهشی میزبان آن، سرمایهگذاری قابلتوجهی انجام دهید تا در صورت خروج از محیط ایزوله، لایه حفاظتی دیگری نیز وجود داشته باشد.
آزمونهای تیم قرمز برای محصورسازی: با استفاده از نسخههای ذخیرهشده مدل در دورههای آموزش پیشرو و مشروط به تحلیل ایمنی، آزمونهای تیم قرمز را بهطور تکرارشونده روی این سامانهها انجام دهید تا شکافها را بیابید و برطرف کنید و امنیت محیط ایزوله، زیرساخت پژوهشی و مرزهای شبکه را بهبود دهید. همچنین همه سرویسهایی را که مدل در طول آموزش میتواند با آنها تعامل داشته باشد (مثلاً حافظه نهان اینترنت) تحت آزمونهای تیم قرمز قرار دهید.
ارتباط بین نمونهها: ارتباط با پهنای باند بالا بین نمونهها را به مسیرهای تأییدشده، مانند ابزارهای چندعاملی، محدود کنید و کانالهای جانبی زیرساخت را که پهنای باند بالایی دارند و عاملها بهآسانی کشفشان میکنند ببندید.
متن تغییرناپذیر تعاملات: متن تعاملات عاملها را در همه فرایندهای آموزش یادگیری تقویتی، ارزیابی و استقرار داخلی، برای مدتی معقول بهشکلی تغییرناپذیر ذخیره کنید (مثلاً در حسابهای ذخیرهسازی با قابلیت نوشتن فقط یکبار) تا بررسی قابلاعتماد حوادث ممکن شود و از ویرایش ناخواسته جلوگیری شود.
پایش: سامانه پایش زندهای داشته باشید تا اگر مدلها شروع به اقدامات ناهمسو کردند، هرگونه ناهمسویی احتمالی را شناسایی کند و مشکلات دارای اولویت، پیش از وقوع حادثهای جدی، بهسرعت برطرف شوند. این کار میتواند شامل موارد زیر باشد:
الزام پایشپذیری: با ارزیابیهای پایشپذیری و گریز از پایش و با آستانههای روشن، مطمئن شوید مدلها همچنان پایشپذیر میمانند تا رفتار نگرانکننده زود شناسایی شود.
نرخ بازیابی بالا برای مشکلات شناختهشده: مطمئن شوید سامانه پایش در ارزیابی روی دادههای کنارگذاشتهشده، نرخ بازیابی بالایی برای حوادث گذشته دارد.
بهروز بودن ارزیابی سامانههای پایش: برای دورههای جدید، نمونههای ارزیابی نماینده ریسکهای کاملاً تازه بسازید تا سنجههای نرخ بازیابی و دقت سامانه پایش بهروز بمانند.
واکنش سریع: هشدارهای دارای اولویتی پیادهسازی کنید که پیش از آسیبرساندن مدل و در مهلت توافقنامه سطح خدمت مشخص، به اقدام منجر شوند؛ یا با فراخواندن مسئول کشیک یا با توقف موقت خودکار دوره درگیر (مثلاً در حوادث روزانه، به مسئول کشیک امنیت و مسئول دوره هشدار فوری دهید و شبها، در صورت تأییدنشدن دریافت هشدار، دورهها را خودکار متوقف کنید).
در کنار توصیههای مربوط به تدابیر حفاظتی فنی، در حال تدوین بهترین رویههای عملیاتی برای پروندههای ایمنی دورههای آموزش هوش مصنوعی پیشرو بودهایم. این رویهها میتوانند شامل موارد زیر باشند:
نقدهای مخالف (تحلیل پیشاپیش شکست): پس از تدوین پیشنویس پرونده ایمنی، یکی از اعضای تیمی دیگر باید نقدی مخالف بنویسد تا کاستیهای احتمالی پرونده مشخص شود و برآوردی سنجیده از ریسک ارائه دهد. سپس تیم آموزش باید به این نقد پاسخ دهد تا پرونده ایمنی تقویت شود.
تأییدها: اعضای مدیریت ارشد باید پرونده ایمنی را بررسی کنند و هر یک اختیار وتوی دوره آموزش را داشته باشند تا چند لایه نظارت داخلی بر آن وجود داشته باشد (مثلاً مدیر یا معاون بخش پژوهش، رئیس ایمنی و دانشمند ارشد).
پاسخگویی: مدیر ارشد مسئول دوره آموزش (مثلاً مدیر یا معاون بخش پژوهش) باید در قبال پرونده ایمنی و هرگونه واکنش به حادثه پاسخگو باشد؛ این مسئولیت باید در ارزیابی عملکرد او نیز لحاظ شود تا تیمهای آموزش برای پیشبرد ایمنی و همسویی هم انگیزه داشته باشند.
توقف موقت: اگر مشکلاتی یافت شد که اعتبار پرونده ایمنی را زیر سؤال میبرد (مثلاً یک مشکل امنیتی جدید)، باید دستورالعملهای اجرایی، کنترلهای فنی و توافقنامههای سطح خدمت برای توقف موقت همه دورههای مشمول وجود داشته باشد.
شفافیت داخلی: پروندههای ایمنی باید در اختیار گروههای نظارت داخلی (مثلاً کمیتهٔ ایمنی و امنیت) قرار گیرند.
ممیزیها: باید دسترسی کافی به ممیزان داده شود تا اعتبار و استحکام ادعاهای پرونده ایمنی را راستیآزمایی کنند و کاستیهای احتمالی را گزارش دهند.
ارجاع به سطوح بالاتر: باید فرایند روشنی برای ارجاع موارد ناهمسویی به سطوح بالاتر، جدولی از سطوح تعریفشده شدت ناهمسویی و مسئول کشیک ناهمسویی وجود داشته باشد که وقتی دوره آموزش به سطح مشخصی از شدت میرسد، بتواند به مدیران ارشد (مثلاً مدیرعامل) هشدار فوری بدهد.
کنترلهای فنی: شروع دورههای آموزش مغایر با الزامات باید برای انسانها و عاملها دشوار باشد. قابلیتهای ایمنی مانند پایش و توقف موقت خودکار باید در صورت خرابی، جلوی ادامه فعالیت را بگیرند (مثلاً نباید بتوان دورهها را بدون فعالبودن پایش مناسب آغاز کرد یا سامانه پایش را از داخل محیط آموزش یادگیری تقویتی، ارزیابی یا استقرار داخلی غیرفعال کرد).
امکان بازگردانی: شناسایی همه کاربردهای پاییندستی یک مدل ناهمسو در فرایند آموزش (مثلاً تولید داده یا نمرهدهی) باید آسان باشد تا در صورت نیاز بتوان اثر خروجیهای ناهمسو را خنثی کرد.
جامعیت ریسکهای باقیمانده: پروندههای ایمنی باید تا حد امکان فهرست جامعی از ریسکهای باقیماندهای ارائه دهند که تدابیر کاهشی فعلی آنها را پوشش نمیدهند تا تصمیمگیری آگاهانه درباره پذیرش ریسک ممکن شود.
این موارد توصیههای فعلی ما هستند و در OpenAI در حال اجرا شدناند. انتظار داریم رویههای ما در هفتههای آینده همچنان تکامل یابند.
همچنین در حال تدوین بهترین رویهها برای بررسی حوادث شدید ناهمسویی هوش مصنوعی بودهایم. آزمایشگاهها باید بکوشند از هر حادثه تا حد ممکن بیاموزند (مشابه رویههای بررسی حوادث(در یک پنجره جدید باز میشود) در دیگر صنایع حساس) تا بتوانند از تکرار چنین مواردی در آینده جلوگیری کنند. نمونههایی از این اقدامات عبارتاند از:
شفافیت داخلی: از آنجا که تکمیل بررسی ممکن است زمان زیادی ببرد، باید گزارشهای دورهای از روند بررسی حوادث در داخل سازمان ارائه شود (مثلاً گزارشهای روزانه برای بررسیهای در حال انجام). کارکنان باید مسیرهای مشخصی برای دریافت دسترسی بیشتر، از جمله دسترسی به متن خام تعاملات و نمونهگیری از مدلهای ناهمسو، داشته باشند؛ مشروط به اینکه این دسترسی ایمن و با کارشان مرتبط باشد.
ریشهیابی ناهمسویی: پژوهشگران باید پویاییهای آموزش را ریشهیابی کنند (مثلاً با آزمایشهای حذف هدفمند مؤلفهها یا نمونهگیری مجدد) تا دریابند رفتارهای ناهمسو چگونه پدید آمدهاند؛ این کار به درک بهتر مبانی علمی ناهمسویی و پیشگیری بهتر از آن در آینده کمک میکند.
تحلیل پس از حادثه: باید تحلیلی از جنبههای عملیاتی و فرهنگ سازمانی انجام شود تا همه علل مؤثر در حادثه روشن شوند؛ از جمله اینکه چرا مشکلات ایجاد شدند و پیش از حادثه شناسایی نشدند یا به سطوح بالاتر ارجاع داده نشدند.
تشخیص: باید روشهای آزمون همسویی را بهگونهای توسعه دهیم که بتوانند گرایش به ایجاد حادثه را کشف کنند، بدون اینکه مستقیماً بر مبنای اطلاعات حاصل از حادثه (مثلاً متن تعاملات یا خلاصه حادثه) بهینهسازی شوند. باید ارزیابیهایی برگرفته از حوادث بهعنوان «آزمونهای پسرفت» ساخته شوند تا اطمینان یابیم مدلهای آینده در حوادث بسیار مشابه، گرایش به ناهمسویی نشان نمیدهند.
اطلاعرسانی عمومی: پس از پایان بررسی، نتایج آن، تحلیلهای پس از حادثه و تغییرات عملیاتی باید با عموم به اشتراک گذاشته شوند. باید در اسرع وقت به اشخاص ثالثی که تحت تأثیر قرار گرفتهاند اطلاع داده شود.


