اولویتها و اصول ارزیابی مؤثر اشخاص ثالث
آزمایشگاههای هوش مصنوعی پیشرو مسئولیت عظیمی در آموزش، ارزیابی و استقرار ایمن مدلها دارند. ارزیابیهای اشخاص ثالث نقشی حیاتی در ایجاد توازن در این مسئولیت، گسترش فرصتهای اظهارنظر درباره ایمنی هوش مصنوعی، آگاه نگه داشتن جهان و پاسخگو نگه داشتن آزمایشگاهها در برابر ادعاهای ایمنی روشن و مستقلاً تأییدشده دارند.
OpenAI در چارچوب تلاشهای خود برای همگامی با مرزهای پیشرو، متعهد است با فراهم کردن دسترسی عمیق به فرایندهای آموزش، ارزیابی و استقرار، از ارزیابیهای مستقل پشتیبانی کند. این دسترسی باید به ارزیابان امکان دهد فرضهای ما را به چالش بکشند، خطرهایی را که ممکن است از نظر ما دور مانده باشند شناسایی کنند و درباره اثربخشی تدابیر حفاظتی ما مستقلاً به نتیجه برسند.
مدتهاست که در مراحل مختلف فرایند توسعه و استقرار مدل با ارزیابان شخص ثالث همکاری میکنیم. همچنین ارزیابیهای اشخاص ثالث را در رویههای چارچوب آمادگی خود گنجاندهایم و از سازمانها و قوانینی پشتیبانی کردهایم که خواهان فرایندی دقیقتر و پاسخگوتر هستند. در طول این همکاریها، دسترسیهای عمیقی فراهم کردهایم؛ از جمله اطلاعات مربوط به تدابیر حفاظتی فنی، دسترسی به زنجیره تفکر قابل مشاهده، و سطحی بیسابقه از دسترسی محرمانه به دادهها و استقرارهای داخلی برای واکنش به رخداد و تیم قرمزِ سامانههای پایش. اولویتها و اصول ارائهشده در اینجا بر همکاری ما با سازمانهای ارزیابی مستقل در بخش خصوصی و غیرانتفاعی، برای انجام ارزیابیهای فنی ایمنی تمرکز دارند. این موارد مکمل همکاری ما با دولتها در زمینه آزمون و ارزیابیاند؛ حوزهای که نقشها و مسئولیتهای متفاوت ممکن است رویکردهای دیگری را ایجاب کنند.
اثربخشی این ارزیابیها مستلزم سازوکارهای قوی استقلال، دقت علمی، رویههای امنیتی مستحکم و مسئولیتهای روشن است. آزمایشگاهها موظفاند ضمن حفاظت از اطلاعات حساس، امکان بررسی دقیق و مؤثر را فراهم کنند. آزمایشگاهها و ارزیابان مستقل در اجرای درست این کار مسئولیتی مشترک دارند و باید بر اساس استانداردهای بینالمللی مشترک برای رویههای ایمنی و امنیتی فعالیت کنند. در ادامه، چهار حوزه اولویتدار برای ارزیابی عمیقتر را همراه با اصول انجام کاری دقیق، امن و مستقل پیشنهاد میکنیم.
ارزیابیهای اشخاص ثالث زمانی بیشترین فایده را دارند که به پرسشهای مشخص و مهم بپردازند: آیا شواهد از پرونده ایمنی و ادعاهای ایمنی یک آزمایشگاه پشتیبانی میکنند؟ آیا ارزیابیها خطرهایی را که برای سنجش آنها طراحی شدهاند، بهاندازه کافی میآزمایند؟ آیا تدابیر حفاظتی در شرایط واقعی مؤثرند؟
ارزیابیهای شرحدادهشده در اینجا باید متناسب با پرسشهای ایمنی مورد بررسی، شکلهای متفاوتی داشته باشند. انتظار داریم همزمان و در بازههای زمانی متفاوت از چندین ارزیابی پشتیبانی کنیم؛ برخی چند هفته و برخی دیگر چند ماه طول خواهند کشید. اگرچه ارزیابیهای اشخاص ثالث میتوانند بخشی از اقدامات پیش از استقرار باشند و بر تصمیمهای استقرار اثر بگذارند، کار توصیفشده در اینجا عموماً بلندمدت و مستقل از زمان عرضه است و بر بررسی عمیق ادعاهای ایمنی مشخص در طول زمان تمرکز دارد.
در سراسر حوزههای اولویتدار و اصول خود، از «ادعاهای ایمنی» و «پروندههای ایمنی» سخن میگوییم. منظور ما از این اصطلاحات چنین است:
ادعای ایمنی: گزارهای مشخص درباره قابلیتها، رفتار یا تدابیر حفاظتی یک مدل یا سامانه که بر ایمنی آن اثر دارد و میتوان آن را بر اساس شواهد ارزیابی کرد. هر ادعا باید خطرها و شرایط موردنظر و نیز فرضها و محدودیتهای مرتبط را مشخص کند.
پرونده ایمنی: استدلالی ساختاریافته و مبتنی بر شواهد که توضیح میدهد چرا خطرهای یک مدل یا سامانه برای فعالیتی مشخص، مانند آموزش، ارزیابی یا استقرار، بهدرستی مدیریت شدهاند. پرونده ایمنی، ادعاهای ایمنی را به شواهد پشتیبان آنها پیوند میدهد و فرضها، عدمقطعیتها و خطرهای باقیماندهای را که ممکن است بر نتیجهگیریهای آن اثر بگذارند، بهصراحت بیان میکند.
چهار حوزه اولویتدار برای ارزیابی عمیقتر را همراه با اصول انجام کاری دقیق، امن و مستقل پیشنهاد میکنیم.
ارزیابی مستقل پروندههای ایمنی در مراحل آموزش، ارزیابی، استقرار داخلی و استقرار خارجی.
ارزیابی پروندههای ایمنی به تخصص در همترازی، روشهای کنترل مانند پایش، امنیت سایبری، سوءاستفادههای زیستی و شیمیایی و تیم قرمز نیاز دارد. پروندههای ایمنی از ادعاهایی درباره آموزش، ارزیابی قابلیتها و تدابیر حفاظتی تشکیل شدهاند و میتوان آنها را یکجا یا بهصورت جداگانه ارزیابی کرد (اولویتهای ۲ و ۳ در ادامه را ببینید). احتمالاً لازم است چند ارزیاب، با تکیه بر تخصصهای خود، بخشهای متفاوت پروندهها را بررسی کنند. مجموع ارزیابیهای آنها باید به پرسشهایی از این دست پاسخ دهد:
آیا شواهد پروندههای ایمنی مربوط به آموزش، ارزیابی و استقرارها مستند و معتبرند؟ آیا شرایط پرونده ایمنی در طول آموزش، ارزیابی و استقرار رعایت شدهاند؟
آیا پروندههای ایمنی ما فوریترین خطرهای شناساییشده در جریان ارزیابی را پوشش میدهند؟ آیا ادعاهای ایمنی از پرونده کلی ایمنی پشتیبانی میکنند؟ آیا کاستی یا زمینهای برای بهبود وجود دارد؟
آیا برای شناسایی و کاهش انگیزههای آموزشی که ممکن است فریبکاری، سوءاستفاده از سازوکار پاداش، اقدامات مخرب یا دور زدن محدودیتها را تشویق کنند، از روشهای مؤثر استفاده میشود؟
ارزیابی تدابیر حفاظتی حیاتی در استقرارهای داخلی و خارجی
مجموعه تدابیر حفاظتی ما همواره برای سازگاری با قابلیتها و فضای در حال تغییر تکامل مییابد. تدابیر حفاظتی ما آموزش، استقرار داخلی و استقرار خارجی را پوشش میدهند. این تدابیر اکنون شامل حفاظتهای سطح مدل، حفاظتهای اجرایی و حفاظتهای امنیتی و نیز سامانههای پایش ناهمترازیاند و طیف گستردهای از خطرها، مانند ازدسترفتن کنترل و سوءاستفاده در حوزههای سایبری، زیستی و شیمیایی، را پوشش میدهند. همکاریهای فنی میتوانند ضمن شناسایی ضعفهای فعلی تدابیر حفاظتی، روشهای ارزیابی را بهبود دهند و تدوین استانداردها را تسریع کنند؛ در نتیجه، مبنای فنی محکمتری برای سیاستگذاری عمومی آینده با هدف همگامی با مرزهای پیشرو فراهم میشود، بهویژه در استقرارهای داخلی که استانداردهای ایمنی و امنیتی هنوز نوپا هستند.
ارزیابیهای مستقل باید میزان اثربخشی این تدابیر حفاظتی و نقاط ضعف احتمالی آنها را بررسی کنند؛ برای نمونه:
با دسترسی «جعبه خاکستری»، آیا تدابیر حفاظتی در برابر آزمونهای خصمانه (دور زدن محدودیتها) مقاوماند و بهاندازه کافی از افزایش قابلیت در حوزههای پرخطر، مانند سایبری و زیستی، جلوگیری میکنند؟ آیا آزمونهای خصمانه و تیم قرمز ما مهمترین خطرها را پوشش میدهند؟
در آزمونهای مجاز و تحت شرایط عملیاتی واقعی، عاملها چگونه با دفاعهای سایبری مانند کنترل دسترسی، محیطهای ایزوله و سامانههای تشخیص و واکنش تعامل میکنند؟ کدام دفاعها از اقدامات زیانبار جلوگیری میکنند، آنها را تشخیص میدهند یا مهار میکنند، و در کجا ناکام میمانند؟
آیا سامانههای پایش ناهمترازی ما در استقرارهای داخلی یا خارجی کاستیهای مهمی دارند که ممکن است به ازدسترفتن کنترل یا ناهمترازی شدید بینجامد؟ با افزایش قابلیتهای مدل، پایش زنجیره تفکر تا چه حد میتواند منبع قابلاعتمادی برای شواهد ایمنی یا همترازی باشد؟
آیا در همه فرایندهای مرتبط آموزش، ارزیابی و استقرار، پایش مناسبی اجرا شده است که نتوان آن را بهآسانی غیرفعال کرد؟
آیا تدابیر حفاظتی متناسب با قابلیتها اجرا شدهاند؟
ارزیابی سنجشهای قابلیت که دستههای خطر چارچوب آمادگی (خطرهای شیمیایی و زیستی، امنیت سایبری و خودبهبودی هوش مصنوعی) را پوشش میدهند و سنجشهای همترازی برای خطرهای ناهمترازی
چارچوب آمادگی ما مستلزم انجام ارزیابیهایی برای سنجش حوزههای اصلی خطر مرزی است. با عبور از آستانهها و اشباع ارزیابیها، باید ارزیابیهای قابلیت در حوزههای خطر آمادگی و نیز ارزیابیهای همترازی برای سنجش خطرهای ناهمترازی شدید، پیوسته بهروزرسانی شوند و از پوشش و کیفیت آنها اطمینان حاصل شود.
پرسشهای مرتبط عبارتاند از:
آیا ارزیابیهای خطرهای آمادگی، تعریف آستانه خطر آمادگی را بهاندازه کافی پوشش میدهند؟ آیا آستانههای این ارزیابیها بهدرستی تعیین شدهاند؟
آیا وقتی مدلها پیوسته بالاترین امتیازها را کسب میکنند، ارزیابیها بهروزرسانی میشوند و آیا آزمونهای جدید واقعاً قابلیتهای پیشرفتهتر را میسنجند؟
آیا ارزیابیهای همترازی ما خطرهای ناهمترازی شدید را بهاندازه کافی پوشش میدهند و ممکن است کدام رفتارها یا شرایط مهم را از قلم بیندازند؟
بررسی مستقل رخدادهای بحرانی ناهمترازی
بررسی مستقل میتواند در طیف گستردهای از رخدادهای بحرانی ایمنی هوش مصنوعی ارزشمند باشد. در اینجا بر ناهمترازی مدل تمرکز میکنیم؛ از جمله اقدام بدون مجوز یا گریز مدلها از نظارت که حتی بدون سوءاستفاده عمدی نیز میتواند ضعفهای روشهای همترازی و تدابیر حفاظتی را آشکار کند.
در برخی شرایط، مانند رخداد OpenAI در Hugging Face، میتواند مفید باشد که شخص ثالث مستقلی برای بررسی مستقل رخدادهای ناهمترازی مشارکت کند. ضروری است اشخاص ثالثی که در بررسی رخداد مشارکت میکنند، تخصص لازم را داشته باشند؛ از جمله، حسب مورد، تخصص جرمیابی سایبری، همترازی، تحلیل گسترده زنجیره تفکر و نیز کارکنان و منابع کافی برای انجام بهموقع بررسی. واکنش به رخداد ممکن است مستلزم دسترسی به دادههای داخلی حساس و دادههای اشخاص ثالث باشد؛ بنابراین انتشار یا دسترسی به برخی جزئیات میتواند حساس باشد. یافتههای بررسیهای مستقل میتوانند با ارائه شواهدی برای ارزیابی ادعاهای مربوط به همترازی مدل و اثربخشی اقدامات اصلاحی انجامشده برای ناهمترازیهای پیشین، به پرونده ایمنی آن نیز کمک کنند.
در زمینه رخدادهای ناهمترازی، ارزیابیهای مستقل را در موارد زیر در اولویت قرار میدهیم:
در جریان رخداد چه رفتار مدل یا مشکلات ناهمترازی روی داده و عوامل اصلی مؤثر در آنها چه بودهاند؟
آیا تدابیر حفاظتی و اقدامات اصلاحی میتوانند رخدادهای مشابه آینده را بهطور مؤثر کاهش دهند؟
دامنه روشن و ادعاهای مورد توافق طرفین برای ارزیابی: ارزیابیها باید با تعیین دامنهای مورد توافق طرفین آغاز شوند و سپس ادعاهای ایمنی بهروشنی تعریف و پیش از آغاز فعالیتهای ارزیابی، از قبل ثبت شوند. اشخاص ثالث و آزمایشگاهها باید روشن کنند که آیا این ادعاها را شرکتِ در حال ارزیابی برای بررسی مطرح کرده است، یا ارزیاب شخص ثالث قصد دارد آنها را مستقلاً بررسی کند و آزمایشگاه نیز پذیرفته است که بر اساس آنها ارزیابی شود. برخی ادعاها ممکن است به دلایل گوناگون خارج از دامنه باشند؛ از جمله ناممکن بودن دسترسی اشخاص ثالث به دادهها، کافی نبودن تخصص ارزیاب یا محدودیت زمانی معقول در ارزیابیهای فوری. آزمایشگاهها و ارزیابان باید فرایندی برای بررسی خطرهای مهم شناساییشده خارج از دامنه اولیه ایجاد کنند، از جمله تعیین اینکه آیا بررسی بیشتر ضرورت دارد یا خیر. نتیجهگیریها باید با توجه به دامنه مورد توافق طرفین، بهروشنی مشخص کنند چه مواردی ارزیابی شده و چه مواردی ارزیابی نشدهاند.
دسترسی متناسب: ارزیابان باید تا حد ممکن و در چارچوب محدودیتهای حقوقی، امنیتی و مالکیت فکری، برای بررسی ادعاهای مورد توافق از دسترسی متناسب برخوردار باشند. هرگاه دسترسی مستقیم عملی یا ممکن نباشد، ارزیابان میتوانند با نماینده تعیینشده شرکت همکاری کنند یا برای حفاظت از اطلاعات زیربنایی، سازوکارهای دسترسی غیرمستقیم یا حافظ حریم خصوصی را بررسی کنند.
روششناسی و استانداردهای شفاف: ارزیابان باید روشها، معیارهای ارزیابی و عدمقطعیتهای خود را توضیح دهند و هرجا ممکن است، بر استانداردهای تثبیتشده تکیه کنند. هرجا هنوز استانداردی وجود ندارد، باید معیارهای مورد استفاده خود را بهروشنی توجیه کنند. گزارشها باید یافتههای مستقیم را از تفسیر متمایز کنند، عدمقطعیت را توضیح دهند و روشن سازند که شواهد از کدام نتیجهگیریها پشتیبانی میکنند.
تخصص و استقلال: ارزیابان باید تخصص فنی مرتبط خود را نشان دهند و تعارض منافع سازمانی و فردی، از جمله انگیزههای مالی، روابط با توسعهدهندگان و مشارکت قبلی در کار مورد ارزیابی را شناسایی، افشا و رفع کنند. تدابیر حفاظتی باید بهگونهای طراحی شوند که فشارهای تجاری و ترتیبات پرداخت بر یافتهها اثر نگذارند و میتوانند شامل کنارهگیری از ارزیابی یا دورههای منع مشارکت مناسب باشند.
امنیت و محرمانگی: ارزیابان باید متناسب با حساسیت سامانهها و اطلاعاتی که به آنها دسترسی دارند، شیوههای امنیت اطلاعات و تضمینهای الزامآور محرمانگی را برای کارکنان خود به کار گیرند. این تضمینها باید مالکیت فکری، اطلاعات حساس و سوابق ارزیابی را پوشش دهند. اگر ارزیابان نتوانند الزامات امنیتی را در محیط خود رعایت کنند یا دادههای مورد دسترسی حساسیت ویژهای داشته باشند، استفاده از دستگاهها یا محلهای تحت مدیریت شرکت میتواند مناسب باشد.
یافتههای عملی و فرصت رفع مشکلات: ارزیابیها باید کاستیهای مشخص را شناسایی کنند و جزئیات کافی برای رفع آنها در اختیار آزمایشگاهها بگذارند. در صورت اقتضا، آزمایشگاهها باید پیش از انتشار، فرصت معقولی برای رفع مشکلات داشته باشند. در موارد مرتبط، گزارشها باید درسهای قابل استفاده برای توسعهدهندگان، استقراردهندگان و مدافعان عاملها را نیز همراه با توصیههای عملی برای اجرا توضیح دهند.
شیوههای انتشار مسئولانه: گزارشهای ارزیابی باید مبتنی بر شواهد باشند و ضمن حفاظت از اطلاعات حساس و محرمانه، تا حد امکان بهصورت عمومی منتشر شوند. اگر افشای عمومی کامل ممکن نباشد، گزارشدهی محرمانه به نهادهای نظارتی مناسب، مانند نهادهای راهبری یا هیئتمدیره شرکتها، میتواند به پاسخگویی کمک کند. برای حفظ توازن میان استقلال و محرمانگی، باید تضمینها و سیاستهای اصولمند حذف اطلاعات و نیز انتظارات روشنی درباره بازخورد و اصلاح موارد نادرست وجود داشته باشد. ارزیابان باید استقلال تحریریه خود را حفظ کنند و همزمان از رعایت محرمانگی و حفاظت از مالکیت فکری اطمینان یابند. ارزیابان باید سیاستهای روشنی برای حذف اطلاعات تدوین کنند تا آزمایشگاهها بتوانند حذف اطلاعات حساس را درخواست کنند؛ در عین حال، ارزیابان میتوانند موارد حذف محتوای اساسی و تأثیر آنها بر گزارش ارزیابی را ذکر کنند.
ما متعهدیم از ارزیابان مستقل پشتیبانی کنیم و برای ارزیابی مؤثر اشخاص ثالث، چه از طریق قوانین آینده و چه نهادهای راهبری خصوصی، استانداردهای بینالمللی مشترک و روشنتری ایجاد کنیم. اگرچه زیستبوم ارزیابی مستقل هنوز در حال رشد است، با پشتیبانی و همکاری با جامعهای متنوع از ارزیابان مستقل که در مسائل ایمنی پیشرو تخصص عمیق دارند، به رشد آن کمک خواهیم کرد. هیچ شخص ثالثی بهتنهایی نمیتواند و نباید همه مسائل فوری ایمنی پیشرو را بهطور جامع پوشش دهد. سنجیده و هدفمند پیش خواهیم رفت تا ظرفیت خود را افزایش دهیم و به زیستبوم روبهرشد اشخاص ثالث امکان دهیم بر سر بهترین شیوهها و اصول همسو شوند. درباره پیشنهادهای همسو با حوزههای اولویتدار بالا، با چندین شخص ثالث در حال گفتوگو هستیم.


