پرش به محتوای اصلی
OpenAI

۳۱ شهریور ۱۴۰۵

ایمنی

اولویت‌ها و اصول ارزیابی مؤثر اشخاص ثالث

در حال بارگذاری…

آزمایشگاه‌های هوش مصنوعی پیشرو مسئولیت عظیمی در آموزش، ارزیابی و استقرار ایمن مدل‌ها دارند. ارزیابی‌های اشخاص ثالث نقشی حیاتی در ایجاد توازن در این مسئولیت، گسترش فرصت‌های اظهارنظر درباره ایمنی هوش مصنوعی، آگاه نگه داشتن جهان و پاسخ‌گو نگه داشتن آزمایشگاه‌ها در برابر ادعاهای ایمنی روشن و مستقلاً تأییدشده دارند.

OpenAI در چارچوب تلاش‌های خود برای همگامی با مرزهای پیشرو، متعهد است با فراهم کردن دسترسی عمیق به فرایندهای آموزش، ارزیابی و استقرار، از ارزیابی‌های مستقل پشتیبانی کند. این دسترسی باید به ارزیابان امکان دهد فرض‌های ما را به چالش بکشند، خطرهایی را که ممکن است از نظر ما دور مانده باشند شناسایی کنند و درباره اثربخشی تدابیر حفاظتی ما مستقلاً به نتیجه برسند.

مدت‌هاست که در مراحل مختلف فرایند توسعه و استقرار مدل با ارزیابان شخص ثالث همکاری می‌کنیم. همچنین ارزیابی‌های اشخاص ثالث را در رویه‌های چارچوب آمادگی خود گنجانده‌ایم و از سازمان‌ها و قوانینی پشتیبانی کرده‌ایم که خواهان فرایندی دقیق‌تر و پاسخ‌گوتر هستند. در طول این همکاری‌ها، دسترسی‌های عمیقی فراهم کرده‌ایم؛ از جمله اطلاعات مربوط به تدابیر حفاظتی فنی، دسترسی به زنجیره تفکر قابل مشاهده، و سطحی بی‌سابقه از دسترسی محرمانه به داده‌ها و استقرارهای داخلی برای واکنش به رخداد و تیم قرمزِ سامانه‌های پایش. اولویت‌ها و اصول ارائه‌شده در اینجا بر همکاری ما با سازمان‌های ارزیابی مستقل در بخش خصوصی و غیرانتفاعی، برای انجام ارزیابی‌های فنی ایمنی تمرکز دارند. این موارد مکمل همکاری ما با دولت‌ها در زمینه آزمون و ارزیابی‌اند؛ حوزه‌ای که نقش‌ها و مسئولیت‌های متفاوت ممکن است رویکردهای دیگری را ایجاب کنند.

اثربخشی این ارزیابی‌ها مستلزم سازوکارهای قوی استقلال، دقت علمی، رویه‌های امنیتی مستحکم و مسئولیت‌های روشن است. آزمایشگاه‌ها موظف‌اند ضمن حفاظت از اطلاعات حساس، امکان بررسی دقیق و مؤثر را فراهم کنند. آزمایشگاه‌ها و ارزیابان مستقل در اجرای درست این کار مسئولیتی مشترک دارند و باید بر اساس استانداردهای بین‌المللی مشترک برای رویه‌های ایمنی و امنیتی فعالیت کنند. در ادامه، چهار حوزه اولویت‌دار برای ارزیابی عمیق‌تر را همراه با اصول انجام کاری دقیق، امن و مستقل پیشنهاد می‌کنیم.

حوزه‌های اولویت‌دار ارزیابی

ارزیابی‌های اشخاص ثالث زمانی بیشترین فایده را دارند که به پرسش‌های مشخص و مهم بپردازند: آیا شواهد از پرونده ایمنی و ادعاهای ایمنی یک آزمایشگاه پشتیبانی می‌کنند؟ آیا ارزیابی‌ها خطرهایی را که برای سنجش آن‌ها طراحی شده‌اند، به‌اندازه کافی می‌آزمایند؟ آیا تدابیر حفاظتی در شرایط واقعی مؤثرند؟

ارزیابی‌های شرح‌داده‌شده در اینجا باید متناسب با پرسش‌های ایمنی مورد بررسی، شکل‌های متفاوتی داشته باشند. انتظار داریم هم‌زمان و در بازه‌های زمانی متفاوت از چندین ارزیابی پشتیبانی کنیم؛ برخی چند هفته و برخی دیگر چند ماه طول خواهند کشید. اگرچه ارزیابی‌های اشخاص ثالث می‌توانند بخشی از اقدامات پیش از استقرار باشند و بر تصمیم‌های استقرار اثر بگذارند، کار توصیف‌شده در اینجا عموماً بلندمدت و مستقل از زمان عرضه است و بر بررسی عمیق ادعاهای ایمنی مشخص در طول زمان تمرکز دارد.

در سراسر حوزه‌های اولویت‌دار و اصول خود، از «ادعاهای ایمنی» و «پرونده‌های ایمنی» سخن می‌گوییم. منظور ما از این اصطلاحات چنین است:

ادعای ایمنی: گزاره‌ای مشخص درباره قابلیت‌ها، رفتار یا تدابیر حفاظتی یک مدل یا سامانه که بر ایمنی آن اثر دارد و می‌توان آن را بر اساس شواهد ارزیابی کرد. هر ادعا باید خطرها و شرایط موردنظر و نیز فرض‌ها و محدودیت‌های مرتبط را مشخص کند.

پرونده ایمنی: استدلالی ساختاریافته و مبتنی بر شواهد که توضیح می‌دهد چرا خطرهای یک مدل یا سامانه برای فعالیتی مشخص، مانند آموزش، ارزیابی یا استقرار، به‌درستی مدیریت شده‌اند. پرونده ایمنی، ادعاهای ایمنی را به شواهد پشتیبان آن‌ها پیوند می‌دهد و فرض‌ها، عدم‌قطعیت‌ها و خطرهای باقی‌مانده‌ای را که ممکن است بر نتیجه‌گیری‌های آن اثر بگذارند، به‌صراحت بیان می‌کند.

چهار حوزه اولویت‌دار برای ارزیابی عمیق‌تر را همراه با اصول انجام کاری دقیق، امن و مستقل پیشنهاد می‌کنیم.

  1. ارزیابی مستقل پرونده‌های ایمنی در مراحل آموزش، ارزیابی، استقرار داخلی و استقرار خارجی.

    ارزیابی پرونده‌های ایمنی به تخصص در هم‌ترازی، روش‌های کنترل مانند پایش، امنیت سایبری، سوءاستفاده‌های زیستی و شیمیایی و تیم قرمز نیاز دارد. پرونده‌های ایمنی از ادعاهایی درباره آموزش، ارزیابی قابلیت‌ها و تدابیر حفاظتی تشکیل شده‌اند و می‌توان آن‌ها را یکجا یا به‌صورت جداگانه ارزیابی کرد (اولویت‌های ۲ و ۳ در ادامه را ببینید). احتمالاً لازم است چند ارزیاب، با تکیه بر تخصص‌های خود، بخش‌های متفاوت پرونده‌ها را بررسی کنند. مجموع ارزیابی‌های آن‌ها باید به پرسش‌هایی از این دست پاسخ دهد:

    1. آیا شواهد پرونده‌های ایمنی مربوط به آموزش، ارزیابی و استقرارها مستند و معتبرند؟ آیا شرایط پرونده ایمنی در طول آموزش، ارزیابی و استقرار رعایت شده‌اند؟

    2. آیا پرونده‌های ایمنی ما فوری‌ترین خطرهای شناسایی‌شده در جریان ارزیابی را پوشش می‌دهند؟ آیا ادعاهای ایمنی از پرونده کلی ایمنی پشتیبانی می‌کنند؟ آیا کاستی یا زمینه‌ای برای بهبود وجود دارد؟

    3. آیا برای شناسایی و کاهش انگیزه‌های آموزشی که ممکن است فریب‌کاری، سوءاستفاده از سازوکار پاداش، اقدامات مخرب یا دور زدن محدودیت‌ها را تشویق کنند، از روش‌های مؤثر استفاده می‌شود؟

  2. ارزیابی تدابیر حفاظتی حیاتی در استقرارهای داخلی و خارجی

    مجموعه تدابیر حفاظتی ما همواره برای سازگاری با قابلیت‌ها و فضای در حال تغییر تکامل می‌یابد. تدابیر حفاظتی ما آموزش، استقرار داخلی و استقرار خارجی را پوشش می‌دهند. این تدابیر اکنون شامل حفاظت‌های سطح مدل، حفاظت‌های اجرایی و حفاظت‌های امنیتی و نیز سامانه‌های پایش ناهم‌ترازی‌اند و طیف گسترده‌ای از خطرها، مانند ازدست‌رفتن کنترل و سوءاستفاده در حوزه‌های سایبری، زیستی و شیمیایی، را پوشش می‌دهند. همکاری‌های فنی می‌توانند ضمن شناسایی ضعف‌های فعلی تدابیر حفاظتی، روش‌های ارزیابی را بهبود دهند و تدوین استانداردها را تسریع کنند؛ در نتیجه، مبنای فنی محکم‌تری برای سیاست‌گذاری عمومی آینده با هدف همگامی با مرزهای پیشرو فراهم می‌شود، به‌ویژه در استقرارهای داخلی که استانداردهای ایمنی و امنیتی هنوز نوپا هستند.

    ارزیابی‌های مستقل باید میزان اثربخشی این تدابیر حفاظتی و نقاط ضعف احتمالی آن‌ها را بررسی کنند؛ برای نمونه:

    1. با دسترسی «جعبه خاکستری»، آیا تدابیر حفاظتی در برابر آزمون‌های خصمانه (دور زدن محدودیت‌ها) مقاوم‌اند و به‌اندازه کافی از افزایش قابلیت در حوزه‌های پرخطر، مانند سایبری و زیستی، جلوگیری می‌کنند؟ آیا آزمون‌های خصمانه و تیم قرمز ما مهم‌ترین خطرها را پوشش می‌دهند؟

    2. در آزمون‌های مجاز و تحت شرایط عملیاتی واقعی، عامل‌ها چگونه با دفاع‌های سایبری مانند کنترل دسترسی، محیط‌های ایزوله و سامانه‌های تشخیص و واکنش تعامل می‌کنند؟ کدام دفاع‌ها از اقدامات زیان‌بار جلوگیری می‌کنند، آن‌ها را تشخیص می‌دهند یا مهار می‌کنند، و در کجا ناکام می‌مانند؟

    3. آیا سامانه‌های پایش ناهم‌ترازی ما در استقرارهای داخلی یا خارجی کاستی‌های مهمی دارند که ممکن است به ازدست‌رفتن کنترل یا ناهم‌ترازی شدید بینجامد؟ با افزایش قابلیت‌های مدل، پایش زنجیره تفکر تا چه حد می‌تواند منبع قابل‌اعتمادی برای شواهد ایمنی یا هم‌ترازی باشد؟

    4. آیا در همه فرایندهای مرتبط آموزش، ارزیابی و استقرار، پایش مناسبی اجرا شده است که نتوان آن را به‌آسانی غیرفعال کرد؟

    5. آیا تدابیر حفاظتی متناسب با قابلیت‌ها اجرا شده‌اند؟

  3. ارزیابی سنجش‌های قابلیت که دسته‌های خطر چارچوب آمادگی (خطرهای شیمیایی و زیستی، امنیت سایبری و خودبهبودی هوش مصنوعی) را پوشش می‌دهند و سنجش‌های هم‌ترازی برای خطرهای ناهم‌ترازی

    چارچوب آمادگی ما مستلزم انجام ارزیابی‌هایی برای سنجش حوزه‌های اصلی خطر مرزی است. با عبور از آستانه‌ها و اشباع ارزیابی‌ها، باید ارزیابی‌های قابلیت در حوزه‌های خطر آمادگی و نیز ارزیابی‌های هم‌ترازی برای سنجش خطرهای ناهم‌ترازی شدید، پیوسته به‌روزرسانی شوند و از پوشش و کیفیت آن‌ها اطمینان حاصل شود.

    پرسش‌های مرتبط عبارت‌اند از:

    1. آیا ارزیابی‌های خطرهای آمادگی، تعریف آستانه خطر آمادگی را به‌اندازه کافی پوشش می‌دهند؟ آیا آستانه‌های این ارزیابی‌ها به‌درستی تعیین شده‌اند؟

    2. آیا وقتی مدل‌ها پیوسته بالاترین امتیازها را کسب می‌کنند، ارزیابی‌ها به‌روزرسانی می‌شوند و آیا آزمون‌های جدید واقعاً قابلیت‌های پیشرفته‌تر را می‌سنجند؟

    3. آیا ارزیابی‌های هم‌ترازی ما خطرهای ناهم‌ترازی شدید را به‌اندازه کافی پوشش می‌دهند و ممکن است کدام رفتارها یا شرایط مهم را از قلم بیندازند؟

  4. بررسی مستقل رخدادهای بحرانی ناهم‌ترازی

    بررسی مستقل می‌تواند در طیف گسترده‌ای از رخدادهای بحرانی ایمنی هوش مصنوعی ارزشمند باشد. در اینجا بر ناهم‌ترازی مدل تمرکز می‌کنیم؛ از جمله اقدام بدون مجوز یا گریز مدل‌ها از نظارت که حتی بدون سوءاستفاده عمدی نیز می‌تواند ضعف‌های روش‌های هم‌ترازی و تدابیر حفاظتی را آشکار کند.

    در برخی شرایط، مانند رخداد OpenAI در Hugging Face، می‌تواند مفید باشد که شخص ثالث مستقلی برای بررسی مستقل رخدادهای ناهم‌ترازی مشارکت کند. ضروری است اشخاص ثالثی که در بررسی رخداد مشارکت می‌کنند، تخصص لازم را داشته باشند؛ از جمله، حسب مورد، تخصص جرم‌یابی سایبری، هم‌ترازی، تحلیل گسترده زنجیره تفکر و نیز کارکنان و منابع کافی برای انجام به‌موقع بررسی. واکنش به رخداد ممکن است مستلزم دسترسی به داده‌های داخلی حساس و داده‌های اشخاص ثالث باشد؛ بنابراین انتشار یا دسترسی به برخی جزئیات می‌تواند حساس باشد. یافته‌های بررسی‌های مستقل می‌توانند با ارائه شواهدی برای ارزیابی ادعاهای مربوط به هم‌ترازی مدل و اثربخشی اقدامات اصلاحی انجام‌شده برای ناهم‌ترازی‌های پیشین، به پرونده ایمنی آن نیز کمک کنند.

    در زمینه رخدادهای ناهم‌ترازی، ارزیابی‌های مستقل را در موارد زیر در اولویت قرار می‌دهیم:

    1. در جریان رخداد چه رفتار مدل یا مشکلات ناهم‌ترازی روی داده و عوامل اصلی مؤثر در آن‌ها چه بوده‌اند؟

    2. آیا تدابیر حفاظتی و اقدامات اصلاحی می‌توانند رخدادهای مشابه آینده را به‌طور مؤثر کاهش دهند؟

اصول ارزیابی مؤثر

  • دامنه روشن و ادعاهای مورد توافق طرفین برای ارزیابی: ارزیابی‌ها باید با تعیین دامنه‌ای مورد توافق طرفین آغاز شوند و سپس ادعاهای ایمنی به‌روشنی تعریف و پیش از آغاز فعالیت‌های ارزیابی، از قبل ثبت شوند. اشخاص ثالث و آزمایشگاه‌ها باید روشن کنند که آیا این ادعاها را شرکتِ در حال ارزیابی برای بررسی مطرح کرده است، یا ارزیاب شخص ثالث قصد دارد آن‌ها را مستقلاً بررسی کند و آزمایشگاه نیز پذیرفته است که بر اساس آن‌ها ارزیابی شود. برخی ادعاها ممکن است به دلایل گوناگون خارج از دامنه باشند؛ از جمله ناممکن بودن دسترسی اشخاص ثالث به داده‌ها، کافی نبودن تخصص ارزیاب یا محدودیت زمانی معقول در ارزیابی‌های فوری. آزمایشگاه‌ها و ارزیابان باید فرایندی برای بررسی خطرهای مهم شناسایی‌شده خارج از دامنه اولیه ایجاد کنند، از جمله تعیین اینکه آیا بررسی بیشتر ضرورت دارد یا خیر. نتیجه‌گیری‌ها باید با توجه به دامنه مورد توافق طرفین، به‌روشنی مشخص کنند چه مواردی ارزیابی شده و چه مواردی ارزیابی نشده‌اند.

  • دسترسی متناسب: ارزیابان باید تا حد ممکن و در چارچوب محدودیت‌های حقوقی، امنیتی و مالکیت فکری، برای بررسی ادعاهای مورد توافق از دسترسی متناسب برخوردار باشند. هرگاه دسترسی مستقیم عملی یا ممکن نباشد، ارزیابان می‌توانند با نماینده تعیین‌شده شرکت همکاری کنند یا برای حفاظت از اطلاعات زیربنایی، سازوکارهای دسترسی غیرمستقیم یا حافظ حریم خصوصی را بررسی کنند.

  • روش‌شناسی و استانداردهای شفاف: ارزیابان باید روش‌ها، معیارهای ارزیابی و عدم‌قطعیت‌های خود را توضیح دهند و هرجا ممکن است، بر استانداردهای تثبیت‌شده تکیه کنند. هرجا هنوز استانداردی وجود ندارد، باید معیارهای مورد استفاده خود را به‌روشنی توجیه کنند. گزارش‌ها باید یافته‌های مستقیم را از تفسیر متمایز کنند، عدم‌قطعیت را توضیح دهند و روشن سازند که شواهد از کدام نتیجه‌گیری‌ها پشتیبانی می‌کنند.

  • تخصص و استقلال: ارزیابان باید تخصص فنی مرتبط خود را نشان دهند و تعارض منافع سازمانی و فردی، از جمله انگیزه‌های مالی، روابط با توسعه‌دهندگان و مشارکت قبلی در کار مورد ارزیابی را شناسایی، افشا و رفع کنند. تدابیر حفاظتی باید به‌گونه‌ای طراحی شوند که فشارهای تجاری و ترتیبات پرداخت بر یافته‌ها اثر نگذارند و می‌توانند شامل کناره‌گیری از ارزیابی یا دوره‌های منع مشارکت مناسب باشند.

  • امنیت و محرمانگی: ارزیابان باید متناسب با حساسیت سامانه‌ها و اطلاعاتی که به آن‌ها دسترسی دارند، شیوه‌های امنیت اطلاعات و تضمین‌های الزام‌آور محرمانگی را برای کارکنان خود به کار گیرند. این تضمین‌ها باید مالکیت فکری، اطلاعات حساس و سوابق ارزیابی را پوشش دهند. اگر ارزیابان نتوانند الزامات امنیتی را در محیط خود رعایت کنند یا داده‌های مورد دسترسی حساسیت ویژه‌ای داشته باشند، استفاده از دستگاه‌ها یا محل‌های تحت مدیریت شرکت می‌تواند مناسب باشد.

  • یافته‌های عملی و فرصت رفع مشکلات: ارزیابی‌ها باید کاستی‌های مشخص را شناسایی کنند و جزئیات کافی برای رفع آن‌ها در اختیار آزمایشگاه‌ها بگذارند. در صورت اقتضا، آزمایشگاه‌ها باید پیش از انتشار، فرصت معقولی برای رفع مشکلات داشته باشند. در موارد مرتبط، گزارش‌ها باید درس‌های قابل استفاده برای توسعه‌دهندگان، استقراردهندگان و مدافعان عامل‌ها را نیز همراه با توصیه‌های عملی برای اجرا توضیح دهند.

  • شیوه‌های انتشار مسئولانه: گزارش‌های ارزیابی باید مبتنی بر شواهد باشند و ضمن حفاظت از اطلاعات حساس و محرمانه، تا حد امکان به‌صورت عمومی منتشر شوند. اگر افشای عمومی کامل ممکن نباشد، گزارش‌دهی محرمانه به نهادهای نظارتی مناسب، مانند نهادهای راهبری یا هیئت‌مدیره شرکت‌ها، می‌تواند به پاسخ‌گویی کمک کند. برای حفظ توازن میان استقلال و محرمانگی، باید تضمین‌ها و سیاست‌های اصول‌مند حذف اطلاعات و نیز انتظارات روشنی درباره بازخورد و اصلاح موارد نادرست وجود داشته باشد. ارزیابان باید استقلال تحریریه خود را حفظ کنند و هم‌زمان از رعایت محرمانگی و حفاظت از مالکیت فکری اطمینان یابند. ارزیابان باید سیاست‌های روشنی برای حذف اطلاعات تدوین کنند تا آزمایشگاه‌ها بتوانند حذف اطلاعات حساس را درخواست کنند؛ در عین حال، ارزیابان می‌توانند موارد حذف محتوای اساسی و تأثیر آن‌ها بر گزارش ارزیابی را ذکر کنند.

مسیر پیش رو

ما متعهدیم از ارزیابان مستقل پشتیبانی کنیم و برای ارزیابی مؤثر اشخاص ثالث، چه از طریق قوانین آینده و چه نهادهای راهبری خصوصی، استانداردهای بین‌المللی مشترک و روشن‌تری ایجاد کنیم. اگرچه زیست‌بوم ارزیابی مستقل هنوز در حال رشد است، با پشتیبانی و همکاری با جامعه‌ای متنوع از ارزیابان مستقل که در مسائل ایمنی پیشرو تخصص عمیق دارند، به رشد آن کمک خواهیم کرد. هیچ شخص ثالثی به‌تنهایی نمی‌تواند و نباید همه مسائل فوری ایمنی پیشرو را به‌طور جامع پوشش دهد. سنجیده و هدفمند پیش خواهیم رفت تا ظرفیت خود را افزایش دهیم و به زیست‌بوم رو‌به‌رشد اشخاص ثالث امکان دهیم بر سر بهترین شیوه‌ها و اصول همسو شوند. درباره پیشنهادهای همسو با حوزه‌های اولویت‌دار بالا، با چندین شخص ثالث در حال گفت‌وگو هستیم.