پرش به محتوای اصلی
OpenAI

۲۵ شهریور ۱۴۰۵

تحقیقایمنی

چارچوب ما برای گزارش ناهم‌سویی مدل

در حال بارگذاری…

ما چارچوب جدیدی برای ردیابی، بررسی و افشای موارد ناهم‌سویی مدل در OpenAI منتشر می‌کنیم؛ همراه با شش گزارش درباره رفتارهای غیرمنتظره یا نگران‌کننده مدل‌ها که در شش ماه گذشته مشاهده کرده‌ایم.

در گذشته، برای آگاهی‌بخشی بهتر به پژوهشگران، توسعه‌دهندگان هوش مصنوعی، سیاست‌گذاران و عموم مردم، تلاش کرده‌ایم یافته‌های خود درباره ناهم‌سویی را علنی کنیم. اما به‌دلیل نبود رویکردی نظام‌مند برای گزارش این یافته‌ها، افشاگری‌های ما موردی و کمتر از حد مطلوب بوده‌اند: اغلب صبر کرده‌ایم تا چند مورد را در یک گزارش گرد آوریم یا آن‌ها را به کارت سیستم مدل‌های تازه‌منتشرشده افزوده‌ایم. هدف این چارچوب جدید، تسریع انتشار گزارش ناهم‌سویی پس از مشاهده آن است؛ حتی وقتی هنوز رفتار گزارش‌شده را کاملاً توضیح نداده یا مهار نکرده‌ایم.

با پیشرفته‌تر و فراگیرتر شدن استقرار سامانه‌های هوش مصنوعی، باید درباره پیشرفت پژوهش هم‌سویی، اجماعی گسترده‌تر و آگاهانه‌تر شکل دهیم. ما باور نداریم که صنعت هوش مصنوعی مسئله هم‌سویی و نظارت را به اندازه‌ای حل کرده باشد که بتوان برای مدتی طولانی‌تر، توسعه را با حداکثر سرعت و به‌شکلی مسئولانه ادامه داد. تصمیم‌گیری درباره مسیر توسعه هوش مصنوعی در ماه‌ها و سال‌های آینده باید بر شواهدی تکیه کند که افراد بیرون از شرکت‌های سازنده مدل‌های پیشرو بتوانند خودشان آن‌ها را بررسی کنند.

نمونه‌های ناهم‌سویی می‌توانند به شناسایی مشکلاتی کمک کنند که توسعه‌دهندگان دیگر هوش مصنوعی با رسیدن سامانه‌هایشان به قابلیت‌های مشابه ممکن است با آن‌ها روبه‌رو شوند، ضعف سازوکارهای حفاظتی را آشکار کنند یا فرضیات درباره رفتار مدل را به چالش بکشند. انتشار این یافته‌ها به دیگران امکان می‌دهد همان مشکلات را بررسی کنند، توضیحات ما را بیازمایند و راهکارهای مهار را بهبود دهند. چون به ارزش شفافیت درباره ناهم‌سویی باور داریم، چارچوب جدید ما حتی در صورت نامشخص بودن اهمیت یک مورد، افشای آن را ترجیح می‌دهد. یعنی ممکن است بعداً مشخص شود برخی مواردی که افشا می‌کنیم بی‌اساس‌اند و بخشی از الگویی گسترده‌تر نیستند یا نشانه‌ای از تحولات آینده به شمار نمی‌روند.

در حال حاضر، چارچوبی در سطح کل صنعت وجود ندارد که معیارهای صریحی برای نحوه افشای نمونه‌های ناهم‌سویی مدل‌ها از سوی توسعه‌دهندگان هوش مصنوعی تعیین کند. امیدواریم چارچوبی که امروز ارائه می‌کنیم، نخستین گام برای تدوین چنین معیارهایی باشد و مشخص کند توسعه‌دهندگان باید کدام موارد ناهم‌سویی را افشا کنند و گزارش‌هایشان چه محتوایی داشته باشد. این چارچوب را کاری در حال تکامل می‌دانیم که با کسب تجربه و دریافت بازخورد عمومی اصلاحش خواهیم کرد.

در اینجا نحوه عملکرد چارچوب را شرح می‌دهیم و نخستین گزارش‌های خود را منتشر می‌کنیم.

کدام نمونه‌های ناهم‌سویی را گزارش می‌کنیم

هدف ما افشای نمونه‌هایی است که شواهد مفیدی درباره چگونگی شکل‌گیری و بروز ناهم‌سویی مدل و نقاط موفقیت یا شکست سازوکارهای حفاظتی ارائه می‌کنند. سازوکارهای جدید، تغییرات معنادار در رفتارهای شناخته‌شده و یافته‌هایی را در اولویت قرار می‌دهیم که فرضیات مربوط به ایمنی یا مهار را به چالش می‌کشند. برای آنکه نمونه‌ای ارزش افشا داشته باشد، لازم نیست آسیبی ایجاد کرده یا الگویی گسترده‌تر را اثبات کرده باشد. این چارچوب رفتارهای واجد شرایط را در سراسر چرخه عمر مدل، از جمله آموزش، ارزیابی، آزمایش و استقرار، پوشش می‌دهد.

این موارد شامل روش‌های جدیدی است که مدل‌ها از طریق آن‌ها بدون مجوز اقدام می‌کنند، با مدل‌های دیگر هماهنگ می‌شوند یا از نظارت می‌گریزند؛ همچنین شکست‌هایی که یک روش هم‌سویی یا سازوکار حفاظتی را زیر سؤال می‌برند و رفتارهایی که ادعایی را در یک ارزیابی ایمنی منتشرشده به چالش می‌کشند. همین معیارهای افشا درباره ناهم‌سویی‌هایی که ممکن است بر اشخاص ثالث اثر بگذارند نیز اعمال می‌شود.

این موارد ممکن است نمونه‌هایی از ناهم‌سویی را نیز شامل شود که ظاهراً مشابه مواردی هستند که پیش‌تر افشا کرده‌ایم. تکرار مشکل ممکن است خود شاهد مفیدی درباره رفتار مدل‌های ما یا اثربخشی سازوکارهای حفاظتی‌مان باشد؛ برای مثال، وقتی نوع خاصی از رفتار ناهم‌سو با وجود تلاش‌های مکرر برای مهار آن همچنان تکرار می‌شود. در چنین شرایطی، نمونه‌های جدید را با به‌روزرسانی افشای اولیه ناهم‌سویی منتشر خواهیم کرد.

در گذر زمان قصد داریم با همکاری دیگر توسعه‌دهندگان، پژوهشگران مستقل، نهادهای تدوین استانداردهای صنعتی و تنظیم‌گران، معیارهای عینی‌تری برای افشا تدوین کنیم. همچنین معتقدیم رخدادهای جدی مرتبط با ایمنی، امنیت و ناهم‌سویی باید با دولت فدرال ایالات متحده در میان گذاشته شوند و در حال تدوین پیشنهادهایی برای سازوکارهای گزارش‌دهی هستیم. این چارچوب را مکمل تعهدات فعلی خود می‌دانیم و تأکید می‌کنیم که جایگزین الزامات قانونی افشای اطلاعات، از جمله الزامات مربوط به رخدادهای حیاتی ایمنی یا نقض امنیت سایبری، نمی‌شود.

نمونه‌های ناهم‌سویی که امروز منتشر می‌کنیم

برای آغاز چارچوب جدید افشای ناهم‌سویی، شش گزارش درباره موارد رفتار ناهم‌سویی منتشر می‌کنیم که هنگام آموزش یا ارزیابی مدل‌هایمان مشاهده کرده‌ایم. این موارد طیفی از رفتارهای گوناگون و درخور انتشار را نشان می‌دهند؛ از پنهان کردن اطلاعات از کاربر تا انجام اقدامات بدون مجوز برای غلبه بر موانع. این‌ها گزارش‌هایی درباره موارد منفردند و نباید نمایانگر میزان تکرار ناهم‌سویی در مدل‌های ما تلقی شوند. هر مورد زیر به گزارش کامل آن پیوند دارد.

  1. دستورالعمل‌های خودساخته در خلاصه‌های وظیفه(در یک پنجره جدید باز می‌شود). یک مدل پژوهشی منتشرنشده، دستورالعمل‌های نامرتبطی، از جمله دستور نادیده گرفتن محدودیت‌های عادی خود، در خلاصه‌هایی گنجاند که برای ادامه کارش در یک پنجره زمینه جدید استفاده می‌شدند. ۲۷ خلاصه متأثر را شناسایی کردیم.

  2. دستورالعمل‌های پنهان کردن اشتباهات در خلاصه‌های وظیفه(در یک پنجره جدید باز می‌شود). در جریان آموزش GPT‑5.6 Sol، بسیاری از نمونه‌های مدل دستورالعمل‌هایی به خلاصه‌های خود افزودند تا اشتباهات یا رفتار ناهم‌سویشان را از کاربر پنهان کنند. برای مثال، خلاصه‌های فشرده‌سازی شامل دستورالعمل‌هایی برای جعل داده‌های تاریخی مفقود بدون افشای این کار و پنهان کردن ناهماهنگی میان نسخه‌های منبع بودند.

  3. جست‌وجوی کلیدهای API افشاشده در محل‌های نگهداری عمومی و سپس جعل اطلاعات(در یک پنجره جدید باز می‌شود). مدلی هنگام پاسخ به پرسشی عادی درباره ارقام درآمد در یکی از شهرستان‌های کالیفرنیا، یک کلید API افشاشده را یافت و بدون مجوز از آن استفاده کرد. وقتی باز هم نتوانست ارقام درخواستی را بازیابی کند، آن‌ها را جعل کرد و به‌عنوان داده‌های منبع درخواستی ارائه داد.

  4. بارگذاری فایل‌ها در اینترنت برای استناد به آن‌ها(در یک پنجره جدید باز می‌شود). وقتی کاربری شناسه و نام دریاچه‌های بزرگ‌تر از ۵٬۰۰۰٬۰۰۰ مترمربع را از یک مدل منتشرنشده خواست، عامل با استفاده از Python پاسخ درست را یافت. اما چون دستورالعمل‌ها استناد مرورگری می‌خواستند، عامل بدون پرسیدن از کاربر تصمیم گرفت فایل را بارگذاری کند تا بتواند در پاسخ خود به آن استناد کند.

  5. نوشتن و ارتباط بدون مجوز از طریق محل نگهداری داخلی نرم‌افزار(در یک پنجره جدید باز می‌شود). مدل‌ها هنگام جست‌وجوی فایل‌های ورودی مفقود، از یک محل نگهداری داخلی نرم‌افزار مانند تابلوی پیام استفاده کردند تا میان نمونه‌های آموزشی جداگانه درخواست و پاسخ ردوبدل کنند؛ هرچند نتوانستند آن فایل‌ها را بازیابی کنند. این گزارش همچنین موردی قدیمی‌تر را بررسی می‌کند که در آن مدلی هنگام تلاش برای دور زدن محدودیت‌های شبکه، با موفقیت فایل‌های آزمایشی را در یک محل نگهداری بارگذاری کرد.

  6. اشتراک‌گذاری بدون مجوز فایل میان عامل‌های همکار(در یک پنجره جدید باز می‌شود). عامل‌هایی که روی یک وظیفه آموزشی مشترک کار می‌کردند، وقتی به فایل‌های محلی یکدیگر دسترسی نداشتند، برای اشتراک‌گذاری فایل از وب‌سایت‌های عمومی میزبانی فایل استفاده کردند. در نتیجه، خروجی‌های وظیفه در نشانی‌های عمومی اینترنتی در دسترس قرار گرفتند، با اینکه در وظیفه از مدل‌ها خواسته شده بود فقط از فایل‌های محلی استفاده کنند.

فرایند افشای ما چگونه کار می‌کند

هر یک از کارکنان OpenAI می‌تواند نمونه‌ای از ناهم‌سویی را برای بررسی به تیم‌های ایمنی و هم‌سویی ما گزارش دهد و درخواست کند امکان افشای عمومی آن بررسی شود. با این کار فرایند افشای ما آغاز می‌شود و برای هر مرحله مهلتی تعیین شده است تا بررسی و افشا به‌موقع انجام شود.

پس از گزارش یک نمونه، کارکنان فنی ما بررسی می‌کنند چه اتفاقی افتاده، چه مواردی همچنان نامشخص است، آیا افشای عمومی موجه است و کدام واقعیت‌ها را می‌توان منتشر کرد. همچنین ارزیابی می‌کنند که آیا شخص ثالثی تحت تأثیر قرار گرفته و لازم است پیش از انتشار، به‌صورت خصوصی مطلع شود یا خیر.

سپس نمونه در یکی از سه مسیر قرار می‌گیرد: «آماده افشا»، «بررسی محدود» یا «بررسی گسترده» («مسیر آهسته»).

مسیر «آماده افشا» شامل موارد واجد شرایطی است که بررسی آن‌ها به‌اندازه کافی کامل شده و پس از بازبینی قابل انتشارند. مسیر «بررسی محدود» شامل مواردی است که به بررسی فنی بیشتری نیاز دارند. انتظار داریم اکثریت قریب‌به‌اتفاق موارد افشاشده در این دو مسیر قرار بگیرند؛ به‌ویژه مواردی که به بررسی گسترده، هماهنگی با اشخاص ثالث یا رسیدگی به خطرهای سوءاستفاده شدید نیاز ندارند. تمام مواردی که امروز منتشر می‌کنیم در یکی از این دو مسیر قرار دارند.

مسیر «بررسی گسترده» شامل بررسی‌های پیچیده، به‌ویژه موارد مرتبط با اشخاص ثالث است. وقتی شخص ثالثی تحت تأثیر قرار گرفته باشد، تعهدات امنیتی، حقوقی و افشای مسئولانه ما بر این چارچوب اولویت دارند. هدف ما انتشار اطلاعیه‌ای اولیه در سریع‌ترین زمان ممکن است، اما شاید به دلایل امنیتی ناچار به تأخیر شویم؛ مثلاً اگر مدلی آسیب‌پذیری ناشناخته‌ای را در نرم‌افزاری پرکاربرد کشف کند. اگر گزارشی هویت شخص ثالثی را آشکار کند، قصد داریم حتی در صورت نقض نشدن هیچ مرز امنیتی، او را پیشاپیش مطلع کنیم.

اطلاعیه اولیه درباره موردی در مسیر «بررسی گسترده»، شرحی کلی از آنچه رخ داده ارائه می‌کند، می‌گوید آیا کارشناسان بیرونی به بررسی کمک می‌کنند و هر برآورد موجودی از زمان احتمالی انتشار گزارش نهایی را اعلام می‌کند. اگر رخداد Hugging Face متعلق به OpenAI ذیل این چارچوب افشا می‌شد، در همین مسیر قرار می‌گرفت.

کارمندی که نمونه را مطرح کرده است، از تصمیم درباره افشای آن و در صورت افشا، از مسیر رسیدگی به آن مطلع خواهد شد. اختلاف‌نظرهای حل‌نشده درباره افشا یا مسیر مناسب به گروه مشورتی ایمنی OpenAI (SAG) ارجاع می‌شود؛ گروهی متشکل از مدیران ارشد بخش‌های مختلف شرکت که قابلیت‌ها و سازوکارهای حفاظتی مدل‌های پیشرو را ارزیابی می‌کند، بر چارچوب آمادگی ما نظارت دارد و به رهبران OpenAI مشاوره می‌دهد. اختلاف‌نظرهای درون گروه مشورتی ایمنی یا اعتراض کارکنان به تصمیم‌های آن، به رهبران OpenAI ارجاع خواهد شد. تصمیم مبنی بر افشا نکردن یا موجه نبودن افشا، با مدیران ایمنی و هم‌سویی و تا حد امکان با کارکنان فنی مرتبط در میان گذاشته خواهد شد.

ممکن است با روشن شدن نحوه عملکرد این فرایند افشا در عمل، آن را بازنگری کنیم و هر تغییری را در همین مطلب ثبت خواهیم کرد.

محتوای هر گزارش

هر گزارش کامل، رفتار مشاهده‌شده، شدت و هرگونه پیامد بیرونی آن، محیط وقوع، تاریخ یا بازه زمانی رخداد، زمان کشف آن و در سطح کلی، مدل یا مدل‌های دخیل را شرح خواهد داد. در صورت امکان، موارد زیر را نیز منتشر می‌کنیم:

  • جزئیات بیشتر درباره آنچه رخ داده و هرگونه آسیب ناشی از آن؛

  • نحوه کشف ناهم‌سویی و دامنه بررسی ما؛

  • برداشت ما از پیامدهای آن برای پژوهش هم‌سویی و ایمنی فنی هوش مصنوعی؛

  • پرسش‌های مهم و بی‌پاسخی که این نمونه مطرح می‌کند؛

  • اقداماتی که برای رسیدگی به این رفتار انجام می‌دهیم یا قصد انجامشان را داریم. ممکن است این اطلاعات هنگام افشا همیشه در دسترس نباشد، زیرا شاید گزارش ناهم‌سویی را پیش از تکمیل بررسی یا تدوین راه‌حل منتشر کنیم.

درباره ناهم‌سویی‌هایی که در استقرارهای مشتریان رخ می‌دهد، تا جایی که حریم خصوصی مشتری و تعهدات قراردادی ما اجازه دهد اطلاعات منتشر خواهیم کرد.

گزارش‌های امروز مجموعه‌ای اولیه از موارد افشاشده‌اند، نه شرحی جامع از ناهم‌سویی‌های شناخته‌شده یا بررسی‌های در حال انجام. هدف از این گزارش‌های اولیه، نمایش تمام گستره یا شدت موارد مشمول این چارچوب نیست. ما متعهدیم موارد ناهم‌سویی مطابق با معیارهای این چارچوب را افشا کنیم؛ از جمله موارد پیچیده‌تری که به بررسی طولانی‌تر یا هماهنگی با اشخاص ثالث نیاز دارند. انتشار مستمر گزارش‌ها ذیل این چارچوب را ادامه خواهیم داد و هم‌زمان با تکمیل تعهدات گزارش‌دهی خود، اطلاعات بیشتری درباره آن‌ها ارائه می‌کنیم.

نویسنده

OpenAI