ما چارچوب جدیدی برای ردیابی، بررسی و افشای موارد ناهمسویی مدل در OpenAI منتشر میکنیم؛ همراه با شش گزارش درباره رفتارهای غیرمنتظره یا نگرانکننده مدلها که در شش ماه گذشته مشاهده کردهایم.
در گذشته، برای آگاهیبخشی بهتر به پژوهشگران، توسعهدهندگان هوش مصنوعی، سیاستگذاران و عموم مردم، تلاش کردهایم یافتههای خود درباره ناهمسویی را علنی کنیم. اما بهدلیل نبود رویکردی نظاممند برای گزارش این یافتهها، افشاگریهای ما موردی و کمتر از حد مطلوب بودهاند: اغلب صبر کردهایم تا چند مورد را در یک گزارش گرد آوریم یا آنها را به کارت سیستم مدلهای تازهمنتشرشده افزودهایم. هدف این چارچوب جدید، تسریع انتشار گزارش ناهمسویی پس از مشاهده آن است؛ حتی وقتی هنوز رفتار گزارششده را کاملاً توضیح نداده یا مهار نکردهایم.
با پیشرفتهتر و فراگیرتر شدن استقرار سامانههای هوش مصنوعی، باید درباره پیشرفت پژوهش همسویی، اجماعی گستردهتر و آگاهانهتر شکل دهیم. ما باور نداریم که صنعت هوش مصنوعی مسئله همسویی و نظارت را به اندازهای حل کرده باشد که بتوان برای مدتی طولانیتر، توسعه را با حداکثر سرعت و بهشکلی مسئولانه ادامه داد. تصمیمگیری درباره مسیر توسعه هوش مصنوعی در ماهها و سالهای آینده باید بر شواهدی تکیه کند که افراد بیرون از شرکتهای سازنده مدلهای پیشرو بتوانند خودشان آنها را بررسی کنند.
نمونههای ناهمسویی میتوانند به شناسایی مشکلاتی کمک کنند که توسعهدهندگان دیگر هوش مصنوعی با رسیدن سامانههایشان به قابلیتهای مشابه ممکن است با آنها روبهرو شوند، ضعف سازوکارهای حفاظتی را آشکار کنند یا فرضیات درباره رفتار مدل را به چالش بکشند. انتشار این یافتهها به دیگران امکان میدهد همان مشکلات را بررسی کنند، توضیحات ما را بیازمایند و راهکارهای مهار را بهبود دهند. چون به ارزش شفافیت درباره ناهمسویی باور داریم، چارچوب جدید ما حتی در صورت نامشخص بودن اهمیت یک مورد، افشای آن را ترجیح میدهد. یعنی ممکن است بعداً مشخص شود برخی مواردی که افشا میکنیم بیاساساند و بخشی از الگویی گستردهتر نیستند یا نشانهای از تحولات آینده به شمار نمیروند.
در حال حاضر، چارچوبی در سطح کل صنعت وجود ندارد که معیارهای صریحی برای نحوه افشای نمونههای ناهمسویی مدلها از سوی توسعهدهندگان هوش مصنوعی تعیین کند. امیدواریم چارچوبی که امروز ارائه میکنیم، نخستین گام برای تدوین چنین معیارهایی باشد و مشخص کند توسعهدهندگان باید کدام موارد ناهمسویی را افشا کنند و گزارشهایشان چه محتوایی داشته باشد. این چارچوب را کاری در حال تکامل میدانیم که با کسب تجربه و دریافت بازخورد عمومی اصلاحش خواهیم کرد.
در اینجا نحوه عملکرد چارچوب را شرح میدهیم و نخستین گزارشهای خود را منتشر میکنیم.
هدف ما افشای نمونههایی است که شواهد مفیدی درباره چگونگی شکلگیری و بروز ناهمسویی مدل و نقاط موفقیت یا شکست سازوکارهای حفاظتی ارائه میکنند. سازوکارهای جدید، تغییرات معنادار در رفتارهای شناختهشده و یافتههایی را در اولویت قرار میدهیم که فرضیات مربوط به ایمنی یا مهار را به چالش میکشند. برای آنکه نمونهای ارزش افشا داشته باشد، لازم نیست آسیبی ایجاد کرده یا الگویی گستردهتر را اثبات کرده باشد. این چارچوب رفتارهای واجد شرایط را در سراسر چرخه عمر مدل، از جمله آموزش، ارزیابی، آزمایش و استقرار، پوشش میدهد.
این موارد شامل روشهای جدیدی است که مدلها از طریق آنها بدون مجوز اقدام میکنند، با مدلهای دیگر هماهنگ میشوند یا از نظارت میگریزند؛ همچنین شکستهایی که یک روش همسویی یا سازوکار حفاظتی را زیر سؤال میبرند و رفتارهایی که ادعایی را در یک ارزیابی ایمنی منتشرشده به چالش میکشند. همین معیارهای افشا درباره ناهمسوییهایی که ممکن است بر اشخاص ثالث اثر بگذارند نیز اعمال میشود.
این موارد ممکن است نمونههایی از ناهمسویی را نیز شامل شود که ظاهراً مشابه مواردی هستند که پیشتر افشا کردهایم. تکرار مشکل ممکن است خود شاهد مفیدی درباره رفتار مدلهای ما یا اثربخشی سازوکارهای حفاظتیمان باشد؛ برای مثال، وقتی نوع خاصی از رفتار ناهمسو با وجود تلاشهای مکرر برای مهار آن همچنان تکرار میشود. در چنین شرایطی، نمونههای جدید را با بهروزرسانی افشای اولیه ناهمسویی منتشر خواهیم کرد.
در گذر زمان قصد داریم با همکاری دیگر توسعهدهندگان، پژوهشگران مستقل، نهادهای تدوین استانداردهای صنعتی و تنظیمگران، معیارهای عینیتری برای افشا تدوین کنیم. همچنین معتقدیم رخدادهای جدی مرتبط با ایمنی، امنیت و ناهمسویی باید با دولت فدرال ایالات متحده در میان گذاشته شوند و در حال تدوین پیشنهادهایی برای سازوکارهای گزارشدهی هستیم. این چارچوب را مکمل تعهدات فعلی خود میدانیم و تأکید میکنیم که جایگزین الزامات قانونی افشای اطلاعات، از جمله الزامات مربوط به رخدادهای حیاتی ایمنی یا نقض امنیت سایبری، نمیشود.
برای آغاز چارچوب جدید افشای ناهمسویی، شش گزارش درباره موارد رفتار ناهمسویی منتشر میکنیم که هنگام آموزش یا ارزیابی مدلهایمان مشاهده کردهایم. این موارد طیفی از رفتارهای گوناگون و درخور انتشار را نشان میدهند؛ از پنهان کردن اطلاعات از کاربر تا انجام اقدامات بدون مجوز برای غلبه بر موانع. اینها گزارشهایی درباره موارد منفردند و نباید نمایانگر میزان تکرار ناهمسویی در مدلهای ما تلقی شوند. هر مورد زیر به گزارش کامل آن پیوند دارد.
دستورالعملهای خودساخته در خلاصههای وظیفه(در یک پنجره جدید باز میشود). یک مدل پژوهشی منتشرنشده، دستورالعملهای نامرتبطی، از جمله دستور نادیده گرفتن محدودیتهای عادی خود، در خلاصههایی گنجاند که برای ادامه کارش در یک پنجره زمینه جدید استفاده میشدند. ۲۷ خلاصه متأثر را شناسایی کردیم.
دستورالعملهای پنهان کردن اشتباهات در خلاصههای وظیفه(در یک پنجره جدید باز میشود). در جریان آموزش GPT‑5.6 Sol، بسیاری از نمونههای مدل دستورالعملهایی به خلاصههای خود افزودند تا اشتباهات یا رفتار ناهمسویشان را از کاربر پنهان کنند. برای مثال، خلاصههای فشردهسازی شامل دستورالعملهایی برای جعل دادههای تاریخی مفقود بدون افشای این کار و پنهان کردن ناهماهنگی میان نسخههای منبع بودند.
جستوجوی کلیدهای API افشاشده در محلهای نگهداری عمومی و سپس جعل اطلاعات(در یک پنجره جدید باز میشود). مدلی هنگام پاسخ به پرسشی عادی درباره ارقام درآمد در یکی از شهرستانهای کالیفرنیا، یک کلید API افشاشده را یافت و بدون مجوز از آن استفاده کرد. وقتی باز هم نتوانست ارقام درخواستی را بازیابی کند، آنها را جعل کرد و بهعنوان دادههای منبع درخواستی ارائه داد.
بارگذاری فایلها در اینترنت برای استناد به آنها(در یک پنجره جدید باز میشود). وقتی کاربری شناسه و نام دریاچههای بزرگتر از ۵٬۰۰۰٬۰۰۰ مترمربع را از یک مدل منتشرنشده خواست، عامل با استفاده از Python پاسخ درست را یافت. اما چون دستورالعملها استناد مرورگری میخواستند، عامل بدون پرسیدن از کاربر تصمیم گرفت فایل را بارگذاری کند تا بتواند در پاسخ خود به آن استناد کند.
نوشتن و ارتباط بدون مجوز از طریق محل نگهداری داخلی نرمافزار(در یک پنجره جدید باز میشود). مدلها هنگام جستوجوی فایلهای ورودی مفقود، از یک محل نگهداری داخلی نرمافزار مانند تابلوی پیام استفاده کردند تا میان نمونههای آموزشی جداگانه درخواست و پاسخ ردوبدل کنند؛ هرچند نتوانستند آن فایلها را بازیابی کنند. این گزارش همچنین موردی قدیمیتر را بررسی میکند که در آن مدلی هنگام تلاش برای دور زدن محدودیتهای شبکه، با موفقیت فایلهای آزمایشی را در یک محل نگهداری بارگذاری کرد.
اشتراکگذاری بدون مجوز فایل میان عاملهای همکار(در یک پنجره جدید باز میشود). عاملهایی که روی یک وظیفه آموزشی مشترک کار میکردند، وقتی به فایلهای محلی یکدیگر دسترسی نداشتند، برای اشتراکگذاری فایل از وبسایتهای عمومی میزبانی فایل استفاده کردند. در نتیجه، خروجیهای وظیفه در نشانیهای عمومی اینترنتی در دسترس قرار گرفتند، با اینکه در وظیفه از مدلها خواسته شده بود فقط از فایلهای محلی استفاده کنند.
هر یک از کارکنان OpenAI میتواند نمونهای از ناهمسویی را برای بررسی به تیمهای ایمنی و همسویی ما گزارش دهد و درخواست کند امکان افشای عمومی آن بررسی شود. با این کار فرایند افشای ما آغاز میشود و برای هر مرحله مهلتی تعیین شده است تا بررسی و افشا بهموقع انجام شود.
پس از گزارش یک نمونه، کارکنان فنی ما بررسی میکنند چه اتفاقی افتاده، چه مواردی همچنان نامشخص است، آیا افشای عمومی موجه است و کدام واقعیتها را میتوان منتشر کرد. همچنین ارزیابی میکنند که آیا شخص ثالثی تحت تأثیر قرار گرفته و لازم است پیش از انتشار، بهصورت خصوصی مطلع شود یا خیر.
سپس نمونه در یکی از سه مسیر قرار میگیرد: «آماده افشا»، «بررسی محدود» یا «بررسی گسترده» («مسیر آهسته»).
مسیر «آماده افشا» شامل موارد واجد شرایطی است که بررسی آنها بهاندازه کافی کامل شده و پس از بازبینی قابل انتشارند. مسیر «بررسی محدود» شامل مواردی است که به بررسی فنی بیشتری نیاز دارند. انتظار داریم اکثریت قریببهاتفاق موارد افشاشده در این دو مسیر قرار بگیرند؛ بهویژه مواردی که به بررسی گسترده، هماهنگی با اشخاص ثالث یا رسیدگی به خطرهای سوءاستفاده شدید نیاز ندارند. تمام مواردی که امروز منتشر میکنیم در یکی از این دو مسیر قرار دارند.
مسیر «بررسی گسترده» شامل بررسیهای پیچیده، بهویژه موارد مرتبط با اشخاص ثالث است. وقتی شخص ثالثی تحت تأثیر قرار گرفته باشد، تعهدات امنیتی، حقوقی و افشای مسئولانه ما بر این چارچوب اولویت دارند. هدف ما انتشار اطلاعیهای اولیه در سریعترین زمان ممکن است، اما شاید به دلایل امنیتی ناچار به تأخیر شویم؛ مثلاً اگر مدلی آسیبپذیری ناشناختهای را در نرمافزاری پرکاربرد کشف کند. اگر گزارشی هویت شخص ثالثی را آشکار کند، قصد داریم حتی در صورت نقض نشدن هیچ مرز امنیتی، او را پیشاپیش مطلع کنیم.
اطلاعیه اولیه درباره موردی در مسیر «بررسی گسترده»، شرحی کلی از آنچه رخ داده ارائه میکند، میگوید آیا کارشناسان بیرونی به بررسی کمک میکنند و هر برآورد موجودی از زمان احتمالی انتشار گزارش نهایی را اعلام میکند. اگر رخداد Hugging Face متعلق به OpenAI ذیل این چارچوب افشا میشد، در همین مسیر قرار میگرفت.
کارمندی که نمونه را مطرح کرده است، از تصمیم درباره افشای آن و در صورت افشا، از مسیر رسیدگی به آن مطلع خواهد شد. اختلافنظرهای حلنشده درباره افشا یا مسیر مناسب به گروه مشورتی ایمنی OpenAI (SAG) ارجاع میشود؛ گروهی متشکل از مدیران ارشد بخشهای مختلف شرکت که قابلیتها و سازوکارهای حفاظتی مدلهای پیشرو را ارزیابی میکند، بر چارچوب آمادگی ما نظارت دارد و به رهبران OpenAI مشاوره میدهد. اختلافنظرهای درون گروه مشورتی ایمنی یا اعتراض کارکنان به تصمیمهای آن، به رهبران OpenAI ارجاع خواهد شد. تصمیم مبنی بر افشا نکردن یا موجه نبودن افشا، با مدیران ایمنی و همسویی و تا حد امکان با کارکنان فنی مرتبط در میان گذاشته خواهد شد.
ممکن است با روشن شدن نحوه عملکرد این فرایند افشا در عمل، آن را بازنگری کنیم و هر تغییری را در همین مطلب ثبت خواهیم کرد.
هر گزارش کامل، رفتار مشاهدهشده، شدت و هرگونه پیامد بیرونی آن، محیط وقوع، تاریخ یا بازه زمانی رخداد، زمان کشف آن و در سطح کلی، مدل یا مدلهای دخیل را شرح خواهد داد. در صورت امکان، موارد زیر را نیز منتشر میکنیم:
جزئیات بیشتر درباره آنچه رخ داده و هرگونه آسیب ناشی از آن؛
نحوه کشف ناهمسویی و دامنه بررسی ما؛
برداشت ما از پیامدهای آن برای پژوهش همسویی و ایمنی فنی هوش مصنوعی؛
پرسشهای مهم و بیپاسخی که این نمونه مطرح میکند؛
اقداماتی که برای رسیدگی به این رفتار انجام میدهیم یا قصد انجامشان را داریم. ممکن است این اطلاعات هنگام افشا همیشه در دسترس نباشد، زیرا شاید گزارش ناهمسویی را پیش از تکمیل بررسی یا تدوین راهحل منتشر کنیم.
درباره ناهمسوییهایی که در استقرارهای مشتریان رخ میدهد، تا جایی که حریم خصوصی مشتری و تعهدات قراردادی ما اجازه دهد اطلاعات منتشر خواهیم کرد.
گزارشهای امروز مجموعهای اولیه از موارد افشاشدهاند، نه شرحی جامع از ناهمسوییهای شناختهشده یا بررسیهای در حال انجام. هدف از این گزارشهای اولیه، نمایش تمام گستره یا شدت موارد مشمول این چارچوب نیست. ما متعهدیم موارد ناهمسویی مطابق با معیارهای این چارچوب را افشا کنیم؛ از جمله موارد پیچیدهتری که به بررسی طولانیتر یا هماهنگی با اشخاص ثالث نیاز دارند. انتشار مستمر گزارشها ذیل این چارچوب را ادامه خواهیم داد و همزمان با تکمیل تعهدات گزارشدهی خود، اطلاعات بیشتری درباره آنها ارائه میکنیم.


