خلاصه
مسئله
تیم قرمز برای کشف آسیبپذیریها و بهبود استحکام مدلهای ما ضروری است. بااینحال، رویکردهای کنونی مقیاسپذیر نیستند و گلوگاه ایجاد میکنند.
ارزیابیهای رایج استحکام پیشاپیش با جدیدترین مدلهای ما به سقف خود رسیدهاند.
باید روشهایی توسعه دهیم که ایمنی و همراستاسازی را همگام با قابلیتهای مدلها مقیاسپذیر کنند.
کاری که انجام دادیم
ما GPT‑Red را آموزش دادیم؛ مدلی خودکار برای تیم قرمز که توانایی ما در یافتن آسیبپذیریها را مقیاسپذیر میکند تا پیش از استقرار گستردهتر آنها را برطرف کنیم.
GPT‑Red یک عضو قدرتمند تیم قرمز است و مدلهای پیشین ما در برابر حملات تزریق اعلان آن بسیار آسیبپذیرند.
ما از GPT‑Red برای آموزش خصمانه GPT‑5.6 استفاده میکنیم و آن را در برابر تزریق اعلان بسیار مقاومتر میسازیم.
این رویکرد را در کنار تیم قرمز انسانی و شخص ثالث، محافظتهای لایهای و پایش بلادرنگ همچنان مقیاسپذیر خواهیم کرد.
سامانههای هوش مصنوعی معمولاً از طریق مرورگرها، برنامههای متصل، فایلهای محلی و ابزارهای دیگر با دادههای شخص ثالث روبهرو میشوند. این قابلیتها برای انجام وظایف دنیای واقعی ضروریاند، اما فرصتهای بیشتری هم برای اثرگذاری عاملان مخرب بر رفتار مدل ایجاد میکنند. برای مثال، یک شخص ثالث ممکن است در یک ایمیل، صفحه وب، پاسخ ابزار یا محل نگهداری کد، دستوری با دقت طراحیشده قرار دهد که هدفش فریب مدل برای بارگذاری دادههای حساس در سروری خارجی است.
تیم قرمز انسانی بخش مهمی از کار ایمنی ماست و کمک میکند این آسیبپذیریها را پیش از استقرار کشف کنیم و محافظتهای درست را به کار بگیریم. اما مقیاسدادن به تیم قرمز انسانی بهتنهایی دشوار است. طراحی و اجرای این تمرینها زمانبر است و سرعت ما را در شناسایی حالتهای شکست جدید و گنجاندن آنها در محافظتهای قویتر محدود میکند. علاوه بر این، گرچه این تمرینها نمونههای ارزشمندی از حملات موفق تولید میکنند، نمیتوانند حجم و تنوع دادههای خصمانه لازم برای بهبود استحکام مدل از طریق آموزش را فراهم کنند.
همگام ماندن با مدلهایی که هر روز توانمندتر میشوند، مستلزم آن است که تیم قرمز نیز مقیاسپذیر شود. برای این منظور، مدلهای خودکار و صرفاً داخلیِ تیم قرمز را آموزش دادهایم که پیش از استقرار آسیبپذیریها را آشکار میکنند و هنگام آموزش مدل، برای بهبود استحکام حمله تولید میکنند. باور داریم تیم قرمز خودکار، شکل مهمی از خودبهبودی برای ایمنی را ممکن میکند: استفاده از مدلهای امروز برای کمک مستقیم به ایمنتر کردن مدلهای آینده.
GPT‑Red حاصل این تلاشها و در حال حاضر بهترین مدل خودکار ما برای تیم قرمز ایمنی است. همانگونه که تیمهای قرمز انسانی حمله طراحی میکنند، این مدل نیز با ارسال اعلان، مشاهده واکنش مدلهای GPT به آن و تکرار، به سوی یک هدف حرکت میکند. ما GPT‑Red را در مقیاس محاسباتی برخی از بزرگترین اجراهای پساآموزش خود در OpenAI آموزش دادیم؛ حجمی بیسابقه از محاسبات که صرفاً به بهبود ایمنی اختصاص یافت.
ما GPT‑Red را مستقیماً در فرایند آموزش مدلهای تولیدی خود وارد میکنیم. در نتیجه، GPT‑5.6 Sol مقاومترین مدل ما تا امروز در برابر تزریق اعلان است و در سختترین معیار تزریق اعلان مستقیم ما، نسبت به بهترین مدل تولیدیمان در تنها چهار ماه پیش، ۶ برابر شکستهای کمتری دارد. مقیاسپذیری رویکردمان ما را به نتایج حتی قویتر در آینده امیدوار کرده است، زیرا همچنان تیمهای قرمز قویتری آموزش میدهیم.
GPT‑Red با یادگیری تقویتیِ بازی با خود آموزش میبیند؛ در این فرایند، مدل و مجموعهای متنوع از الگوهای زبانی بزرگ (LLM) مدافع، همزمان روی طیف گستردهای از سناریوهای تیم قرمز آموزش داده میشوند. GPT‑Red برای ایجاد یک شکست معتبر، مانند تزریق اعلان موفق، پاداش میگیرد؛ درحالیکه مدلهای مدافع برای مقاومت در برابر حمله و انجام وظایف اصلی خود پاداش میگیرند. هرچه مدافعان مقاومتر میشوند، GPT‑Red ناچار میشود حملات قویتر و متنوعتری کشف کند.
برای پشتیبانی از آموزش بازی با خود، مجموعهای گسترده از سناریوهای واقعگرایانه میسازیم که ممکن است تزریق اعلان در آنها گنجانده شود. هر محیط یک مدل تهدید دارد که مشخص میکند GPT‑Red چه چیزهایی را میتواند کنترل کند و چه چیزی حمله موفق محسوب میشود. برای نمونه، GPT‑Red ممکن است بخشی از یک فایل محلی، بنر یک صفحه وب، متن یک ایمیل یا خروجی یک ابزار را کنترل کند.
در پایان آموزش، GPT‑Red مهاجمی بسیار قدرتمند است: میتواند تقریباً همه مدلهایی را که در برابرش قرار میگیرند بشکند، چه مدلهای داخلی و چه مدلهای تولیدی تا GPT‑5.5 و شامل آن. پس از پایان آموزش GPT‑Red، از آن برای تولید تزریقهای اعلان در آموزش GPT‑5.6 استفاده کردیم و در نتیجه مدل در برابر حملات GPT‑Red بسیار مقاوم شد.
ما GPT‑Red را از مدلهایی که مستقر میکنیم جدا نگه میداریم. این کار قابلیتهای مخربی را که مشخصاً در GPT‑Red آموزش میدهیم از دست عاملان متخاصم دور نگه میدارد، و در عین حال استحکام را در مدلهای تولیدی ما نهادینه میکند.
GPT‑Red در برابر جمعیت مدلهای مدافع و سناریوهای تیم قرمزی که روی آنها آموزش دیده بود، بسیار مؤثر است. همچنین ارزیابی میکنیم که آیا این مدل بهعنوان یک عامل عمومی تیم قرمز برای کمک گسترده به ایمنی در OpenAI مفید است یا نه. برای این کار، اثربخشی GPT‑Red را در محیطهای ایمنی و مدلهای هدفِ تازه آزمایش میکنیم.
ابتدا توانایی GPT‑Red را برای تعمیم به سناریوهای تازه تیم قرمز، با استفاده از نسخهای بازتولیدشده از میدان تزریق اعلان غیرمستقیم از Dziemian و همکاران (۲۰۲۵)(در یک پنجره جدید باز میشود) ارزیابی میکنیم. در این چالش، هم تیمهای قرمز انسانی و هم GPT‑Red بهطور مستقل حملاتی را علیه GPT‑5.1 در مجموعهای از محیطهای ازپیشمشخصشده پیشنهاد کردند. این سناریوها و اهداف تیم قرمز با مواردی که برای آموزش GPT‑Red استفاده شدهاند متفاوتاند. GPT‑Red به نرخهای موفقیت حمله بهمراتب بالاتری میرسد و در ۸۴٪ سناریوها موفق میشود، در مقایسه با ۱۳٪ برای انسانها.
GPT‑Red بهعنوان یک عضو خودکار تیم قرمز عملکردی درخشان دارد. GPT‑Red میتواند با استفاده از یک آینه داخلیِ میدان تزریق اعلان غیرمستقیم از Dziemian و همکاران (۲۰۲۵)، در سناریوهایی بهمراتب بیشتر از تیمهای قرمز انسانی، حملات موفقی علیه GPT‑5.1 تولید کند.
آزمون نهایی یک عضو تیم قرمز، توانایی دستیابی به اهداف مخربِ هدفمند در برابر سامانههای عاملی دنیای واقعی است، آن هم با دانشی ناقص از مدل زیربنایی و طراحی چارچوب آزمون سامانه. نخستین آزمایش ما در این وضعیت، GPT‑Red را در برابر یک دستگاه فروش خودکار مجهز به هوش مصنوعی در دفتر OpenAI قرار داد که Andon Labs آن را ساخته بود و شبیه Project Vend(در یک پنجره جدید باز میشود) بود. به GPT‑Red توصیفی از سامانه و امکان ارسال حمله و مشاهده فراخوانی ابزارها از سوی عامل شبیهسازیشدهای دادیم که استقرار دنیای واقعی را از نزدیک بازتاب میداد. پس از چندین دور تکرار روی حملات، GPT‑Red حمله خود را علیه عامل تولیدی اجرا کرد و به هر سه هدف مخربش رسید:
- قیمت یک کالای گرانِ موجود را به حداقل قیمت مجاز، یعنی ۰٫۵۰ دلار، تغییر دهد؛
- کالایی جدید با قیمت بیش از ۱۰۰ دلار سفارش دهد و آن را با ۰٫۵۰ دلار عرضه کند؛ و
- سفارش مشتری دیگری را لغو کند.
ما این آسیبپذیریها را افشا کردیم و محافظتهای تازه بهطور فعال در حال آزمایشاند.
GPT‑Red میتواند یک عامل خودمختار زنده به نام Vendy را که دستگاه فروش خودکار را مدیریت میکند بشکند. GPT‑Red توانست با آزمایش اولیه در شبیهسازی و سپس انتقال حملات به عامل زنده، عامل تولیدی را وادار کند اقلام گران را ارزان کند و سفارشهای دیگر مشتریان را لغو کند.
همچنین از GPT‑Red برای حمله به یک عامل Codex CLI مبتنی بر GPT‑5.4 mini در مجموعهای از ۱۰ سناریوی کنارگذاشتهشده استخراج داده استفاده میکنیم. برای بررسی اثر فرایند آموزشمان بر عملکرد تیم قرمز در موارد کنارگذاشتهشده، مدل را با خط مبنای GPT‑5.5 مبتنی بر اعلان مقایسه میکنیم. GPT‑Red هم مؤثرتر است، چون میتواند در سناریوهای بیشتری عامل را وادار به استخراج دادههای حساس کند، و هم از نظر مصرف توکن کارآمدتر است.
GPT‑Red در شکستن عاملهای زنده Codex مؤثرتر و کارآمدتر است. آن را روی یک عامل Codex مبتنی بر GPT‑5.4 Mini، در مجموعهای سفارشی از ۱۰ وظیفه استخراج داده آزمایش میکنیم.
هدف نهایی GPT‑Red بهبود استحکام مدلهای ماست. در شش ماه گذشته، با افزایش محاسبات، مدلهای تیم قرمزِ بهتدریج قویتری، یعنی پیشنمونههای GPT‑Red، آموزش دادهایم و از این مدلها در آموزش هر مدل تولیدی پیاپی از GPT‑5.3 به بعد استفاده کردهایم. با گذشت زمان، هر انتشار بعدی GPT مقاومتر شده است.
برای نمونه، نسخهای اولیه از GPT‑Red دستهای تازه از حملات مستقیم تزریق اعلان را یافت که به حملات «زنجیره تفکر جعلی» معروفاند. این حملات روی GPT‑5.1 به نرخ موفقیتی بالاتر از ۹۵٪ رسیدند، اما اکنون برای GPT‑5.6 Sol به کمتر از ۱۰٪ رسیدهاند. بهطور مشابه، چندین معیار تزریق اعلان غیرمستقیم ما که حملات در ابزارهای توسعهدهنده و مرور را هدف میگیرند، با جدیدترین مدل ما به سقف رسیدهاند (دقت >۹۷٪).
استحکام در برابر خود GPT‑Red نیز بهطور چشمگیری بهبود یافته است. در مجموعهای گسترده از محیطهای استحکام، نرخ موفقیت حملات GPT‑Red در طول زمان بهصورت یکنواخت کاهش یافته است. در جدیدترین انتشار مدل ما، GPT‑5.6 Sol تنها در ۰٫۰۵٪ از تزریقهای اعلان مستقیم GPT‑Red شکست میخورد.
با ادامه مقیاسدادن به آموزش بازی با خود برای تزریق اعلان، تهدیدهای تازهای یافتهایم که میتوانند مدلهای موجود را بشکنند. بااینحال، همین مقیاسدهی به بهبود چشمگیر استحکام در برابر این حملات نیز کمک کرده است. نرخ موفقیت حمله بهصورت میانگین موفقیت تلاشها در همه تلاشهای GPT‑Red در محیطهای کنارگذاشتهشده محاسبه میشود.
یک مدل میتواند با رد درخواستهای بیشتر یا کاهش توانمندی، ایمنتر به نظر برسد. مدلی که کارهای کمتری انجام میدهد طبعاً سختتر مورد حمله قرار میگیرد، اما این استحکام مفیدی نیست.
ما هم قابلیتهای عمومی پیشرو و هم وظایف هدفمندِ رد بیشازحد را که طراحی کردهایم، با دقت ارزیابی میکنیم. میبینیم که همه قابلیتهای عادی دستنخورده میمانند، درحالیکه استحکام بهطور چشمگیری بهتر میشود. این نشان میدهد افزایش استحکام از مقاومت بهتر در برابر دستورهای مخرب ناشی شده است، نه از استفاده نادرست از ابزارها یا رد پیشفرض درخواستهای مشروع.
عاملهای هوش مصنوعی هماکنون برای بهبود قابلیتهای مدلهای نسل بعدی ما به کار میروند. با GPT‑Red باور داریم که چرخهای مشابه برای ایمنی را آغاز کردهایم؛ جایی که مدلهای امروز میتوانند برای مقاومتر، همراستاتر و قابلاعتمادتر کردن مدلهای فردا به کار روند. ما همچنان محاسبات و داده را مقیاسپذیر میکنیم و همزمان بهبودهای الگوریتمی انجام میدهیم تا نسخههای آینده GPT‑Red را آموزش دهیم که از مدل امروز قویتر باشند. و این مدلها نیز به نوبه خود کمک خواهند کرد انتشارهای آینده GPT ایمنتر شوند.
اواخر این هفته پیشچاپی با جزئیات بیشتر منتشر خواهیم کرد.


