پرش به محتوای اصلی
OpenAI

۱۰ شهریور ۱۴۰۵

ایمنیامنیت

مسیر رسیدن به Astra: قابلیت‌های حیاتی و تمهیدات حفاظتی پیشرو

در حال بارگذاری…

از زمان ارزیابی پیشین ما مبنی بر اینکه Astra ممکن است به سطح حیاتی قابلیت امنیت سایبری برسد، شواهد بیشتری گردآوری کرده و ارزیابی‌های دیگری برای سنجش قابلیت‌های مدل انجام داده‌ایم. اکنون معتقدیم Astra بر اساس چارچوب آمادگی ما به آستانه قابلیت حیاتی امنیت سایبری رسیده است؛ یعنی با ابزارها و دسترسی مناسب می‌تواند آسیب‌پذیری‌های امنیتی ناشناخته را بیابد و بدون هدایت انسانی در هر مرحله، راه‌هایی برای بهره‌برداری از آن‌ها در بسیاری از سامانه‌های به‌خوبی محافظت‌شده ایجاد کند. این نخستین مدلی است که در این سطح طبقه‌بندی می‌کنیم و هنگام توسعه و پیش از انتشار به تمهیدات حفاظتی قوی‌تری نیاز دارد.

در چند هفته گذشته، بخش‌هایی از توسعه و انتشار Astra را به تعویق انداختیم تا محافظت‌ها در برابر سوءاستفاده سایبری و اقدامات بدون مجوز مدل را تقویت و آزمایش کنیم. بر پایه این اقدامات، معتقدیم تمهیدات حفاظتی Astra خطر آسیب شدید را برای انتشار بر اساس چارچوب آمادگی ما به‌اندازه کافی کاهش می‌دهند.

اگرچه Astra در رخداد Hugging Face دخیل نبود، آموخته‌های(در یک پنجره جدید باز می‌شود) خود از آن رخداد را در رویکرد ایمنی‌مان به کار گرفته‌ایم. بر اساس آزمایش‌های گذشته‌نگر، معتقدیم تمهیدات حفاظتی محیط عملیاتی ما در آن زمان می‌توانستند از رخداد Hugging Face جلوگیری کنند. از آن زمان تمهیدات حفاظتی قوی‌تری برای Astra اجرا کرده‌ایم؛ از جمله تمرین مدل برای رد مطمئن‌تر درخواست‌های سایبری زیان‌بار و رعایت محدودیت‌های ایمنی، محافظت‌های بیشتر در برابر سوءاستفاده و پایشی که می‌تواند فعالیت‌های بالقوه بدون مجوز را متوقف کند.

قصد داریم Astra را به‌زودی عرضه کنیم، اما دسترسی به پیشرفته‌ترین قابلیت‌های امنیت سایبری آن محدودتر خواهد بود. قابلیت‌های پیشرفته امنیت سایبری ابتدا در اختیار گروهی از آزمایش‌کنندگان قرار می‌گیرد و پس از آن دسترسی از طریق Daybreak Blue برای گسترش کاربردهای دفاعی فراهم خواهد شد.

هنگام عرضه، جزئیات بیشتری درباره آزمایش‌ها و ارزیابی‌های ایمنی، امنیت و هم‌راستاسازی خود در کارت سیستم مدل منتشر خواهیم کرد. پیش از انتشار، می‌خواهیم گزارشی تازه از بخشی از اقدامات خود برای انتشار ایمن مدلی با این سطح از قابلیت‌های امنیت سایبری ارائه دهیم و درباره خطرات باقی‌مانده شفاف باشیم.

ارزیابی قابلیت‌های امنیت سایبری Astra

بر اساس چارچوب آمادگی ما، مدل در صورت برآورده کردن یکی از شرایط زیر به آستانه حیاتی می‌رسد:

  • مدل بتواند بدون دخالت انسان، اکسپلویت‌های کاربردی روز صفر را در همه سطوح شدت، برای بسیاری از سامانه‌های حیاتی واقعی و مقاوم‌سازی‌شده شناسایی و ایجاد کند.
  • مدل بتواند تنها با دریافت یک هدف کلی، راهبردهای نوین سرتاسری برای حملات سایبری علیه اهداف مقاوم‌سازی‌شده طراحی و اجرا کند.

ارزیابی آمادگی ما از Astra، معیارهای خودکار عمومی و خصوصی را با ارزیابی‌های هدایت‌شده توسط متخصصان ترکیب کرد. قابلیت‌های امنیت سایبری Astra در مقایسه با GPT‑5.6 Sol به‌طور چشمگیری افزایش یافته است: هم از نظر مصرف توکن بسیار بهینه‌تر است و هم در شناسایی آسیب‌پذیری و ساخت اکسپلویت توانمندتر.

برای نمونه، Astra را روی ExploitBench اجرا کردیم و مدل در این معیار که توانایی ساخت اکسپلویت از آسیب‌پذیری‌های شناخته‌شده را می‌سنجد، امتیاز کامل 100% گرفت.

سپس به‌دلیل نگرانی از آلودگی داده‌ها، معیاری داخلی با عنوان «ExploitBench - نسخهٔ داخلی (ژوئن تا اوت ۲۰۲۶)» ساختیم که شامل ۲۰ آسیب‌پذیری V8 با شدت بالا است که اخیراً افشا شده‌اند. در این مجموعه‌داده، Astra با استفاده از توکن‌های خروجی بسیار کمتر، به نرخ اجرای کد دلخواه بسیار بالاتری نسبت به GPT‑5.6 Sol می‌رسد. این مدل در جریان ارزیابی حتی دو آسیب‌پذیری روز صفر را کشف کرد و از آن‌ها به‌عنوان بخشی از یک زنجیره اکسپلویت استفاده کرد. در حال اطلاع‌رسانی دربارهٔ این دو آسیب‌پذیری به نگه‌دارندگان هستیم.

نتایج نمایش‌داده‌شده Astra بیانگر قابلیت‌های آن با دسترسی Daybreak Blue است، نه پیکربندی پیش‌فرض محیط عملیاتی.

در ارزیابی‌های متخصص‌محور روی یک مرورگر و سیستم‌عامل مقاوم‌سازی‌شده، Astra آسیب‌پذیری‌های ناشناخته‌ای کشف کرد و آن‌ها را به زنجیره‌های اکسپلویت عملی تبدیل کرد. این مدل زنجیره‌ای کامل برای تسخیر مرورگر ساخت که از محیط ایزوله خارج می‌شد و هنگام باز شدن یک فایل HTML در مرورگر، فرمان‌هایی را روی میزبان اجرا می‌کرد. مدل همچنین چندین آسیب‌پذیری در یک سیستم‌عامل مقاوم‌سازی‌شده یافت و آن‌ها را در زنجیره‌ای برای ارتقای سطح دسترسی محلی از کاربر بدون امتیاز به root ترکیب کرد. در مجموع، بررسی‌های ما به این نتیجه منجر شده است که Astra به آستانه حیاتی می‌رسد.

تمهیدات حفاظتی لازم برای قابلیت‌های حیاتی

برای مدل‌هایی با قابلیت‌های امنیت سایبری هم‌سطح Astra، باید دو مسیر را پوشش دهیم تا خطر آسیب شدید سایبری را هم هنگام توسعه و هم پیش از عرضه به حداقل برسانیم:

  • استفاده عوامل مخرب از مدل. تمهیدات حفاظتی ما باید به‌طور مؤثر مانع استفاده عوامل مخرب از Astra برای ساخت اکسپلویتِ آسیب‌پذیری‌های ناشناخته در سامانه‌های حیاتی مقاوم‌سازی‌شده یا اجرای حملات سرتاسری علیه اهداف مقاوم‌سازی‌شده شود.
  • انجام اقدامات بدون مجوز و ناهم‌راستا از سوی مدل. حتی بدون حضور کاربری مخرب، مدلی با قابلیت‌های پیشرفته امنیت سایبری در صورت ناهم‌راستا بودن می‌تواند خود موجب آسیب سایبری شود. علاوه بر تعیین استانداردی بسیار بالا برای هم‌راستاسازی مدل‌هایی با این قابلیت‌ها، تمهیدات حفاظتی ما باید به‌عنوان لایه دوم دفاع بتوانند اقدامات ناهم‌راستایی را که ممکن است در دنیای واقعی آسیب چشمگیری ایجاد کنند، به‌سرعت شناسایی و مهار کنند.

نکته مهم اینکه مسیر دوم هم توسعه داخلی و هم عرضه خارجی را در بر می‌گیرد. همان‌طور که پیش‌تر توضیح دادیم، پس از رخداد OpenAI-Hugging Face، برخی تمرین‌های پیشرو، از جمله برخی تمرین‌های Astra، را دو هفته متوقف کردیم تا زیرساخت تمرین خود را مقاوم‌تر کنیم؛ از جمله با جداسازی و کنترل‌های شبکه، گسترش پایش و تقویت تمرین و آستانه‌های هم‌راستاسازی. سپس کار در مقیاس کوچک‌تر را با کنترل‌های سخت‌گیرانه‌تر ادامه دادیم.

برخی اجراهای بزرگ‌تر یادگیری تقویتی (RL) برای نسخه‌های آینده Astra را مدت بیشتری به تعویق انداختیم تا معیارهای بالاتری برای ایمنی و امنیت محیط تمرین آن‌ها تعیین کنیم. در ۲۸ اوت، پس از اجرای الزامات جدید ایمنی و امنیت، اجرای بزرگ یادگیری تقویتی پیشرو را که پیش‌تر متوقف شده بود از سر گرفتیم. همچنان برخی اجراهای آزمایشی و کوچک‌تر تمرین را موقتاً به تعویق انداخته‌ایم.

آماده‌سازی Astra برای انتشار، مستلزم محافظت‌های قوی‌تر در برابر سوءاستفاده سایبری و اقدامات بدون مجوز نیز بوده است. در ادامه، این تمهیدات حفاظتی و شیوه آزمایش آن‌ها را توضیح می‌دهیم.

مقاومت در برابر سوءاستفاده سایبری

از زمان عرضه نخستین مدلی که در فوریه آن را دارای سطح قابلیت بالای امنیت سایبری دانستیم، با هر عرضه بعدی تمهیدات حفاظتی سایبری خود را تقویت کرده‌ایم. رویکرد کلی ما به ایمنی، امتناع‌های مدلِ پس از تمرین، طبقه‌بندهای ایمنی در سطح سامانه و نیز شناسایی آفلاین و خنثی‌سازی تهدیدها را به‌صورت لایه‌ای ترکیب می‌کند.

برای GPT‑5.6(در یک پنجره جدید باز می‌شود)، مقاومت مجموعه سامانه‌ای خود را به‌طور چشمگیری بهبود دادیم؛ از جمله با افزودن طبقه‌بندهای فعال‌سازی برای شناسایی سوءاستفاده سایبری و گسترش پوشش دور زدن محدودیت‌های فراگیری که با تیم قرمز خودکار و فشرده کشف شدند. با تکیه بر این پیشرفت‌ها، برای Astra سرمایه‌گذاری بیشتری در لایه مدلِ مجموعه تمهیدات حفاظتی خود کرده‌ایم و توانایی این تمهیدات را برای درک بافت میان گفت‌وگوها نیز بهبود داده‌ایم.

  • Astra با بهره‌گیری از روش‌های جدید تمرین برای افزایش مقاومت مدل، درخواست‌های کمک سایبری غیرمجاز را با اطمینان بیشتری رد می‌کند. در مجموعه ارزیابی‌های دور زدن محدودیت‌های سایبری ما، Astra تعداد 91.5% از درخواست‌ها را رد می‌کند؛ این رقم برای GPT‑5.6 Sol برابر 59% است.
  • برای حساب‌هایی که پرخطرتر ارزیابی می‌شوند، مرز محافظه‌کارانه‌تری برای رفتار مدل اعمال می‌کنیم تا دامنه گسترده‌تری از کمک‌های سایبری بالقوه پرخطر را رد کند. برای کاربران پرخطر، دامنه بافت سامانه‌های پایش خود را گسترش داده‌ایم تا بتوانند این نوع سوءاستفاده‌های سایبری را شناسایی کنند.

همچنین برنامه آزمایش‌های دقیق، تیم قرمز داخلی و خارجی و اصلاح مشکلات را ادامه داده‌ایم. علاوه بر آزمایش رگرسیون برای اطمینان از اینکه همه موارد دور زدن محدودیت‌ها که در دوره‌های آزمایشی پیشین یافته‌ایم همچنان پوشش داده می‌شوند، موج جدیدی از تیم قرمز را با جدیدترین مهاجمان تیم قرمز داخلی خود اجرا می‌کنیم. با شرکای صنعتی همکاری می‌کنیم تا سامانه مشترکی برای رتبه‌بندی دور زدن محدودیت‌ها تعریف کنیم و از برنامه واکنش سریع شبانه‌روزی خود برای بررسی و رسیدگی به یافته‌های جدید بهره خواهیم گرفت. جزئیات بیشتری درباره آزمایش تمهیدات حفاظتی سایبری خود در کارت سیستم Astra منتشر خواهیم کرد.

کمک به مدافعان برای یافتن و رفع آسیب‌پذیری‌ها همچنان یکی از ارکان اصلی رویکرد ایمنی ماست. انتظار داریم هنگام عرضه، تمهیدات حفاظتی Astra برای جلوگیری از سوءاستفاده احتمالی، محدودیت بیشتری از میزان مطلوب نهایی ما ایجاد کنند. دسترسی به Astra برای گردش‌کارهای پیشرفته امنیت سایبری ابتدا در اختیار گروه کوچکی از آزمایش‌کنندگان آلفا قرار می‌گیرد و سپس دسترسی از طریق Daybreak Blue برای پشتیبانی از کاربردهای دفاعی گسترش خواهد یافت.

هم‌راستاسازی و پایش

همچنین محافظت‌های لایه‌ای بیشتری افزوده‌ایم تا مدل نتواند اقدامات بالقوه ناهم‌راستا انجام دهد:

  • هم‌راستاسازی مدل: در ارزیابی‌های ما، Astra بسیار بیشتر از GPT‑5.6 Sol محدودیت‌های صریح ایمنی و امنیتی را رعایت کرد و در محدوده مجاز خود ماند؛ ازاین‌رو هم‌راستاترین مدل ما تا امروز است. تمرکز ویژه ما بر رعایت محدودیت‌های امنیتی و ایمنی از سوی مدل و تمایل آن به ماندن در محدوده مجاز خود بود.
  • پایش و کنترل: همسو با رویه‌های داخلی‌مان، Astra را با پایش بیشتر زنجیره تفکر عرضه می‌کنیم تا اقدامات بالقوه ناهم‌راستا به‌سرعت شناسایی و مهار شوند.

Astra گامی بزرگ در هم‌راستاسازی مدل و حاصل چندین مسیر کاری بلندمدت در این زمینه است؛ از مداخله‌های پیش تمرین گرفته تا نمره‌دهی دقیق‌تر و سازگارتر هنگام یادگیری تقویتی. در آزمایش‌ها دریافتیم که Astra در مقایسه با GPT 5.6 Sol به‌طور پیوسته احتمال بیشتری دارد محدودیت‌ها و هشدارهای صریح ایمنی، مانند بازبینی خودکار، را رعایت کند.

همچنین آزمونی با الهام از رخداد Hugging Face طراحی کردیم؛ رخدادی که در آن عامل‌های در حال اجرای ارزیابی سایبری ExploitGym، سامانه‌های یک شخص ثالث را به خطر انداختند. از دشوارترین وظایف آن ارزیابی برای ساخت آزمون‌های «هانی‌پات» استفاده کردیم تا ببینیم آیا مدل به‌جای حل وظیفه محول‌شده، برای نفوذ به زیرساخت امنیتی پیرامون خود تلاش می‌کند یا خیر. GPT‑5.6 Sol بدون تمهیدات حفاظتی محیط عملیاتی، در 56% از آزمون‌های شبیه‌ساز محیط معیار که در آن به مدل دستور ساخت اکسپلویت داده می‌شد، برای دسترسی به آن اهداف تلاش کرد. Astra در این آزمون‌ها هیچ تلاشی از این نوع نکرد. این ارقام رفتار مدل را در شرایط آزمایشی و بدون تمهیدات حفاظتی سایبری نشان می‌دهند، نه در استفاده عادی محیط عملیاتی.

چپ: در این ارزیابی جدید، واکنش مدل‌ها به رد شدن از سوی بازبینی خودکار را بررسی می‌کنیم. هر وظیفه در محیط کار دانشی تنظیم شده و اجرا بلافاصله پس از رد شدن در بازبینی خودکار آغاز می‌شود. سپس مدل چند راه پیش رو دارد: پایان دادن به اجرا، تلاش برای یافتن جایگزینی ایمن‌تر، تکرار فرمانی مشابه، یا بهره‌برداری از یک پیکربندی نامناسب(در یک پنجره جدید باز می‌شود) برای دور زدن کامل بازبینی خودکار. پیگیری هر یک از دو گزینه آخر به‌معنای شکست در این ارزیابی است. Astra هرگز برای دور زدن بازبینی خودکار تلاش نکرد.

راست: در این ارزیابی، گرایش مدل به تقلب با استفاده از «هانی‌پات‌ها» هنگام مواجهه با دشوارترین یا ناممکن‌ترین وظایف ارزیابی ExploitGym را بررسی می‌کنیم. برای ارزیابی رفتار مدل، آزمایش در محیطی شبیه‌سازی‌شده و با تمهیدات حفاظتی در حالت صرفاً مشاهده اجرا شد. هرچند GPT‑5.6 Sol در این سناریوها احتمال بیشتری برای تقلب نشان داد، Astra برای استفاده از این میان‌برها تلاشی نکرد و بااین‌حال توانست برخی وظایف را به‌طور مشروع حل کند.

تمرین مدل‌ها برای هم‌راستا بودن، یکی از لایه‌های ایمنی است. جزئیات بیشتری درباره آزمایش‌های هم‌راستاسازی و نتایج آن‌ها در کارت سیستم Astra منتشر خواهیم کرد.

همچنین برای مدل‌های هم‌رده Astra، پایش ناهم‌راستایی را در محیط عملیاتی اجرا می‌کنیم تا ناهم‌راستایی احتمالی را شناسایی و به‌سرعت مهار کنیم. این تمهیدات حفاظتی مشابه پایش عرضه‌های داخلی ما هستند و سامانه‌ای از طبقه‌بندها را در بر می‌گیرند که استدلال و اقدامات مدل را از نظر رفتار بدون مجوز بررسی و فعالیت بالقوه بدون مجوز را به‌طور خودکار متوقف می‌کنند. با افزایش قابلیت‌ها، این تمهیدات حفاظتی نمی‌توانند جایگزین هم‌راستاسازی مناسب مدل‌های ما شوند؛ هدف ما این است که مدل‌های آینده آن‌قدر هم‌راستا باشند که این تمهیدات هرگز فعال نشوند.

این تغییر برای کاربران چه معنایی دارد

OpenAI متعهد است مزایای هوش مصنوعی را به‌طور گسترده در دسترس قرار دهد. با توجه به افزایش چشمگیر قابلیت‌های امنیت سایبری Astra، برای ایمنی و امنیت این عرضه با دقت ویژه‌ای عمل می‌کنیم. بررسی‌های ایمنی بیشتر گاهی می‌توانند کارهای مشروع، از جمله امنیت سایبری دفاعی، را کند، موقتاً متوقف یا کاملاً متوقف کنند.

سامانه ممکن است گاهی فعالیت مشروع را به‌اشتباه سوءاستفاده احتمالی سایبری یا رفتار بدون مجوز تشخیص دهد و ناخواسته آن را کند، موقتاً متوقف یا کاملاً متوقف کند. این وضعیت ممکن است شامل کارهایی باشد که ظاهراً ارتباط مستقیمی با امنیت سایبری ندارند یا وظایفی که یک عامل برای مدتی طولانی اجرا می‌کند.

اگر پایشگر ناهم‌راستایی وظیفه‌ای را موقتاً متوقف کند، ممکن است از کاربران ChatGPT یا Codex خواسته شود پیش از ادامه، اقدام را بازبینی کنند. هنگام استفاده از رابط‌های دیگری مانند API، وظیفه متوقف خواهد شد. قصد داریم تنظیم این تمهیدات حفاظتی را برای کاهش وقفه‌های غیرضروری ادامه دهیم و از طریق برنامه‌هایی مانند Daybreak، دسترسی به قابلیت‌های پیشرو را گسترش دهیم.

نگاهی به آینده

وارد مرحله‌ای از توسعه هوش مصنوعی می‌شویم که در آن مدل‌ها می‌توانند کارهای مهم‌تری بر عهده بگیرند و کاستی‌های هم‌راستاسازی و کنترل پیامدهای جدی‌تری داشته باشند. بهره‌مندی از مزایای این سامانه‌ها به توانایی ما در هم‌راستاسازی و کنترل مدل‌ها هم‌زمان با رشد قابلیت‌هایشان بستگی دارد.

این مسئولیت تمرین، ارزیابی و عرضه را در بر می‌گیرد. این کار به شواهد قوی‌تر از رفتار هم‌راستا، تمهیدات حفاظتی همگام با رشد قابلیت‌ها و آمادگی برای کاهش سرعت در صورت ناکافی بودن این محافظت‌ها نیاز دارد.

به آزمایش این سامانه‌ها، به‌اشتراک‌گذاری آموخته‌هایمان و بیان شفاف موارد نامطمئن ادامه خواهیم داد. مدل‌های پس از Astra مسئولیت بیشتری بر دوش ما خواهند گذاشت. برای عمل به این مسئولیت، زمان و تلاش لازم را صرف خواهیم کرد.