در حال بارگذاری…
امروز GPT‑6 Astra را عرضه میکنیم؛ توانمندترین مدلی که تاکنون بهطور گسترده ارائه کردهایم. Astra نخستین مدل ماست که طبق چارچوب آمادگی، از نظر توانمندی امنیت سایبری به سطح بحرانی رسیده است.
مهمترین نکاتی که باید درباره ایمنی این عرضه بدانید، عبارتاند از:
- GPT‑6 Astra جهشی چشمگیر در توانمندیهای سایبری است و به آستانه بحرانی ما میرسد. این یعنی GPT‑6 Astra با ابزارها و دسترسی مناسب میتواند نقصهای امنیتی ناشناخته را پیدا کند و بدون هدایت انسانی در هر مرحله، روشهای تازهای برای بهرهبرداری از آنها در بسیاری از سامانههای بهخوبی محافظتشده توسعه دهد. ازاینرو، محافظتهای خود را در برابر اقدامات سایبری زیانبار مدل، چه بر اثر سوءاستفاده و چه ناهمراستایی، بهطور چشمگیری تقویت کردهایم. همچنین برای ایمنسازی توسعه و استقرار داخلی Astra و مدلهای مشابه اقداماتی انجام دادهایم؛ از جمله جداسازی سختگیرانهتر، رمزگذاری نقاط بازرسی، پایش فراگیر مسیرهای کامل شامل زنجیرههای فکر (CoT)، و فرایند ارزیابی الزامی همراستایی پیش از استفاده داخلی.
- GPT‑6 Astra بهطور چشمگیری از نسلهای پیشین خود مقاومتر است. GPT‑6 Astra با بهرهگیری از روشهای تازه آموزش ایمنی برای افزایش مقاومت، در برابر دور زدن محدودیتها، از جمله در مسیرهای طولانیتر، بهمراتب مقاومتر از GPT‑5.6 Sol است. این نتیجه را از آزمونهای آفلاین و برنامه سختگیرانه داخلی و خارجی خود برای آزمایش و رفع موارد دور زدن محدودیتها به دست آوردهایم. برای کاربرانی که بالقوه پرخطر تشخیص داده میشوند، مدل را افزون بر این آموزش دادهایم تا مرز امتناع خود را محافظهکارانهتر تنظیم کند و طیف گستردهتری از خطرات دومنظوره را پوشش دهد. با آزمون رگرسیون اطمینان مییابیم که Astra در برابر موارد دور زدن محدودیتها که در دورههای آزمایشی پیشین کشف شدهاند مقاوم است؛ همچنین برای تأیید بهبودها، دورهای تازهای از تیم قرمز خودکار را با جدیدترین مهاجمان داخلی تیم قرمز اجرا کردیم.
- GPT‑6 Astra از GPT‑5.6 Sol همراستاتر است. Astra گامی بزرگ در همراستایی مدل به شمار میرود و بهبودهایی را از ترکیب دادههای پیش تمرین تا شیوه نمرهدهی در یادگیری تقویتی در بر میگیرد. ما مجموعه تازهای از ارزیابیهای همراستایی(در یک پنجره جدید باز میشود) را گزارش میکنیم و دریافتهایم که GPT‑6 Astra در رعایت مرزهای ایمنی و امنیتی و ماندن در محدوده مجاز خود عملکرد بهتری دارد. همچنین در شبیهسازی بیش از ۵۴٬۰۰۰ وظیفه داخلی Codex(در یک پنجره جدید باز میشود)، شمار هشدارهای Astra درباره رفتار ناهمراستای شدیدتر تقریباً نصف Sol بود.
- پایش ناهمراستایی را بهطور گسترده به کار میگیریم. همراستایی مدل را اهرم اصلی جلوگیری از رفتارهای ناهمراستای احتمالی مدلهایمان میدانیم. بااینحال، پایش دیدی گسترده از رفتار مدلهای پیشرو فراهم میکند و فرصتهای بهبود بیشتر همراستایی و ایمنی را آشکار میسازد. افزون بر این، پایش لایه محافظتی دیگری در برابر رفتار ناهمراستای شناساییشده فراهم میکند. به همین دلایل، با وجود هزینه محاسباتی قابلتوجه، پایش ناهمراستایی را به همه استنتاجهای متکی بر ابزار در استقرار خارجی Astra افزودهایم. این سامانه مشابه سازوکار داخلی ماست.
- پایشپذیری GPT‑6 Astra در مقایسه با GPT‑5.6 Sol کاهش یافته است. ما بررسیهای گستردهای درباره پایشپذیری(در یک پنجره جدید باز میشود) و کنترلپذیری(در یک پنجره جدید باز میشود) GPT‑6 Astra انجام دادهایم. دریافتیم که GPT‑6 Astra نسبت به GPT‑5.6 Sol توانایی بیشتری در کنترل CoT خود دارد و احتمال کمتری دارد که اطلاعات افشاگرانه را در CoT بگنجاند. در شرایط خصمانه، یعنی زمانی که مدل را وادار میکنیم از پایشگرهای ما بگریزد، مدل میتواند هنگام پنهانکاری راهبردی تواناییهایش در ارزیابیها (پنهانکاری تواناییها) شناسایینشده باقی بماند و گاهی نیز وقتی از آن خواسته میشود برخی وظایف خرابکارانه(در یک پنجره جدید باز میشود) را انجام دهد، از پایشگرهای داخلی ما بگریزد. شواهدی از استدلال پنهاننگارانه در CoT ندیدهایم؛ برای مثال، پنهانکردن استدلال مخفی در متنی عادی و ظاهراً نامرتبط. این امر نشان میدهد که خطر گریز ممکن است عمدتاً به وظایف استدلالی سطح پایین محدود باشد.
- این یافتهها نشان میدهند که مدلهای رده Astra ممکن است در شرایط خصمانه از پایشگرهای CoT ما بگریزند. در حال حاضر، این یافتهها عمدتاً بر ارزیابیهای خصمانه مبتنیاند، یعنی زمانی که به مدل دستور میدهیم از پایش بگریزد؛ بااینحال، ارزیابیهای همراستایی ما در مجموع نشان میدهند که احتمال نقض محدودیتهای امنیتی و ایمنی توسط Astra کمتر از GPT‑5.6 Sol است.
- بااینحال، این روند را جدی میگیریم و همزمان با توانمندتر شدن مدلهایمان، بررسی این یافتهها و پیامدهایشان برای پایشپذیری را ادامه میدهیم. OpenAI برای حفظ و بهرهگیری از پایش زنجیره فکر تلاش کرده است و حفظ پایشپذیری CoT یکی از اهداف اصلی این برنامه پژوهشی است. بااینحال، این نتایج بر اهمیت توسعه روشهای ممیزی همراستایی فراتر از بررسی زنجیره فکر مدل نیز تأکید میکنند.
- GPT‑6 Astra در مرور وب و محیطهای کاری مسئولانهتر عمل میکند: GPT‑6 Astra در برابر تزریق اعلان، بهمراتب مقاومتر از GPT‑5.6 Sol است. همچنین رفتار مدل را در محیطهای واقعگرایانه مرور وب و رایانههای حرفهای آزمایش کردهایم و دریافتهایم که در مقایسه با GPT‑5.6 Sol، احتمال انجام اقدامات ناهمراستا و بالقوه مخرب، مانند تراکنشهای غیرمجاز، از دست رفتن دادهها، دسترسی بیشازحد یا دور زدن کنترلها، بهطور چشمگیری کمتر است. این مدل هنگام رسیدگی به درخواستهای زیانبار در محیطهای عاملی نیز ایمنتر عمل میکند؛ مانند درخواست کمک برای برنامهریزی حمله خشونتآمیز یا ارتکاب کلاهبرداری.
- GPT‑6 Astra در موقعیتهای پرخطرتر، بهطور چشمگیری ایمنتر است. GPT‑6 Astra در پاسخ به درخواستهای دشوار برگرفته از محیط عملیاتی و تیم قرمز انسانی خصمانه، ایمنتر از GPT‑5.6 Sol عمل میکند. Astra در تکمیل ایمن درخواستهای ناامن و پرهیز از امتناع غیرضروری از درخواستهای بیخطر، بهبود پارتویی به دست میآورد. این بهبودها سناریوهای بسیار خطیری را نیز در بر میگیرند که خطر آسیب در آنها نه از درخواستی صریح، بلکه از بافت گستردهتر ناشی میشود. Astra همچنین مرزهای ایمنی متناسب با سن را برای کاربران زیر ۱۸ سال با ثبات بیشتری اعمال میکند.
برای اطلاعات بیشتر، کارت سیستم کامل(در یک پنجره جدید باز میشود) را ببینید.
نویسنده
OpenAI


