پرش به محتوای اصلی
OpenAI
در حال بارگذاری…

امروز GPT‑6 Astra را عرضه می‌کنیم؛ توانمندترین مدلی که تاکنون به‌طور گسترده ارائه کرده‌ایم. Astra نخستین مدل ماست که طبق چارچوب آمادگی، از نظر توانمندی امنیت سایبری به سطح بحرانی رسیده است.

مهم‌ترین نکاتی که باید درباره ایمنی این عرضه بدانید، عبارت‌اند از:

  1. GPT‑6 Astra جهشی چشمگیر در توانمندی‌های سایبری است و به آستانه بحرانی ما می‌رسد. این یعنی GPT‑6 Astra با ابزارها و دسترسی مناسب می‌تواند نقص‌های امنیتی ناشناخته را پیدا کند و بدون هدایت انسانی در هر مرحله، روش‌های تازه‌ای برای بهره‌برداری از آن‌ها در بسیاری از سامانه‌های به‌خوبی محافظت‌شده توسعه دهد. ازاین‌رو، محافظت‌های خود را در برابر اقدامات سایبری زیان‌بار مدل، چه بر اثر سوءاستفاده و چه ناهم‌راستایی، به‌طور چشمگیری تقویت کرده‌ایم. همچنین برای ایمن‌سازی توسعه و استقرار داخلی Astra و مدل‌های مشابه اقداماتی انجام داده‌ایم؛ از جمله جداسازی سخت‌گیرانه‌تر، رمزگذاری نقاط بازرسی، پایش فراگیر مسیرهای کامل شامل زنجیره‌های فکر (CoT)، و فرایند ارزیابی الزامی هم‌راستایی پیش از استفاده داخلی.
  2. GPT‑6 Astra به‌طور چشمگیری از نسل‌های پیشین خود مقاوم‌تر است. GPT‑6 Astra با بهره‌گیری از روش‌های تازه آموزش ایمنی برای افزایش مقاومت، در برابر دور زدن محدودیت‌ها، از جمله در مسیرهای طولانی‌تر، به‌مراتب مقاوم‌تر از GPT‑5.6 Sol است. این نتیجه را از آزمون‌های آفلاین و برنامه سخت‌گیرانه داخلی و خارجی خود برای آزمایش و رفع موارد دور زدن محدودیت‌ها به دست آورده‌ایم. برای کاربرانی که بالقوه پرخطر تشخیص داده می‌شوند، مدل را افزون بر این آموزش داده‌ایم تا مرز امتناع خود را محافظه‌کارانه‌تر تنظیم کند و طیف گسترده‌تری از خطرات دومنظوره را پوشش دهد. با آزمون رگرسیون اطمینان می‌یابیم که Astra در برابر موارد دور زدن محدودیت‌ها که در دوره‌های آزمایشی پیشین کشف شده‌اند مقاوم است؛ همچنین برای تأیید بهبودها، دورهای تازه‌ای از تیم قرمز خودکار را با جدیدترین مهاجمان داخلی تیم قرمز اجرا کردیم.
  3. GPT‑6 Astra از GPT‑5.6 Sol هم‌راستاتر است. Astra گامی بزرگ در هم‌راستایی مدل به شمار می‌رود و بهبودهایی را از ترکیب داده‌های پیش تمرین تا شیوه نمره‌دهی در یادگیری تقویتی در بر می‌گیرد. ما مجموعه تازه‌ای از ارزیابی‌های هم‌راستایی(در یک پنجره جدید باز می‌شود) را گزارش می‌کنیم و دریافته‌ایم که GPT‑6 Astra در رعایت مرزهای ایمنی و امنیتی و ماندن در محدوده مجاز خود عملکرد بهتری دارد. همچنین در شبیه‌سازی بیش از ۵۴٬۰۰۰ وظیفه داخلی Codex(در یک پنجره جدید باز می‌شود)، شمار هشدارهای Astra درباره رفتار ناهم‌راستای شدیدتر تقریباً نصف Sol بود.
  4. پایش ناهم‌راستایی را به‌طور گسترده به کار می‌گیریم. هم‌راستایی مدل را اهرم اصلی جلوگیری از رفتارهای ناهم‌راستای احتمالی مدل‌هایمان می‌دانیم. بااین‌حال، پایش دیدی گسترده از رفتار مدل‌های پیشرو فراهم می‌کند و فرصت‌های بهبود بیشتر هم‌راستایی و ایمنی را آشکار می‌سازد. افزون بر این، پایش لایه محافظتی دیگری در برابر رفتار ناهم‌راستای شناسایی‌شده فراهم می‌کند. به همین دلایل، با وجود هزینه محاسباتی قابل‌توجه، پایش ناهم‌راستایی را به همه استنتاج‌های متکی بر ابزار در استقرار خارجی Astra افزوده‌ایم. این سامانه مشابه سازوکار داخلی ماست.
  5. پایش‌پذیری GPT‑6 Astra در مقایسه با GPT‑5.6 Sol کاهش یافته است. ما بررسی‌های گسترده‌ای درباره پایش‌پذیری(در یک پنجره جدید باز می‌شود) و کنترل‌پذیری(در یک پنجره جدید باز می‌شود) GPT‑6 Astra انجام داده‌ایم. دریافتیم که GPT‑6 Astra نسبت به GPT‑5.6 Sol توانایی بیشتری در کنترل CoT خود دارد و احتمال کمتری دارد که اطلاعات افشاگرانه را در CoT بگنجاند. در شرایط خصمانه، یعنی زمانی که مدل را وادار می‌کنیم از پایشگرهای ما بگریزد، مدل می‌تواند هنگام پنهان‌کاری راهبردی توانایی‌هایش در ارزیابی‌ها (پنهان‌کاری توانایی‌ها) شناسایی‌نشده باقی بماند و گاهی نیز وقتی از آن خواسته می‌شود برخی وظایف خرابکارانه(در یک پنجره جدید باز می‌شود) را انجام دهد، از پایشگرهای داخلی ما بگریزد. شواهدی از استدلال پنهان‌نگارانه در CoT ندیده‌ایم؛ برای مثال، پنهان‌کردن استدلال مخفی در متنی عادی و ظاهراً نامرتبط. این امر نشان می‌دهد که خطر گریز ممکن است عمدتاً به وظایف استدلالی سطح پایین محدود باشد.
    • این یافته‌ها نشان می‌دهند که مدل‌های رده Astra ممکن است در شرایط خصمانه از پایشگرهای CoT ما بگریزند. در حال حاضر، این یافته‌ها عمدتاً بر ارزیابی‌های خصمانه مبتنی‌اند، یعنی زمانی که به مدل دستور می‌دهیم از پایش بگریزد؛ بااین‌حال، ارزیابی‌های هم‌راستایی ما در مجموع نشان می‌دهند که احتمال نقض محدودیت‌های امنیتی و ایمنی توسط Astra کمتر از GPT‑5.6 Sol است.
    • بااین‌حال، این روند را جدی می‌گیریم و هم‌زمان با توانمندتر شدن مدل‌هایمان، بررسی این یافته‌ها و پیامدهایشان برای پایش‌پذیری را ادامه می‌دهیم. OpenAI برای حفظ و بهره‌گیری از پایش زنجیره فکر تلاش کرده است و حفظ پایش‌پذیری CoT یکی از اهداف اصلی این برنامه پژوهشی است. بااین‌حال، این نتایج بر اهمیت توسعه روش‌های ممیزی هم‌راستایی فراتر از بررسی زنجیره فکر مدل نیز تأکید می‌کنند.
  6. GPT‑6 Astra در مرور وب و محیط‌های کاری مسئولانه‌تر عمل می‌کند: GPT‑6 Astra در برابر تزریق اعلان، به‌مراتب مقاوم‌تر از GPT‑5.6 Sol است. همچنین رفتار مدل را در محیط‌های واقع‌گرایانه مرور وب و رایانه‌های حرفه‌ای آزمایش کرده‌ایم و دریافته‌ایم که در مقایسه با GPT‑5.6 Sol، احتمال انجام اقدامات ناهم‌راستا و بالقوه مخرب، مانند تراکنش‌های غیرمجاز، از دست رفتن داده‌ها، دسترسی بیش‌ازحد یا دور زدن کنترل‌ها، به‌طور چشمگیری کمتر است. این مدل هنگام رسیدگی به درخواست‌های زیان‌بار در محیط‌های عاملی نیز ایمن‌تر عمل می‌کند؛ مانند درخواست کمک برای برنامه‌ریزی حمله خشونت‌آمیز یا ارتکاب کلاهبرداری.
  7. GPT‑6 Astra در موقعیت‌های پرخطرتر، به‌طور چشمگیری ایمن‌تر است. GPT‑6 Astra در پاسخ به درخواست‌های دشوار برگرفته از محیط عملیاتی و تیم قرمز انسانی خصمانه، ایمن‌تر از GPT‑5.6 Sol عمل می‌کند. Astra در تکمیل ایمن درخواست‌های ناامن و پرهیز از امتناع غیرضروری از درخواست‌های بی‌خطر، بهبود پارتویی به دست می‌آورد. این بهبودها سناریوهای بسیار خطیری را نیز در بر می‌گیرند که خطر آسیب در آن‌ها نه از درخواستی صریح، بلکه از بافت گسترده‌تر ناشی می‌شود. Astra همچنین مرزهای ایمنی متناسب با سن را برای کاربران زیر ۱۸ سال با ثبات بیشتری اعمال می‌کند.

برای اطلاعات بیشتر، کارت سیستم کامل(در یک پنجره جدید باز می‌شود) را ببینید.