جاري التحميل...
نطلق اليوم GPT‑6 Astra، وهو أقوى نموذج نشرناه على نطاق واسع حتى الآن. Astra هو أول نموذج لنا يبلغ المستوى الحرج من قدرات الأمن السيبراني وفقًا لإطار الجاهزية.
فيما يلي أهم ما ينبغي معرفته عن سلامة هذا الإصدار:
- يمثل GPT‑6 Astra قفزة كبيرة في القدرات السيبرانية ويبلغ عتبتنا للمستوى الحرج. وهذا يعني أنه يستطيع، عند تزويده بالأدوات والصلاحيات المناسبة، اكتشاف ثغرات أمنية لم تكن معروفة من قبل وابتكار طرق جديدة لاستغلالها في العديد من الأنظمة المحمية جيدًا، من دون توجيه بشري في كل خطوة. لذلك، عززنا بدرجة كبيرة وسائل الحماية لمنع النموذج من تنفيذ إجراءات سيبرانية ضارة، سواء بسبب إساءة الاستخدام أو اختلال المواءمة. واتخذنا أيضًا خطوات لتأمين تطوير Astra والنماذج المماثلة ونشرها داخليًا، شملت عزلًا أكثر صرامة، وتشفير نقاط التحقق، والمراقبة الشاملة للمسارات الكاملة بما فيها سلاسل الاستدلال (CoT)، وعملية تقييم للمواءمة تمنع الاستخدام الداخلي قبل اجتيازها.
- GPT‑6 Astra أكثر متانة بكثير من النماذج السابقة. بفضل دمج تقنيات جديدة للتدريب على متانة السلامة، أصبح GPT‑6 Astra أكثر مقاومة بكثير لمحاولات تجاوز إجراءات الحماية مقارنةً بـ GPT‑5.6 Sol، بما في ذلك عبر المسارات الأطول. نعرف ذلك من الاختبارات غير المتصلة بالإنترنت ومن برنامجنا الصارم لاختبار محاولات تجاوز إجراءات الحماية ومعالجتها داخليًا وخارجيًا. وبالنسبة إلى المستخدمين المصنفين على أنهم قد يمثلون مخاطر مرتفعة، درّبنا النموذج أيضًا على تعديل حدود الرفض لتصبح أكثر تحفظًا وتشمل نطاقًا أوسع من مخاطر الاستخدام المزدوج. نستخدم اختبارات الانحدار للتأكد من متانة Astra في مواجهة محاولات تجاوز إجراءات الحماية المكتشفة في فترات الاختبار السابقة، كما أجرينا جولات جديدة من اختبارات تقييم المخاطر المؤتمتة باستخدام أحدث أدوات الهجوم الداخلية لدينا للتحقق من التحسينات.
- GPT‑6 Astra أفضل مواءمةً من GPT‑5.6 Sol. يمثل Astra تقدمًا كبيرًا في مواءمة النماذج، ويتضمن تحسينات تمتد من تكوين بيانات التدريب المسبق إلى آليات التقييم أثناء التعلم بالتعزيز. ونستعرض مجموعة جديدة من تقييمات المواءمة(يفتح في نافذة جديدة)، ونجد أن GPT‑6 Astra أقدر على احترام حدود السلامة والأمن والبقاء ضمن نطاق صلاحياته. وفي محاكاة استخدمت أكثر من 54,000 مهمة داخلية من Codex(يفتح في نافذة جديدة)، تلقى Astra أيضًا نحو نصف عدد الإشارات التي تلقاها Sol بشأن السلوك غير المتوائم الأعلى خطورة.
- نطبّق مراقبة اختلال المواءمة على نطاق واسع. نعد مواءمة النماذج أداتنا الأساسية لمنع نماذجنا من إظهار سلوك محتمل غير متوائم. لكن المراقبة تتيح رؤية شاملة لسلوك النماذج الرائدة، وتكشف فرصًا لمواصلة تحسين المواءمة والسلامة. إضافةً إلى ذلك، تمثل المراقبة طبقة حماية إضافية من السلوك غير المتوائم الذي يجري اكتشافه. لهذه الأسباب، أضفنا أيضًا مراقبة اختلال المواءمة إلى جميع عمليات الاستدلال التي تستخدم الأدوات ضمن نشر Astra خارجيًا، رغم تكلفتها الحاسوبية الكبيرة. يوازي هذا النظام إعدادنا الداخلي.
- انخفضت قابلية مراقبة GPT‑6 Astra مقارنةً بـ GPT‑5.6 Sol. أجرينا أبحاثًا موسعة حول قابلية مراقبة(يفتح في نافذة جديدة) GPT‑6 Astra وقابليته للتحكم(يفتح في نافذة جديدة). ووجدنا أن GPT‑6 Astra أقدر من GPT‑5.6 Sol على التحكم في سلسلة استدلاله، وأقل ميلًا إلى تضمين معلومات تدينه فيها. وفي الظروف الهجومية، حيث ندفع النموذج إلى تفادي أنظمة المراقبة، وجدنا أنه يستطيع الإفلات من الاكتشاف عند التعمّد في خفض أدائه أثناء التقييمات، ويمكنه أحيانًا تفادي أنظمة المراقبة الداخلية عندما يُطلب منه تنفيذ مهام تخريب معينة(يفتح في نافذة جديدة). ولم نرصد دليلًا على استخدام الاستدلال الخفي في سلسلة الاستدلال، مثل إخفاء استدلال سري داخل نص عادي يبدو غير ذي صلة، ما يشير إلى أن خطر الإفلات قد يقتصر إلى حد بعيد على مهام الاستدلال الأقل تعقيدًا.
- تشير هذه النتائج إلى أن نماذج فئة Astra قد تتمكن من تفادي أنظمة مراقبة سلسلة الاستدلال في الظروف الهجومية. تستند هذه النتائج حاليًا إلى حد بعيد إلى تقييمات هجومية، أي عندما نطلب من النموذج تفادي المراقبة، بينما تُظهر تقييمات المواءمة عمومًا أن احتمال انتهاك Astra لقيود الأمن والسلامة أقل من GPT‑5.6 Sol.
- لكننا نتعامل مع هذا التوجه بجدية، ونواصل بحث هذه النتائج وتداعياتها على قابلية المراقبة مع ازدياد قدرات نماذجنا. عملت OpenAI على الحفاظ على مراقبة سلسلة الاستدلال والاستفادة منها، ويُعد الحفاظ على قابلية مراقبتها هدفًا أساسيًا للبرنامج البحثي. لكن هذه النتائج تؤكد أيضًا أهمية تطوير تقنيات لتدقيق المواءمة تتجاوز فحص سلسلة استدلال النموذج.
- يتعامل GPT‑6 Astra بمسؤولية أكبر مع التصفح وبيئات العمل: GPT‑6 Astra أكثر مقاومة بكثير لهجمات حقن المطالبات من GPT‑5.6 Sol. اختبرنا أيضًا سلوك النموذج في بيئات واقعية للتصفح والعمل الاحترافي على الحاسوب، ووجدنا أنه أقل بكثير من GPT‑5.6 Sol احتمالًا لتنفيذ إجراءات غير متوائمة قد تكون مدمرة، مثل المعاملات غير المصرح بها أو فقدان البيانات أو الوصول المفرط أو التحايل على الضوابط. كما يتصرف بأمان أكبر عند التعامل مع الطلبات الضارة في البيئات الوكيلة، مثل طلبات المساعدة في التخطيط لهجوم عنيف أو ارتكاب الاحتيال.
- GPT‑6 Astra أكثر أمانًا بكثير في السيناريوهات الأعلى خطورة. يستجيب GPT‑6 Astra بأمان أكبر من GPT‑5.6 Sol للطلبات الصعبة المستمدة من بيئة الإنتاج واختبارات تقييم المخاطر الهجومية التي يجريها البشر. يحقق Astra تحسنًا وفق معيار باريتو في التعامل الآمن مع الطلبات غير الآمنة، مع تجنب الرفض غير الضروري للطلبات غير الضارة. تشمل هذه التحسينات السيناريوهات الشديدة الخطورة التي ينشأ فيها احتمال الضرر من السياق الأوسع، لا من طلب صريح. كما يطبّق Astra حدود السلامة الملائمة للعمر بصورة أكثر اتساقًا للمستخدمين دون سن 18 عامًا.
لمزيد من المعلومات، راجع بطاقة النظام الكاملة(يفتح في نافذة جديدة).
المؤلف
OpenAI


