تخطي إلى المحتوى الرئيسي
OpenAI

28 سبتمبر 2026

السلامة

نحو ملفات إثبات السلامة لتدريب نماذج الذكاء الاصطناعي الرائدة

جاري التحميل...

نعتقد أننا ندخل عصرًا جديدًا ينبغي فيه اشتراط توثيق منظّم للسلامة قبل مواصلة أي عملية تدريب بالتعلم بالتعزيز للنماذج الرائدة. ومن الناحية المثالية، ينبغي أن يرقى هذا التوثيق إلى مستوى «ملفات إثبات السلامة»، وهي حجج شاملة ومنظّمة وقائمة على الأدلة بشأن المخاطر، تُستخدم في صناعات أخرى تُعد السلامة فيها أمرًا بالغ الأهمية. نتخذ من ملفات إثبات السلامة هدفًا طموحًا يوجّه عملنا ونسعى إلى بلوغه، مع إدراك صعوبة جعلها لنماذج الذكاء الاصطناعي بالصرامة نفسها المطبقة في الطيران أو الطاقة النووية، نظرًا إلى التعقيد المستجد عند كل مستوى جديد من قدرات الذكاء الاصطناعي. نعمل على وضع إطار لتقنين هذه الممارسات.

فيما يلي بعض الإرشادات الأولية التي نرى ضرورة إدراجها في ملفات إثبات السلامة الخاصة بتدريب نماذج الذكاء الاصطناعي الرائدة. تعكس هذه الممارسات الفضلى ما تعلمناه حتى الآن، ونتوقع أن تتطور مع مواصلة تحسين إجراءاتنا الداخلية لضمان التطوير المتأني. نشاركها الآن توضيحًا لرؤيتنا الحالية بشفافية، وندعو المجتمع إلى تقديم ملاحظاته. تجدر الإشارة إلى أن هذه الوثيقة تركز على تدريب النماذج الرائدة بالتعلم بالتعزيز؛ أما النشر الداخلي والخارجي فيتطلب مراعاة مجموعة أوسع بكثير من خصائص المواءمة.

1. ضمانات تقنية

ينبغي أن تغطي ملفات إثبات السلامة ثلاثة جوانب من المنظومة التقنية: التدريب على المواءمة، والاحتواء، والمراقبة. تساعد هذه الضمانات على التأكد من أن النموذج لا يحاول اتخاذ إجراءات غير مواءَمة، وأنه حتى إن حاول ذلك، فسيصعب عليه اختراق الاحتواء، وستكشف المراقبة محاولته قبل وقوع ضرر.

  • مواءمة النماذج: ينبغي أن يكون خط الدفاع الأول هو تدريب النماذج على المواءمة، أي على التصرف بصورة موثوقة وفق ما نقصد. وقد يشمل ذلك:

    • بيئات التدريب ومنح الدرجات: تقليل مخاطر اكتساب النماذج سلوكًا غير مواءَم، عبر منع التعزيز الإيجابي للتحايل على المكافآت أثناء التدريب. وقد يشمل ذلك:

      • المراجعة الآلية لمجموعات البيانات: استخدام الوكلاء لاكتشاف بيئات التعلم بالتعزيز المعيبة وإصلاحها، إذ قد تتيح لمسارات سلوكية غير مواءَمة نيل مكافآت مرتفعة عبر استغلال الثغرات بدلًا من اتباع السلوك المقصود، مما يقلل فرص تعزيز عدم المواءمة أثناء التدريب.

      • المراجعة اليدوية لمجموعات البيانات: استكمال اختبار تقييم المخاطر الآلي بمراجعة يدوية وفحوص جودة لمجموعات البيانات، لتحديد المهام المعيبة التي قد تعزز السلوك غير المواءَم دون قصد.

      • ضبط أنظمة منح الدرجات: ضبط هذه الأنظمة لفرض عقوبات على محاولات النموذج استغلال بيئات التعلم بالتعزيز أو التحايل عليها أثناء التدريب.

      • تحليل عمليات التدريب السابقة: تطبيق أدوات تصنيف على سجلات التنفيذ من التجارب السابقة، للتأكد من أن أنظمة منح الدرجات تعمل على النحو المقصود.

    • قياس المواءمة: إجراء تقييمات تتتبع ميول النموذج إلى عدم المواءمة، لقياس فعالية التدريب على المواءمة. وقد يشمل ذلك:

      • تقييمات المواءمة خارج مسار التشغيل: إجراء تقييمات للمواءمة أثناء عمليات تدريب النماذج الرائدة، لتحديد ما إذا كان التدريب يسير على النحو المقصود، والتحقيق في أي تراجع جوهري.

      • الاختبار بأثر رجعي: اختبار تقييمات المواءمة على حوادث سابقة، للتأكد من أنها تكشف النماذج التي أظهرت عدم المواءمة سابقًا، ولا يجري الإفراط في تكييفها مع حوادث بعينها.

      • تتبع التحايل على التقييمات: تتبع الوعي بالتقييم أو استغلال سياق الاختبار (إدراك النماذج أنها تخضع للاختبار)، مما قد يغيّر سلوكها، مع تحديد عتبات واضحة للمنع (مثل تفعيل أدوات رصد الوعي بالتقييم واستغلال سياق الاختبار ضمن تقييمات المواءمة).

      • اختبارات الضغط لأسوأ الحالات: استثارة أسوأ أشكال السلوك غير السليم والتحقق من أن تقييمًا واحدًا على الأقل سيكشف هذا السلوك.

    • منع التدريب على سلسلة الاستدلال: عدم السماح لأنظمة منح الدرجات الآلية بالاطلاع على سلسلة الاستدلال أثناء التعلم بالتعزيز، لمنع النماذج من التطور على نحو يمكّنها من الإفلات من أدوات مراقبة سلسلة الاستدلال.

  • الاحتواء: في حال أصبح النموذج غير مواءَم، ينبغي أن يكون العزل والأمن قويين بما يكفي لمنع وقوع إجراءات ضارة. وقد يشمل ذلك:

    • طبقات متعددة لأمن البنية التحتية: الاستثمار بكثافة في تحصين كل من البيئة المعزولة التي يعمل فيها النموذج والبنية التحتية البحثية التي تستضيفها، لضمان وجود طبقة حماية إضافية في حال الخروج من البيئة المعزولة.

    • اختبار تقييم المخاطر للاحتواء: تحسين أمن البيئة المعزولة والبنية التحتية البحثية والمحيط الشبكي، عبر إجراء اختبار تقييم المخاطر لهذه الأنظمة على نحو متكرر باستخدام نقاط تحقق محفوظة من عمليات تدريب النماذج الرائدة، مع إخضاع ذلك لتحليل السلامة، للكشف عن أي ثغرات وسدّها. وإجراء اختبار تقييم المخاطر أيضًا لجميع الخدمات التي قد يتفاعل معها النموذج أثناء التدريب (مثل ذاكرة التخزين المؤقت للإنترنت).

    • الاتصال بين العينات: قصر الاتصال عالي النطاق الترددي بين العينات على المسارات المعتمدة، مثل الأدوات متعددة الوكلاء، وإغلاق القنوات الجانبية في البنية التحتية التي تتمتع بنطاق ترددي عالٍ ويسهل على الوكلاء اكتشافها.

    • سجلات تفاعل غير قابلة للتعديل: حفظ سجلات تفاعل الوكلاء بصيغة غير قابلة للتعديل لفترة زمنية معقولة (مثلًا في حسابات تخزين لا تسمح بالكتابة إلا مرة واحدة)، لجميع عمليات التدريب بالتعلم بالتعزيز والتقييم والنشر الداخلي، لتمكين إجراء تحقيقات موثوقة في الحوادث ومنع التعديلات غير المقصودة.

  • المراقبة: في حال بدأت النماذج تتخذ إجراءات غير مواءَمة، ينبغي توفير نظام مراقبة مباشر يكشف أي عدم مواءمة محتمل، مع معالجة المشكلات ذات الأولوية بسرعة قبل وقوع حادث خطير. وقد يشمل ذلك:

    • ضمان قابلية المراقبة: ضمان بقاء النماذج قابلة للمراقبة، وفق قياسات مستمدة من تقييمات قابلية المراقبة والتهرب منها ذات العتبات الواضحة، للكشف المبكر عن السلوك المثير للقلق.

    • معدل استدعاء مرتفع للمشكلات المعروفة: ضمان أن يحقق نظام المراقبة معدل استدعاء مرتفعًا للحوادث السابقة في تقييم تُحجز بياناته بعيدًا عن التدريب.

    • تحديث تقييمات أنظمة المراقبة: إنشاء عينات تقييم تمثل المخاطر المستجدة كليًا في عمليات التدريب الجديدة، حتى تظل مقاييس الاستدعاء والدقة لأنظمة المراقبة مواكبة للمستجدات.

    • الاستجابة السريعة: تطبيق تنبيهات ذات أولوية تستدعي اتخاذ إجراء ضمن المهلة المحددة في اتفاقية مستوى الخدمة، إما بتنبيه مسؤول مناوب أو بإيقاف عملية التدريب المتأثرة مؤقتًا بصورة تلقائية، قبل أن يتسبب النموذج في ضرر (مثل تنبيه مسؤول الأمن المناوب والمسؤول عن عملية التدريب عند وقوع حوادث نهارًا، وإيقاف عمليات التدريب مؤقتًا بصورة تلقائية عند عدم تأكيد استلام التنبيهات ليلًا).

2. إرشادات تشغيلية

إلى جانب التوصيات بشأن الضمانات التقنية، نعمل على وضع أفضل الممارسات التشغيلية لملفات إثبات السلامة الخاصة بعمليات تدريب نماذج الذكاء الاصطناعي الرائدة. وقد تشمل ما يلي:

  • الاعتراضات (تحليل استباقي لأسباب الفشل): بعد إعداد مسودة ملف إثبات السلامة، ينبغي لأحد أعضاء فريق آخر كتابة اعتراض يكشف الثغرات المحتملة في الملف ويقدم تقديرًا متزنًا للمخاطر. وعلى فريق التدريب بعد ذلك معالجة هذه النقاط، بما يعزز ملفات إثبات السلامة.

  • الموافقات: ينبغي أن يراجع ملف إثبات السلامة أعضاء من القيادة العليا، على أن يتمتع كل منهم بصلاحية منع عملية التدريب، لضمان خضوعها لعدة مستويات من الرقابة الداخلية (مثل رئيس قطاع الأبحاث أو نائب الرئيس للأبحاث، ورئيس السلامة، وكبير العلماء).

  • المساءلة: ينبغي أن يخضع المسؤول القيادي عن عملية التدريب (مثل رئيس قطاع الأبحاث أو نائب الرئيس للأبحاث) للمساءلة عن ملف إثبات السلامة وعن الاستجابة لأي حادث، بما في ذلك ضمن مراجعات الأداء، ليكون لدى فرق التدريب أيضًا حافز لتعزيز السلامة والمواءمة.

  • الإيقاف المؤقت: إذا اكتُشفت مشكلات تُبطل صلاحية ملف إثبات السلامة (مثل مشكلة أمنية جديدة)، فيجب ضمان وجود أدلة إجراءات تشغيلية وضوابط تقنية واتفاقيات مستوى خدمة لإيقاف جميع عمليات التدريب المشمولة مؤقتًا.

  • الشفافية الداخلية: ينبغي إتاحة ملفات إثبات السلامة لجهات الرقابة الداخلية (مثل لجنة السلامة والأمن).

  • التدقيق: ينبغي منح المدققين صلاحيات وصول كافية للتحقق من صحة الادعاءات الواردة في ملف إثبات السلامة وسلامتها، والإبلاغ عن أي ثغرات يجدونها.

  • التصعيد: ينبغي وضع إجراءات واضحة لتصعيد مشكلات عدم المواءمة، مع جدول يحدد مستويات خطورتها، وتعيين مسؤول مناوب لهذه المشكلات يمكنه تنبيه القيادات التنفيذية (مثل الرئيس التنفيذي) عندما تبلغ عملية التدريب مستوى معينًا من الخطورة.

  • الضوابط التقنية: ينبغي أن يصعب على البشر والوكلاء بدء عمليات تدريب غير ممتثلة. ينبغي أن تؤدي أعطال ميزات السلامة، مثل المراقبة والإيقاف المؤقت التلقائي، إلى منع التشغيل لا السماح به (فمثلًا، يجب ألا يكون من الممكن بدء عمليات التدريب دون تفعيل المراقبة المناسبة، أو تعطيل نظام المراقبة من داخل التدريب بالتعلم بالتعزيز أو التقييم أو النشر الداخلي).

  • إمكانية التراجع: ينبغي أن يسهل تحديد جميع الاستخدامات اللاحقة لأي نموذج غير مواءَم ضمن عملية التدريب (مثل توليد البيانات أو منح الدرجات)، لتمكين إلغاء أثر المخرجات غير المواءَمة عند الضرورة.

  • شمول حصر المخاطر المتبقية: ينبغي أن تتضمن ملفات إثبات السلامة قائمة شاملة قدر الإمكان بالمخاطر المتبقية التي لا تغطيها تدابير التخفيف المطبقة حاليًا، لتمكين اتخاذ قرارات مستنيرة بشأن قبول المخاطر.

تمثل هذه توصياتنا الحالية، ويجري تطبيقها في OpenAI. ونتوقع أن تواصل ممارساتنا التطور خلال الأسابيع المقبلة.

3. التحقيق في حوادث عدم المواءمة

نعمل أيضًا على تطوير بعض أفضل الممارسات للتحقيق في الحوادث الخطيرة الناجمة عن عدم مواءمة الذكاء الاصطناعي. ينبغي للمختبرات السعي إلى استخلاص أكبر قدر ممكن من الدروس من كل حادث على حدة (على غرار ممارسات التحقيق⁠(يفتح في نافذة جديدة) في الصناعات الأخرى التي تنطوي على مخاطر جسيمة)، لتتمكن من منع تكرار مثل هذه الحوادث مستقبلًا. ومن أمثلة الإجراءات الممكنة:

  • الشفافية الداخلية: نظرًا إلى أن إكمال التحقيق قد يستغرق وقتًا طويلًا، ينبغي تقديم مستجدات دورية داخليًا بشأن التحقيقات في الحوادث (مثل تقديم مستجدات يومية عن التحقيقات الجارية). ينبغي إتاحة مسارات محددة للموظفين للحصول على صلاحيات وصول أوسع، تشمل سجلات التفاعل الخام وأخذ عينات من مخرجات النماذج غير المواءَمة، متى كان ذلك آمنًا وذا صلة بعملهم.

  • الأسباب الجذرية لعدم المواءمة: ينبغي للباحثين تحديد الأسباب الجذرية في ديناميكيات التدريب (مثلًا عبر تجارب استبعاد موجّهة للمكونات أو تجارب إعادة أخذ العينات)، لفهم كيفية نشوء السلوكيات غير المواءَمة، وتعميق الفهم العلمي لعدم المواءمة وتحسين الوقاية منها مستقبلًا.

  • مراجعة ما بعد الحادث: ينبغي إجراء مراجعة للجوانب التشغيلية والثقافة المؤسسية بعد الحادث لفهم جميع الأسباب التي أسهمت فيه، مثل أسباب نشوء المشكلات وبقائها دون اكتشاف أو تصعيد قبل وقوعه.

  • الكشف: ينبغي أن نطور أساليب لاختبار المواءمة قادرة على اكتشاف الميل إلى التسبب في الحادث، دون تحسينها تدريجيًا بالاعتماد المباشر على المعلومات المستمدة منه (مثل سجلات التفاعل أو ملخصات الحادث). ينبغي إنشاء تقييمات مستمدة من الحوادث لتكون بمثابة «اختبارات عدم التراجع»، تضمن ألا تُظهر النماذج المستقبلية ميلًا إلى عدم المواءمة في حوادث شديدة التشابه.

  • الإفصاح العام: ينبغي إطلاع الجمهور على نتائج التحقيق ومراجعات ما بعد الحادث والتغييرات التشغيلية بعد انتهاء التحقيق. ينبغي إخطار الأطراف الخارجية المتضررة في أقرب وقت ممكن.

المؤلف

OpenAI