تخطي إلى المحتوى الرئيسي
OpenAI

22 سبتمبر 2026

السلامة

أولويات ومبادئ التقييمات الخارجية الفعالة

جاري التحميل...

تتحمل مختبرات الذكاء الاصطناعي الرائدة مسؤولية هائلة عن تدريب النماذج وتقييمها ونشرها بأمان. تمثل تقييمات الجهات الخارجية عنصرًا أساسيًا في تحقيق التوازن في تحمل هذه المسؤولية، إذ توسّع فرص الإسهام في سلامة الذكاء الاصطناعي، وتطلع العالم على المستجدات، وتُخضع المختبرات للمساءلة وفق ادعاءات سلامة واضحة ومدعومة بصورة مستقلة.

في إطار جهودنا الرامية إلى ضبط وتيرة التقدم في مجال الذكاء الاصطناعي الرائد، تلتزم OpenAI بدعم التقييمات المستقلة عبر إتاحة وصول معمّق إلى مراحل التدريب والتقييم والنشر. ينبغي لهذا الوصول أن يمكّن المقيّمين من اختبار افتراضاتنا، وتحديد مخاطر ربما أغفلناها، والتوصل إلى استنتاجاتهم الخاصة بشأن فعالية ضماناتنا الوقائية.

لطالما عملنا مع مقيّمين من جهات خارجية في مراحل مختلفة من عملية تطوير النموذج ونشره. كما أدرجنا تقييمات الجهات الخارجية في ممارسات إطار الجاهزية، ودعمنا مؤسسات وتشريعات تدعو إلى عملية أشد صرامة وخضوعًا للمساءلة. أتَحنا طوال هذه المشاركات أشكالًا معمّقة من الوصول، شملت معلومات عن ضماناتنا التقنية، والوصول إلى سلسلة الاستدلال الظاهرة، ومستويات غير مسبوقة من الوصول السرّي إلى البيانات وعمليات النشر الداخلية للاستجابة للحوادث واختبار تقييم مخاطر أنظمة المراقبة. تركّز الأولويات والمبادئ الواردة هنا على تعاوننا مع مؤسسات التقييم المستقلة في القطاعين الخاص وغير الربحي بشأن تقييمات السلامة التقنية. وهي تكمّل عملنا مع الحكومات في الاختبار والتقييم، حيث قد تستدعي الأدوار والمسؤوليات المختلفة اتباع مناهج مغايرة.

تتطلب فعالية هذه التقييمات آليات قوية للاستقلالية، وصرامة علمية، وممارسات أمنية متينة، ومسؤوليات واضحة. تتحمل المختبرات مسؤولية إتاحة تدقيق جاد مع حماية المعلومات الحساسة. تتقاسم المختبرات والمقيّمون المستقلون مسؤولية إنجاز ذلك على النحو الصحيح، وينبغي أن يعملوا وفق معايير دولية مشتركة لممارسات السلامة والأمن. نقترح أدناه أربعة مجالات ذات أولوية لإجراء تقييم أعمق، إلى جانب مبادئ للعمل الصارم والآمن والمستقل.

مجالات التقييم ذات الأولوية

تبلغ تقييمات الجهات الخارجية أقصى فائدة عندما تتناول أسئلة محددة ومهمة: هل تدعم الأدلة حجة السلامة وادعاءات السلامة لدى المختبر؟ هل تختبر التقييمات المخاطر المستهدفة بالقدر الكافي؟ هل تعمل الضمانات الوقائية في الظروف الواقعية؟

يُراد للتقييمات الموضحة هنا أن تتخذ أشكالًا مختلفة وفقًا لمسائل السلامة الخاضعة للفحص. نتوقع دعم عدة تقييمات بالتوازي وعلى فترات زمنية متفاوتة، فقد يستمر بعضها أسابيع وبعضها الآخر عدة أشهر. ومع أن تقييمات الجهات الخارجية قد تكون أيضًا جزءًا من العمل السابق للنشر وقد تسترشد بها قرارات النشر، فإن العمل الموضح هنا أطول أمدًا عمومًا وغير مرتبط بإطلاق بعينه، إذ يركّز على الفحص المتعمق لادعاءات سلامة محددة بمرور الوقت.

نشير في مجالات أولوياتنا ومبادئنا إلى ادعاءات السلامة وحجج السلامة. ونقصد بهذه المصطلحات ما يلي:

ادعاء السلامة: تأكيد محدد بشأن قدرات نموذج أو نظام أو سلوكه أو ضماناته الوقائية، يكون ذا صلة بسلامته ويمكن تقييمه استنادًا إلى الأدلة. ينبغي أن يحدد الادعاء المخاطر والظروف التي يتناولها، إلى جانب الافتراضات والقيود ذات الصلة.

حجة السلامة: حجة منظّمة ومدعومة بالأدلة، تبيّن سبب إدارة مخاطر نموذج أو نظام إدارةً كافية لنشاط محدد، مثل التدريب أو التقييم أو النشر. تربط حجة السلامة ادعاءات السلامة الفردية بالأدلة الداعمة لها، وتوضح الافتراضات ومواطن عدم اليقين والمخاطر المتبقية التي قد تؤثر في استنتاجاتها.

نقترح أربعة مجالات ذات أولوية لإجراء تقييم أعمق، إلى جانب مبادئ للعمل الصارم والآمن والمستقل.

  1. تقييم مستقل لحجج السلامة، يشمل التدريب والتقييم والنشر الداخلي والخارجي.

    يتطلب تقييم حجج السلامة خبرة في المواءمة، وأساليب التحكم مثل المراقبة، والأمن السيبراني، وإساءة الاستخدام البيولوجي والكيميائي، واختبار تقييم المخاطر. تتألف حجج السلامة من ادعاءات تشمل التدريب وتقييمات القدرات والضمانات الوقائية، ويمكن تقييمها ككل أو في أجزاء (انظر الأولويتين 2 و3 أدناه). سيحتاج على الأرجح عدة مقيّمين إلى فحص أجزاء مختلفة من الحجج، كلٌ وفق خبرته. وينبغي أن تجيب تقييماتهم مجتمعةً عن أسئلة مثل:

    1. هل الأدلة المؤيدة لحجج سلامة التدريب والتقييم والنشر مثبتة؟ هل روعيت شروط حجة السلامة أثناء التدريب والتقييم والنشر؟

    2. هل تغطي حجج السلامة لدينا أكثر المخاطر إلحاحًا مما حُدد خلال التقييم؟ هل تدعم ادعاءات السلامة حجة السلامة الشاملة؟ هل توجد ثغرات أو مجالات للتحسين؟

    3. هل تُستخدم أساليب فعالة لتحديد الحوافز التدريبية التي قد تكافئ الخداع أو التحايل على آلية المكافآت أو الأفعال التخريبية أو تجاوز القيود، والحد منها؟

  2. تقييم الضمانات الوقائية الحيوية في عمليات النشر الداخلية والخارجية

    تتطور منظومة ضماناتنا الوقائية باستمرار لمواكبة القدرات والمشهد المتغيرين. تمتد ضماناتنا الوقائية عبر التدريب والنشر الداخلي والخارجي. تشمل حاليًا ضمانات على مستوى النموذج، وضمانات للإنفاذ والأمن، وأدوات لرصد عدم المواءمة، وتغطي طيفًا واسعًا من المخاطر، مثل فقدان السيطرة وإساءة الاستخدام في المخاطر السيبرانية والبيولوجية والكيميائية. يمكن للشراكات التقنية تحديد أوجه الضعف الحالية في الضمانات الوقائية، مع تحسين أساليب التقييم وتسريع تطوير المعايير، بما يوفر أساسًا تقنيًا أقوى للسياسات العامة المستقبلية كي تواكب تطور النماذج الرائدة، لا سيما في عمليات النشر الداخلي التي لا تزال معايير السلامة والأمن فيها ناشئة.

    ينبغي أن تفحص التقييمات المستقلة مدى فعالية هذه الضمانات الوقائية ومواضع قصورها المحتملة، مثل:

    1. عند إتاحة وصول «الصندوق الرمادي»، هل تصمد الضمانات الوقائية أمام الاختبارات الهجومية (محاولات تجاوز إجراءات الحماية)، وهل توفر حماية كافية من زيادة القدرات في المجالات عالية المخاطر، مثل الأمن السيبراني والبيولوجيا؟ هل تغطي اختباراتنا الهجومية واختبارات تقييم المخاطر أهم المخاطر؟

    2. في الاختبارات المصرح بها ضمن ظروف تشغيل واقعية، كيف تتفاعل الوكلاء مع الدفاعات السيبرانية، مثل ضوابط الوصول والعزل في بيئات محمية وأنظمة الكشف والاستجابة؟ ما الدفاعات التي تمنع الأفعال الضارة أو تكشفها أو تحتويها، وأين تخفق؟

    3. هل توجد في أدواتنا لرصد عدم المواءمة ثغرات خطيرة قد تؤدي إلى فقدان السيطرة أو عدم مواءمة شديد في عمليات النشر الداخلية والخارجية؟ ما مدى موثوقية مراقبة سلسلة الاستدلال بوصفها مصدرًا لأدلة السلامة أو المواءمة مع تحسن قدرات النموذج؟

    4. هل تُطبّق مراقبة مناسبة في جميع عمليات التدريب والتقييم والنشر ذات الصلة، على نحو يصعب تعطيله؟

    5. هل تُطبّق ضمانات وقائية تتناسب مع القدرات؟

  3. تقييم اختبارات القدرات التي تغطي فئات مخاطر إطار الجاهزية (المخاطر الكيميائية والبيولوجية، والأمن السيبراني، والتحسين الذاتي للذكاء الاصطناعي)، واختبارات المواءمة الخاصة بمخاطر عدم المواءمة

    يشترط إطار الجاهزية إجراء تقييمات لمجالات مخاطر النماذج المتقدمة الرئيسية. مع تجاوز الحدود القصوى وتشبع التقييمات، من المهم تحديث التقييمات باستمرار وضمان تغطيتها وجودتها؛ سواء تلك التي تقيس القدرات في مجالات مخاطر إطار الجاهزية أو تقييمات المواءمة الرامية إلى قياس مخاطر عدم المواءمة الشديدة.

    تشمل الأسئلة ذات الصلة ما يلي:

    1. هل تغطي التقييمات التي تقيس مخاطر إطار الجاهزية تعريف حدود هذه المخاطر بالقدر الكافي؟ هل حُددت الحدود الصحيحة لهذه التقييمات؟

    2. هل تُحدّث التقييمات عندما تحقق النماذج أعلى الدرجات باستمرار، وهل تقيس الاختبارات الجديدة قدرات أكثر تقدمًا بصورة حقيقية؟

    3. هل تغطي تقييمات المواءمة لدينا مخاطر عدم المواءمة الشديدة بالقدر الكافي، وما السلوكيات أو الظروف المهمة التي قد تغفلها؟

  4. تحقيق مستقل في حوادث عدم المواءمة الخطيرة

    يمكن أن يكون التحقيق المستقل مفيدًا في طيف من حوادث سلامة الذكاء الاصطناعي الخطيرة. نركّز هنا على عدم مواءمة النماذج، بما يشمل تصرفها دون تصريح أو تحايلها على الرقابة، وهو ما قد يكشف أوجه ضعف في أساليب المواءمة والضمانات الوقائية حتى في غياب إساءة استخدام متعمدة.

    في ظروف محددة، كما في حادثة OpenAI على Hugging Face، قد يكون من المفيد الاستعانة بجهة خارجية مستقلة لإجراء تحقيقات مستقلة في حوادث عدم المواءمة. من الضروري أن تمتلك الجهات الخارجية المشاركة في التحقيق في الحوادث الخبرة اللازمة، بما يشمل عند الاقتضاء الخبرة في الأدلة الجنائية السيبرانية والمواءمة وتحليل سلسلة الاستدلال على نطاق واسع، فضلًا عن الموظفين والموارد اللازمة لإجراء التحقيق في الوقت المناسب. قد تتطلب الاستجابة للحوادث الوصول إلى بيانات داخلية حساسة وبيانات جهات خارجية، ولذلك قد تكون بعض التفاصيل حساسة من حيث النشر أو الوصول. يمكن لنتائج التحقيقات المستقلة أيضًا أن تدعم حجة سلامة النموذج بتقديم أدلة لتقييم الادعاءات المتعلقة بمواءمته وفعالية التدابير المتخذة لمعالجة حالات عدم المواءمة المرصودة سابقًا.

    في سياق حوادث عدم المواءمة، نعطي الأولوية للتقييمات المستقلة بشأن:

    1. ما سلوك النموذج أو مشكلات عدم المواءمة التي حدثت أثناء الحادثة، وما العوامل الرئيسية المساهمة فيها؟

    2. هل ستحد الضمانات الوقائية وإجراءات المعالجة بفعالية من حوادث مماثلة مستقبلًا؟

مبادئ التقييمات الفعالة

  • ادعاءات محددة النطاق ومتفق عليها للتقييم: ينبغي أن تبدأ التقييمات بنطاق متفق عليه، تليه ادعاءات سلامة واضحة التعريف ومسجّلة مسبقًا قبل بدء أنشطة التقييم. ينبغي للجهات الخارجية والمختبرات توضيح ما إذا كانت الادعاءات مقدمة من الشركة الخاضعة للتقييم، أم أن المقيّم الخارجي يسعى إلى تقييمها بصورة مستقلة ويوافق المختبر على الخضوع للتقييم وفقًا لها. قد تخرج بعض الادعاءات عن النطاق لأسباب عديدة، منها تعذر وصول الجهات الخارجية إلى البيانات، أو افتقار المقيّم إلى الخبرة الكافية، أو وجود قيود زمنية معقولة حين يكون التقييم عاجلًا. ينبغي للمختبرات والمقيّمين وضع آلية للنظر في المخاطر الكبيرة المكتشفة خارج النطاق الأصلي، بما في ذلك تحديد ما إذا كانت تستدعي مزيدًا من التحقيق. ينبغي أن توضح الاستنتاجات ما خضع للتقييم وما لم يخضع له ضمن النطاق المتفق عليه.

  • وصول متناسب: ينبغي تمكين المقيّمين، حيثما أمكن، من مستوى وصول يتناسب مع تقييم الادعاءات المتفق عليها، ضمن القيود القانونية والأمنية وقيود الملكية الفكرية. عندما يتعذر الوصول المباشر أو يكون غير عملي، يمكن للمقيّمين العمل مع ممثل معيّن في الشركة أو استكشاف آليات وصول غير مباشر أو حافظة للخصوصية لحماية المعلومات الأساسية.

  • منهجية ومعايير شفافة: ينبغي للمقيّمين شرح أساليبهم ومعايير التقييم ومواطن عدم اليقين، والاستناد إلى المعايير الراسخة حيثما توفرت. وحين لا تتوفر معايير بعد، ينبغي لهم تقديم مسوغات واضحة للمعايير التي يستخدمونها. ينبغي أن تميّز التقارير بين النتائج المباشرة والتفسيرات، وأن تشرح مواطن عدم اليقين وتوضح الاستنتاجات التي تؤيدها الأدلة.

  • الخبرة والاستقلالية: ينبغي للمقيّمين إثبات امتلاك الخبرة التقنية ذات الصلة، وتحديد تضارب المصالح المؤسسية والفردية والإفصاح عنه ومعالجته، بما يشمل الحوافز المالية والعلاقات مع المطورين والمشاركة السابقة في العمل الخاضع للتقييم. ينبغي تصميم الضمانات بما يكفل عدم تأثير الضغوط التجارية وترتيبات التعويض في النتائج، وقد تشمل التنحي أو فترات استبعاد مناسبة.

  • الأمن والسرية: ينبغي للمقيّمين إثبات اتباع ممارسات لأمن المعلومات وتطبيق تدابير سرية ملزمة تشمل موظفيهم، بما يتناسب مع حساسية الأنظمة والمعلومات التي يصلون إليها. ينبغي أن تشمل هذه التدابير الملكية الفكرية والمعلومات الحساسة وسجلات التقييم. عندما يتعذر على المقيّمين تلبية المتطلبات الأمنية في بيئاتهم، أو تكون البيانات المتاحة شديدة الحساسية، فقد يكون من المناسب إتاحة الوصول عبر أجهزة أو مقار تديرها الشركة.

  • نتائج قابلة للتنفيذ ووقت للمعالجة: ينبغي أن تحدد التقييمات ثغرات بعينها، وأن تقدم تفاصيل كافية تمكّن المختبرات من معالجتها. ينبغي، عند الاقتضاء، منح المختبرات مهلة معقولة لمعالجة المشكلات قبل النشر. ينبغي أيضًا، عند الحاجة، أن توضح التقارير الدروس المستفادة لمطوري الوكلاء والجهات الناشرة والمدافعين، مع توصيات عملية للتنفيذ.

  • ممارسات النشر المسؤولة: ينبغي أن تستند تقارير التقييم إلى الأدلة وأن تُتاح بأكبر قدر ممكن من الانفتاح، مع حماية المعلومات الحساسة والسرية. عندما يتعذر الإفصاح العام الكامل، يمكن للتقارير السرية المقدمة إلى جهات الرقابة المناسبة، مثل هيئات الحوكمة أو مجالس إدارة الشركات، أن تدعم المساءلة. ينبغي وضع ضوابط وسياسات مدروسة لحجب المعلومات الحساسة، وتحديد توقعات واضحة بشأن الملاحظات وتصحيح الأخطاء، حفاظًا على التوازن بين الاستقلالية والسرية. ينبغي للمقيّمين الحفاظ على استقلاليتهم التحريرية، مع ضمان استمرار حماية السرية والملكية الفكرية. وينبغي للمقيّمين اعتماد سياسات واضحة للحجب تتيح للمختبرات طلب حجب المعلومات الحساسة، مع تمكين المقيّمين من الإشارة إلى مواضع التنقيح الجوهري وأثره في تقرير التقييم.

الطريق إلى الأمام

نلتزم بدعم المقيّمين المستقلين ووضع معايير دولية مشتركة وأكثر وضوحًا للتقييمات الخارجية الفعالة، سواء من خلال القوانين المستقبلية أو مؤسسات الحوكمة الخاصة. ومع أن منظومة التقييم المستقل لا تزال في طور النمو، فسندعم نموها بالعمل مع مجتمع متنوع من المقيّمين المستقلين ذوي الخبرة العميقة في مسائل سلامة النماذج الرائدة ودعمهم. لا تستطيع أي جهة خارجية منفردة، ولا ينبغي لها، تغطية المسائل الملحّة المتعلقة بسلامة النماذج الرائدة تغطية شاملة. سنتقدم بتأنٍ ووعي لتنمية قدراتنا وتمكين منظومة الجهات الخارجية المتنامية من التوافق على أفضل الممارسات والمبادئ. نجري حوارات مع جهات خارجية متعددة بشأن مقترحات تتوافق مع مجالات الأولوية المذكورة أعلاه.