تخطي إلى المحتوى الرئيسي
OpenAI

30 سبتمبر 2026

الأمان

إحباط حملة منسّقة لتقطير النماذج

جاري التحميل...

رصدنا مؤخرًا حملة منسّقة تهدف إلى استخراج الاستدلال المحمي من نماذجنا وأحبطناها، وكان أول نشاط رصدناه قد وقع في الأسبوع الأول من يوليو. يتوافق هذا النشاط مع التقطير العدائي: أي الاستخدام المنهجي وغير المصرّح به لمخرجات نموذج أو استدلاله للمساعدة في تدريب نموذج آخر أو استنساخه أو تحسينه. الاستدلال المحمي هو السجل الداخلي للخطوات التي يتّبعها النموذج لإنجاز مهمة؛ وقد يكشف استخراجه عن معلومات حُجبت عن الإجابة النهائية، ويساعد الآخرين على استنساخ قدرات النموذج.

لم يخترق منفّذو الحملة تشفيرنا، ولم يخترقوا أي قاعدة بيانات، ولم يصلوا مباشرةً إلى محادثات المستخدمين المخزّنة. بل تلاعبوا بالتفاعلات مع النماذج لإعادة إظهار الاستدلال المحمي بصيغ مرئية لمقدّم الطلب، على نحو منسّق وواسع النطاق يخالف شروط الخدمة لدينا. ولا يمثّل هذا التلاعب ثغرة تقتصر على نماذج OpenAI، وقد شاركنا معلومات عنه مع شركاء القطاع عبر منتدى النماذج الرائدة لتعزيز الدفاعات المشتركة ضد التقطير العدائي.

قبل النشر، حقّقنا في نطاق النشاط وتأثيره المحتمل، وطبّقنا تدابير التخفيف الخاصة بنا، وشاركنا المعلومات مع باحثين وشركاء في القطاع وتلقّينا ملاحظاتهم لضمان توافر وسائل حماية من هذا النوع من الهجمات. ولا تزال أعمال التحقيق واتخاذ مزيد من تدابير التخفيف مستمرة. نعتقد أن مشاركة ما تعلّمناه الآن ستساعد منظومة الذكاء الاصطناعي الأوسع على تعزيز دفاعاتها.

ما رصدناه

رصدنا محاولات منفّذي الحملة لاستخراج الاستدلال المحمي بطرق مبتكرة، منها نسخ الاستدلال المشفّر من محادثة، ثم مطالبة نموذج في محادثة أخرى بفك تشفير محتوى الاستدلال المخفي وكتابته نصيًا.

كما نبّهنا باحثون أمنيون مستقلون⁠(يفتح في نافذة جديدة)، عبر الإفصاح المسؤول، إلى ثغرات ذات صلة تمتد عبر نماذج مختلفة وترتبط بتكثيف السياق في المحادثات. حقّقنا في نتائجهم وأكّدنا أن مسارات الهجوم التي حدّدوها حقيقية. ساعدنا عملهم على فهم الفئة الأوسع التي تندرج ضمنها هذه الهجمات، وتسريع تطبيق تدابير التخفيف.

بدأ النشاط في الأول من يوليو بحجم محدود، إلى أن رصدنا ارتفاعًا حادًا في 24 و25 يوليو بلغ 16,000 طلب1 من أكثر من 4,000 مستخدم، باستخدام نمط استخراج ذي صلة. وكشفت تحقيقات إضافية عن نشاط يستخدم أنماط مطالبات ذات صلة لدى مجموعة تضم أكثر من 15,000 مستخدم، وقد أوقفنا هذا النشاط بالكامل بحلول 28 يوليو.

تطوّر النشاط بمرور الوقت، مما يؤكّد أن التقطير العدائي تحدٍّ أمني أوسع يتطلّب دفاعات متعددة الطبقات وقابلة للتكيّف.

تقييمنا للجهات المسؤولة

ليس من الواضح ما إذا كان جميع المنفّذين الذين رصدناهم خلال الفترة المعنية يتبعون جهة واحدة. لكننا ننسب مجموعة أساسية من هذا النشاط إلى أفراد مرتبطين بشركة Moonshot AI، مطوّرة Kimi.

أهمية هذا الأمر

يشكّل التقطير العدائي مخاطر على السلامة والأمن القومي. فقد يُستخدم الاستدلال المستخرَج لتدريب نموذج آخر من دون الحفاظ على ضمانات السلامة المطبّقة على مخرجات النموذج الأصلي التي تُعرض للمستخدمين. وعلى نطاق واسع، قد يسرّع التقطير أيضًا نقل القدرات المتقدمة من دون الحاجة إلى استثمار مماثل في السلامة. وتزداد هذه المخاوف مع اكتساب النماذج قدرات في مجالات الاستخدام المزدوج.

ولا يقتصر هذا الخطر على OpenAI. فكما أشرنا أعلاه، قد تؤثّر تقنيات مماثلة في أنظمة ذكاء اصطناعي متقدمة أخرى، مما يجعل هذا تحدّيًا أمنيًا مشتركًا يتطلّب التنسيق على مستوى القطاع.

كيف استجبنا

حدَدْنا من أثر حملة التقطير الأخيرة هذه عبر مزيج من إجراءات إنفاذ السياسات على الحسابات، والضوابط التقنية، والتنسيق مع الشركاء. حظرنا الحسابات الاحتيالية أو قيّدناها، وعزّزنا ضوابط التسجيل والبنية التحتية، ووسّعنا مراقبة الشبكات ذات الصلة.

وعزّزنا أيضًا حماية الاستدلال المخفي على مستوى المستخدمين ومساحات العمل والمؤسسات وعائلات النماذج. أغلقنا مسارًا كان يتيح لمن يملك مسبقًا الاستدلال المشفّر لمستخدم آخر إعادة تمريره واسترجاع محتواه، وأضفنا فحوصًا لرصد المخرجات المتدفقة التي قد تكشف الاستدلال وإيقافها مؤقتًا. وعندما انتقل النشاط المرتبط بالحملة إلى خدمات جهات خارجية، عملنا مع مقدّمي تلك الخدمات لتحديد الحسابات المعنية وتعطيل نشاطها.

وأخيرًا، شاركنا النتائج ذات الصلة عبر منتدى النماذج الرائدة والقنوات الحكومية المناسبة لتبادل المعلومات، حتى يتمكّن مطوّرو النماذج الرائدة الآخرون وشركاء القطاع العام من البحث عن نشاط مماثل وتعزيز دفاعاتهم. وقد تواجه الأنظمة التي تدعم عناصر استدلال قابلة للنقل أو إعادة الاستخدام مخاطر ذات صلة.

الخطوات المقبلة

نتوقّع أن تزداد محاولات التقطير العدائي تطوّرًا مع تحسّن النماذج الرائدة وسعي الجهات المنفّذة إلى إيجاد طرق أقل تكلفة لمحاكاة قدراتها. يتطلّب التصدي لهذا النشاط ضوابط متعددة الطبقات وتكيّفًا مستمرًا.

ولم ينتهِ هذا العمل بعد. تحتاج عمليات النشر التي يستضيفها الشركاء إلى وسائل الحماية نفسها المطبّقة على الخدمات التي نقدمها مباشرةً، كما تتطلّب هجمات مخرجات الأدوات وسائل حماية تفحص ما يتجاوز النصوص المرئية المعتادة. ونواصل تحسين دفاعات الأدوات، وتوسيع نطاق تغطية المصنّفات، وتحسين آليات رفض النماذج للطلبات، وتعميم الضوابط ذات الصلة على شركائنا في الخدمات السحابية.

ستواصل استجابتنا التركيز على ثلاثة محاور: تعزيز الحماية التقنية من الاستخراج، وتحسين رصد الحملات المنسّقة وإنفاذ السياسات ضدها، وتوسيع تبادل معلومات التهديدات بين القطاع والجهات الحكومية.

المؤلف

OpenAI

الحواشي

  1. 1

    تعبّر هذه الأرقام عن محاولات استخراج، وليس بالضرورة عن عمليات استخراج ناجحة.