مرکزی مواد پر جائیں
OpenAI

۳۰ ستمبر، ۲۰۲۶

سیکیورٹی

ماڈل کی تقطیر کی ایک مربوط مہم میں خلل ڈالنا

لوڈ ہو رہا ہے…

ہم نے حال ہی میں ایک مربوط مہم کی نشان دہی کرکے اس کا سدباب کیا، جس کا مقصد ہمارے ماڈلز سے محفوظ ریزننگ نکالنا تھا. اس مہم کی سرگرمی پہلی بار جولائی کے پہلے ہفتے میں دیکھی گئی تھی. یہ سرگرمی مخالفانہ تقطیر کے زمرے میں آتی ہے: یعنی کسی دوسرے ماڈل کو تربیت دینے، اس کی نقل تیار کرنے یا اسے بہتر بنانے کے لیے ایک ماڈل کے جوابات یا ریزننگ کا منظم اور غیر مجاز استعمال. محفوظ ریزننگ کسی کام کو انجام دینے کے دوران ماڈل کی سوچ کے مراحل کا اندرونی ریکارڈ ہوتی ہے. اسے نکالنے سے ایسی معلومات سامنے آ سکتی ہیں جو حتمی جواب میں شامل نہیں کی گئیں، اور اس سے دوسروں کو ماڈل کی صلاحیتوں کی نقل تیار کرنے میں مدد مل سکتی ہے.

یہ سرگرمی انجام دینے والوں نے نہ تو ہماری خفیہ کاری توڑی، نہ کسی ڈیٹابیس میں نقب لگائی، اور نہ ہی صارفین کی محفوظ کردہ گفتگوؤں تک براہ راست رسائی حاصل کی. اس کے بجائے، انہوں نے ماڈل کے ساتھ تعامل میں اس طرح ردوبدل کیا کہ محفوظ ریزننگ درخواست گزار کو دکھائی دینے والی صورتوں میں دوبارہ پیش ہو سکے. یہ کام مربوط انداز میں اور بڑے پیمانے پر کیا گیا، جو ہماری شرائطِ خدمت کی خلاف ورزی تھی. اس طرح کے ردوبدل کی گنجائش صرف OpenAI کے ماڈلز کی کمزوری نہیں ہے. ہم نے مخالفانہ تقطیر کے خلاف اجتماعی دفاع کو مضبوط بنانے کے لیے فرنٹیئر ماڈل فورم کے ذریعے صنعت کے شراکت داروں کو اس کے بارے میں معلومات فراہم کی ہیں.

یہ معلومات شائع کرنے سے پہلے ہم نے اس سرگرمی کے دائرے اور ممکنہ اثرات کی تحقیق کی، اپنے حفاظتی اقدامات نافذ کیے، اور محققین اور صنعت کے شراکت داروں کے ساتھ معلومات کا تبادلہ کرکے ان کی رائے لی، تاکہ اس نوعیت کے حملے کے خلاف تحفظات کی موجودگی یقینی بنائی جا سکے. مزید حفاظتی اقدامات اور تحقیقات کا کام جاری ہے. ہمارا خیال ہے کہ اب تک حاصل شدہ معلومات عام کرنے سے اس شعبے سے وابستہ دیگر اداروں کو اپنا دفاع مضبوط بنانے میں مدد ملے گی.

ہم نے کیا دیکھا

ہم نے دیکھا کہ یہ سرگرمی انجام دینے والوں نے محفوظ ریزننگ نکالنے کے نئے طریقے آزمائے. ان میں ایک گفتگو سے رمزبند ریزننگ نقل کرنا اور پھر دوسری گفتگو میں ماڈل سے اس پوشیدہ ریزننگ کو رمزکش کرکے تحریری صورت میں پیش کرنے کو کہنا بھی شامل تھا.

آزاد سلامتی محققین⁠(نئی ونڈو میں کھلتا ہے) نے بھی ذمہ دارانہ اطلاع دہی کے ذریعے مختلف ماڈلز کے درمیان تعامل اور گفتگو کی کمپیکشن سے متعلق کمزوریوں کی طرف ہماری توجہ دلائی. ہم نے ان کی دریافتوں کی تحقیق کی اور تصدیق کی کہ حملے کے جن راستوں کی انہوں نے نشان دہی کی تھی، وہ واقعی موجود تھے. ان کے کام سے ہمیں اس وسیع تر زمرے کے حملوں کو سمجھنے اور حفاظتی اقدامات تیزی سے نافذ کرنے میں مدد ملی.

یہ سرگرمی یکم جولائی کو شروع ہوئی اور ابتدا میں اس کا حجم کم تھا. پھر 24 اور 25 جولائی کو ہم نے اس میں تیز اضافہ دیکھا، جب 4,000 سے زیادہ صارفین نے متعلقہ طریقے سے معلومات نکالنے کے لیے 16,000 درخواستیں1 بھیجیں. مزید تحقیق سے 15,000 سے زیادہ صارفین کے ایک گروہ میں متعلقہ پرومپٹ طرز کی سرگرمی کی نشان دہی ہوئی، جسے ہم نے 28 جولائی تک مکمل طور پر روک دیا.

وقت کے ساتھ اس سرگرمی کی شکل بدلتی رہی، جس سے اس بات کی مزید تائید ہوتی ہے کہ مخالفانہ تقطیر سلامتی کا ایک وسیع تر چیلنج ہے اور اس کے لیے کثیر سطحی دفاع درکار ہے جو بدلتے حالات کے مطابق ڈھل سکے.

ذمہ داروں کے تعین کے بارے میں ہمارا جائزہ

یہ واضح نہیں ہے کہ متعلقہ مدت میں جن افراد کو ہم نے یہ سرگرمی کرتے دیکھا، آیا وہ سب کسی ایک ہی فریق سے وابستہ تھے. تاہم، ہمارے جائزے کے مطابق اس سرگرمی کا ایک مرکزی حصہ کیمی تیار کرنے والی کمپنی مون شاٹ اے آئی سے وابستہ افراد نے انجام دیا.

یہ کیوں اہم ہے

مخالفانہ تقطیر سے حفاظت اور قومی سلامتی کو خطرات لاحق ہوتے ہیں. نکالی گئی ریزننگ کسی دوسرے ماڈل کی تربیت میں استعمال کی جا سکتی ہے، جبکہ ان حفاظتی اقدامات کو برقرار نہ رکھا جائے جو اصل ماڈل کے صارفین کو دکھائی دینے والے جوابات پر لاگو تھے. بڑے پیمانے پر تقطیر جدید صلاحیتوں کی منتقلی کو بھی تیز کر سکتی ہے، جبکہ حفاظت پر اتنی ہی سرمایہ کاری کرنا ضروری نہیں رہتا. جیسے جیسے ماڈلز ایسے شعبوں میں صلاحیتیں حاصل کرتے ہیں جن کا استعمال مفید اور نقصان دہ دونوں مقاصد کے لیے ہو سکتا ہے، یہ خدشات بڑھتے جاتے ہیں.

یہ خطرہ صرف OpenAI تک محدود نہیں ہے. جیسا کہ اوپر بتایا گیا ہے، اسی طرح کی تکنیکیں مصنوعی ذہانت کے دیگر جدید نظاموں کو بھی متاثر کر سکتی ہیں. اس لیے یہ سلامتی کا ایک مشترکہ چیلنج ہے جس سے نمٹنے کے لیے پوری صنعت میں باہمی تعاون درکار ہے.

ہم نے کیا اقدامات کیے

ہم نے اکاؤنٹس کے خلاف کارروائی، تکنیکی ضوابط اور شراکت داروں کے ساتھ تعاون کے ذریعے تقطیر کی اس حالیہ مہم کا اثر کم کیا. ہم نے دھوکہ دہی میں ملوث اکاؤنٹس بند کیے یا ان پر پابندیاں لگائیں، اندراج اور بنیادی ڈھانچے سے متعلق ضوابط مضبوط کیے، اور متعلقہ نیٹ ورکس کی نگرانی بڑھائی.

ہم نے صارفین، کام کی جگہوں، تنظیموں اور ماڈلز کے مختلف خاندانوں میں پوشیدہ ریزننگ کے تحفظ کو بھی مضبوط کیا. ہم نے ایک ایسا راستہ بند کیا جس کے ذریعے کوئی شخص، جس کے پاس پہلے سے کسی دوسرے صارف کی رمزبند ریزننگ موجود ہو، اسے دوبارہ نظام کو بھیج کر اس کا مواد حاصل کر سکتا تھا. ہم نے ایسی جانچ بھی شامل کی جو بتدریج جاری ہونے والے جواب میں ریزننگ ظاہر ہونے کے امکان کو پہچان کر اسے روک سکے. جب متعلقہ سرگرمی تیسرے فریق کی خدمات کے ذریعے ہونے لگی تو ہم نے ان خدمات کے فراہم کنندگان کے ساتھ مل کر ملوث اکاؤنٹس کی نشان دہی کی اور ان کی سرگرمی روکی.

آخر میں، ہم نے فرنٹیئر ماڈل فورم اور معلومات کے تبادلے کے مناسب سرکاری ذرائع سے متعلقہ نتائج فراہم کیے، تاکہ جدید ترین ماڈلز تیار کرنے والے دیگر ادارے اور سرکاری شعبے کے شراکت دار ایسی سرگرمی کا سراغ لگا سکیں اور اپنا دفاع مضبوط بنا سکیں. ایسے نظام بھی متعلقہ خطرات کا سامنا کر سکتے ہیں جو ریزننگ کے ریکارڈ کو منتقل کرنے یا دوبارہ استعمال کرنے کی سہولت دیتے ہیں.

آگے کیا ہوگا

ہمیں توقع ہے کہ جیسے جیسے جدید ترین ماڈلز بہتر ہوں گے اور مختلف فریق ان کی صلاحیتوں کی نقل تیار کرنے کے سستے طریقے تلاش کریں گے، مخالفانہ تقطیر کی کوششیں بھی زیادہ پیچیدہ ہوتی جائیں گی. اس سرگرمی سے دفاع کے لیے کثیر سطحی ضوابط اور حالات کے مطابق مسلسل تبدیلی درکار ہے.

یہ کام ابھی مکمل نہیں ہوا ہے. شراکت داروں کے نظاموں پر چلنے والی خدمات کو بھی وہی تحفظ درکار ہے جو ہماری اپنی خدمات کو حاصل ہے. اس کے علاوہ، آلات کے نتائج کے ذریعے ہونے والے حملوں کے خلاف ایسے تحفظات ضروری ہیں جو عام نظر آنے والے متن کے علاوہ دیگر مواد کی بھی جانچ کریں. ہم آلات کے دفاع، درجہ بندی کرنے والے نظاموں کے دائرۂ کار، اور ماڈلز کی جانب سے نامناسب درخواستیں مسترد کرنے کی صلاحیت کو بہتر بنا رہے ہیں، اور متعلقہ ضوابط کو کلاؤڈ شراکت داروں کے ہاں بھی نافذ کر رہے ہیں.

ہمارے اقدامات آئندہ بھی تین شعبوں پر مرکوز رہیں گے: معلومات نکالنے کے خلاف زیادہ مضبوط تکنیکی تحفظات، مربوط مہمات کی بہتر نشان دہی اور ان کے خلاف مؤثر کارروائی، اور صنعت و حکومت کے درمیان خطرات سے متعلق معلومات کا مزید وسیع تبادلہ.

مصنف

OpenAI

حواشی

  1. 1

    یہ اعداد و شمار معلومات نکالنے کی کوششوں کو ظاہر کرتے ہیں، ضروری نہیں کہ یہ کوششیں کامیاب رہی ہوں.