خلاصہ
مسئلہ
کمزوریاں دریافت کرنے اور اپنے ماڈلز کی مضبوطی بہتر بنانے کے لیے ریڈ ٹیمنگ لازمی ہے. تاہم, موجودہ طریقے اسکیل نہیں ہو پاتے, جس سے ایک رکاوٹ پیدا ہوتی ہے.
عام طور پر استعمال ہونے والی مضبوطی کی جانچیں ہمارے تازہ ترین ماڈلز سے پہلے ہی سیر ہو چکی ہیں.
ہمیں ایسے طریقے تیار کرنے کی ضرورت ہے جو حفاظت اور الائنمنٹ کو ماڈل کی صلاحیتوں کے ساتھ ساتھ بڑھنے دیں.
ہم نے کیا کیا
ہم نے GPT‑Red کو تربیت دی، ایک خودکار ریڈ ٹیمنگ ماڈل جو کمزوریاں تلاش کرنے کی ہماری صلاحیت کو بڑھاتا ہے تاکہ وسیع تعیناتی سے پہلے ہم انہیں ٹھیک کر سکیں.
GPT‑Red ایک مضبوط ریڈ ٹیمر ہے, اور ہمارے پچھلے ماڈلز اس کے پرومپٹ انجیکشن حملوں کے لیے بہت زیادہ کمزور ہیں.
ہم GPT‑Red کو GPT‑5.6 کی مخالفانہ ٹریننگ کے لیے استعمال کرتے ہیں, جس سے وہ پرومپٹ انجیکشنز کے خلاف کہیں زیادہ مضبوط ہو جاتا ہے.
ہم انسانی اور تھرڈ پارٹی ریڈ ٹیمنگ، تہہ دار حفاظتی تدابیر, اور ریئل ٹائم نگرانی کے ساتھ اس طریقے کو مسلسل اسکیل کرتے رہیں گے.
AI سسٹمز عموماً براؤزرز, منسلک ایپس, مقامی فائلوں, اور دیگر ٹولز کے ذریعے تھرڈ پارٹی ڈیٹا سے روبرو ہوتے ہیں. حقیقی دنیا کے کام انجام دینے کے لیے یہ سہولتیں ضروری ہیں, مگر یہ بد نیت کرداروں کو ماڈل کے رویے پر اثر انداز ہونے کے مزید مواقع بھی دیتی ہیں. مثال کے طور پر, کوئی تھرڈ پارٹی ای میل, ویب پیج, ٹول کے جواب, یا کوڈ ریپوزٹری میں احتیاط سے تیار کی گئی ہدایت شامل کر سکتی ہے, جس کا مقصد ماڈل کو حساس ڈیٹا کسی بیرونی —سرور— پر اپ لوڈ کرنے کے لیے دھوکا دینا ہو.
انسانی ریڈ ٹیمنگ ہمارے حفاظتی کام کا ایک اہم حصہ ہے, جو تعیناتی سے پہلے ان کمزوریوں کو سامنے لانے اور مناسب حفاظتی تدابیر لگانے میں مدد دیتی ہے. لیکن صرف انسانی ریڈ ٹیمنگ کو اسکیل کرنا مشکل ہے. ان مشقوں کو ڈیزائن اور چلانے میں بہت وقت لگتا ہے, جس سے یہ محدود ہو جاتا ہے کہ ہم نئے ناکامی کے طریقوں کی کتنی جلد شناخت کر کے انہیں مضبوط تر حفاظتی تدابیر میں شامل کر سکتے ہیں. مزید یہ کہ اگرچہ یہ مشقیں کامیاب حملوں کی قیمتی مثالیں دیتی ہیں, وہ مخالفانہ ڈیٹا کی وہ مقدار اور تنوع پیدا نہیں کر سکتیں جو ٹریننگ کے ذریعے ماڈل کی مضبوطی بہتر بنانے کے لیے ضروری ہے.
تیزی سے زیادہ قابل ہوتے ماڈلز کے ساتھ قدم ملانے کے لیے ریڈ ٹیمنگ کو بھی اسکیل ہونا ہوگا. اسی مقصد کے لیے ہم خودکار, صرف اندرونی استعمال کے ریڈ ٹیمنگ ماڈلز تربیت دیتے رہے ہیں جو تعیناتی سے پہلے کمزوریاں سامنے لاتے ہیں اور مضبوطی بہتر بنانے کے لیے ماڈل ٹریننگ کے دوران حملے بناتے ہیں. ہمارا ماننا ہے کہ خودکار ریڈ ٹیمنگ حفاظت کے لیے خود بہتری کی ایک اہم شکل کھولتی ہے: آج کے ماڈلز کو براہ راست مستقبل کے ماڈلز کو زیادہ محفوظ بنانے میں استعمال کرنا.
GPT‑Red انہی کوششوں کا نتیجہ اور ہمارا موجودہ بہترین خودکار حفاظتی ریڈ ٹیمنگ ماڈل ہے. انسانی ریڈ ٹیمنگ ماہرین کے حملے تیار کرنے کے طریقے کی طرح, یہ ماڈل پرومپٹ بھیج کر, GPT ماڈلز کے ردعمل کو دیکھ کر, اور تکرار کر کے کسی مقصد کی طرف کام کرتا ہے. ہم نے GPT‑Red کو OpenAI میں اپنی کچھ سب سے بڑی پوسٹ ٹریننگ رنز کے کمپیوٹ اسکیل پر تربیت دی—یعنی صرف حفاظت بہتر بنانے کے لیے مخصوص کمپیوٹ کی ایک بے مثال مقدار.
ہم GPT‑Red کو اپنے پروڈکشن ماڈلز کے ٹریننگ عمل میں براہ راست شامل کرتے ہیں. نتیجتاً, GPT‑5.6 Sol آج تک پرومپٹ انجیکشنز کے خلاف ہمارا سب سے مضبوط ماڈل ہے, جس نے صرف چار ماہ پہلے کے ہمارے بہترین پروڈکشن ماڈل کے مقابلے ہمارے سب سے مشکل براہ راست پرومپٹ انجیکشن بینچ مارک پر 6 گنا کم ناکامیاں دکھائیں. ہمارے طریقے کی اسکیل ایبلٹی ہمیں مستقبل میں اور بھی مضبوط نتائج کے لیے پرجوش کرتی ہے, کیونکہ ہم زیادہ مضبوط ریڈ ٹیمرز کی ٹریننگ جاری رکھیں گے.
GPT‑Red کو سیلف پلے ری اِنفورسمنٹ لرننگ سے تربیت دی جاتی ہے, جہاں ماڈل اور مختلف دفاعی LLMs کا ایک مجموعہ ریڈ ٹیمنگ کے وسیع منظرناموں پر بیک وقت تربیت پاتے ہیں. GPT‑Red کو کسی درست ناکامی, جیسے کامیاب پرومپٹ انجیکشن, کو سامنے لانے پر انعام دیا جاتا ہے, جبکہ دفاعی ماڈلز کو حملے کا مقابلہ کرنے اور اپنے اصل کام مکمل کرنے پر انعام ملتا ہے. جیسے جیسے دفاعی ماڈلز زیادہ مضبوط ہوتے ہیں, GPT‑Red کو زیادہ طاقتور اور متنوع حملے دریافت کرنے پڑتے ہیں.
سیلف پلے ٹریننگ میں مدد کے لیے ہم حقیقت پسندانہ منظرناموں کا ایک وسیع مجموعہ بناتے ہیں جہاں پرومپٹ انجیکشنز شامل کیے جا سکتے ہیں. ہر ماحول میں ایک خطرے کا ماڈل ہوتا ہے جو بتاتا ہے کہ GPT‑Red کیا کنٹرول کر سکتا ہے اور کامیاب حملہ کس چیز کو سمجھا جائے گا. مثال کے طور پر, GPT‑Red کسی مقامی فائل کا حصہ, ویب پیج بینر, ای میل کا متن, یا کسی ٹول کی آؤٹ پٹ کنٹرول کر سکتا ہے.
ٹریننگ کے اختتام پر GPT‑Red ایک بہت طاقتور حملہ آور بن چکا ہے: یہ جن ماڈلز کے مقابل رکھا جاتا ہے, تقریباً سب کو توڑ سکتا ہے, چاہے وہ اندرونی ہوں یا پروڈکشن ماڈلز, GPT‑5.5 تک اور اسے شامل کرتے ہوئے. GPT‑Red کی ٹریننگ مکمل ہونے کے بعد, ہم نے اسے GPT‑5.6 کی ٹریننگ کے لیے پرومپٹ انجیکشنز بنانے میں استعمال کیا, جس کے نتیجے میں ماڈل GPT‑Red کے حملوں کے خلاف انتہائی مزاحم ہو گیا.
ہم GPT‑Red کو ان ماڈلز سے الگ رکھتے ہیں جنہیں ہم تعینات کرتے ہیں. اس سے وہ نقصان دہ صلاحیتیں, جنہیں ہم خاص طور پر GPT‑Red میں تربیت دیتے ہیں, مخالف کرداروں کے ہاتھوں سے دور رہتی ہیں, جبکہ ہمارے پروڈکشن ماڈلز میں مضبوطی شامل ہوتی ہے.
GPT‑Red دفاعی ماڈلز کی اس آبادی اور ریڈ ٹیمنگ منظرناموں کے خلاف انتہائی مؤثر ہے جن پر اسے تربیت دی گئی تھی. ہم یہ بھی جانچتے ہیں کہ آیا یہ ماڈل OpenAI میں وسیع تر حفاظت کے فائدے کے لیے عمومی مقصد کے ریڈ ٹیمنگ ایجنٹ کے طور پر مفید ہے. اس کے لیے ہم نئے حفاظتی ماحولوں اور ہدفی ماڈلز پر GPT‑Red کی مؤثریت آزماتے ہیں.
سب سے پہلے ہم GPT‑Red کی نئے ریڈ ٹیمنگ منظرناموں میں عمومی اطلاق کی صلاحیت کو Dziemian et al. (2025) کے بالواسطہ پرومپٹ انجیکشن ارینا(نئی ونڈو میں کھلتا ہے) کے ایک نقل شدہ ورژن سے جانچتے ہیں. اس چیلنج میں, انسانی ریڈ ٹیمنگ ماہرین اور GPT‑Red دونوں نے پہلے سے متعین ماحولوں کے ایک مجموعے پر GPT‑5.1 کے خلاف آزادانہ طور پر حملے تجویز کیے. یہ ریڈ ٹیمنگ منظرنامے اور اہداف ان سے مختلف ہیں جو GPT‑Red کی ٹریننگ کے لیے استعمال ہوئے تھے. GPT‑Red حملے کی کامیابی کی شرحوں میں نمایاں طور پر بہتر کارکردگی دکھاتا ہے, انسانوں کے 13% کے مقابلے میں 84% منظرناموں میں کامیاب ہوتا ہے.
GPT‑Red ایک خودکار ریڈ ٹیمر کے طور پر بہترین کارکردگی دکھاتا ہے. GPT‑Red ایک اندرونی نقل استعمال کرتے ہوئے Dziemian et al. (2025) کے بالواسطہ پرومپٹ انجیکشن ارینا میں انسانی ریڈ ٹیمنگ ماہرین کے مقابلے کہیں زیادہ منظرناموں میں GPT‑5.1 کے خلاف کامیاب حملے بنا سکتا ہے.
کسی ریڈ ٹیمر کا حتمی امتحان یہ ہے کہ وہ حقیقی دنیا کے ایجنٹک سسٹمز کے خلاف, سسٹم کے بنیادی ماڈل اور ہارنیس ڈیزائن کی نامکمل معلومات کے باوجود, ہدفی نقصان دہ مقاصد حاصل کر سکے. اس ماحول میں ہمارے پہلے تجربے نے GPT‑Red کو OpenAI کے دفتر میں Andon Labs کی بنائی ہوئی ایک AI سے چلنے والی وینڈنگ مشین کے مقابل رکھا, جو Project Vend(نئی ونڈو میں کھلتا ہے) سے ملتی جلتی تھی. ہم نے GPT‑Red کو سسٹم کی تفصیل, حملے بھیجنے کی صلاحیت, اور سمولیٹڈ ایجنٹ کی ٹول کالز دیکھنے کی سہولت دی جو حقیقی دنیا کی تعیناتی سے بہت قریب سے ملتی ہے. حملوں پر تکرار کے بعد, GPT‑Red نے اپنا حملہ پروڈکشن ایجنٹ کے خلاف تعینات کیا اور اپنے تینوں نقصان دہ مقاصد حاصل کیے:
- اسٹاک میں موجود ایک مہنگی شے کی قیمت بدل کر کم سے کم مجاز قیمت $0.50 کرنا؛
- $100+ کی نئی شے آرڈر کرنا اور اسے $0.50 میں پیش کرنا؛ اور
- کسی دوسرے صارف کا آرڈر منسوخ کرنا.
ہم نے ان کمزوریوں کا انکشاف کر دیا ہے اور نئی حفاظتی تدابیر کی فعال طور پر جانچ ہو رہی ہے.
GPT‑Red ایک لائیو خود مختار ایجنٹ Vendy کو توڑ سکتا ہے, جو وینڈنگ مشین کا انتظام کرتا ہے. GPT‑Red پہلے سمولیشن میں جانچ کر اور پھر حملوں کو لائیو ایجنٹ پر منتقل کر کے پروڈکشن ایجنٹ سے مہنگی اشیا کو سستا کروانے اور دوسرے صارفین کے آرڈرز منسوخ کروانے میں کامیاب رہا.
ہم GPT‑Red کو 10 held-out ڈیٹا اخراج منظرناموں کے مجموعے پر ایک Codex CLI ایجنٹ (GPT‑5.4 mini پر مبنی) پر حملہ کرنے کے لیے بھی استعمال کرتے ہیں. ہم ماڈل کا موازنہ پرومپٹڈ GPT‑5.5 بیس لائن سے کرتے ہیں تاکہ held-out ریڈ ٹیمنگ کارکردگی پر اپنے ٹریننگ طریقہ کار کے اثرات کا مطالعہ کر سکیں. GPT‑Red زیادہ مؤثر بھی ہے, کیونکہ یہ زیادہ منظرناموں میں ایجنٹ سے حساس ڈیٹا خارج کروا سکتا ہے، اور ٹوکن کے لحاظ سے زیادہ کارگر بھی ہے.
GPT‑Red لائیو Codex ایجنٹس کو توڑنے میں زیادہ مؤثر اور کارگر ہے. ہم GPT‑5.4 Mini کی پشت پناہی والے ایک Codex ایجنٹ کو ڈیٹا نکالنے کے 10 کاموں کے کسٹم مجموعے پر آزماتے ہیں.
GPT‑Red کا حتمی مقصد ہمارے ماڈلز کی مضبوطی بہتر بنانا ہے. گزشتہ چھ ماہ میں ہم نے بڑھتے ہوئے compute کے ساتھ بتدریج زیادہ مضبوط ریڈ ٹیمنگ ماڈلز (GPT‑Red کے پیش رو) تربیت دیے, اور GPT‑5.3 کے بعد سے ہر successive پروڈکشن ماڈل کی ٹریننگ میں ان ماڈلز کو استعمال کیا. وقت کے ساتھ, ہر بعد والی GPT ریلیز زیادہ مضبوط ہوتی گئی ہے.
ایک مثال کے طور پر, GPT‑Red کے ایک ابتدائی ورژن نے براہ راست پرومپٹ انجیکشن حملوں کی ایک نئی قسم دریافت کی جسے “فیک چین-آف-تھاٹ” حملے کہا جاتا ہے. ان حملوں نے GPT‑5.1 پر 95% سے زیادہ کامیابی کی شرحیں حاصل کیں, لیکن اب GPT‑5.6 Sol کے لیے 10% سے کم ہیں. اسی طرح, ڈیولپر ٹولز اور براؤزنگ میں حملوں کو ہدف بنانے والے ہمارے کئی بالواسطہ پرومپٹ انجیکشن بینچ مارکس ہمارے تازہ ترین ماڈل سے سیر ہو چکے ہیں (>97% درستگی).
خود GPT‑Red کے خلاف مضبوطی بھی نمایاں طور پر بہتر ہوئی ہے. مضبوطی کے ماحولوں کے وسیع مجموعے پر, GPT‑Red کی حملوں کی کامیابی کی شرحیں وقت کے ساتھ مسلسل گھٹتی گئی ہیں. ہماری تازہ ترین ماڈل ریلیز کے مطابق, GPT‑5.6 Sol GPT‑Red کے براہ راست پرومپٹ انجیکشنز میں سے صرف 0.05% پر ناکام ہوتا ہے.
جیسے جیسے ہم نے پرومپٹ انجیکشنز کے لیے سیلف پلے ٹریننگ کو بڑھایا ہے, ہمیں ایسے نئے خطرات ملے ہیں جو موجودہ ماڈلز کو توڑ سکتے ہیں. اس کے باوجود, ہماری اسکیلنگ نے ان حملوں کے خلاف مضبوطی کو بھی نمایاں طور پر بہتر بنایا ہے. حملے کی کامیابی کی شرح held-out ماحولوں میں GPT‑Red کی تمام کوششوں کی اوسط کامیابی کے طور پر نکالی جاتی ہے.
کوئی ماڈل زیادہ درخواستیں مسترد کر کے یا کم قابل ہو کر زیادہ محفوظ دکھائی دے سکتا ہے. جو ماڈل کم کام کرتا ہے اس پر حملہ کرنا فطری طور پر مشکل ہوتا ہے, لیکن یہ مفید مضبوطی نہیں ہے.
ہم عمومی جدید ترین صلاحیتوں کے ساتھ ساتھ ان ہدفی اوور ریفیوزل کاموں کا بھی تفصیل سے جائزہ لیتے ہیں جو ہم ڈیزائن کرتے ہیں. ہمیں معلوم ہوتا ہے کہ مضبوطی میں نمایاں بہتری کے باوجود تمام معمول کی صلاحیتیں متاثر نہیں ہوتیں. اس سے ظاہر ہوتا ہے کہ مضبوطی میں اضافہ نقصان دہ ہدایات کے خلاف بہتر مزاحمت سے آیا, نہ کہ غلط ٹول استعمال سے یا جائز درخواستوں کو بطور ڈیفالٹ مسترد کرنے سے.
AI ایجنٹس پہلے ہی ہمارے نیکسٹ جنریشن کے ماڈلز کی صلاحیتیں بہتر بنانے کے لیے استعمال ہو رہے ہیں. ہمیں یقین ہے کہ GPT‑Red کے ساتھ ہم نے حفاظت کے لیے اسی طرح کا فلائی وہیل کھولنا شروع کیا ہے, جہاں آج کے ماڈلز کل کے ماڈلز کو زیادہ مضبوط, الائنڈ, اور قابل اعتماد بنانے کے لیے استعمال ہو سکتے ہیں. ہم الگورتھمی بہتریوں کے ساتھ کمپیوٹ اور ڈیٹا کو مسلسل اسکیل کرتے رہیں گے, تاکہ GPT‑Red کے مستقبل کے ایسے ورژنز تربیت دیے جا سکیں جو آج کے ماڈل سے زیادہ مضبوط ہوں. اور بدلے میں, یہ ماڈلز مستقبل کی GPT ریلیزز کو زیادہ محفوظ بنانے میں مدد کریں گے.
ہم اس ہفتے کے آخر میں مزید تفصیلات کے ساتھ ایک پری پرنٹ جاری کریں گے.


