مرکزی مواد پر جائیں
OpenAI

۳ ستمبر، ۲۰۲۶

حفاظت

حفاظتی جائزہ: GPT‑6 Astra

لوڈ ہو رہا ہے…

آج ہم GPT‑6 Astra جاری کر رہے ہیں، جو وسیع پیمانے پر تعینات کیے گئے ہمارے تمام ماڈلز میں سب سے زیادہ قابل ہے. Astra ہمارا پہلا ماڈل ہے جو تیاری کے فریم ورک کے تحت سائبر سکیورٹی کی صلاحیت کی نازک سطح تک پہنچا ہے.

اس اجرا کی حفاظت کے بارے میں جاننے لائق سب سے اہم باتیں درج ذیل ہیں:

  1. GPT‑6 Astra کی سائبر صلاحیتوں میں نمایاں اضافہ ہوا ہے اور یہ ہماری نازک حد پر پورا اترتا ہے. اس کا مطلب ہے کہ درست ٹولز اور رسائی کے ساتھ GPT‑6 Astra سکیورٹی کی ایسی خامیاں تلاش کر سکتا ہے جو پہلے نامعلوم تھیں، اور متعدد عمدہ طور پر محفوظ نظاموں میں ان سے فائدہ اٹھانے کے نئے طریقے تیار کر سکتا ہے، جبکہ ہر مرحلے پر کسی شخص کی رہنمائی بھی درکار نہیں ہوتی. اسی لیے ہم نے ماڈل کے ضرر رساں سائبر اقدامات کے خلاف اپنے حفاظتی انتظامات نمایاں طور پر مضبوط کیے ہیں، خواہ ان اقدامات کا سبب غلط استعمال ہو یا عدم ہم آہنگی. ہم نے Astra اور ملتے جلتے ماڈلز کی داخلی تیاری اور تعیناتی کو محفوظ بنانے کے لیے بھی اقدامات کیے ہیں، جن میں زیادہ سخت علیحدگی، چیک پوائنٹ رمز نگاری، سلسلۂ فکر (CoT) سمیت مکمل عملی سلسلوں کی ہمہ گیر نگرانی، اور داخلی استعمال سے پہلے ناکامی کی صورت میں استعمال روک دینے والا ہم آہنگی جائزہ شامل ہیں.
  2. GPT‑6 Astra اپنے پیش رو ماڈلز سے نمایاں طور پر زیادہ مضبوط ہے. مضبوطی کے لیے حفاظتی تربیت کی نئی تکنیکیں شامل کیے جانے کے باعث GPT‑6 Astra، GPT‑5.6 Sol کے مقابلے میں جیل بریک کے خلاف نمایاں طور پر زیادہ مضبوط ہے، حتیٰ کہ طویل عملی سلسلوں میں بھی. ہمیں یہ آف لائن آزمائشوں اور جیل بریک کی سخت داخلی و خارجی جانچ اور تدارک کے اپنے پروگرام سے معلوم ہوا ہے. ممکنہ طور پر زیادہ خطرے کے حامل قرار دیے گئے صارفین کے لیے ہم نے ماڈل کو یہ اضافی تربیت بھی دی ہے کہ وہ انکار کی حد کو زیادہ محتاط بنا سکے اور دوہرے استعمال کے خطرات کی وسیع تر اقسام کا احاطہ کر سکے. ہم رجعتی جانچ کے ذریعے یقینی بناتے ہیں کہ Astra سابقہ ادوار کی جانچ میں ملنے والے جیل بریک کے خلاف مضبوط رہے، اور اپنی بہتریوں کی توثیق کے لیے تازہ ترین داخلی ریڈ ٹیمنگ حملہ آوروں کے ساتھ خودکار ریڈ ٹیمنگ کے نئے ادوار بھی مکمل کیے.
  3. GPT‑6 Astra، GPT‑5.6 Sol سے بہتر طور پر ہم آہنگ ہے. Astra ماڈل کی ہم آہنگی میں ایک نمایاں پیش رفت ہے، جس میں پری-ٹریننگ ڈیٹا کی تشکیل سے لے کر ری اِنفورسمنٹ لرننگ کے دوران ہماری درجہ بندی تک بہتریاں شامل ہیں. ہم ہم آہنگی کے جائزوں کا ایک نیا مجموعہ(نئی ونڈو میں کھلتا ہے) پیش کرتے ہیں اور پاتے ہیں کہ GPT‑6 Astra حفاظت اور سکیورٹی کی حدود کا احترام کرنے اور اپنے مجاز دائرۂ کار میں رہنے میں زیادہ مضبوط ہے. 54,000 سے زیادہ داخلی Codex کاموں(نئی ونڈو میں کھلتا ہے) پر مبنی ایک نقل میں Astra کو شدید تر عدم ہم آہنگ رویے کے لیے Sol کے مقابلے میں تقریباً نصف انتباہات ملے.
  4. ہم عدم ہم آہنگی کی نگرانی وسیع پیمانے پر نافذ کر رہے ہیں. ہم ماڈل کی ہم آہنگی کو اپنے ماڈلز کے ممکنہ عدم ہم آہنگ رویے کی روک تھام کا بنیادی ذریعہ سمجھتے ہیں. تاہم، نگرانی جدید ترین ماڈل کے رویے کی وسیع تصویر فراہم کرتی ہے اور ہم آہنگی و حفاظت کو مزید بہتر بنانے کے مواقع سامنے لاتی ہے. اس کے علاوہ، نگرانی شناخت شدہ عدم ہم آہنگ رویے کے خلاف تحفظ کی ایک اضافی تہہ کا کام کرتی ہے. ان وجوہ سے ہم نے Astra کی خارجی تعیناتی میں ٹولز استعمال کرنے والے تمام استنباطی عمل پر عدم ہم آہنگی کی نگرانی بھی نافذ کی ہے، جس پر خاصی کمپیوٹنگ لاگت آتی ہے. یہ نظام ہمارے داخلی انتظام کے مماثل ہے.
  5. GPT‑6 Astra کی نگرانی پذیری GPT‑5.6 Sol کے مقابلے میں کم ہوئی ہے. ہم نے GPT‑6 Astra کی نگرانی پذیری(نئی ونڈو میں کھلتا ہے) اور قابو پذیری(نئی ونڈو میں کھلتا ہے) پر وسیع تحقیقات کی ہیں. ہم نے پایا کہ GPT‑6 Astra اپنے CoT کو GPT‑5.6 Sol سے بہتر طور پر قابو کر سکتا ہے اور اس کے CoT میں خود کو قصوروار ثابت کرنے والی معلومات شامل ہونے کا امکان بھی کم ہے. مخالفانہ حالات میں، جہاں ہم ماڈل کو اپنی نگرانی سے بچنے کی ترغیب دیتے ہیں، ہم نے پایا کہ جائزوں میں دانستہ طور پر کم کارکردگی دکھاتے ہوئے، یعنی سینڈ بیگنگ (sandbagging) کرتے وقت، ماڈل شناخت سے بچ سکتا ہے اور تخریب کاری کے بعض کام(نئی ونڈو میں کھلتا ہے) کرنے کو کہنے پر کبھی کبھار ہماری داخلی نگرانی سے بھی بچ نکلتا ہے. ہمیں رمزی CoT ریزننگ، مثلاً معمول کے اور بظاہر غیر متعلق متن میں پوشیدہ ریزننگ چھپانے، کا کوئی ثبوت نہیں ملا، جس سے ظاہر ہوتا ہے کہ نگرانی سے بچنے کا خطرہ بڑی حد تک کم درجے کی ریزننگ والے کاموں تک محدود ہو سکتا ہے.
    • یہ نتائج ظاہر کرتے ہیں کہ مخالفانہ حالات میں Astra زمرے کے ماڈلز ہماری CoT نگرانی سے بچ سکتے ہیں. فی الحال یہ نتائج زیادہ تر مخالفانہ جائزوں پر مبنی ہیں، یعنی جب ہم ماڈل کو نگرانی سے بچنے کی ہدایت دیتے ہیں، جبکہ مجموعی طور پر ہمارے ہم آہنگی جائزے دکھاتے ہیں کہ Astra کے GPT‑5.6 Sol کی بہ نسبت سکیورٹی اور حفاظت کی پابندیاں توڑنے کا امکان کم ہے.
    • تاہم، ہم اس رجحان کو سنجیدگی سے لیتے ہیں اور اپنے ماڈلز کی صلاحیت بڑھنے کے ساتھ ان نتائج اور نگرانی پذیری پر ان کے اثرات کی تحقیق جاری رکھے ہوئے ہیں. OpenAI نے سلسلۂ فکر کی نگرانی کو برقرار رکھنے اور استعمال کرنے کے لیے کام کیا ہے، اور CoT کی نگرانی پذیری محفوظ رکھنا اس تحقیقی پروگرام کا بنیادی مقصد ہے. تاہم، یہ نتائج ماڈل کے سلسلۂ فکر کی جانچ سے آگے بڑھ کر ہم آہنگی کی پڑتال کی تکنیکیں تیار کرنے کی اہمیت بھی واضح کرتے ہیں.
  6. GPT‑6 Astra براؤزنگ اور کام کی جگہ کے حالات کو زیادہ ذمہ داری سے سنبھالتا ہے: GPT‑6 Astra پرومپٹ دراندازی کے خلاف GPT‑5.6 Sol سے نمایاں طور پر زیادہ مضبوط ہے. ہم نے حقیقی براؤزنگ اور پیشہ ورانہ کمپیوٹر ماحول میں بھی ماڈل کے رویے کی جانچ کی ہے اور پایا ہے کہ GPT‑5.6 Sol کے مقابلے میں اس کے عدم ہم آہنگ اور ممکنہ طور پر تباہ کن اقدامات، مثلاً غیر مجاز لین دین، ڈیٹا کا نقصان، ضرورت سے زیادہ رسائی یا ضابطوں سے بچنے، کا امکان نمایاں طور پر کم ہے. خود مختار عامل والے حالات میں ضرر رساں درخواستیں سنبھالتے وقت بھی یہ زیادہ محفوظ رویہ اپناتا ہے، مثلاً پُرتشدد حملے کی منصوبہ بندی میں مدد یا دھوکا دہی کی درخواستیں.
  7. GPT‑6 Astra زیادہ خطرے والے حالات میں نمایاں طور پر زیادہ محفوظ ہے. GPT‑6 Astra عملی استعمال اور انسانوں کی مخالفانہ ریڈ ٹیمنگ سے حاصل کردہ مشکل درخواستوں کا GPT‑5.6 Sol سے زیادہ محفوظ جواب دیتا ہے. Astra غیر محفوظ درخواستوں کو محفوظ طریقے سے مکمل کرنے اور بے ضرر درخواستوں سے غیر ضروری انکار سے بچنے، دونوں میں پیریٹو بہتری حاصل کرتا ہے. یہ بہتریاں ان انتہائی سنگین حالات تک بھی پھیلی ہوئی ہیں جہاں نقصان کا خطرہ کسی واضح درخواست کے بجائے وسیع تر سیاق سے پیدا ہوتا ہے. Astra اٹھارہ سال سے کم عمر صارفین کے لیے عمر کے لحاظ سے موزوں حفاظتی حدود بھی زیادہ مستقل مزاجی سے نافذ کرتا ہے.

مزید معلومات کے لیے مکمل سسٹم کارڈ(نئی ونڈو میں کھلتا ہے) دیکھیں.