مرکزی مواد پر جائیں
OpenAI

۲۸ ستمبر، ۲۰۲۶

حفاظت

جدید ترین مصنوعی ذہانت کی تربیت کے لیے حفاظتی استدلال کی جانب

لوڈ ہو رہا ہے…

ہمارے خیال میں ہم ایک نئے دور میں داخل ہو رہے ہیں، جس میں جدید ترین ری اِنفورسمنٹ لرننگ کا کوئی بھی تربیتی عمل جاری رکھنے سے پہلے منظم حفاظتی دستاویزات لازمی ہونی چاہئیں. مثالی طور پر، ایسی دستاویزات کو ”حفاظتی استدلال“ کے معیار تک پہنچنا چاہیے، یعنی خطرات کے بارے میں جامع، منظم اور شواہد پر مبنی دلائل، جو ان دیگر صنعتوں میں استعمال ہوتے ہیں جہاں حفاظت نہایت اہم ہے. ہم حفاظتی استدلال کو ایک رہنما نصب العین سمجھتے ہیں جس کی طرف پیش قدمی کر رہے ہیں. ساتھ ہی، ہم تسلیم کرتے ہیں کہ مصنوعی ذہانت کی صلاحیت کے ہر نئے درجے پر ابھرنے والی پیچیدگی کے باعث، اس کے ماڈلوں کے لیے ایسا استدلال ہوا بازی یا جوہری توانائی جتنا مضبوط بنانا مشکل ہے. ہم ان طریقوں کو باقاعدہ اصولوں میں ڈھالنے کے لیے ایک لائحۂ عمل تیار کر رہے ہیں.

ذیل میں چند ابتدائی رہنما اصول ہیں جو ہمارے خیال میں جدید ترین مصنوعی ذہانت کی تربیت کے ایسے حفاظتی استدلال کا حصہ ہونے چاہئیں. یہ بہترین طریقے ہماری اب تک کی سیکھ کی عکاسی کرتے ہیں. ہمیں توقع ہے کہ محتاط ترقی کے لیے داخلی طریقۂ کار کو مسلسل بہتر بنانے کے ساتھ یہ بھی بدلتے رہیں گے. ہم انہیں ابھی شیئر کر رہے ہیں تاکہ ہماری موجودہ سوچ واضح ہو، اور ہم متعلقہ برادری کی آرا کا خیرمقدم کرتے ہیں. واضح رہے کہ اس دستاویز کا محور جدید ترین ری اِنفورسمنٹ لرننگ کی تربیت ہے؛ داخلی اور خارجی استعمال کے لیے ہم آہنگی کی کہیں زیادہ وسیع خصوصیات پر غور کرنا ضروری ہے.

1. تکنیکی حفاظتی تدابیر

حفاظتی استدلال میں تکنیکی نظام کے تین پہلوؤں کا احاطہ ہونا چاہیے: ہم آہنگی کی تربیت، محدود دائرے میں رکھنا اور نگرانی. یہ حفاظتی تدابیر یقینی بنانے میں مدد دیتی ہیں کہ ماڈل غیر ہم آہنگ اقدامات کی کوشش نہ کرے، اور اگر کرے بھی تو اس کے لیے مقررہ حدود سے نکلنا مشکل ہو، اور نقصان ہونے سے پہلے نگرانی کے ذریعے اس کا پتا چل جائے.

  • ماڈل کی ہم آہنگی: دفاع کا پہلا مرحلہ ماڈلوں کو ہم آہنگ رہنے کی تربیت دینا ہونا چاہیے، یعنی اس طرح قابلِ اعتماد انداز میں کام کرنا جس طرح ہم چاہتے ہیں. اس میں درج ذیل شامل ہو سکتے ہیں:

    • تربیتی ماحول اور درجہ بندی: تربیت کے دوران انعامی نظام کی خامیوں سے فائدہ اٹھانے کی حوصلہ افزائی روک کر، ماڈلوں میں غیر ہم آہنگ رویے پیدا ہونے کے خطرات کم کریں. اس میں درج ذیل شامل ہو سکتے ہیں:

      • مجموعہ ہائے مواد کے خودکار جائزے: ایجنٹوں سے ری اِنفورسمنٹ لرننگ کے ان ناقص ماحولوں کو تلاش کروا کر درست کریں جہاں مطلوبہ رویے کے بجائے خامیوں سے فائدہ اٹھا کر غیر ہم آہنگ سلسلۂ اعمال کو زیادہ انعام مل سکتا ہو. یوں تربیت کے دوران عدم ہم آہنگی کو تقویت ملنے کے مواقع کم ہوں گے.

      • مجموعہ ہائے مواد کے انسانی جائزے: خودکار ریڈ ٹیمنگ کے ساتھ ساتھ انسانوں سے بھی مجموعہ ہائے مواد کا جائزہ اور معیار کی جانچ کروائیں، تاکہ ایسے ناقص کاموں کی نشاندہی ہو جو نادانستہ طور پر غیر ہم آہنگ رویے کو تقویت دے سکتے ہیں.

      • درجہ بندی کرنے والے نظاموں کی ترتیب: ان نظاموں کو اس طرح ترتیب دیں کہ تربیت کے دوران ماڈل کی جانب سے ری اِنفورسمنٹ لرننگ کے ماحول کی خامیوں سے فائدہ اٹھانے یا اس میں ناجائز مداخلت کی کوششوں پر منفی نمبر دیں.

      • سابقہ تربیتی عمل کا تجزیہ: پچھلے تجربات کے عملی ریکارڈ پر زمرہ بندی کرنے والے نظام چلائیں، تاکہ یقینی ہو کہ درجہ بندی کرنے والے نظام حسبِ منشا کام کر رہے ہیں.

    • ہم آہنگی کی پیمائش: ہم آہنگی کی تربیت کی افادیت ناپنے کے لیے ایسے جائزے چلائیں جو ماڈل میں عدم ہم آہنگی کے رجحانات کا پتا لگائیں. اس میں درج ذیل شامل ہو سکتے ہیں:

      • ہم آہنگی کے آف لائن جائزے: جدید ترین تربیتی عمل کے دوران ہم آہنگی کے جائزے چلائیں، تاکہ معلوم ہو کہ تربیت حسبِ منشا کام کر رہی ہے یا نہیں، اور کسی بھی نمایاں تنزلی کی تحقیقات کریں.

      • سابقہ واقعات پر جانچ: ہم آہنگی کے جائزوں کو پچھلے واقعات پر آزما کر تصدیق کریں کہ وہ پہلے غیر ہم آہنگ رہنے والے ماڈلوں کی شناخت کرتے ہیں اور محض مخصوص واقعات کے مطابق نہیں ڈھل رہے.

      • جائزے میں چال بازی کی نگرانی: جائزہ آگاہی یا جانچ کو بھانپ کر حکمتِ عملی بدلنے پر نظر رکھیں، یعنی ماڈلوں کا یہ پہچان لینا کہ ان کی جانچ ہو رہی ہے، جس سے ان کا رویہ بدل سکتا ہے. اس کے لیے روک لگانے کی واضح حدیں مقرر ہوں (مثلاً ہم آہنگی کے جائزوں میں جائزہ آگاہی اور ایسی حکمتِ عملی کی نگرانی فعال کریں).

      • بدترین حالات میں سخت جانچ: بدترین غلط رویہ ظاہر کرنے والے حالات پیدا کریں اور جانچیں کہ کم از کم ایک جائزہ اس رویے کا پتا لگا سکے.

    • چین-آف-تھاٹ پر تربیت روکیں: ری اِنفورسمنٹ لرننگ میں خودکار درجہ بندی کرنے والے نظاموں کو چین-آف-تھاٹ نہ دیکھنے دیں، تاکہ ماڈل ایسی صلاحیت نہ سیکھیں جس سے وہ چین-آف-تھاٹ کے نگران نظاموں سے بچ نکلیں.

  • محدود دائرے میں رکھنا: اگر ماڈل غیر ہم آہنگ ہو جائے تو اس کا الگ تھلگ ماحول اور حفاظتی انتظامات اتنے مضبوط ہوں کہ نقصان دہ اقدامات روکے جا سکیں. اس میں درج ذیل شامل ہو سکتے ہیں:

    • بنیادی ڈھانچے کی سلامتی کی متعدد تہیں: ماڈل کے الگ تھلگ ماحول اور اس ماحول کو چلانے والے تحقیقی بنیادی ڈھانچے، دونوں کو مضبوط بنانے پر بھرپور وسائل لگائیں، تاکہ ماڈل کے اس ماحول سے نکل جانے کی صورت میں تحفظ کی ایک اضافی تہہ موجود ہو.

    • حدبندی کی ریڈ ٹیمنگ: حفاظتی تجزیے کی شرط کے ساتھ، جدید ترین تربیتی عمل میں محفوظ کیے گئے ماڈل کے عبوری نسخوں سے ان نظاموں کی بار بار ریڈ ٹیمنگ کریں، تاکہ خامیاں تلاش اور دور کی جا سکیں. یوں الگ تھلگ ماحول، تحقیقی بنیادی ڈھانچے اور بیرونی حدود کی سلامتی بہتر بنائیں. ان تمام خدمات کی بھی مخالفانہ جانچ کریں جن تک ماڈل تربیت کے دوران رسائی پا سکتا ہے (مثلاً انٹرنیٹ کا عارضی ذخیرہ).

    • نمونوں کے درمیان رابطہ: نمونوں کے درمیان زیادہ مقدار میں معلومات منتقل کرنے والے رابطے کو منظور شدہ راستوں، مثلاً متعدد ایجنٹوں کے لیے بنے آلات، تک محدود رکھیں. بنیادی ڈھانچے کے ایسے ضمنی راستے بند کریں جو بڑی مقدار میں معلومات منتقل کر سکتے ہوں اور جنہیں ایجنٹ آسانی سے دریافت کر سکیں.

    • ناقابلِ ترمیم مکالماتی ریکارڈ: ری اِنفورسمنٹ لرننگ کی تمام تربیت، جائزوں اور داخلی استعمال کے لیے ایجنٹوں کے مکالماتی ریکارڈ مناسب مدت تک ناقابلِ ترمیم صورت میں محفوظ رکھیں (مثلاً ایسے ذخیرہ جاتی کھاتوں میں جہاں صرف ایک بار لکھا جا سکے)، تاکہ واقعات کی قابلِ اعتماد تحقیقات ممکن ہوں اور غیر ارادی ترامیم روکی جا سکیں.

  • نگرانی: اگر ماڈل غیر ہم آہنگ اقدامات کرنے لگیں تو فوری نگرانی کا نظام موجود ہو، جو کسی بھی ممکنہ عدم ہم آہنگی کا پتا لگائے اور سنگین واقعہ ہونے سے پہلے ترجیحی مسائل کا تیزی سے ازالہ ممکن بنائے. اس میں درج ذیل شامل ہو سکتے ہیں:

    • قابلِ نگرانی رہنا لازم کریں: یقینی بنائیں کہ ماڈل قابلِ نگرانی رہیں. اسے واضح حدوں والے ایسے جائزوں سے ناپیں جو نگرانی کی گنجائش اور نگرانی سے بچ نکلنے کی صلاحیت جانچتے ہوں، تاکہ تشویش ناک رویے کا جلد پتا چل سکے.

    • معلوم مسائل کی زیادہ سے زیادہ شناخت: تربیت سے الگ رکھے گئے جائزے میں یقینی بنائیں کہ نگرانی کا نظام ماضی کے واقعات کی بڑی شرح کو شناخت کر سکے.

    • نگران نظاموں کے جائزوں کی تازگی: نئے تربیتی عمل کے لیے بالکل نئے خطرات کی نمائندگی کرنے والے جانچ کے نمونے بنائیں، تاکہ نگران نظام کی شناخت کی شرح اور درستگی کی پیمائشیں پرانی نہ پڑ جائیں.

    • فوری ردعمل: ایسے ترجیحی انتباہات نافذ کریں جن پر مقررہ خدمت کی سطح کے معاہدے کے تحت وقت پر کارروائی ہو، خواہ ہنگامی ڈیوٹی پر موجود فرد کو فوری اطلاع دے کر یا متاثرہ تربیتی عمل خودکار طور پر روک کر، اس سے پہلے کہ ماڈل نقصان پہنچائے (مثلاً دن کے واقعات پر سلامتی کی ہنگامی ڈیوٹی والے فرد اور تربیتی عمل کے ذمہ دار کو اطلاع دیں، اور رات کو جن انتباہات کی وصولی کی تصدیق نہ ہو ان پر تربیتی عمل خودکار طور پر روک دیں).

2. عملی رہنما اصول

تکنیکی حفاظتی تدابیر کی سفارشات کے ساتھ ساتھ، ہم جدید ترین مصنوعی ذہانت کے تربیتی عمل کے لیے حفاظتی استدلال تیار کرنے کے بہترین عملی طریقوں پر بھی کام کر رہے ہیں. ان میں درج ذیل شامل ہو سکتے ہیں:

  • اختلافی آرا (پیشگی ناکامی کا تجزیہ): حفاظتی استدلال کا مسودہ تیار ہونے کے بعد، دوسری ٹیم کے کسی رکن کو اختلافی رائے لکھنی چاہیے، تاکہ استدلال میں ممکنہ خامیوں کی نشاندہی ہو اور خطرے کی سطح کے مطابق متوازن رائے سامنے آئے. پھر تربیتی ٹیم کو ان نکات کا ازالہ کرنا چاہیے، تاکہ حفاظتی استدلال مضبوط ہو.

  • منظوریاں: اعلیٰ قیادت کے ارکان کو حفاظتی استدلال کا جائزہ لینا چاہیے اور ان میں سے ہر ایک کو تربیتی عمل روکنے کا اختیار ہونا چاہیے، تاکہ اس پر کئی داخلی جانچیں یقینی بنائی جا سکیں (مثلاً تحقیقی شعبے کے سربراہ / نائب صدر، سربراہِ حفاظت اور چیف سائنس دان).

  • جواب دہی: تربیتی عمل کے ذمہ دار اعلیٰ عہدے دار (مثلاً تحقیقی شعبے کے سربراہ / نائب صدر برائے تحقیق) کو حفاظتی استدلال اور کسی بھی واقعے پر ردعمل کے لیے جواب دہ ہونا چاہیے، بشمول کارکردگی کے جائزوں میں، تاکہ تربیتی ٹیموں کو بھی حفاظت اور ہم آہنگی کو آگے بڑھانے کی ترغیب ملے.

  • عارضی تعطل: اگر ایسے مسائل ملیں جو حفاظتی استدلال کو ناقابلِ قبول بنا دیں (مثلاً سلامتی کا کوئی نیا مسئلہ)، تو یقینی بنائیں کہ اس کے دائرے میں آنے والے تمام تربیتی عمل روکنے کے لیے عملی ہدایات، تکنیکی کنٹرول اور خدمت کی سطح کے معاہدے موجود ہوں.

  • داخلی شفافیت: حفاظتی استدلال داخلی نگرانی کے گروہوں (مثلاً سیفٹی اینڈ سیکورٹی کمیٹی) کو دستیاب ہونا چاہیے.

  • آڈٹ: آڈٹ کرنے والوں کو اتنی رسائی دینی چاہیے کہ وہ تصدیق کر سکیں کہ حفاظتی استدلال کے دعوے درست اور ٹھوس ہیں، اور کوئی کمی ملنے پر اس کی نشاندہی کر سکیں.

  • اعلیٰ سطح پر اطلاع: عدم ہم آہنگی کے مسائل اعلیٰ سطح تک پہنچانے کا واضح طریقۂ کار ہونا چاہیے، جس میں شدت کی متعین سطحوں کا جدول اور عدم ہم آہنگی کے لیے ہنگامی ڈیوٹی پر مامور فرد شامل ہو. یہ فرد تربیتی عمل کے کسی مقررہ شدت تک پہنچنے پر اعلیٰ عہدے داروں (مثلاً چیف ایگزیکٹو) کو فوری اطلاع دے سکے.

  • تکنیکی کنٹرول: انسانوں اور ایجنٹوں کے لیے قواعد کی خلاف ورزی کرنے والے تربیتی عمل شروع کرنا مشکل ہونا چاہیے. نگرانی اور خودکار تعطل جیسی حفاظتی خصوصیات میں خرابی آنے پر کام رک جانا چاہیے (مثلاً مناسب نگرانی فعال کیے بغیر تربیتی عمل شروع کرنا، یا ری اِنفورسمنٹ لرننگ کی تربیت، جائزے یا داخلی استعمال کے اندر سے نگران نظام بند کرنا ممکن نہیں ہونا چاہیے).

  • اثرات واپس پلٹانے کی صلاحیت: تربیت کے دوران غیر ہم آہنگ ماڈل کے تمام بعد کے استعمالات (مثلاً مواد تیار کرنا یا درجہ بندی کرنا) کی نشاندہی آسان ہونی چاہیے، تاکہ ضرورت پڑنے پر غیر ہم آہنگ نتائج کے اثرات زائل کیے جا سکیں.

  • باقی ماندہ خطرات کا جامع احاطہ: حفاظتی استدلال میں حتی الامکان ان تمام باقی ماندہ خطرات کی جامع فہرست ہونی چاہیے جن کا موجودہ تدابیر سے ازالہ نہیں ہوتا، تاکہ خطرہ قبول کرنے کے فیصلے باخبر انداز میں کیے جا سکیں.

یہ ہماری موجودہ سفارشات ہیں، جن پر OpenAI میں عمل درآمد جاری ہے. ہمیں توقع ہے کہ آنے والے ہفتوں میں ہمارے طریقۂ کار میں مسلسل تبدیلی اور بہتری آتی رہے گی.

3. عدم ہم آہنگی کے واقعات کی تحقیقات

ہم مصنوعی ذہانت میں عدم ہم آہنگی کے سنگین واقعات کی تحقیقات کے لیے بھی کچھ بہترین طریقے تیار کر رہے ہیں. تحقیقی اداروں کو ہر واقعے سے زیادہ سے زیادہ سیکھنے کی کوشش کرنی چاہیے (دیگر پُرخطر صنعتوں میں تحقیقات کے طریقوں⁠(نئی ونڈو میں کھلتا ہے) کی طرح)، تاکہ مستقبل میں ایسے واقعات روکے جا سکیں. ایسے اقدامات کی چند مثالیں یہ ہو سکتی ہیں:

  • داخلی شفافیت: چونکہ تحقیقات مکمل ہونے میں خاصا وقت لگ سکتا ہے، اس لیے ان کی پیش رفت باقاعدہ وقفوں سے ادارے کے اندر پیش کرنی چاہیے (مثلاً جاری تحقیقات کی روزانہ تازہ صورتِ حال). ملازمین کے لیے مزید رسائی حاصل کرنے کے متعین طریقے ہونے چاہئیں، جن میں اصل مکالماتی ریکارڈ اور غیر ہم آہنگ ماڈلوں سے نمونے حاصل کرنا شامل ہو، بشرطیکہ یہ محفوظ اور ان کے کام سے متعلق ہو.

  • عدم ہم آہنگی کی بنیادی وجہ: محققین کو تربیت کی حرکیات میں بنیادی اسباب تلاش کرنے چاہئیں (مثلاً مخصوص اجزا ہٹا کر یا دوبارہ نمونے لے کر تجربات کے ذریعے)، تاکہ معلوم ہو کہ غیر ہم آہنگ رویے کیسے پیدا ہوئے. اس سے عدم ہم آہنگی کی سائنسی سمجھ بہتر ہوگی اور مستقبل میں اسے زیادہ مؤثر طریقے سے روکا جا سکے گا.

  • بعد از واقعہ تجزیہ: عملی طریقوں اور ادارہ جاتی ثقافت کا بعد از واقعہ تجزیہ کرنا چاہیے، تاکہ واقعے میں کردار ادا کرنے والے تمام اسباب سمجھے جا سکیں، مثلاً مسائل کیوں پیدا ہوئے اور واقعے سے پہلے ان کا پتا کیوں نہ چلا یا انہیں اعلیٰ سطح تک کیوں نہ پہنچایا گیا.

  • شناخت: ہمیں ہم آہنگی جانچنے کے ایسے طریقے تیار کرنے چاہئیں جو واقعہ پیدا کرنے کے رجحان کو دریافت کر سکیں، لیکن جنہیں بہتر بناتے وقت واقعے سے حاصل کردہ معلومات (مثلاً مکالماتی ریکارڈ یا واقعے کے خلاصے) کو براہِ راست ہدف نہ بنایا جائے. واقعات سے اخذ کردہ جائزوں کو ”سابقہ خرابیوں کی واپسی کی جانچ“ کے طور پر تیار کرنا چاہیے، تاکہ آئندہ ماڈل بالکل ملتے جلتے واقعات میں عدم ہم آہنگی کا رجحان ظاہر نہ کریں.

  • عوامی انکشافات: تحقیقات مکمل ہونے کے بعد ان کے نتائج، بعد از واقعہ تجزیے اور عملی تبدیلیاں عوام کے ساتھ شیئر کرنی چاہئیں. متاثرہ تیسرے فریقوں کو جلد از جلد مطلع کرنا چاہیے.

مصنف

OpenAI