مرکزی مواد پر جائیں
OpenAI

۲۲ ستمبر، ۲۰۲۶

حفاظت

موثر فریق ثالث جائزوں کی ترجیحات اور اصول

لوڈ ہو رہا ہے…

جدید ترین AI لیبارٹریوں پر ماڈلز کی محفوظ تربیت، جانچ اور تعیناتی کی بہت بڑی ذمہ داری عائد ہوتی ہے. فریق ثالث جائزے اس ذمہ داری میں توازن، AI کی حفاظت پر رائے کے مواقع بڑھانے، دنیا کو باخبر رکھنے اور واضح و آزاد شواہد سے تقویت یافتہ حفاظتی دعوؤں کے لیے لیبارٹریوں کو جواب دہ بنانے میں نہایت اہم ہیں.

جدید ترین AI کی پیش رفت کے ساتھ چلنے کی ہماری کوششوں کے تحت، OpenAI تربیت، جانچ اور تعیناتی کے تمام مراحل میں گہری رسائی کے ساتھ آزاد جائزوں کی معاونت کے لیے پُرعزم ہے. اس رسائی سے جائزہ کاروں کو ہمارے مفروضوں پر سوال اٹھانے، ہم سے پوشیدہ رہ جانے والے خطرات شناخت کرنے اور ہمارے حفاظتی اقدامات کی افادیت کے بارے میں اپنے نتائج اخذ کرنے کے قابل ہونا چاہیے.

ہم طویل عرصے سے ماڈل کی تیاری اور تعیناتی کے مختلف مراحل میں فریق ثالث جائزہ کاروں کے ساتھ کام کرتے آ رہے ہیں. ہم نے فریق ثالث جائزوں کو اپنے تیاری کے فریم ورک کے طریقوں میں بھی شامل کیا ہے اور زیادہ سخت و جواب دہ عمل کی حمایت کرنے والی تنظیموں اور قانون سازی کی معاونت کی ہے. ان سرگرمیوں میں ہم نے گہری رسائی فراہم کی ہے، جس میں ہمارے تکنیکی حفاظتی اقدامات کی معلومات، قابل مشاہدہ چین-آف-تھاٹ تک رسائی، اور واقعات سے نمٹنے اور نگرانی کی ریڈ ٹیمنگ کے لیے خفیہ ڈیٹا اور اندرونی تعیناتی تک بے مثال رسائی شامل ہے. یہاں پیش کردہ ترجیحات اور اصول تکنیکی حفاظتی جائزوں کے لیے نجی اور غیر منافع بخش شعبوں کی آزاد جائزہ تنظیموں کے ساتھ ہماری شمولیت پر مرکوز ہیں. یہ جانچ اور جائزے کے سلسلے میں حکومتوں کے ساتھ ہمارے کام کی تکمیل کرتے ہیں، جہاں مختلف کردار اور ذمہ داریاں الگ طریقوں کا تقاضا کر سکتی ہیں.

ان جائزوں کو موثر بنانے کے لیے آزادی کے مضبوط طریقے، سائنسی سختی، مستحکم سلامتی کے طریقے اور واضح ذمہ داریاں درکار ہیں. لیبارٹریوں کی ذمہ داری ہے کہ حساس معلومات کی حفاظت کرتے ہوئے بامعنی چھان بین ممکن بنائیں. اس عمل کو درست بنانے کی ذمہ داری لیبارٹریوں اور آزاد جائزہ کاروں پر مشترکہ طور پر عائد ہوتی ہے، اور انہیں حفاظت اور سلامتی کے طریقوں کے مشترکہ بین الاقوامی معیارات کے مطابق کام کرنا چاہیے. ذیل میں ہم سخت، محفوظ اور آزاد کام کے اصولوں کے ساتھ گہرے جائزے کے چار ترجیحی شعبے تجویز کرتے ہیں.

جائزے کے ترجیحی شعبے

فریق ثالث جائزے تب سب سے مفید ہوتے ہیں جب وہ مخصوص اور اہم سوالات کا جواب دیں: کیا شواہد کسی لیبارٹری کے حفاظتی مقدمے اور حفاظتی دعوؤں کی تائید کرتے ہیں؟ کیا جائزے ان خطرات کو مناسب طور پر جانچتے ہیں جن کی پیمائش ان کا مقصد ہے؟ کیا حفاظتی اقدامات حقیقی حالات میں موثر رہتے ہیں؟

یہاں بیان کردہ جائزوں کی نوعیت زیر تحقیق حفاظتی سوالات کے مطابق مختلف ہوگی. ہم مختلف مدتوں میں بیک وقت متعدد جائزوں کی معاونت کی توقع رکھتے ہیں، جن میں کچھ کئی ہفتے اور کچھ کئی ماہ جاری رہیں گے. اگرچہ فریق ثالث جائزے تعیناتی سے پہلے کے کام کا حصہ بن کر تعیناتی کے فیصلوں میں رہنمائی دے سکتے ہیں، یہاں بیان کردہ کام عموماً طویل مدتی اور اجرا سے غیر وابستہ ہے، جس کا مقصد وقت کے ساتھ مخصوص حفاظتی دعوؤں کا گہرائی سے جائزہ لینا ہے.

اپنے ترجیحی شعبوں اور اصولوں میں ہم حفاظتی دعوؤں اور حفاظتی مقدمات کا ذکر کرتے ہیں. ان اصطلاحات سے ہماری مراد درج ذیل ہے:

حفاظتی دعویٰ: ماڈل یا نظام کی صلاحیتوں، رویے یا حفاظتی اقدامات کے بارے میں ایسا مخصوص دعویٰ جو اس کی حفاظت سے متعلق ہو اور شواہد کی بنیاد پر جانچا جا سکے. دعویٰ میں متعلقہ خطرات اور حالات کے ساتھ اہم مفروضوں اور حدود کی نشان دہی ہونی چاہیے.

حفاظتی مقدمہ: شواہد سے تقویت یافتہ ایک منظم دلیل، جو واضح کرتی ہے کہ تربیت، جائزے یا تعیناتی جیسی کسی مخصوص سرگرمی کے لیے ماڈل یا نظام کے خطرات کا مناسب انتظام کیوں کیا گیا ہے. حفاظتی مقدمہ انفرادی حفاظتی دعوؤں کو ان کے معاون شواہد سے جوڑتا ہے اور ان مفروضوں، غیر یقینی صورتوں اور باقی خطرات کو واضح کرتا ہے جو اس کے نتائج کو متاثر کر سکتے ہیں.

ہم سخت، محفوظ اور آزاد کام کے اصولوں کے ساتھ گہرے جائزے کے چار ترجیحی شعبے تجویز کرتے ہیں.

  1. تربیت، جانچ، اندرونی تعیناتی اور بیرونی تعیناتی پر محیط حفاظتی مقدمات کا آزادانہ جائزہ.

    حفاظتی مقدمات کے جائزے کے لیے ہم آہنگی، نگرانی جیسے کنٹرول کے طریقوں، سائبر سلامتی، حیاتیاتی و کیمیائی غلط استعمال اور ریڈ ٹیمنگ میں مہارت درکار ہے. حفاظتی مقدمات میں تربیت، صلاحیت کے جائزوں اور حفاظتی اقدامات سے متعلق دعوے شامل ہوتے ہیں، جنہیں مکمل طور پر یا حصوں میں جانچا جا سکتا ہے، جیسا کہ ذیل میں ترجیحات 2 اور 3 میں درج ہے. ممکنہ طور پر متعدد جائزہ کاروں کو اپنی اپنی مہارت کے مطابق مقدمات کے مختلف حصوں کا جائزہ لینا ہوگا. ان کے مشترکہ جائزوں کو درج ذیل جیسے سوالات کے جواب دینے چاہئیں:

    1. کیا تربیت، جانچ اور تعیناتیوں کے حفاظتی مقدمات کے شواہد کی مناسب تصدیق ہوتی ہے؟ کیا تربیت، جانچ اور تعیناتی کے دوران حفاظتی مقدمے کی شرائط پر عمل کیا گیا؟

    2. کیا ہمارے حفاظتی مقدمات جائزے کے دوران شناخت ہونے والے انتہائی فوری خطرات کا احاطہ کرتے ہیں؟ کیا حفاظتی دعوے مجموعی حفاظتی مقدمے کی تائید کرتے ہیں؟ کیا کوئی خامیاں یا بہتری کے شعبے موجود ہیں؟

    3. کیا تربیت میں ایسی ترغیبات کی شناخت اور کمی کے لیے موثر طریقے استعمال کیے جاتے ہیں جو فریب، ریوارڈ ہیکنگ (reward hacking)، تباہ کن کارروائیوں یا پابندیوں سے بچنے کو انعام دے سکتی ہیں؟

  2. اندرونی اور بیرونی تعیناتیوں میں اہم حفاظتی اقدامات کا جائزہ

    بدلتی صلاحیتوں اور حالات کے مطابق ہمارا حفاظتی نظام مسلسل ارتقا پذیر ہے. ہمارے حفاظتی اقدامات تربیت، اندرونی تعیناتی اور بیرونی تعیناتی پر محیط ہیں. ان میں فی الحال ماڈل کی سطح کے حفاظتی اقدامات، نفاذی اور سلامتی کے اقدامات، نیز عدم ہم آہنگی کے نگران شامل ہیں، جو کنٹرول کھونے اور سائبر، حیاتیاتی و کیمیائی خطرات میں غلط استعمال جیسے کئی خطرات کا احاطہ کرتے ہیں. تکنیکی شراکتیں موجودہ حفاظتی اقدامات کی کمزوریاں شناخت کرنے کے ساتھ جائزے کے طریقے بہتر اور معیارات کی تیاری تیز کر سکتی ہیں، یوں جدید ترین AI کی پیش رفت سے ہم آہنگ مستقبل کی عوامی پالیسیوں کے لیے مضبوط تکنیکی بنیاد ملتی ہے، خصوصاً اندرونی تعیناتیوں میں جہاں حفاظت و سلامتی کے معیارات ابھی ابتدائی مرحلے میں ہیں.

    آزاد جائزوں میں یہ جانچ ہونی چاہیے کہ یہ حفاظتی اقدامات کتنے موثر ہیں اور کہاں ناکام ہو سکتے ہیں، مثلاً:

    1. ”گرے باکس“ رسائی کے استعمال سے، کیا حفاظتی اقدامات مخالفانہ جانچ یعنی جیل بریک کے مقابل مضبوط ہیں، اور کیا وہ زیادہ خطرے والے شعبوں، مثلاً سائبر اور حیاتیات، میں صلاحیت بڑھنے کے خلاف کافی تحفظ دیتے ہیں؟ کیا ہماری مخالفانہ جانچ اور ریڈ ٹیمنگ اہم ترین خطرات کا احاطہ کرتی ہے؟

    2. حقیقی عملی حالات میں مجاز جانچ کے دوران ایجنٹ، رسائی کے کنٹرول، محدود آزمائشی ماحول اور شناخت و ردعمل کے نظام جیسے سائبر دفاعی انتظامات کے ساتھ کیسے تعامل کرتے ہیں؟ کون سے دفاعی انتظامات نقصان دہ کارروائیوں کو روکتے، شناخت کرتے یا محدود رکھتے ہیں، اور وہ کہاں ناکام ہوتے ہیں؟

    3. کیا اندرونی اور بیرونی تعیناتیوں میں ہمارے عدم ہم آہنگی کے نگرانوں میں ایسی اہم خامیاں ہیں جو کنٹرول کھونے یا شدید عدم ہم آہنگی کا باعث بن سکتی ہیں؟ ماڈل کی صلاحیتیں بہتر ہونے کے ساتھ حفاظت یا ہم آہنگی کے شواہد کے ذریعے کے طور پر چین-آف-تھاٹ کی نگرانی کتنی قابل اعتماد ہے؟

    4. کیا تمام متعلقہ تربیت، جائزوں اور تعیناتی میں مناسب نگرانی اس طرح نافذ ہے کہ اسے آسانی سے غیر فعال نہ کیا جا سکے؟

    5. کیا حفاظتی اقدامات صلاحیتوں کے متناسب نافذ کیے گئے ہیں؟

  3. تیاری کے خطرے کے زمروں، یعنی کیمیائی و حیاتیاتی خطرات، سائبر سلامتی اور AI کی خود بہتری، کا احاطہ کرنے والے صلاحیت کے جائزوں اور عدم ہم آہنگی کے خطرات سے متعلق ہم آہنگی کے جائزوں کی جانچ

    ہمارے تیاری کے فریم ورک کے تحت جائزوں میں فرنٹیئر رسک کے اہم شعبوں کی جانچ ضروری ہے. حدیں عبور ہونے اور جائزوں کی افادیت اپنی انتہا کو پہنچنے کے ساتھ، تیاری کے خطرے والے شعبوں میں صلاحیتوں کی جانچ اور شدید عدم ہم آہنگی کے خطرات جانچنے والے ہم آہنگی کے جائزوں کو مسلسل تازہ رکھنا اور ان کی جامعیت و معیار یقینی بنانا ضروری ہے.

    متعلقہ سوالات میں شامل ہیں:

    1. کیا تیاری کے خطرات جانچنے والے جائزے، تیاری کے خطرے کی حد کی تعریف کا مناسب احاطہ کرتے ہیں؟ کیا ان جائزوں کے لیے حدیں درست طور پر مقرر ہیں؟

    2. جب ماڈلز مسلسل بلند ترین اسکور حاصل کریں تو کیا جائزے تازہ کیے جاتے ہیں، اور کیا نئے امتحانات زیادہ ترقی یافتہ صلاحیتوں کی بامعنی پیمائش کرتے ہیں؟

    3. کیا ہمارے ہم آہنگی کے جائزے شدید عدم ہم آہنگی کے خطرات کا مناسب احاطہ کرتے ہیں، اور کون سے اہم رویے یا حالات ان سے چھوٹ سکتے ہیں؟

  4. عدم ہم آہنگی کے سنگین واقعات کی آزادانہ تحقیقات

    AI کی حفاظت کے مختلف سنگین واقعات میں آزادانہ تحقیقات مفید ثابت ہو سکتی ہیں. یہاں ہماری توجہ ماڈل کی عدم ہم آہنگی پر ہے، جس میں ماڈلز کا اجازت کے بغیر کام کرنا یا نگرانی سے بچنا شامل ہے؛ یہ دانستہ غلط استعمال کے بغیر بھی ہم آہنگی کے طریقوں اور حفاظتی اقدامات کی کمزوریاں ظاہر کر سکتا ہے.

    بعض حالات میں، جیسا کہ OpenAI Hugging Face واقعے میں ہوا، آزادانہ عدم ہم آہنگی کے واقعے کی تحقیقات کے لیے کسی آزاد فریق ثالث کو شامل کرنا مفید ہو سکتا ہے. واقعے کی تحقیقات میں شامل فریق ثالث کے پاس ضروری تحقیقاتی مہارت ہونا ناگزیر ہے، جس میں حسب اطلاق سائبر فارنسک، ہم آہنگی، بڑے پیمانے پر چین-آف-تھاٹ کے تجزیے کی مہارت، اور بروقت تحقیقات کے لیے دستیاب عملہ و وسائل شامل ہیں. واقعے سے نمٹنے میں حساس اندرونی اور فریق ثالث ڈیٹا تک رسائی شامل ہو سکتی ہے، اس لیے بعض تفصیلات کی اشاعت یا ان تک رسائی حساس ہو سکتی ہے. آزاد تحقیقات کے نتائج کسی ماڈل کی ہم آہنگی اور پہلے دیکھی گئی عدم ہم آہنگی کے تدارک کے اقدامات کی افادیت سے متعلق دعوؤں کی جانچ کے لیے شواہد فراہم کر کے اس کے حفاظتی مقدمے کو بھی تقویت دے سکتے ہیں.

    عدم ہم آہنگی کے واقعات کے تناظر میں ہم درج ذیل امور کے آزاد جائزوں کو ترجیح دیتے ہیں:

    1. واقعے کے دوران ماڈل کے رویے یا عدم ہم آہنگی سے متعلق کون سے مسائل پیش آئے، اور ان کے بنیادی اسباب کیا تھے؟

    2. کیا حفاظتی اقدامات اور اصلاحی کارروائیاں مستقبل میں ایسے واقعات کو موثر طور پر کم کر سکیں گی؟

موثر جائزوں کے اصول

  • جائزے کے لیے واضح دائرۂ کار اور باہمی طور پر متفقہ دعوے: جائزوں کا آغاز باہمی طور پر متفقہ دائرۂ کار سے ہونا چاہیے، جس کے بعد واضح حفاظتی دعوے طے کیے جائیں اور جائزے کی سرگرمیاں شروع ہونے سے پہلے ان کا اندراج کیا جائے. فریق ثالث اور لیبارٹریوں کو واضح کرنا چاہیے کہ یہ وہ دعوے ہیں جنہیں زیر جائزہ کمپنی جانچ کے لیے پیش کرنا چاہتی ہے، یا وہ دعوے جنہیں فریق ثالث جائزہ کار آزادانہ طور پر جانچنا چاہتا ہے اور لیبارٹری ان کی بنیاد پر جانچ کے لیے رضامند ہے. کچھ دعوے کئی وجوہ سے دائرۂ کار سے باہر ہو سکتے ہیں، مثلاً فریق ثالث کے لیے ڈیٹا تک رسائی کا ناقابل عمل ہونا، جائزہ کار کے پاس ناکافی مہارت، یا فوری جائزے کے وقت معقول وقت کی پابندیاں. لیبارٹریوں اور جائزہ کاروں کو اصل دائرۂ کار سے باہر شناخت ہونے والے اہم خطرات پر غور کرنے کا طریقۂ کار طے کرنا چاہیے، جس میں یہ فیصلہ بھی شامل ہو کہ مزید تحقیق ضروری ہے یا نہیں. نتائج میں باہمی طور پر متفقہ دائرۂ کار کے لحاظ سے واضح ہونا چاہیے کہ کن امور کا جائزہ لیا گیا اور کن کا نہیں.

  • متناسب رسائی: قانونی، سلامتی اور دانشورانہ املاک کی پابندیوں کے اندر، جہاں ممکن ہو جائزہ کاروں کو متفقہ دعوؤں کی جانچ کے لیے متناسب رسائی ملنی چاہیے. جہاں براہ راست رسائی ناقابل عمل یا ناممکن ہو، وہاں جائزہ کار کمپنی کے نامزد نمائندے کے ساتھ کام کر سکتے ہیں یا بنیادی معلومات کے تحفظ کے لیے بالواسطہ یا رازداری برقرار رکھنے والے رسائی کے طریقے تلاش کر سکتے ہیں.

  • شفاف طریقۂ کار اور معیارات: جائزہ کاروں کو اپنے طریقوں، جانچ کے معیار اور غیر یقینی صورتوں کی وضاحت کرنی چاہیے اور جہاں دستیاب ہوں، قائم شدہ معیارات سے رہنمائی لینی چاہیے. جہاں ابھی معیارات موجود نہ ہوں، وہاں استعمال کیے گئے معیار کا واضح جواز دینا چاہیے. رپورٹوں میں براہ راست نتائج اور تشریح کو الگ رکھا جائے، غیر یقینی صورت واضح کی جائے اور بتایا جائے کہ شواہد کن نتائج کی تائید کرتے ہیں.

  • مہارت اور آزادی: جائزہ کاروں کو متعلقہ تکنیکی مہارت ثابت کرنی چاہیے اور ادارہ جاتی و انفرادی مفادات کے ٹکراؤ کی شناخت، انکشاف اور تدارک کرنا چاہیے، جن میں مالی ترغیبات، ڈویلپرز سے تعلقات اور زیر جائزہ کام میں سابقہ شمولیت شامل ہیں. حفاظتی انتظامات اس طرح بنائے جائیں کہ تجارتی دباؤ اور معاوضے کے انتظامات نتائج پر اثر انداز نہ ہوں؛ ان میں خود کو کارروائی سے الگ کرنا یا مناسب مدت تک اخراج شامل ہو سکتا ہے.

  • سلامتی اور رازداری: جائزہ کاروں کو معلوماتی سلامتی کے طریقے اور اپنے عملے پر قابل نفاذ رازداری کے تحفظات ثابت کرنے چاہئیں، جو قابل رسائی نظاموں اور معلومات کی حساسیت کے متناسب ہوں. ان تحفظات میں دانشورانہ املاک، حساس معلومات اور جائزے کے ریکارڈ شامل ہونے چاہئیں. جہاں جائزہ کار اپنے ماحول میں سلامتی کے تقاضے پورے نہ کر سکیں، یا قابل رسائی ڈیٹا خاص طور پر حساس ہو، وہاں کمپنی کے زیر انتظام آلات یا احاطے میں رسائی مناسب ہو سکتی ہے.

  • قابل عمل نتائج اور اصلاح کا وقت: جائزوں میں مخصوص خامیوں کی نشان دہی اور ان کے تدارک کے لیے لیبارٹریوں کو کافی تفصیل فراہم کی جانی چاہیے. جہاں مناسب ہو، اشاعت سے پہلے لیبارٹریوں کو مسائل دور کرنے کے لیے معقول وقت ملنا چاہیے. جہاں متعلقہ ہو، رپورٹوں میں ایجنٹ کے ڈویلپرز، تعینات کنندگان اور محافظوں کے لیے حاصل ہونے والے اسباق اور نفاذ کی عملی سفارشات بھی بیان ہونی چاہئیں.

  • ذمہ دارانہ اشاعتی طریقے: جائزہ رپورٹیں شواہد پر مبنی ہوں اور حساس و خفیہ معلومات کی حفاظت کرتے ہوئے حتی الامکان کھلے طور پر شیئر کی جائیں. جہاں مکمل عوامی انکشاف ممکن نہ ہو، وہاں مناسب نگرانی کے اداروں، مثلاً نظم و نسق کے اداروں یا کمپنی بورڈز، کو خفیہ رپورٹنگ جواب دہی میں مدد دے سکتی ہے. آزادی اور رازداری کا توازن برقرار رکھنے کے لیے اصولی حذف کے تحفظات اور پالیسیاں، نیز آرا اور غلطیوں کی اصلاح سے متعلق واضح توقعات قائم ہونی چاہئیں. جائزہ کاروں کو رازداری اور دانشورانہ املاک کے تحفظات برقرار رکھتے ہوئے اداریاتی آزادی قائم رکھنی چاہیے. جائزہ کاروں کو حذف کی واضح پالیسیاں اپنانی چاہئیں، جن کے تحت لیبارٹریاں حساس معلومات حذف کرنے کی درخواست کر سکیں اور جائزہ کار اہم حذف اور جائزہ رپورٹ پر اس کے اثرات کی نشان دہی کر سکیں.

آگے کا راستہ

ہم آزاد جائزہ کاروں کی معاونت اور موثر فریق ثالث جائزوں کے لیے مستقبل کے قوانین اور نجی نظم و نسق کے اداروں، دونوں کے ذریعے زیادہ واضح اور مشترکہ بین الاقوامی معیارات قائم کرنے کے لیے پُرعزم ہیں. اگرچہ آزادانہ جانچ کا نظام ابھی ترقی کر رہا ہے، ہم جدید ترین AI کی حفاظت کے مختلف سوالات میں گہری مہارت رکھنے والے آزاد جائزہ کاروں کی متنوع برادری کی معاونت اور اس کے ساتھ کام کر کے اسے فروغ دیں گے. کوئی ایک فریق ثالث جدید ترین AI کی حفاظت کے فوری سوالات کا جامع احاطہ نہ کر سکتا ہے اور نہ اسے کرنا چاہیے. ہم اپنی صلاحیت بڑھانے اور ترقی پذیر فریق ثالث نظام کو بہترین طریقوں اور اصولوں پر متفق ہونے کے قابل بنانے کے لیے سوچ سمجھ کر اور واضح مقصد کے ساتھ آگے بڑھیں گے. ہم مذکورہ ترجیحی شعبوں سے ہم آہنگ تجاویز کے بارے میں متعدد فریق ثالث سے بات چیت کر رہے ہیں.