مرکزی مواد پر جائیں
OpenAI

۶ ستمبر، ۲۰۲۶

تحقیقاشاعتحفاظت

تحقیق میں تیزی: OpenAI کے اندر کا منظر

لوڈ ہو رہا ہے…

ہم یقین رکھتے ہیں کہ AGI سے پوری انسانیت کو فائدہ پہنچانے کے لیے، اس کا نظم و نسق جمہوری طور پر ہونا چاہیے. یہ صرف انتہائی قابل AI نظاموں کی صلاحیتوں، خطرات اور حفاظتی تدابیر کے بارے میں ایک باخبر عوامی بحث کے ذریعے ہی ممکن ہو سکتا ہے. ہر جگہ لوگوں کو فرنٹیئر AI کے ممکنہ مستقبل کے رخ کو سمجھنے کی ضرورت ہے، تاکہ وہ اس کی ترقی کے بارے میں بامعنی رائے دے سکیں.

مخصوص خطرات، واقعات اور حفاظتی تدابیر کے بارے میں شفافیت ضروری ہے، لیکن کافی نہیں. ہمارا ماننا ہے کہ عوام کو یہ بھی سمجھنے کی ضرورت ہے کہ سب سے زیادہ صلاحیت والے نظام کس طرح ترقی کر رہے ہیں اور وہ فرنٹیئر لیبز کے اندر تحقیقی پیش رفت کو کیسے آگے بڑھا رہے ہیں.

ہمارا مقصد ایک خودکار AI محقق کو محفوظ طریقے سے بنانا ہے جو انسانی نگرانی میں کام کر سکے اور ڈیپ لرننگ اور ہم آہنگی میں مزید پیش رفت کے لیے تکراری بہتریاں ممکن بنائے. ہماری پیمائشوں کے مطابق، ہم اب اس ہدف کو حاصل کر چکے ہیں، جس کا گزشتہ خزاں میں اعلان⁠(نئی ونڈو میں کھلتا ہے) کیا گیا تھا، کہ اس سال ستمبر تک ہمارے پاس ایک خودکار تحقیقی انٹرن ہو. "ریسرچ انٹرن" سے ہماری مراد ایک ایسا نظام ہے جو انسانی رہنمائی میں واضح طور پر متعین تحقیقی کام انجام دے سکے، جن میں ایسے کام بھی شامل ہیں جنہیں ایک ماہر محقق کو کرنے میں چند دن لگ سکتے ہیں. ہم مارچ 2028 تک ایک خودکار AI محقق بنانے کی سمت نمایاں پیش رفت کر رہے ہیں.

اس سال کے دوران، OpenAI کے محققین کے روزمرہ کام میں نمایاں تبدیلی آئی ہے. محققین دن بھر کوڈنگ ایجنٹس استعمال کر رہے ہیں (اکثر بیک وقت سیشنز میں) اور مجموعی استعمال تیزی سے بڑھ رہا ہے، جو OpenAI کی دیگر ٹیموں میں اضافے کی رفتار سے آگے ہے. محققین زیادہ تیزی سے کوڈ میں تعاون کر رہے ہیں اور مزید تجربات چلا رہے ہیں. محققین جس طرح ایجنٹس کا استعمال کرتے ہیں، وہ بھی بدل رہا ہے: ایجنٹس بتدریج زیادہ پیچیدہ کام انجام دے رہے ہیں، اور ان میں زیادہ کثرت سے کامیاب بھی ہو رہے ہیں. AI کی تحقیق ایک پیچیدہ عمل ہے جس میں کئی ممکنہ رکاوٹیں ہو سکتی ہیں، اس لیے پیش رفت کی مجموعی رفتار غالباً ان مخصوص پیمانوں کے ساتھ اپنی رفتار برقرار نہیں رکھ سکے گی. لیکن مجموعی طور پر، یہ نتائج اس وسیع تر تاثر سے مطابقت رکھتے ہیں جو ہم میں سے بہت سے لوگوں کو داخلی طور پر ہے کہ ایجنٹک ٹولز تحقیق کی پیش رفت کو نمایاں طور پر تیز کر رہے ہیں. لوگ اب بھی ہماری تحقیقی ترجیحات طے کرتے ہیں، پرکھتے ہیں کہ کن خیالات اور نتائج کو آگے بڑھایا جائے اور فیصلہ کرتے ہیں کہ نظاموں کو وسعت دی جائے، عارضی طور پر روکا جائے یا تعینات کیا جائے.

اگر یہ ذمہ داری سے کیا جائے تو ہمیں یقین ہے کہ خودکار AI تحقیق ایسے ماڈل فراہم کرے گی جو براہ راست انسانی بہبود کو بہتر بنائیں گے اور OpenAI کے مشن کو آگے بڑھائیں گے. یہ جدید انٹیلیجنس کی لاگت کم کر سکتی ہے تاکہ دنیا بھر کے لوگ فائدہ اٹھا سکیں. ہم یہ کام جزوی طور پر اس لیے کر رہے ہیں کہ خودکار تحقیق ہمیں AI الائنمنٹ کا مسئلہ حل کرنے اور روز بروز زیادہ صلاحیت رکھنے والی AI کے خلاف دفاعی نظام تیار کرنے میں مدد دے سکتی ہے. ایک خودکار AI محقق خودکار سیفٹی یا الائنمنٹ کا محقق بھی ہو سکتا ہے. زیادہ صلاحیت رکھنے والے اور ہم آہنگ نظام اہم بنیادی ڈھانچے کو محفوظ بنانے، خطرناک AI ایجنٹس کے خلاف دفاع کرنے اور نئے حفاظتی اقدامات تیار کرنے میں مدد کر سکتے ہیں.

یہ مفید خودکار تحقیقی صلاحیتیں تیار کرنے کی وجوہات ہیں، لیکن ان کا مطلب یہ نہیں کہ تیز رفتار RSI لازماً ایسا نتیجہ ہے جس کے حصول کی ہمیں کوشش کرنی چاہیے. آگے بڑھنا ہے یا نہیں، اور اگر ہاں تو کیسے، اس کا انحصار انسانی کنٹرول برقرار رکھنے کی ہماری صلاحیت اور فوائد و خطرات کے بارے میں باخبر جمہوری فیصلوں پر ہونا چاہیے.

ہم ابھی تک یہ نہیں جانتے کہ محفوظ طریقے سے ہم آہنگ، مکمل RSI کے مرحلے تک کیسے پہنچا جائے. ہم صلاحیتوں کے ساتھ ساتھ الائنمنٹ اور حفاظتی اقدامات کو بھی بڑے پیمانے پر وسعت دینے پر کام کر رہے ہیں. لیکن ہم یہ فرض نہیں کر سکتے کہ الائنمنٹ اور حفاظت میں پیش رفت اسی رفتار سے جاری رہے گی اور زیادہ صلاحیت رکھنے والے نظاموں کی نگرانی کرنا زیادہ مشکل ہو سکتا ہے. محتاط ہم آہنگی اور حفاظتی کام اس کوشش کا مرکزی حصہ ہے اور اس کا آغاز ان حفاظتی مسائل کی پیمائش اور تخفیف سے ہوتا ہے جو ہم آج ایجنٹک کوڈنگ سسٹمز میں دیکھتے ہیں. جب بھی ہمیں یہ معلوم ہوگا کہ آگے بڑھنے سے ناقابلِ قبول حفاظتی خطرہ پیدا ہوگا، تو ہم مناسب ردِعمل دیں گے، جس میں ایسے نظاموں کی تیاری یا تعیناتی کو سست کرنا یا روکنا بھی شامل ہے جن کی کافی حد تک حفاظت یقینی بنانے سے ہم خود کو قاصر پائیں گے.

حالیہ Hugging Face واقعے کے بعد، ہم نے اس عزم کو عملی جامہ پہنایا⁠ اور ڈیپلائمنٹ کے لیے تیار اپنے تازہ ترین ماڈلز کی ری اِنفورسمنٹ لرننگ (RL) ٹریننگ میں وقفہ کیا، جبکہ ہم نے اپنے تحقیقی ماحولوں کو مزید مضبوط بنایا، ان کی ریڈ ٹیمنگ کی اور اپنے نگرانی کے نظاموں کی کوریج بڑھائی. اس سے تمام تحقیق نہیں رکی: کچھ ورک لوڈز زیادہ سخت کنٹرولز کے تحت دوبارہ شروع ہوئے، جبکہ دیگر بدستور معطل رہے. ہم نے اپنے حفاظتی اور الائنمنٹ معیارات بلند کیے ہیں اور حفاظتی کام کو ماڈل کے لائف سائیکل میں مزید گہرائی تک شامل کر دیا ہے، جس کے لیے ٹریننگ کے پورے عمل میں ہم آہنگ رویے کے مضبوط تر شواہد درکار ہیں.

آج ہم اس بات کا ایک تفصیلی جائزہ پیش کر رہے ہیں کہ حالیہ مہینوں میں ایجنٹک سسٹمز نے RSI کی جانب ہماری پیش رفت میں کس طرح حصہ ڈالا ہے. ایجنٹک سسٹمز نئے ہیں اور تیزی سے بدل رہے ہیں، اور ہماری پیمائش کی کوششیں ابھی ابتدائی ہیں. ان ابتدائی نتائج اور ان کے پسِ پردہ طریقۂ کار کو شیئر کرکے، ہمارا مقصد عوام کو آگاہ کرنا، عوامی افشا کے معمول کی حوصلہ افزائی کرنا، اور اس شعبے کو پیمائش کے مشترکہ معیارات کی طرف بڑھنے میں مدد دینا ہے.

آخرکار، جیسا کہ ہم نے اپنے فرنٹیئر پالیسی بلیوپرنٹ⁠ میں لکھا ہے، ہمارا ماننا ہے کہ ہمیں اور دیگر کمپنیوں کو RSI کی جانب اپنی پیش رفت کو عوامی طور پر ٹریک کرنا لازم ہونا چاہیے. ایسے کسی تقاضے کے بغیر بھی، ہم اپنی RSI پیش رفت کے بارے میں شفاف رہنا جاری رکھنے کا ارادہ رکھتے ہیں. جیسے جیسے ہماری پیمائش کی تکنیکیں اور سمجھ بہتر ہوں گی، ہم شفافیت سے متعلق اپنے طریقۂ کار کو بتدریج بہتر بناتے رہیں گے، ساتھ ہی سیکیورٹی اور ملکیتی معلومات کے تحفظ کی ضرورت کے ساتھ توازن بھی برقرار رکھیں گے.

1. کوڈنگ ایجنٹس OpenAI کے محققین کے روزمرہ کام کو نئی شکل دے رہے ہیں

اس سال کے آغاز میں، OpenAI میں ایجنٹ کے استعمال کے لحاظ سے میڈین محقق کوڈنگ ایجنٹس کو صرف محدود مقدار میں استعمال کر رہا تھا. اگست کے وسط تک، میڈین محقق روزانہ اپنے کام میں ایجنٹس کو شامل کر رہا تھا، اور API کی قیمتوں کے حساب سے روزانہ $600 سے زیادہ کی انفرنس استعمال کر رہا تھا. ہماری تحقیقی تنظیم میں 90ویں پرسنٹائل کا صارف اب روزانہ $7,000 سے زیادہ مالیت کے ٹوکن استعمال کرتا ہے.

جون 2026 سے پہلے، تحقیقی ادارے میں ایجنٹس کے کل رن ٹائم کی مقدار اب بھی انسانی محنت کے کل وقت سے کم تھی. اس کے بعد سے یہ تبدیل ہو چکا ہے. 8 گھنٹے کے معیاری کام کے دن کے حساب سے، اگست کے وسط تک، تحقیقی ادارہ انسانی محنت کے ہر کام کے دن کے لیے مجموعی طور پر 3.1 ایجنٹ-کام کے دن کی محنت استعمال کرتا ہے.

اسے دیکھنے کا ایک اور طریقہ یہ ہے کہ یہ سمجھا جائے کہ کتنے محققین بہت زیادہ متوازی ورک فلوز استعمال کرتے ہیں (مثلاً، بیک وقت 4 یا اس سے زیادہ ایجنٹس چلانا). جیسا کہ نیچے دکھایا گیا ہے، یہ تعداد بڑھ رہی ہے. ان اعداد و شمار میں صارف کے ذریعے براہ راست شروع کیے گئے ایجنٹس اور اُن ایجنٹس سے آگے کے مراحل میں بنائے گئے ذیلی ایجنٹس، دونوں کی روزانہ کی زیادہ سے زیادہ قدریں شامل ہیں.

2. محققین مزید کوڈ لکھ رہے ہیں اور مزید تجربات کر رہے ہیں

AI کی زیادہ تر تحقیق کو ایک محنت طلب عمل کے طور پر دیکھا جا سکتا ہے، جس کا مقصد ماڈل کی انٹیلیجنس یا کارکردگی میں ہونے والی نئی بہتری کو ہمارے بنیادی ماڈلز میں سے کسی ایک میں شامل کرنا ہے. یہ عمل بہت سے مراحل پر منحصر ہے، اور صلاحیتیں اس وقت آگے بڑھتی ہیں جب تمام مراحل مل کر درست طریقے سے کام کریں: محققین کو نئی بہتریاں ڈیزائن کرنی ہوتی ہیں، ماڈل کی کارکردگی جانچنے کے لیے جائزے لکھنے ہوتے ہیں، ان بہتریوں کو بڑے پیمانے پر آزمانے کے لیے انفراسٹرکچر تیار کرنا ہوتا ہے، تربیت کے دوران بگز کے ساتھ ساتھ غیر محفوظ یا غیر ہم آہنگ رویّے بھی پکڑنے ہوتے ہیں اور کامیاب خیالات کو بنیادی تربیتی رن میں شامل کرنا ہوتا ہے. تحقیقی عمل کے کسی بھی حصے میں ناکامی پورے لوپ کو محدود کر سکتی ہے.

کوڈ لکھنا اور تجربات انجام دینا دو بڑی سرگرمیاں ہیں جو محققین اپنے کام کے حصے کے طور پر کرتے ہیں اور ہمیں ایسے شواہد ملتے ہیں کہ یہ عمل تیزی پکڑ رہے ہیں.

ان ڈیٹا پوائنٹس کی پیمائش نسبتاً آسان ہے، لیکن ان کی تشریح کرنا مشکل ہو سکتا ہے. جیسے جیسے خودکاری آگے بڑھے گی، وہ کام جو سب سے کم خودکار کیے جا سکتے ہیں، محققین کی کوشش کا بڑا حصہ لینے لگیں گے اور مستقبل کی پیش رفت کے لیے اہم رکاوٹیں بن جائیں گے. کمپیوٹ پیش رفت کے لیے ایک اور حد بندی کرنے والا عامل ہے اور وقت کے ساتھ، جیسے جیسے دیگر رکاوٹیں کم ہوتی جائیں، یہ زیادہ اہم ہو سکتا ہے.

2026 کے دوران، فی فعال تجربہ کنندہ تجربات کی تعداد میں اضافہ ہوا ہے، اور اگست 2026، جنوری 2025 میں ٹریکنگ شروع ہونے کے بعد سے اب تک کی ہائی سطح رہا ہے. اس کا تعلق Codex کو اپنانے میں اضافے سے ہے، تاہم ہم نوٹ کرتے ہیں کہ 2025 سے ہماری دستیاب کمپیوٹ صلاحیت بھی نمایاں طور پر بڑھی ہے.

3. محققین جن کاموں کے لیے ایجنٹس استعمال کرتے ہیں، وہ بدل رہے ہیں.

کیفی تاثرات اور داخلی ڈیٹا، دونوں سے ظاہر ہوتا ہے کہ محققین کوڈنگ ایجنٹس کو جو کام سونپتے ہیں ان کا امتزاج بدل رہا ہے اور وقت کے ساتھ ہائی سطح کے اور طویل مدت پر محیط کاموں کی تفویض زیادہ عام ہوتی جا رہی ہے.

اس رجحان کی زیادہ واضح تصویر حاصل کرنے کے لیے، ہم نے تحقیقی تنظیم میں حالیہ استعمال کا تجزیہ کیا، جس کے لیے Epoch AI کی تیار کردہ AI R&D لائف سائیکل کا حصہ بننے والے کام کی مختلف اقسام کی حال ہی میں شائع شدہ درجہ بندی⁠(نئی ونڈو میں کھلتا ہے) استعمال کی گئی. یہ درجہ بندی، جو ہر قسم کے کام کی درجہ بندی کے لیے طویل عرصے سے موجود O*NET نظام سے متاثر ہے، خاص طور پر فرنٹیئر AI R&D کے لیے تیار کی گئی ہے اور عمل کو چھ اہم مراحل میں تقسیم کرتی ہے:

  1. فیصلہ کریں: کس چیز پر کام کرنا ہے، کیا جاری رکھنا ہے، کہاں وسائل مختص کرنے ہیں

  2. ڈیزائن: تحقیقی آئیڈیاز اور انجینئرنگ کی تفصیلات

  3. تیار کریں: کوڈ اور ڈیٹا سیٹس

  4. چلائیں: ٹریننگ/ایویلیوایشن رنز، ہارڈویئر، سروِنگ

  5. تجزیہ کریں: تجربات، ماڈلز، تعیناتی، بیرونی کام

  6. مواصلت کریں: نتائج، فیڈبیک، صورتحال، فیصلے

ذیل میں، ہم کوڈنگ ایجنٹ ٹوکنز کو اس درجہ بندی کے تحت درجہ بند کرتے ہیں.

ہم دیکھتے ہیں کہ جنوری اور اگست 2026 کے درمیان تحقیقی سرگرمیوں کے تمام زمروں میں اضافہ ہوا ہے. جنوری میں، غالب زمرہ تحقیق اور انفراسٹرکچر کوڈ تھا. اس زمرے میں وسعت آئی ہے، لیکن ہمیں اضافی زمروں میں بھی قابلِ ذکر اضافہ نظر آتا ہے، خاص طور پر تکنیکی مدد اور مانیٹرنگ رنز میں. ہائی لیول پلاننگ اب بھی ایجنٹ کے آؤٹ پٹ ٹوکنز کا نہایت معمولی حصہ رہتی ہے.

غیر رسمی مشاہدات کے مطابق، ساتھی بتاتے ہیں کہ کوڈنگ ایجنٹس اندرونی تحقیقی انفراسٹرکچر کی خرابیوں کا سراغ لگانے میں بہت اچھے ہیں، جس سے تحقیق کی پیش رفت میں حائل ایک اہم رکاوٹ دور ہوتی ہے. کئی ٹیموں نے، جو پہلے محققین کو اپنے تجربات میں پیش آنے والے مسائل حل کرنے میں مدد دینے کے لیے آفس آورز سیشنز منعقد کرتی تھیں، 2026 میں حاضری میں کمی نوٹ کی ہے، اور ان میں سے ایک نے دوسرے نظامی بہتری کے کاموں پر توجہ دینے کے لیے یہ سیشنز مکمل طور پر بند کر دیے ہیں.

یہاں، ہم فی دن اعلیٰ سطحی پوسٹس کی تعداد کو ان اہم داخلی چینلز میں سے ایک کے لیے پلاٹ کرتے ہیں جہاں محققین دیگر ٹیموں سے تکنیکی معاونت حاصل کرتے ہیں. ہماری معلومات کے مطابق، چینل کی سرگرمی میں کمی کی تلافی اس بات سے نہیں ہوئی کہ استفسارات انسانوں کے ذریعے چلائے جانے والے کسی دوسرے تکنیکی معاونت چینل پر منتقل ہو گئے ہوں. ٹریفک میں کمی اس وسیع تر تبدیلی سے مطابقت رکھتی ہے.

ہم یہ بھی مطالعہ کر سکتے ہیں کہ آیا کوڈنگ ایجنٹس ان کاموں میں کامیاب ہو رہے ہیں جن کی محققین درخواست کرتے ہیں. ایک ایجنٹک کلاسیفائر استعمال کرتے ہوئے، ہمیں معلوم ہوتا ہے کہ جن کاموں کے لیے ہمیں گراؤنڈ ٹروتھ نتیجہ مل سکتا ہے، ان میں جنوری سے جولائی تک دشواری کے کئی زمروں میں (جنہیں اس تخمینی وقت سے ظاہر کیا گیا ہے جو کسی انسان کو کام مکمل کرنے میں لگتا ہے) کامیابی کی شرحیں عموماً بڑھیں. تاہم، ایجنٹس کو کامیاب ہونے کے لیے اب بھی خاطر خواہ انسانی رہنمائی کی ضرورت ہوتی ہے، خاص طور پر جب کام کی پیچیدگی بڑھتی ہے. گزشتہ 6 ماہ میں، چار سے آٹھ گھنٹے کے کامیاب کاموں میں سے نصف سے زیادہ میں ایک یا زیادہ مداخلتیں شامل تھیں.

محققین کے کاموں میں کامیابی کی شرح وقت کے ساتھ بڑھی ہے. گراف ایسی درجہ بندیوں کو خارج کرتا ہے جہاں نتیجہ غیر یقینی تھا، نیز ایسے ڈیٹا پوائنٹس کو بھی جن میں <50 سیشنز یا <50 منفرد صارفین ہوں.

جنوری سے جولائی تک ٹاسک کی کامیابی اور مداخلت کی شرح، زمانی افق (time horizon) کے لحاظ سے تقسیم کی گئی ہے. ایسی درجہ بندیوں کو شامل نہیں کرتا جن کا نتیجہ غیر یقینی تھا.

4. ماڈل کی ترقی کی رفتار مقرر کرنا

محفوظ اور فائدہ مند AGI کے لیے زیادہ قابل نظاموں کی جانب پیش رفت کا انحصار ایسے کام کے لیے درکار حفاظتی اقدامات پر بھی ہوگا. ضروری حفاظتی اقدامات کے بارے میں ہمارا جائزہ جیسے جیسے ہمیں خطرات کے بارے میں مزید معلومات حاصل ہوں گی، بدل سکتا ہے.

جیسا کہ ہم نے بیان کیا ہے،⁠ ہم نے حال ہی میں نگرانی، ہم آہنگی اور سیکیورٹی کے لیے اپنے معیارات کو اپ ڈیٹ کیا ہے. یہاں، ہم دکھاتے ہیں کہ حالیہ پابندیوں نے تحقیقی سرگرمی کے ایک پہلو کو کس طرح متاثر کیا ہے.

*یہاں 20 جولائی سے 6 اگست کے درمیان دکھائے گئے Astra کمپیوٹ کی اکثریت کا مقصد حفاظت اور سیکیورٹی میں بہتریوں کے نفاذ کی جانچ کرنا تھا.

20 جولائی کو، یہ معلوم ہونے کے بعد کہ ایجنٹس نے ہمارے تحقیقی انفراسٹرکچر پر سمجھوتہ کر دیا تھا، ہم نے تربیت کے لیے استعمال ہونے والی کنٹینر سروس کو عارضی طور پر بند کر دیا اور پھر اسے نمایاں اضافی پابندیوں کے ساتھ بحال کیا.

اس کے نتیجے میں RL ٹریننگ کے کمپیوٹ میں تیزی سے کمی آئی، جبکہ ٹیموں نے مزید محفوظ بنائے گئے تحقیقی ماحول میں کام کرنے کے لیے اپنے ورک فلوز کو از سرِ نو ترتیب دیا. اوپر والے پلاٹ میں ڈیپلائمنٹ کے لیے تیار کیے گئے ہمارے تازہ ترین ماڈلز پر ری اِنفورسمنٹ لرننگ میں دو ہفتے کا وقفہ شامل ہے. 20 جولائی سے 6 اگست کے درمیان Astra-کلاس RL تجربات میں رنز کی اکثریت (GPU الاٹمنٹ کے لحاظ سے) سیفٹی اور سیکیورٹی میں بہتریوں کے نفاذ کی جانچ کرنے کے لیے ہے.

7 اگست کو، ابتدائی شواہد کہ Astra میں اہم سائبر صلاحیتیں ہو سکتی ہیں⁠ ہمارے تیاری کا فریم ورک⁠(نئی ونڈو میں کھلتا ہے) کے تحت، اضافی ماڈل کے لیے مخصوص سیکیورٹی پابندیوں کا باعث بنے، جن کے تحت Astra ماڈل کو ہائی محفوظ تحقیقی ماحول میں چلانا ضروری تھا. اگلے ہفتے، Astra-کلاس GPU کی تخصیص میں مزید 59.2 فیصد کمی ہوئی، لیکن دیگر ماڈل کلاسز کے لیے تخصیص 17.2 فیصد بڑھ گئی. اس اضافے نے Astra-کلاس میں کمی کے تقریباً 85 فیصد کی تلافی کر دی، جس کے نتیجے میں زیرِ تجزیہ RL ورک لوڈز میں کل تخصیص بڑی حد تک غیر تبدیل شدہ رہی. یہ پیٹرن Astra سے متعلق کام محدود ہونے کے دوران کچھ ٹریننگ اور تجربات کے نان-Astra ماڈلز کی طرف منتقل ہونے سے مطابقت رکھتا ہے اور محققین کی ان غیر رسمی رپورٹوں سے بھی مطابقت رکھتا ہے کہ انہوں نے کمپیوٹنگ وسائل کے دوسرے استعمال تلاش کیے، جنہیں اب نئی پابندیوں کے دائرے میں آنے والے ورک لوڈز کے لیے استعمال نہیں کیا جا سکتا تھا.

یہ ڈیٹا تربیت اور سلامتی کے بارے میں جاری مباحثوں کے لیے ایک مفید اشارہ فراہم کرتا ہے: جب نئے کنٹرولز متعارف کرائے جاتے ہیں، تو کمپیوٹ قیمتی اور لچکدار رہتا ہے اور فطری طور پر تحقیقی نظام کے اندر متبادل استعمالات کی طرف منتقل ہو جاتا ہے. طویل مدت میں، AI کی پیش رفت کی رفتار کے بارے میں مباحثوں کا دائرہ اس سوال تک بھی بڑھنا چاہیے کہ نئے یا مجوزہ ضوابط کے تابع کمپیوٹنگ وسائل کو بہترین طور پر کیسے استعمال کیا جا سکتا ہے.

5. آگے کا راستہ

ہم آہنگ RSI کی سمت پیش رفت کرنا اور اس پیش رفت کو سمجھنا ہمارے مشن کے لیے اہم ہے. ہم اپنے طریقوں کو بہتر بناتے رہیں گے، اپنی ارتقا پذیر سمجھ بوجھ کے بارے میں رپورٹ کریں گے اور فرنٹیئر سسٹمز پر باخبر عوامی بحث اور بامعنی جمہوری حکمرانی کے لیے کام کریں گے.

ضمیمہ: اس پوسٹ کے لیے ہمارا طریقۂ کار

ایجنٹ سے تقویت یافتہ AI تحقیق ابھی نئی ہے، اور ہم اب بھی یہ سیکھ رہے ہیں کہ اس کی پیمائش کیسے کی جائے. کچھ اشاریے، جیسے ہماری تحقیقی ٹیمیں جتنی مقدار میں کوڈ تیار کرتی ہیں، جمع کرنا نسبتاً آسان ہوتے ہیں، لیکن ان کی تشریح کرنا مشکل ہوتا ہے کیونکہ تحقیقی پیش رفت سے ان کا تعلق غیر یقینی ہوتا ہے. وہ پیمانے جو تحقیقی پیش رفت پر زیادہ براہِ راست توجہ دیتے ہیں—مثلاً یہ کہ ایجنٹس محققین کے دیے گئے کاموں میں کتنی بار کامیاب ہوتے ہیں—زیادہ مفید ہو سکتے ہیں، لیکن انہیں تیار کرنا اور ان کی توثیق کرنا پیچیدہ ہے. اس مشکل میں مزید اضافہ یہ ہے کہ وہ آلات اور نظام جن پر محققین انحصار کرتے ہیں، تیزی سے ارتقا پذیر ہیں. تحقیقی رفتار میں اضافے کے بارے میں اپنی سمجھ کو گہرا کرنا OpenAI میں ایک اہم توجہ کا شعبہ ہے.

ان تمام تجزیوں میں، جب تک بصورتِ دیگر ذکر نہ کیا جائے:

  • "محقق" ہمارے تحقیقاتی ادارے کے کسی بھی رکن کے لیے ایک وسیع اصطلاح ہے، جس میں وہ افراد بھی شامل ہیں جو تحقیقی انفراسٹرکچر بناتے ہیں، تحقیقی پروجیکٹس کا نظم و نسق سنبھالتے ہیں، یا کسی اور طریقے سے ادارے کی معاونت کرتے ہیں.

  • کوڈنگ ایجنٹ کے استعمال کے پیمانے زیادہ تر، مگر تمام نہیں، استعمال کا احاطہ کرتے ہیں، کیونکہ محققین جن ٹولز اور سسٹمز پر انحصار کرتے ہیں وہ تیزی سے ارتقا پذیر ہیں.