آئرن کلاڈ کے ساتھ کمپیوٹر استعمال کی صلاحیت کو بہتر بنانا
معاہدہ سازی میں تحقیقی اشتراک کس طرح پیچیدہ پیشہ ورانہ کاموں پر مصنوعی ذہانت کے ایجنٹوں کی تربیت اور جانچ میں ہماری مدد کر رہا ہے.
جب ہم نے GPT‑6 Astra متعارف کرایا، تو ہم نے دکھایا کہ دستاویزات تیار کرنے سے لے کر ویب سائٹس کی آزمائش تک، پیشہ ورانہ کاموں کے لیے کمپیوٹر استعمال کرنے میں ہمارے ماڈل کتنی ترقی کر چکے ہیں. ہمارا اگلا ہدف یہ ہے کہ پیچیدہ کاروباری مسائل حل کرنے کے لیے مخصوص سافٹ ویئر استعمال کرنے میں ایجنٹوں کی صلاحیت اور کارکردگی بہتر بنائی جائے. ہم یہ کھوج رہے ہیں کہ ماڈلوں کو کسی کمپنی کے کاروباری قواعد سمجھنے، کئی مراحل پر مشتمل طریقۂ کار انجام دینے، اور یہ تصدیق کرنے کی تربیت کیسے دی جائے کہ ان کا کام اصل تقاضوں پر پورا اترتا ہے.
اس تحقیق کو تیز کرنے کے لیے ہم چند ایسی سافٹ ویئر کمپنیوں کے ساتھ براہ راست شراکت کر رہے ہیں جو ان طریقۂ کار کی بہترین سمجھ رکھتی ہیں. ہم مل کر مشکل اور بڑی اہمیت کے حامل کاموں کی نشاندہی کر رہے ہیں اور انہیں اپنے ماڈلوں کی تربیت اور جانچ کے لیے تحقیقی مسائل میں بدل رہے ہیں. اس سے بالآخر ہمارے ماڈل حقیقی کاروباری استعمال میں زیادہ قابل اور کارآمد بنیں گے.
ہمارا پہلا شراکت دار آئرن کلاڈ ہے، جو مصنوعی ذہانت کی مدد سے معاہدہ سازی میں ایک سرکردہ کمپنی ہے. آئرن کلاڈ کی ٹیم کے ساتھ قریبی تعاون سے ہم نے ایسے کام تیار کیے ہیں جن میں ایجنٹوں کو معاہدوں، منظوریوں اور دوبارہ استعمال کے قابل قانونی شرائط کی ترتیب دینی ہوتی ہے، اور ان پیچیدہ طریقۂ کار میں پیش رفت دکھائی ہے. آئرن کلاڈ کی مہارت نے کامیابی کے معیارات طے کرنے اور صارفین کی حقیقی ضروریات کو جدید ترین ماڈلوں کی تیاری میں براہ راست شامل کرنے میں کلیدی کردار ادا کیا ہے. ہم ان کی شراکت کے شکرگزار ہیں اور مل کر حاصل کردہ کامیابیاں آپ کے سامنے پیش کرنے کے لیے پُرجوش ہیں.
GPT‑6 Astra ہمارا پہلا جدید ترین ماڈل ہے جسے آئرن کلاڈ کے کاموں پر تربیت دی گئی ہے. ہماری تحقیقی جانچ میں اس کا اوسط اسکور GPT‑5.6 Sol سے 32% زیادہ تھا، جبکہ فی کوشش تخمینی وقت 48% کم تھا.1
فرض کریں کہ قانونی امور کی ایک ٹیم سافٹ ویئر خریدنے کا عمل ترتیب دے رہی ہے. ایک مقررہ رقم سے زیادہ کی خریداری کے لیے شعبۂ مالیات کی منظوری، بعض درخواستوں کے لیے شعبۂ سلامتی کا جائزہ، اور غیرمعیاری شرائط کے لیے شعبۂ قانون کا جائزہ درکار ہو سکتا ہے. یہ عمل ترتیب دینے والے شخص کو اس مختصر فہرست کی بنیاد پر درخواست فارم، دستاویزات کے سانچے، منظوری کے قواعد، اور حتمی معاہدے کا ریکارڈ تیار کرنا ہوتا ہے.
یہی کام کرنے والے مصنوعی ذہانت کے ایجنٹ کو سافٹ ویئر میں مختلف مراحل سے گزرتے ہوئے ان تقاضوں کو پیش نظر رکھنا ہوتا ہے. مثلاً، اسے خرچ کی مقررہ حد سے زیادہ رقم کے لیے شعبۂ مالیات کی منظوری کا انتظام کرنا ہوگا اور یہ جانچنا ہوگا کہ اس حد سے اوپر اور نیچے کی درخواستیں درست مراحل سے گزرتی ہیں. ہر مرحلہ الگ سے درست انجام دینا کافی نہیں: مکمل عمل کو ان تمام صورتوں میں درست کام کرنا چاہیے جنہیں سنبھالنے کے لیے اسے بنایا گیا ہے.
آئرن کلاڈ کے ملازمین اور OpenAI میں آئرن کلاڈ استعمال کرنے والے افراد نے قانونی، تجارتی اور خریداری کے شعبوں میں 11 کاموں کی نشاندہی کرنے میں ہمارے محققین کی مدد کی. ان میں رازداری کے معاہدے ترتیب دینا، خریداری کی منظوری کے عمل بنانا، اور دوبارہ استعمال کے قابل قانونی شق کو اس طرح تازہ کرنا شامل تھا کہ وہ درخواست گزار کے منتخب کردہ دائرۂ اختیار کے مطابق ہو. ہمارا اندازہ ہے کہ ایک تجربہ کار صارف کو ان میں سے ہر کام مکمل کرنے میں اوسطاً تقریباً 30 سے 40 منٹ لگیں گے.
ہم نے ہر کام کی پیچیدگی کے لحاظ سے اسے 8 سے 50 معیارات پر پرکھا. اس سے ہمیں معلوم ہوا کہ ماڈل نے کون سے حصے درست انجام دیے اور کہاں کمی رہ گئی. آئرن کلاڈ نے اپنی مصنوع کے میزبانی شدہ سافٹ ویئر ماحول بھی فراہم کیے، جہاں ماڈل ان کاموں کی مشق کر سکتے تھے. ہمارے محققین نے نمائندہ طریقۂ کار کی بنیاد پر مصنوعی تربیتی کام2 تیار کیے اور ری اِنفورسمنٹ لرننگ استعمال کی تاکہ ماڈل مشق اور آرا کی مدد سے بہتر ہو سکیں. کام کی سمجھ رکھنے والے افراد کے ساتھ منتخب کیے گئے کام، تفصیلی معیارات، اور ماڈلوں کے لیے مشق کی جگہ—ان تینوں کا امتزاج یقینی بناتا ہے کہ ہم حقیقی دنیا کے ان کاموں میں بہتری لا رہے ہیں جو ہمارے صارفین کے لیے سب سے اہم ہیں.
ہم نے آسٹرا اور GPT‑5.6 Sol کا موازنہ کرتے وقت آسٹرا کے لیے Max ریزننگ اور سول کے لیے ہائی ریزننگ استعمال کی. ان ترتیبات پر ہر ماڈل نے اپنا سب سے زیادہ اسکور حاصل کیا تھا. 11 تحقیقی کاموں میں آسٹرا کا اوسط اسکور 55.0% رہا، جبکہ GPT‑5.6 Sol کا 41.6% تھا. فی کوشش تخمینی اوسط وقت بھی سول کے 37.0 منٹ سے گھٹ کر آسٹرا کے لیے 19.2 منٹ رہ گیا.3 آسٹرا کی تیاری میں استعمال ہونے والے ایک داخلی ماڈل نے ان کاموں میں اس سے بھی بہتر، 63.7% اسکور حاصل کیا، اور ہمارا مقصد آئندہ ماڈلوں میں یہ مزید بہتری لانا ہے.
پیمانہ | GPT‑5.6 Sol | GPT‑6 Astra |
جانچ کے معیارات پر اوسط اسکور | 41.6% | 55.0% |
فی کوشش تخمینی اوسط وقت | 37.0 منٹ | 19.2 منٹ |
آسٹرا نے نقلی ماحول میں فی کوشش کم وقت لیتے ہوئے کام کے زیادہ تقاضے پورے کیے. نیچے دیے گئے دو مختصر ویڈیو دکھاتے ہیں کہ ماڈلوں نے ایک ہی تحقیقی کام کیسے انجام دیا. آسٹرا (پہلا ویڈیو) نے اندازاً 20 منٹ میں کام کے تقریباً 94% معیارات پورے کیے؛ GPT‑5.6 Sol (دوسرا ویڈیو) نے اندازاً 32 منٹ میں تقریباً 85% معیارات پورے کیے.
GPT‑6 Astra نے اندازاً 20 منٹ میں کام کے تقریباً 94% معیارات پورے کیے.
GPT‑5.6 Sol نے اندازاً 32 منٹ میں کام کے تقریباً 85% معیارات پورے کیے.
اس کام میں آئرن کلاڈ کا کردار ایک ایسے چیلنج کی عکاسی کرتا ہے جس سے اس کے صارفین بخوبی واقف ہیں: معاہدہ سازی کے عمل میں استثنائی صورتوں کو سنبھالنا بھی ضروری ہے اور ان قواعد کو برقرار رکھنا بھی جن پر کاروبار کا انحصار ہے. اگر کوئی ایجنٹ کام کے دوران ان میں سے کسی قاعدے کو نظرانداز کر دے، تو سافٹ ویئر کمپنی پورے اعتماد کے ساتھ اسے جو کام سونپ سکتی ہے، ان کا دائرہ محدود ہو جاتا ہے. اس سے واضح ہوتا ہے کہ معاہدہ سازی کے پیچیدہ کاموں میں ایجنٹوں کی صلاحیت بہتر ہونے کے باوجود انسانی نگرانی کیوں اہم ہے، اور معاہدہ سازی کا ایک جامع پلیٹ فارم کیوں اب بھی ضروری ہے. ہمارے محققین کے ساتھ کام کرکے آئرن کلاڈ ان مسائل کو بنیادی ماڈل کی تیاری کے عمل میں شامل کر سکتا ہے، جہاں ہم مل کر ان کا مطالعہ کر سکتے ہیں.
جیسے جیسے ماڈلوں کی صلاحیت بڑھتی ہے، آئرن کلاڈ کو اپنی مزید مصنوعات میں انہیں استعمال کرنے کا موقع ملتا ہے. قانونی اور کاروباری ٹیموں کے لیے اس کا مطلب یہ ہو سکتا ہے کہ مصنوعی ذہانت معاہدہ سازی کے پیچیدہ کاموں میں زیادہ محنت اپنے ذمے لے، اور ساتھ ہی ان کنٹرولز کو برقرار رکھے جن پر یہ ٹیمیں انحصار کرتی ہیں.
ہم چند سافٹ ویئر کمپنیوں کو دعوت دے رہے ہیں کہ وہ ہماری تحقیقی اور انجینئرنگ ٹیموں کے ساتھ براہ راست ایسے اہم پیشہ ورانہ کاموں پر کام کریں جنہیں آج کے ایجنٹ اب بھی قابلِ اعتماد طریقے سے مکمل نہیں کر سکتے. اگر آپ کی ٹیم کے پاس ایسا کوئی کام ہے تو ہم اس کی ایک ٹھوس مثال دیکھنا چاہیں گے: آپ ایجنٹ سے کیا کروانا چاہتے ہیں، اس کی ناکامی کے شواہد کیا ہیں، اور آپ کامیاب نتیجے کو کیسے پرکھیں گے. شراکت داروں کو ایسے افراد بھی مہیا کرنے کے قابل ہونا چاہیے جو اس کام کی گہری سمجھ رکھتے ہوں، نیز آزمائش کے لیے محفوظ ماحول اور ایسا ڈیٹا بھی جو تحقیق میں محفوظ طریقے سے استعمال ہو سکے. اس سے ہمیں ناکامی کی چھان بین شروع کرنے اور ماڈل میں بہتری کی پیمائش کرنے کی بنیاد ملتی ہے.
اگر آپ کی ٹیم ان شرائط پر پوری اترتی ہے تو تحقیقی اشتراک کے امکانات دریافت کرنے کے لیے درخواست دیں.
مصنف
حواشی
- 1
- 2
- 3


