تطوير استخدام الحاسوب بالتعاون مع Ironclad
كيف يساعدنا التعاون البحثي في مجال التعاقد على تدريب وكلاء الذكاء الاصطناعي وتقييمهم في الأعمال المهنية المعقدة.
عندما قدّمنا GPT‑6 Astra، أظهرنا مدى تقدّم نماذجنا في استخدام الحاسوب للأعمال المهنية، من إعداد المستندات إلى اختبار المواقع الإلكترونية. هدفنا التالي هو تعزيز قدرة الوكلاء وكفاءتهم في استخدام البرمجيات المتخصصة لحل مشكلات الأعمال المعقدة. نستكشف كيفية تدريب النماذج على فهم قواعد العمل في الشركات، وتنفيذ مسارات عمل متعددة الخطوات، والتحقق من أن ما أنجزته يلبّي المتطلبات الأصلية.
ولتسريع هذا البحث، نتعاون مباشرة مع عدد محدود من شركات البرمجيات الأكثر دراية بمسارات العمل هذه. نعمل معًا على تحديد مهام صعبة وعالية القيمة وتحويلها إلى مسائل بحثية لتدريب نماذجنا وتقييمها، بما يجعلها في نهاية المطاف أكثر قدرة وفائدة في تطبيقات الأعمال الواقعية.
شريكنا الأول هو Ironclad، شركة رائدة في التعاقد المدعوم بالذكاء الاصطناعي. بالتعاون الوثيق مع فريق Ironclad، طوّرنا مهام تتطلب من الوكلاء إعداد اتفاقيات وموافقات وشروط قانونية قابلة لإعادة الاستخدام، وأثبتنا إحراز تقدّم في مسارات العمل المعقدة هذه. كان لخبرة Ironclad دور أساسي في تحديد معايير النجاح وإدخال احتياجات العملاء الفعلية مباشرة في عملية تطوير النماذج الرائدة. نحن ممتنون لهذه الشراكة ومتحمسون لمشاركة ما أنجزناه معًا.
GPT‑6 Astra هو أول نموذج رائد لنا يُدرَّب على مهام Ironclad. في تقييمنا البحثي، تجاوز متوسط درجاته متوسط GPT‑5.6 Sol بنسبة 32%، بينما انخفض الوقت التقديري لكل محاولة بنسبة 48%.1
لنتصور فريق عمليات قانونية يُعدّ إجراءات لشراء البرمجيات. قد يلزم الحصول على موافقة الفريق المالي على المشتريات التي تتجاوز مبلغًا معينًا، ومراجعة فريق الأمن لطلبات محددة، ومراجعة الفريق القانوني للشروط غير القياسية. على المسؤول عن إعداد هذه العملية تحويل تلك القائمة القصيرة إلى نموذج لتلقّي الطلبات، وقوالب مستندات، وقواعد للموافقة، وسجلّ للاتفاقية النهائية.
ويجب على وكيل الذكاء الاصطناعي الذي يؤدي العمل نفسه أن يُبقي هذه المتطلبات حاضرة أثناء تنقّله داخل البرنامج. فعليه، مثلًا، إعداد موافقة الفريق المالي عند تجاوز حدّ الإنفاق، والتحقق من أن الطلبات التي تتجاوز هذا الحدّ وتلك التي تقلّ عنه تسلك المسارات الصحيحة. لا يكفي تنفيذ كل خطوة على نحو صحيح؛ بل يجب أن تعمل العملية المكتملة في مختلف الحالات التي صُمّمت للتعامل معها.
ساعد موظفو Ironclad ومستخدمو منصتها في OpenAI باحثينا على تحديد 11 مهمة في الأعمال القانونية والتجارية والمشتريات. شملت هذه المهام إعداد اتفاقيات عدم الإفصاح، وإنشاء إجراءات الموافقة على المشتريات، وتحديث بند قانوني قابل لإعادة الاستخدام ليعكس الاختصاص القضائي الذي يختاره مقدّم الطلب. نقدّر أن المستخدم المتمرّس يحتاج إلى نحو 30 إلى 40 دقيقة لكل مهمة في المتوسط لإنجاز هذا العمل.
قيّمنا كل مهمة وفق 8 إلى 50 معيارًا، بحسب درجة تعقيدها. أتاح لنا ذلك معرفة الأجزاء التي أنجزها النموذج على نحو صحيح ومواضع قصوره. وفّرت Ironclad أيضًا بيئات برمجية مستضافة لمنتجها، تتيح للنماذج التدرّب على هذه المهام. طوّر باحثونا مهام تدريبية اصطناعية2 تحاكي مسارات عمل نموذجية، واستخدموا التعلم بالتعزيز لمساعدة النماذج على التحسّن من خلال الممارسة والتغذية الراجعة. يضمن هذا المزيج، من مهام نختارها مع أشخاص على دراية بالعمل، ومعايير تفصيلية، وبيئة لتدرّب النماذج، أننا نُحسّن أداء النماذج في المهام الواقعية الأكثر أهمية لعملائنا.
قارنّا بين Astra وGPT‑5.6 Sol باستخدام مستوى الاستدلال «Max» مع Astra ومستوى الاستدلال «عالٍ» مع Sol، وهما الإعدادان اللذان حقق كل نموذج عندهما أعلى درجاته. عبر المهام البحثية الإحدى عشرة، بلغ متوسط درجات Astra نسبة 55.0%، مقابل 41.6% لنموذج GPT‑5.6 Sol، بينما انخفض متوسط الوقت التقديري لكل محاولة من 37.0 دقيقة مع Sol إلى 19.2 دقيقة مع Astra.3 وحقق نموذج داخلي استُخدم في تطوير Astra نتيجة أفضل بلغت 63.7% في هذه المهام، ونسعى إلى نقل هذه التحسينات الإضافية إلى النماذج المستقبلية.
المقياس | GPT‑5.6 Sol | GPT‑6 Astra |
متوسط الدرجة وفق معايير التقييم | 41.6% | 55.0% |
متوسط الوقت التقديري لكل محاولة | 37.0 دقيقة | 19.2 دقيقة |
استوفى Astra مزيدًا من متطلبات المهام في وقت محاكاة أقل لكل محاولة. يوضح المقطعان أدناه كيف تعامل النموذجان مع المهمة البحثية نفسها. استوفى Astra (في المقطع الأول) نحو 94% من معايير المهمة في وقت تقديري بلغ 20 دقيقة؛ واستوفى GPT‑5.6 Sol (في المقطع الثاني) نحو 85% في وقت تقديري بلغ 32 دقيقة.
استوفى GPT‑6 Astra نحو 94% من معايير المهمة في وقت تقديري بلغ 20 دقيقة.
استوفى GPT‑5.6 Sol نحو 85% من معايير المهمة في وقت تقديري بلغ 32 دقيقة.
يعكس دور Ironclad في هذا العمل تحديًا يعرفه عملاؤها جيدًا: يجب أن تتعامل عملية التعاقد مع الاستثناءات مع الالتزام بالقواعد التي تعتمد عليها الشركة. إذا أغفل وكيل إحدى هذه القواعد أثناء تنفيذ مهمة، فإن ذلك يحدّ من المهام التي يمكن لشركة برمجيات أن تسندها إليه بثقة. وهذا يؤكد استمرار أهمية الإشراف البشري مع تحسّن أداء الوكلاء في مهام التعاقد المعقدة، ويبيّن لماذا تظل منصة التعاقد المتكاملة ضرورية. يتيح التعاون مع باحثينا لشركة Ironclad طرح هذه المشكلات خلال تطوير النموذج الأساسي، لندرسها معًا.
ومع تطور قدرات النماذج، تتاح لشركة Ironclad فرصة استخدامها في المزيد من منتجاتها. وبالنسبة إلى الفرق القانونية وفرق الأعمال، قد يعني ذلك أن يتولى الذكاء الاصطناعي جزءًا أكبر من الجهد اللازم لعمليات التعاقد المعقدة، مع الحفاظ على الضوابط التي تعتمد عليها هذه الفرق.
ندعو عددًا محدودًا من شركات البرمجيات إلى العمل مباشرة مع فرق البحث والهندسة لدينا على مهام مهنية مهمة لا يزال الوكلاء الحاليون عاجزين عن إتمامها بموثوقية. إذا كانت لدى فريقكم مهمة من هذا النوع، فنودّ الاطلاع على مثال ملموس: ما الذي تطلبونه من الوكيل، وما الأدلة على مواضع إخفاقه، وكيف تقيّمون نجاح النتيجة. ينبغي أيضًا أن يتمكن الشركاء من إشراك أشخاص لديهم معرفة عميقة بالعمل، وتوفير بيئة آمنة للاختبار وبيانات يمكن استخدامها بأمان في البحث. يمنحنا ذلك نقطة انطلاق لدراسة الإخفاق وقياس مدى تحسّن النموذج.
إذا كان ذلك ينطبق على فريقكم، فتقدّموا بطلب لاستكشاف فرص التعاون البحثي.
المؤلف
الحواشي
- 1
- 2
أنشأنا مهام محاكاة من عقود متاحة للجمهور في قاعدة بيانات EDGAR التابعة لهيئة الأوراق المالية والبورصات الأمريكية (SEC)، بعد تطبيق عوامل تصفية مصممة لإزالة المعلومات الشخصية. لم نستخدم بيانات عملاء OpenAI، أو عقود OpenAI الداخلية، أو بيانات عملاء Ironclad أو عقودهم غير المتاحة للجمهور في التدريب أو التقييم.
- 3


