پیشبرد استفاده از رایانه با Ironclad
چگونه یک همکاری پژوهشی در حوزهٔ قراردادها به ما در آموزش و ارزیابی عاملهای هوش مصنوعی برای کارهای تخصصی پیچیده کمک میکند.
هنگام معرفی GPT‑6 Astra، نشان دادیم که مدلهای ما در استفاده از رایانه برای کارهای تخصصی، از تهیهٔ اسناد تا آزمودن وبسایتها، چقدر پیشرفت کردهاند. هدف بعدی ما این است که عاملها را در استفاده از نرمافزارهای تخصصی برای حل مسائل پیچیدهٔ کسبوکار، توانمندتر و کارآمدتر کنیم. در حال بررسی روشهایی برای آموزش مدلها هستیم تا قواعد کسبوکار یک شرکت را درک کنند، گردشکارهای چندمرحلهای را اجرا کنند و مطمئن شوند که کارشان الزامات اولیه را برآورده میکند.
برای شتاب بخشیدن به این پژوهش، مستقیماً با تعداد محدودی از شرکتهای نرمافزاری همکاری میکنیم که بیشترین شناخت را از این گردشکارها دارند. با هم، وظایف چالشبرانگیز و ارزشمند را شناسایی میکنیم و آنها را به مسائل پژوهشی برای آموزش و ارزیابی مدلهایمان تبدیل میکنیم؛ کاری که در نهایت مدلهای ما را در کاربردهای واقعی کسبوکار توانمندتر و مفیدتر میکند.
نخستین شریک ما Ironclad است؛ یکی از شرکتهای پیشتاز در مدیریت قرارداد با هوش مصنوعی. در همکاری نزدیک با تیم Ironclad، وظایفی طراحی کردهایم که عاملها برای انجام آنها باید قراردادها، تأییدیهها و شروط حقوقیِ قابل استفادهٔ مجدد را پیکربندی کنند و پیشرفت مدلها در این گردشکارهای پیچیده را نشان دادهایم. تخصص Ironclad در تعریف معیارهای موفقیت و وارد کردن مستقیم نیازهای واقعی مشتریان به فرایند توسعهٔ مدلهای پیشرو، نقشی کلیدی داشته است. از این همکاری سپاسگزاریم و مشتاقیم دستاوردهای مشترکمان را با شما به اشتراک بگذاریم.
GPT‑6 Astra نخستین مدل پیشروی ماست که با وظایف Ironclad آموزش دیده است. در ارزیابی پژوهشی ما، میانگین امتیاز آن ۳۲٪ بالاتر از GPT‑5.6 Sol بود، در حالی که زمان برآوردشده برای هر تلاش ۴۸٪ کمتر بود.1
تیم عملیات حقوقیای را در نظر بگیرید که در حال راهاندازی فرایندی برای خرید نرمافزار است. ممکن است خریدهای بالاتر از مبلغی مشخص به تأیید واحد مالی نیاز داشته باشند، بعضی درخواستها نیازمند بررسی واحد امنیت باشند و شروط غیراستاندارد هم به بررسی واحد حقوقی نیاز داشته باشند. کسی که این فرایند را راهاندازی میکند باید این فهرست کوتاه را به فرم ثبت درخواست، قالبهای اسناد، قواعد تأیید و سابقهای از قرارداد نهایی تبدیل کند.
عامل هوش مصنوعیای که همین کار را انجام میدهد، باید هنگام کار با بخشهای مختلف نرمافزار، این الزامات را در نظر داشته باشد. برای مثال، باید برای هزینههای بالاتر از سقف تعیینشده، تأیید واحد مالی را الزامی کند و بررسی کند که درخواستهای بالاتر و پایینتر از این سقف، مسیر درست را طی میکنند. درست انجام دادن تکتک مراحل کافی نیست: فرایند نهایی باید در همهٔ موقعیتهایی که برای آنها طراحی شده است، درست کار کند.
کارکنان Ironclad و افرادی که در OpenAI از Ironclad استفاده میکنند، به پژوهشگران ما کمک کردند تا ۱۱ وظیفه را در حوزههای حقوقی، تجاری و تدارکات شناسایی کنند. این وظایف شامل مواردی مانند تنظیم توافقنامههای عدم افشا، ایجاد فرایندهای تأیید خرید و بهروزرسانی یک بند حقوقیِ قابل استفادهٔ مجدد بود تا با حوزهٔ قضایی انتخابشده توسط درخواستکننده مطابقت داشته باشد. برآورد میکنیم که انجام هر یک از این وظایف برای یک کاربر باتجربه، بهطور میانگین حدود ۳۰ تا ۴۰ دقیقه زمان ببرد.
هر وظیفه را بسته به پیچیدگی آن، بر اساس ۸ تا ۵۰ معیار ارزیابی کردیم. این کار به ما امکان داد ببینیم مدل کدام بخشها را درست انجام داده و کجا کم آورده است. Ironclad همچنین محیطهای نرمافزاری میزبانیشدهای از محصول خود فراهم کرد تا مدلها بتوانند این وظایف را در آنها تمرین کنند. پژوهشگران ما بر مبنای گردشکارهای نمونه، وظایف آموزشی مصنوعی2 طراحی کردند و با استفاده از یادگیری تقویتی به مدلها کمک کردند تا از راه تمرین و بازخورد بهتر شوند. این ترکیب—وظایفی که با کمک افراد آشنا با کار انتخاب شدهاند، معیارهای دقیق و محیطی برای تمرین مدلها—تضمین میکند که بهبود عملکردمان در وظایف واقعیای رخ دهد که برای مشتریان ما بیشترین اهمیت را دارند.
Astra و GPT‑5.6 Sol را با سطح استدلال Max برای Astra و سطح استدلال بالا برای Sol مقایسه کردیم؛ تنظیماتی که هر مدل در آنها بالاترین امتیاز را کسب کرده بود. در مجموعِ ۱۱ وظیفهٔ پژوهشی، میانگین امتیاز Astra برابر با ۵۵٫۰٪ بود، در مقایسه با ۴۱٫۶٪ برای GPT‑5.6 Sol؛ در همین حال، میانگین زمان برآوردشده برای هر تلاش از ۳۷٫۰ دقیقه برای Sol به ۱۹٫۲ دقیقه برای Astra کاهش یافت.3 یک مدل داخلی که در توسعهٔ Astra به کار رفت، در این وظایف به امتیاز بالاترِ ۶۳٫۷٪ رسید و هدف ما این است که این پیشرفتهای بیشتر را به مدلهای آینده بیاوریم.
شاخص | GPT‑5.6 Sol | GPT‑6 Astra |
میانگین امتیاز بر اساس معیارهای ارزیابی | ۴۱٫۶٪ | ۵۵٫۰٪ |
میانگین زمان برآوردشده برای هر تلاش | ۳۷٫۰ دقیقه | ۱۹٫۲ دقیقه |
Astra با زمان شبیهسازیشدهٔ کمتر برای هر تلاش، الزامات بیشتری از وظایف را برآورده کرد. دو ویدیوی کوتاه زیر نشان میدهند که مدلها چگونه یک وظیفهٔ پژوهشی یکسان را انجام دادند. Astra (ویدیوی اول) حدود ۹۴٪ از معیارهای وظیفه را در زمان برآوردشدهٔ ۲۰ دقیقه برآورده کرد؛ GPT‑5.6 Sol (ویدیوی دوم) حدود ۸۵٪ را در زمان برآوردشدهٔ ۳۲ دقیقه.
GPT‑6 Astra حدود ۹۴٪ از معیارهای وظیفه را در زمان برآوردشدهٔ ۲۰ دقیقه برآورده کرد.
GPT‑5.6 Sol حدود ۸۵٪ از معیارهای وظیفه را در زمان برآوردشدهٔ ۳۲ دقیقه برآورده کرد.
نقش Ironclad در این کار بازتاب چالشی است که مشتریانش بهخوبی میشناسند: فرایند عقد قرارداد باید بتواند موارد استثنا را مدیریت کند و در عین حال قواعدی را که کسبوکار به آنها متکی است، حفظ کند. اگر یک عامل در میانهٔ انجام وظیفه، یکی از این قواعد را از یاد ببرد یا دیگر آن را در نظر نگیرد، دامنهٔ کارهایی که یک شرکت نرمافزاری میتواند با اطمینان به آن بسپارد، محدود میشود. این موضوع نشان میدهد چرا با وجود پیشرفت عاملها در انجام وظایف پیچیدهٔ قراردادی، نظارت انسانی همچنان اهمیت دارد و وجود یک پلتفرم جامع مدیریت قرارداد همچنان ضروری است. همکاری با پژوهشگران ما به Ironclad امکان میدهد این مسائل را وارد فرایند توسعهٔ مدل زیربنایی کند تا بتوانیم آنها را با هم بررسی کنیم.
با افزایش توانمندی مدلها، Ironclad این فرصت را دارد که از آنها در تعداد بیشتری از محصولات خود استفاده کند. برای تیمهای حقوقی و تجاری، این میتواند به معنای آن باشد که هوش مصنوعی بخش بیشتری از کارهای پیچیدهٔ قراردادی را بر عهده بگیرد، بدون آنکه سازوکارهای کنترلی مورد اتکای این تیمها کنار گذاشته شوند.
از تعداد محدودی شرکت نرمافزاری دعوت میکنیم تا مستقیماً با تیمهای پژوهشی و مهندسی ما روی وظایف تخصصی مهمی کار کنند که عاملهای امروزی هنوز نمیتوانند آنها را بهطور قابلاعتماد انجام دهند. اگر تیم شما با چنین وظیفهای روبهروست، مایلیم نمونهای مشخص ببینیم: از عامل چه میخواهید، چه شواهدی از ناکامی آن دارید و نتیجهٔ موفق را با چه معیارهایی میسنجید. همکاران ما باید بتوانند افرادی با شناخت عمیق از آن کار، محیطی امن برای آزمایش و دادههایی که استفاده از آنها در پژوهش بیخطر باشد نیز فراهم کنند. اینها نقطهٔ شروعی برای بررسی علت ناکامی و سنجش بهبود مدل در اختیار ما میگذارند.
اگر تیم شما این شرایط را دارد، برای بررسی امکان همکاری پژوهشی درخواست دهید.
نویسنده
پانوشتها
- 1
- 2
ما با استفاده از قراردادهای در دسترس عموم در پایگاه دادهٔ EDGAR متعلق به کمیسیون بورس و اوراق بهادار آمریکا (SEC)، پس از اعمال فیلترهایی برای حذف اطلاعات شخصی، وظایف شبیهسازیشده ایجاد کردیم. برای آموزش یا ارزیابی، از دادههای مشتریان OpenAI، قراردادهای داخلی OpenAI یا دادهها و قراردادهای غیرعمومی مشتریان Ironclad استفاده نکردیم.
- 3


