پرش به محتوای اصلی
OpenAI

۱۴ مهر ۱۴۰۵

مقالات

پیشبرد استفاده از رایانه با Ironclad

چگونه یک همکاری پژوهشی در حوزهٔ قراردادها به ما در آموزش و ارزیابی عامل‌های هوش مصنوعی برای کارهای تخصصی پیچیده کمک می‌کند.

در حال بارگذاری…

هنگام معرفی GPT‑6 Astra، نشان دادیم که مدل‌های ما در استفاده از رایانه برای کارهای تخصصی، از تهیهٔ اسناد تا آزمودن وب‌سایت‌ها، چقدر پیشرفت کرده‌اند. هدف بعدی ما این است که عامل‌ها را در استفاده از نرم‌افزارهای تخصصی برای حل مسائل پیچیدهٔ کسب‌وکار، توانمندتر و کارآمدتر کنیم. در حال بررسی روش‌هایی برای آموزش مدل‌ها هستیم تا قواعد کسب‌وکار یک شرکت را درک کنند، گردش‌کارهای چندمرحله‌ای را اجرا کنند و مطمئن شوند که کارشان الزامات اولیه را برآورده می‌کند.

برای شتاب بخشیدن به این پژوهش، مستقیماً با تعداد محدودی از شرکت‌های نرم‌افزاری همکاری می‌کنیم که بیشترین شناخت را از این گردش‌کارها دارند. با هم، وظایف چالش‌برانگیز و ارزشمند را شناسایی می‌کنیم و آن‌ها را به مسائل پژوهشی برای آموزش و ارزیابی مدل‌هایمان تبدیل می‌کنیم؛ کاری که در نهایت مدل‌های ما را در کاربردهای واقعی کسب‌وکار توانمندتر و مفیدتر می‌کند.

نخستین شریک ما Ironclad است؛ یکی از شرکت‌های پیشتاز در مدیریت قرارداد با هوش مصنوعی. در همکاری نزدیک با تیم Ironclad، وظایفی طراحی کرده‌ایم که عامل‌ها برای انجام آن‌ها باید قراردادها، تأییدیه‌ها و شروط حقوقیِ قابل استفادهٔ مجدد را پیکربندی کنند و پیشرفت مدل‌ها در این گردش‌کارهای پیچیده را نشان داده‌ایم. تخصص Ironclad در تعریف معیارهای موفقیت و وارد کردن مستقیم نیازهای واقعی مشتریان به فرایند توسعهٔ مدل‌های پیشرو، نقشی کلیدی داشته است. از این همکاری سپاسگزاریم و مشتاقیم دستاوردهای مشترکمان را با شما به اشتراک بگذاریم.

GPT‑6 Astra نخستین مدل پیشروی ماست که با وظایف Ironclad آموزش دیده است. در ارزیابی پژوهشی ما، میانگین امتیاز آن ۳۲٪ بالاتر از GPT‑5.6 Sol بود، در حالی که زمان برآوردشده برای هر تلاش ۴۸٪ کمتر بود.1

تبدیل گردش‌کارهای قراردادی به وظایف آموزشی

تیم عملیات حقوقی‌ای را در نظر بگیرید که در حال راه‌اندازی فرایندی برای خرید نرم‌افزار است. ممکن است خریدهای بالاتر از مبلغی مشخص به تأیید واحد مالی نیاز داشته باشند، بعضی درخواست‌ها نیازمند بررسی واحد امنیت باشند و شروط غیراستاندارد هم به بررسی واحد حقوقی نیاز داشته باشند. کسی که این فرایند را راه‌اندازی می‌کند باید این فهرست کوتاه را به فرم ثبت درخواست، قالب‌های اسناد، قواعد تأیید و سابقه‌ای از قرارداد نهایی تبدیل کند.

عامل هوش مصنوعی‌ای که همین کار را انجام می‌دهد، باید هنگام کار با بخش‌های مختلف نرم‌افزار، این الزامات را در نظر داشته باشد. برای مثال، باید برای هزینه‌های بالاتر از سقف تعیین‌شده، تأیید واحد مالی را الزامی کند و بررسی کند که درخواست‌های بالاتر و پایین‌تر از این سقف، مسیر درست را طی می‌کنند. درست انجام دادن تک‌تک مراحل کافی نیست: فرایند نهایی باید در همهٔ موقعیت‌هایی که برای آن‌ها طراحی شده است، درست کار کند.

کارکنان Ironclad و افرادی که در OpenAI از Ironclad استفاده می‌کنند، به پژوهشگران ما کمک کردند تا ۱۱ وظیفه را در حوزه‌های حقوقی، تجاری و تدارکات شناسایی کنند. این وظایف شامل مواردی مانند تنظیم توافق‌نامه‌های عدم افشا، ایجاد فرایندهای تأیید خرید و به‌روزرسانی یک بند حقوقیِ قابل استفادهٔ مجدد بود تا با حوزهٔ قضایی انتخاب‌شده توسط درخواست‌کننده مطابقت داشته باشد. برآورد می‌کنیم که انجام هر یک از این وظایف برای یک کاربر باتجربه، به‌طور میانگین حدود ۳۰ تا ۴۰ دقیقه زمان ببرد.

هر وظیفه را بسته به پیچیدگی آن، بر اساس ۸ تا ۵۰ معیار ارزیابی کردیم. این کار به ما امکان داد ببینیم مدل کدام بخش‌ها را درست انجام داده و کجا کم آورده است. Ironclad همچنین محیط‌های نرم‌افزاری میزبانی‌شده‌ای از محصول خود فراهم کرد تا مدل‌ها بتوانند این وظایف را در آن‌ها تمرین کنند. پژوهشگران ما بر مبنای گردش‌کارهای نمونه، وظایف آموزشی مصنوعی2 طراحی کردند و با استفاده از یادگیری تقویتی به مدل‌ها کمک کردند تا از راه تمرین و بازخورد بهتر شوند. این ترکیب—وظایفی که با کمک افراد آشنا با کار انتخاب شده‌اند، معیارهای دقیق و محیطی برای تمرین مدل‌ها—تضمین می‌کند که بهبود عملکردمان در وظایف واقعی‌ای رخ دهد که برای مشتریان ما بیشترین اهمیت را دارند.

عملکرد Astra چگونه بود

Astra و GPT‑5.6 Sol را با سطح استدلال Max برای Astra و سطح استدلال بالا برای Sol مقایسه کردیم؛ تنظیماتی که هر مدل در آن‌ها بالاترین امتیاز را کسب کرده بود. در مجموعِ ۱۱ وظیفهٔ پژوهشی، میانگین امتیاز Astra برابر با ۵۵٫۰٪ بود، در مقایسه با ۴۱٫۶٪ برای GPT‑5.6 Sol؛ در همین حال، میانگین زمان برآوردشده برای هر تلاش از ۳۷٫۰ دقیقه برای Sol به ۱۹٫۲ دقیقه برای Astra کاهش یافت.3 یک مدل داخلی که در توسعهٔ Astra به کار رفت، در این وظایف به امتیاز بالاترِ ۶۳٫۷٪ رسید و هدف ما این است که این پیشرفت‌های بیشتر را به مدل‌های آینده بیاوریم.

شاخص

GPT‑5.6 Sol
سطح استدلال بالا

GPT‑6 Astra
سطح استدلال Max

میانگین امتیاز بر اساس معیارهای ارزیابی

۴۱٫۶٪

۵۵٫۰٪

میانگین زمان برآوردشده برای هر تلاش

۳۷٫۰ دقیقه

۱۹٫۲ دقیقه

Astra با زمان شبیه‌سازی‌شدهٔ کمتر برای هر تلاش، الزامات بیشتری از وظایف را برآورده کرد. دو ویدیوی کوتاه زیر نشان می‌دهند که مدل‌ها چگونه یک وظیفهٔ پژوهشی یکسان را انجام دادند. Astra (ویدیوی اول) حدود ۹۴٪ از معیارهای وظیفه را در زمان برآوردشدهٔ ۲۰ دقیقه برآورده کرد؛ GPT‑5.6 Sol (ویدیوی دوم) حدود ۸۵٪ را در زمان برآوردشدهٔ ۳۲ دقیقه.

GPT‑6 Astra حدود ۹۴٪ از معیارهای وظیفه را در زمان برآوردشدهٔ ۲۰ دقیقه برآورده کرد.

GPT‑5.6 Sol حدود ۸۵٪ از معیارهای وظیفه را در زمان برآوردشدهٔ ۳۲ دقیقه برآورده کرد.

این همکاری برای Ironclad چه معنایی دارد

نقش Ironclad در این کار بازتاب چالشی است که مشتریانش به‌خوبی می‌شناسند: فرایند عقد قرارداد باید بتواند موارد استثنا را مدیریت کند و در عین حال قواعدی را که کسب‌وکار به آن‌ها متکی است، حفظ کند. اگر یک عامل در میانهٔ انجام وظیفه، یکی از این قواعد را از یاد ببرد یا دیگر آن را در نظر نگیرد، دامنهٔ کارهایی که یک شرکت نرم‌افزاری می‌تواند با اطمینان به آن بسپارد، محدود می‌شود. این موضوع نشان می‌دهد چرا با وجود پیشرفت عامل‌ها در انجام وظایف پیچیدهٔ قراردادی، نظارت انسانی همچنان اهمیت دارد و وجود یک پلتفرم جامع مدیریت قرارداد همچنان ضروری است. همکاری با پژوهشگران ما به Ironclad امکان می‌دهد این مسائل را وارد فرایند توسعهٔ مدل زیربنایی کند تا بتوانیم آن‌ها را با هم بررسی کنیم.

با افزایش توانمندی مدل‌ها، Ironclad این فرصت را دارد که از آن‌ها در تعداد بیشتری از محصولات خود استفاده کند. برای تیم‌های حقوقی و تجاری، این می‌تواند به معنای آن باشد که هوش مصنوعی بخش بیشتری از کارهای پیچیدهٔ قراردادی را بر عهده بگیرد، بدون آنکه سازوکارهای کنترلی مورد اتکای این تیم‌ها کنار گذاشته شوند.

“برای اینکه هوش مصنوعی در حوزه‌های پیچیدهٔ قراردادها واقعاً مفید باشد، باید فراتر از انجام اقدامات مجزا عمل کند. عامل‌ها باید کل چرخهٔ عمر قرارداد را درک کنند؛ از جمله اینکه گردش‌کارهای کسب‌وکار چگونه به هم متصل می‌شوند و در عین حال سازوکارهای کنترلی مورد اتکای تیم‌ها حفظ می‌شوند. همکاری ما با OpenAI این چالش‌های دنیای واقعی را وارد فرایند پژوهش می‌کند و به پیشرفت این فناوری کمک می‌کند.”
—سونیتا ورما، مدیر ارشد فناوری Ironclad

برای پیشبرد هوش مصنوعی در کارهای تخصصی پیچیده با ما همکاری کنید

از تعداد محدودی شرکت نرم‌افزاری دعوت می‌کنیم تا مستقیماً با تیم‌های پژوهشی و مهندسی ما روی وظایف تخصصی مهمی کار کنند که عامل‌های امروزی هنوز نمی‌توانند آن‌ها را به‌طور قابل‌اعتماد انجام دهند. اگر تیم شما با چنین وظیفه‌ای روبه‌روست، مایلیم نمونه‌ای مشخص ببینیم: از عامل چه می‌خواهید، چه شواهدی از ناکامی آن دارید و نتیجهٔ موفق را با چه معیارهایی می‌سنجید. همکاران ما باید بتوانند افرادی با شناخت عمیق از آن کار، محیطی امن برای آزمایش و داده‌هایی که استفاده از آن‌ها در پژوهش بی‌خطر باشد نیز فراهم کنند. این‌ها نقطهٔ شروعی برای بررسی علت ناکامی و سنجش بهبود مدل در اختیار ما می‌گذارند.

اگر تیم شما این شرایط را دارد، برای بررسی امکان همکاری پژوهشی درخواست دهید.

نویسنده

OpenAI

پانوشت‌ها

  1. 1

    این نتایج مربوط به ۱۱ وظیفهٔ پژوهشی است، نه همهٔ گردش‌کارهای Ironclad. زمان‌ها برآوردهای شبیه‌سازی‌شده بر پایهٔ سرعت‌های فرضی پردازش و تولید خروجی مدل هستند، نه اندازه‌گیریِ میزان صرفه‌جویی در وقت مشتریان.

  2. 2

    ما با استفاده از قراردادهای در دسترس عموم در پایگاه دادهٔ EDGAR متعلق به کمیسیون بورس و اوراق بهادار آمریکا (SEC)، پس از اعمال فیلترهایی برای حذف اطلاعات شخصی، وظایف شبیه‌سازی‌شده ایجاد کردیم. برای آموزش یا ارزیابی، از داده‌های مشتریان OpenAI، قراردادهای داخلی OpenAI یا داده‌ها و قراردادهای غیرعمومی مشتریان Ironclad استفاده نکردیم.

  3. 3

    به پانوشت ارزیابی پژوهشی در بالا مراجعه کنید.