Удосконалюємо використання комп’ютерів разом з Ironclad
Як дослідницька співпраця у сфері роботи з договорами допомагає нам навчати й оцінювати ШІ-агентів на складних професійних завданнях.
Коли ми представили GPT‑6 Astra, то показали, наскільки наші моделі просунулися у використанні комп’ютерів для професійної роботи — від підготовки документів до тестування вебсайтів. Наша наступна мета — розширити можливості агентів і підвищити їхню ефективність у використанні спеціалізованого програмного забезпечення для розв’язання складних бізнес-завдань. Ми досліджуємо, як навчити моделі розуміти бізнес-правила компанії, виконувати багатоетапні робочі процеси й перевіряти, чи відповідає їхня робота початковим вимогам.
Щоб прискорити це дослідження, ми безпосередньо співпрацюємо з невеликою кількістю розробників програмного забезпечення, які найкраще розуміють ці робочі процеси. Разом ми визначаємо складні завдання з високою практичною цінністю та перетворюємо їх на дослідницькі задачі для навчання й оцінювання наших моделей. Це зрештою розширює можливості моделей і робить їх кориснішими для реального застосування в бізнесі.
Наш перший партнер — Ironclad, лідер у сфері роботи з договорами за допомогою ШІ. У тісній співпраці з командою Ironclad ми розробили завдання, у яких агенти мають налаштовувати договори, процедури погодження та юридичні умови для повторного використання, і продемонстрували прогрес у виконанні цих складних робочих процесів. Експертиза Ironclad відіграла ключову роль у визначенні критеріїв успіху та безпосередньому врахуванні реальних потреб клієнтів під час розробки передових моделей. Ми вдячні за це партнерство й раді поділитися нашими спільними досягненнями.
GPT‑6 Astra — наша перша передова модель, навчена на завданнях Ironclad. У нашому дослідницькому оцінюванні її середній бал був на 32% вищим, ніж у GPT‑5.6 Sol, а орієнтовний час на спробу — на 48% меншим.1
Уявімо команду з організації юридичної роботи, яка налаштовує процес закупівлі програмного забезпечення. Фінансовому відділу може знадобитися погоджувати закупівлі понад певну суму, відділу безпеки — перевіряти окремі запити, а юридичному відділу — розглядати нестандартні умови. Людина, яка налаштовує цей процес, має перетворити короткий перелік вимог на форму подання запитів, шаблони документів, правила погодження та запис про остаточний договір.
ШІ-агент, який виконує ту саму роботу, має пам’ятати про ці вимоги на кожному етапі роботи в програмі. Наприклад, він має налаштувати погодження фінансовим відділом у разі перевищення порогової суми витрат і перевірити, чи запити на суми вище й нижче цього порога проходять належними маршрутами. Правильно виконати окремі кроки недостатньо: готовий процес має працювати в усіх ситуаціях, для яких його розроблено.
Працівники Ironclad і користувачі Ironclad в OpenAI допомогли нашим дослідникам визначити 11 завдань із юридичної, комерційної та закупівельної роботи. Серед них — налаштування угод про нерозголошення, створення процесів погодження закупівель та оновлення юридичного положення для повторного використання так, щоб воно відповідало юрисдикції, яку вибирає заявник. За нашими оцінками, досвідченому користувачеві знадобилося б у середньому близько 30–40 хвилин на кожне таке завдання.
Ми оцінювали кожне завдання за 8–50 критеріями залежно від його складності. Це дало нам змогу побачити, з якими частинами модель упоралася, а де не досягла потрібного результату. Ironclad також надала розгорнуті середовища свого програмного продукту, у яких моделі могли практикуватися у виконанні цих завдань. Наші дослідники розробили синтетичні навчальні завдання2 на основі типових робочих процесів і застосували навчання з підкріпленням, щоб моделі вдосконалювалися завдяки практиці та зворотному зв’язку. Завдання, відібрані разом із фахівцями, які знають цю роботу, докладні критерії та середовище для практики — це поєднання забезпечує вдосконалення моделей саме в тих реальних завданнях, які найважливіші для наших клієнтів.
Ми порівняли Astra та GPT‑5.6 Sol із рівнем міркування Max для Astra та «Високий» для Sol — саме за цих налаштувань кожна модель отримала найвищі бали. За 11 дослідницькими завданнями середній бал Astra становив 55,0% проти 41,6% у GPT‑5.6 Sol, а орієнтовний середній час на спробу скоротився з 37,0 хвилини для Sol до 19,2 хвилини для Astra.3 Внутрішня модель, яку використовували під час розробки Astra, показала ще кращий результат — 63,7% у цих завданнях. Ми прагнемо перенести ці додаткові покращення в майбутні моделі.
Показник | GPT‑5.6 Sol | GPT‑6 Astra |
Середній бал за критеріями | 41,6% | 55,0% |
Орієнтовний середній час на спробу | 37,0 хвилини | 19,2 хвилини |
Astra виконала більше вимог завдань за менший змодельований час на спробу. Два відео нижче показують, як моделі впоралися з тим самим дослідницьким завданням. Astra (перше відео) виконала близько 94% критеріїв завдання за орієнтовно 20 хвилин; GPT‑5.6 Sol (друге відео) — близько 85% за орієнтовно 32 хвилини.
GPT‑6 Astra виконала близько 94% критеріїв завдання за орієнтовно 20 хвилин.
GPT‑5.6 Sol виконала близько 85% критеріїв завдання за орієнтовно 32 хвилини.
Роль Ironclad у цій роботі пов’язана з викликом, добре знайомим її клієнтам: процес роботи з договорами має враховувати винятки, не порушуючи правил, на які спирається бізнес. Якщо агент випускає з уваги одне з таких правил під час виконання завдання, це обмежує коло дій, які розробник програмного забезпечення може впевнено йому доручити. Саме тому, навіть коли агенти дедалі краще виконують складні завдання з договорами, людський нагляд залишається важливим, а повноцінна платформа для роботи з договорами — необхідною. Співпраця з нашими дослідниками дає Ironclad змогу врахувати ці проблеми під час розробки базової моделі, щоб ми могли вивчати їх разом.
З розширенням можливостей моделей Ironclad зможе використовувати їх у більшій кількості власних продуктів. Для юридичних і бізнес-команд це може означати, що ШІ візьме на себе більшу частину складної роботи з договорами, зберігаючи механізми контролю, на які ці команди покладаються.
Ми запрошуємо невелику кількість розробників програмного забезпечення до прямої співпраці з нашими дослідницькими та інженерними командами над важливими професійними завданнями, які сучасні агенти ще не можуть надійно виконувати. Якщо у вашої команди є таке завдання, ми хотіли б побачити конкретний приклад: що ви доручаєте агенту, які є свідчення його помилок і за якими критеріями ви визначали б успішний результат. Партнери також мають бути готові залучити фахівців, які глибоко розуміють цю роботу, надати захищене середовище для тестування та дані, які можна безпечно використовувати для досліджень. Це дасть нам відправну точку для дослідження причин помилок і вимірювання того, чи покращуються результати моделі.
Якщо це відповідає можливостям вашої команди, подайте заявку, щоб обговорити дослідницьку співпрацю.
Автор
Примітки
- 1
- 2
Ми створили змодельовані завдання на основі договорів із відкритої бази даних EDGAR Комісії з цінних паперів і бірж США (SEC), попередньо застосувавши фільтри для видалення персональних даних. Для навчання чи оцінювання ми не використовували дані клієнтів OpenAI, внутрішні договори OpenAI або непублічні дані чи договори клієнтів Ironclad.
- 3


