Развиваем навыки работы с компьютером вместе с Ironclad
Как совместные исследования в сфере работы с договорами помогают нам обучать и оценивать ИИ-агентов на сложных профессиональных задачах.
Представляя GPT‑6 Astra, мы показали, насколько далеко наши модели продвинулись в использовании компьютера для профессиональной работы — от подготовки документов до тестирования сайтов. Наша следующая цель — расширить возможности агентов и повысить эффективность использования специализированного ПО для решения сложных бизнес-задач. Мы изучаем, как научить модели понимать бизнес-правила компании, выполнять многоэтапные рабочие процессы и проверять соответствие своей работы исходным требованиям.
Чтобы ускорить эти исследования, мы напрямую сотрудничаем с небольшим числом разработчиков ПО, которые лучше всего понимают эти рабочие процессы. Вместе мы находим сложные задачи с высокой практической ценностью и превращаем их в исследовательские задачи для обучения и оценки наших моделей. В конечном счёте это расширяет возможности моделей и делает их полезнее для реальных бизнес-приложений.
Наш первый партнёр — Ironclad, лидер в области работы с договорами с помощью ИИ. В тесном сотрудничестве с командой Ironclad мы разработали задачи, в которых агенты должны настраивать договоры, процедуры согласования и типовые договорные условия, и продемонстрировали прогресс в выполнении этих сложных рабочих процессов. Экспертиза Ironclad сыграла ключевую роль в определении критериев успеха и помогла нам напрямую учитывать реальные потребности клиентов при разработке передовых моделей. Мы благодарны команде Ironclad за партнёрство и рады поделиться нашими совместными достижениями.
GPT‑6 Astra — наша первая передовая модель, обученная на задачах Ironclad. В нашей исследовательской оценке её средний результат был на 32% выше, чем у GPT‑5.6 Sol, а расчётное время на одну попытку — на 48% меньше.1
Представим команду, которая отвечает за организацию юридической работы и настраивает процесс закупки ПО. Финансовому отделу может потребоваться согласовывать закупки свыше определённой суммы, службе безопасности — проверять отдельные заявки, а юристам — рассматривать нестандартные условия. Сотрудник, настраивающий процесс, должен на основе этого короткого списка создать форму подачи заявки, шаблоны документов, правила согласования и запись об итоговом договоре.
ИИ-агент, выполняющий ту же работу, должен учитывать эти требования на всех этапах взаимодействия с ПО. Например, он должен настроить согласование финансовым отделом при превышении пороговой суммы расходов и проверить, что заявки с суммами выше и ниже порога проходят по нужным маршрутам. Правильно выполнить отдельные шаги недостаточно: готовый процесс должен работать во всех ситуациях, для которых он предназначен.
Сотрудники Ironclad и пользователи Ironclad в OpenAI помогли нашим исследователям выделить 11 задач в области юридической работы, коммерческой деятельности и закупок. Среди них — настройка соглашений о неразглашении, создание процессов согласования закупок и обновление типового договорного положения с учётом юрисдикции, которую выбирает заявитель. По нашим оценкам, у опытного пользователя такая работа заняла бы в среднем от 30 до 40 минут на задачу.
Мы оценивали каждую задачу по 8–50 критериям в зависимости от её сложности. Это позволило нам увидеть, с какими частями модель справилась, а где допустила ошибки. Ironclad также предоставила размещённые на серверах среды своего продукта, в которых модели могли практиковаться в выполнении этих задач. Наши исследователи разработали синтетические задачи для обучения2 на основе типичных рабочих процессов и применили обучение с подкреплением, чтобы модели совершенствовались благодаря практике и обратной связи. Сочетание задач, отобранных вместе со специалистами, подробных критериев и среды для практики позволяет нам улучшать результаты моделей в реальных задачах, наиболее важных для наших клиентов.
Мы сравнили Astra и GPT‑5.6 Sol, выбрав уровень рассуждений Max для Astra и «Высокий» для Sol — настройки, при которых каждая модель показала наилучший результат. По 11 экспериментальным задачам средний результат Astra составил 55,0% против 41,6% у GPT‑5.6 Sol, а расчётное среднее время на попытку сократилось с 37,0 минуты у Sol до 19,2 минуты у Astra.3 Внутренняя модель, использованная при разработке Astra, показала ещё более высокий результат — 63,7% на этих задачах. Мы стремимся перенести эти дополнительные улучшения в будущие модели.
Показатель | GPT‑5.6 Sol | GPT‑6 Astra |
Средняя оценка по критериям | 41,6% | 55,0% |
Расчётное среднее время на попытку | 37,0 минуты | 19,2 минуты |
Astra выполнила больше требований задач при меньшем расчётном времени на попытку. Два ролика ниже показывают, как модели справились с одной и той же экспериментальной задачей. Astra (первый ролик) выполнила около 94% критериев задачи за расчётные 20 минут; GPT‑5.6 Sol (второй ролик) — около 85% за расчётные 32 минуты.
GPT‑6 Astra выполнила около 94% критериев задачи за 20 минут по расчётной оценке.
GPT‑5.6 Sol выполнила около 85% критериев задачи за 32 минуты по расчётной оценке.
Участие Ironclad в этой работе связано с задачей, хорошо знакомой её клиентам: процесс работы с договорами должен учитывать исключения, сохраняя при этом правила, на которых строится работа бизнеса. Если агент упускает одно из этих правил в ходе выполнения задачи, это ограничивает круг задач, которые разработчик ПО может уверенно ему поручить. Это объясняет, почему контроль со стороны человека остаётся важным, даже когда агенты всё лучше справляются со сложными договорными задачами, и почему полноценная платформа для работы с договорами по-прежнему необходима. Сотрудничество с нашими исследователями позволяет Ironclad учитывать эти проблемы при разработке самой модели, чтобы мы могли изучать их вместе.
По мере роста возможностей моделей Ironclad сможет применять их в большем числе своих продуктов. Для юридических и бизнес-команд это может означать, что ИИ возьмёт на себя больше трудоёмких операций при работе со сложными договорами, сохраняя механизмы контроля, на которые полагаются эти команды.
Мы приглашаем ограниченное число разработчиков ПО к прямому сотрудничеству с нашими исследователями и инженерами над важными профессиональными задачами, которые современные агенты пока не могут надёжно выполнять. Если у вашей команды есть такая задача, мы хотели бы увидеть конкретный пример: что вы поручаете агенту, где именно он не справляется и по каким критериям вы оценивали бы успешный результат. Партнёры также должны быть готовы привлечь специалистов, которые глубоко разбираются в этой работе, предоставить защищённую среду для тестирования и данные, которые можно безопасно использовать в исследованиях. Это даст нам отправную точку для изучения причин неудачи и оценки улучшений модели.
Если ваша команда соответствует этим условиям, подайте заявку, чтобы обсудить сотрудничество в исследованиях.
Автор
Сноски
- 1
- 2
Мы создали смоделированные задачи на основе договоров из общедоступной базы EDGAR Комиссии по ценным бумагам и биржам США (SEC), предварительно применив фильтры для удаления персональных данных. Для обучения и оценки мы не использовали данные клиентов OpenAI, внутренние договоры OpenAI, а также непубличные данные или договоры клиентов Ironclad.
- 3


