Переход к основному контенту
OpenAI

6 октября 2026 г.

Публикация

Развиваем навыки работы с компьютером вместе с Ironclad

Как совместные исследования в сфере работы с договорами помогают нам обучать и оценивать ИИ-агентов на сложных профессиональных задачах.

Загрузка…

Представляя GPT‑6 Astra, мы показали, насколько далеко наши модели продвинулись в использовании компьютера для профессиональной работы — от подготовки документов до тестирования сайтов. Наша следующая цель — расширить возможности агентов и повысить эффективность использования специализированного ПО для решения сложных бизнес-задач. Мы изучаем, как научить модели понимать бизнес-правила компании, выполнять многоэтапные рабочие процессы и проверять соответствие своей работы исходным требованиям.

Чтобы ускорить эти исследования, мы напрямую сотрудничаем с небольшим числом разработчиков ПО, которые лучше всего понимают эти рабочие процессы. Вместе мы находим сложные задачи с высокой практической ценностью и превращаем их в исследовательские задачи для обучения и оценки наших моделей. В конечном счёте это расширяет возможности моделей и делает их полезнее для реальных бизнес-приложений.

Наш первый партнёр — Ironclad, лидер в области работы с договорами с помощью ИИ. В тесном сотрудничестве с командой Ironclad мы разработали задачи, в которых агенты должны настраивать договоры, процедуры согласования и типовые договорные условия, и продемонстрировали прогресс в выполнении этих сложных рабочих процессов. Экспертиза Ironclad сыграла ключевую роль в определении критериев успеха и помогла нам напрямую учитывать реальные потребности клиентов при разработке передовых моделей. Мы благодарны команде Ironclad за партнёрство и рады поделиться нашими совместными достижениями.

GPT‑6 Astra — наша первая передовая модель, обученная на задачах Ironclad. В нашей исследовательской оценке её средний результат был на 32% выше, чем у GPT‑5.6 Sol, а расчётное время на одну попытку — на 48% меньше.1

Как мы превращаем процессы работы с договорами в задачи для обучения

Представим команду, которая отвечает за организацию юридической работы и настраивает процесс закупки ПО. Финансовому отделу может потребоваться согласовывать закупки свыше определённой суммы, службе безопасности — проверять отдельные заявки, а юристам — рассматривать нестандартные условия. Сотрудник, настраивающий процесс, должен на основе этого короткого списка создать форму подачи заявки, шаблоны документов, правила согласования и запись об итоговом договоре.

ИИ-агент, выполняющий ту же работу, должен учитывать эти требования на всех этапах взаимодействия с ПО. Например, он должен настроить согласование финансовым отделом при превышении пороговой суммы расходов и проверить, что заявки с суммами выше и ниже порога проходят по нужным маршрутам. Правильно выполнить отдельные шаги недостаточно: готовый процесс должен работать во всех ситуациях, для которых он предназначен.

Сотрудники Ironclad и пользователи Ironclad в OpenAI помогли нашим исследователям выделить 11 задач в области юридической работы, коммерческой деятельности и закупок. Среди них — настройка соглашений о неразглашении, создание процессов согласования закупок и обновление типового договорного положения с учётом юрисдикции, которую выбирает заявитель. По нашим оценкам, у опытного пользователя такая работа заняла бы в среднем от 30 до 40 минут на задачу.

Мы оценивали каждую задачу по 8–50 критериям в зависимости от её сложности. Это позволило нам увидеть, с какими частями модель справилась, а где допустила ошибки. Ironclad также предоставила размещённые на серверах среды своего продукта, в которых модели могли практиковаться в выполнении этих задач. Наши исследователи разработали синтетические задачи для обучения2 на основе типичных рабочих процессов и применили обучение с подкреплением, чтобы модели совершенствовались благодаря практике и обратной связи. Сочетание задач, отобранных вместе со специалистами, подробных критериев и среды для практики позволяет нам улучшать результаты моделей в реальных задачах, наиболее важных для наших клиентов.

Результаты Astra

Мы сравнили Astra и GPT‑5.6 Sol, выбрав уровень рассуждений Max для Astra и «Высокий» для Sol — настройки, при которых каждая модель показала наилучший результат. По 11 экспериментальным задачам средний результат Astra составил 55,0% против 41,6% у GPT‑5.6 Sol, а расчётное среднее время на попытку сократилось с 37,0 минуты у Sol до 19,2 минуты у Astra.3 Внутренняя модель, использованная при разработке Astra, показала ещё более высокий результат — 63,7% на этих задачах. Мы стремимся перенести эти дополнительные улучшения в будущие модели.

Показатель

GPT‑5.6 Sol
Уровень рассуждений «Высокий»

GPT‑6 Astra
Уровень рассуждений Max

Средняя оценка по критериям

41,6%

55,0%

Расчётное среднее время на попытку

37,0 минуты

19,2 минуты

Astra выполнила больше требований задач при меньшем расчётном времени на попытку. Два ролика ниже показывают, как модели справились с одной и той же экспериментальной задачей. Astra (первый ролик) выполнила около 94% критериев задачи за расчётные 20 минут; GPT‑5.6 Sol (второй ролик) — около 85% за расчётные 32 минуты.

GPT‑6 Astra выполнила около 94% критериев задачи за 20 минут по расчётной оценке.

GPT‑5.6 Sol выполнила около 85% критериев задачи за 32 минуты по расчётной оценке.

Что это сотрудничество значит для Ironclad

Участие Ironclad в этой работе связано с задачей, хорошо знакомой её клиентам: процесс работы с договорами должен учитывать исключения, сохраняя при этом правила, на которых строится работа бизнеса. Если агент упускает одно из этих правил в ходе выполнения задачи, это ограничивает круг задач, которые разработчик ПО может уверенно ему поручить. Это объясняет, почему контроль со стороны человека остаётся важным, даже когда агенты всё лучше справляются со сложными договорными задачами, и почему полноценная платформа для работы с договорами по-прежнему необходима. Сотрудничество с нашими исследователями позволяет Ironclad учитывать эти проблемы при разработке самой модели, чтобы мы могли изучать их вместе.

По мере роста возможностей моделей Ironclad сможет применять их в большем числе своих продуктов. Для юридических и бизнес-команд это может означать, что ИИ возьмёт на себя больше трудоёмких операций при работе со сложными договорами, сохраняя механизмы контроля, на которые полагаются эти команды.

“Чтобы ИИ был по-настоящему полезен в сложных аспектах работы с договорами, он должен уметь больше, чем просто выполнять отдельные действия. Агенты должны понимать весь жизненный цикл договора, в том числе взаимосвязи бизнес-процессов, и при этом сохранять механизмы контроля, на которые полагаются команды. Наше сотрудничество с OpenAI позволяет учитывать эти практические задачи в исследованиях и помогает развивать технологию.”
— Сунита Верма, технический директор Ironclad

Развивайте вместе с нами ИИ для сложных профессиональных задач

Мы приглашаем ограниченное число разработчиков ПО к прямому сотрудничеству с нашими исследователями и инженерами над важными профессиональными задачами, которые современные агенты пока не могут надёжно выполнять. Если у вашей команды есть такая задача, мы хотели бы увидеть конкретный пример: что вы поручаете агенту, где именно он не справляется и по каким критериям вы оценивали бы успешный результат. Партнёры также должны быть готовы привлечь специалистов, которые глубоко разбираются в этой работе, предоставить защищённую среду для тестирования и данные, которые можно безопасно использовать в исследованиях. Это даст нам отправную точку для изучения причин неудачи и оценки улучшений модели.

Если ваша команда соответствует этим условиям, подайте заявку, чтобы обсудить сотрудничество в исследованиях.

Автор

OpenAI

Сноски

  1. 1

    Эти результаты относятся к 11 экспериментальным задачам, а не ко всем рабочим процессам в Ironclad. Указанное время — это расчётные оценки на основе предполагаемой скорости обработки и генерации данных моделью, а не измеренная экономия времени клиентов.

  2. 2

    Мы создали смоделированные задачи на основе договоров из общедоступной базы EDGAR Комиссии по ценным бумагам и биржам США (SEC), предварительно применив фильтры для удаления персональных данных. Для обучения и оценки мы не использовали данные клиентов OpenAI, внутренние договоры OpenAI, а также непубличные данные или договоры клиентов Ironclad.

  3. 3

    См. сноску об оценке в рамках исследования выше.