Усъвършенстваме използването на компютри с Ironclad
Как изследователско сътрудничество в управлението на договори ни помага да обучаваме и оценяваме ИИ Агенти при изпълнението на сложни професионални задачи.
Когато представихме GPT‑6 Astra, показахме колко са напреднали нашите модели в използването на компютри за професионална работа — от подготовката на документи до тестването на уебсайтове. Следващата ни цел е да направим Агентите по-способни и по-ефективни в използването на специализиран софтуер за решаване на сложни бизнес проблеми. Проучваме как да обучаваме моделите да разбират бизнес правилата на дадена компания, да изпълняват многостъпкови работни процеси и да проверяват дали работата им отговаря на първоначалните изисквания.
За да ускорим това изследване, работим пряко с ограничен брой софтуерни компании, които познават най-добре тези работни процеси. Заедно определяме трудни задачи с голяма практическа стойност и ги превръщаме в изследователски проблеми за обучение и оценяване на моделите ни. Така развиваме способностите им и ги правим по-полезни за реални бизнес приложения.
Първият ни партньор е Ironclad — лидер в управлението на договори с ИИ. В тясно сътрудничество с екипа на Ironclad разработихме задачи, които изискват от Агентите да конфигурират споразумения, одобрения и правни условия за многократна употреба, и демонстрирахме напредък в тези сложни работни процеси. Експертният опит на Ironclad беше решаващ за определянето на критериите за успех и за прякото включване на реалните нужди на клиентите в разработването на авангардни модели. Благодарни сме за партньорството им и с вълнение споделяме какво постигнахме заедно.
GPT‑6 Astra е първият ни авангарден модел, обучен със задачи в Ironclad. При оценяването в рамките на изследването средният му резултат беше с 32% по-висок от този на GPT‑5.6 Sol, а прогнозното време за един опит беше с 48% по-кратко.1
Представете си екип по правни операции, който създава процес за закупуване на софтуер. Може да е нужно финансовият отдел да одобрява покупки над определена сума, отделът по сигурността да проверява определени заявки, а правният отдел да преглежда нестандартни условия. Човекът, който създава процеса, трябва да превърне този кратък списък във формуляр за заявки, шаблони на документи, правила за одобрение и запис на окончателното споразумение.
ИИ Агентът, който върши същата работа, трябва да отчита тези изисквания при всяка стъпка в софтуера. Например той трябва да настрои одобрение от финансовия отдел за разходи над определения праг и да провери дали заявките над и под него следват правилните стъпки. Правилното изпълнение на отделните стъпки не е достатъчно: завършеният процес трябва да работи във всички ситуации, за които е предназначен.
Служители на Ironclad и хора, които използват Ironclad в OpenAI, помогнаха на нашите изследователи да определят 11 задачи в правната и търговската дейност и снабдяването. Сред тях бяха задачи като създаване на споразумения за поверителност, изграждане на процеси за одобрение на покупки и актуализиране на правна клауза за многократна употреба според юрисдикцията, избрана от заявителя. По наша оценка тази работа би отнела на опитен потребител средно около 30 до 40 минути на задача.
Оценявахме всяка задача по 8 до 50 критерия в зависимост от сложността ѝ. Това ни позволи да видим с кои части моделът се справя и къде не достига необходимото ниво. Ironclad предостави и хоствани среди на своя софтуерен продукт, в които моделите можеха да упражняват тези задачи. Нашите изследователи разработиха синтетични задачи за обучение2 въз основа на представителни работни процеси и използваха обучение с утвърждение, за да помогнат на моделите да се подобряват чрез практика и обратна връзка. Това съчетание — задачи, подбрани с хора, които познават работата, подробни критерии и среда за практика на моделите — гарантира, че подобряваме представянето им по реалните задачи с най-голямо значение за нашите клиенти.
Сравнихме Astra и GPT‑5.6 Sol при ниво на структурирано анализиране Max за Astra и „Високо“ за Sol — настройките, при които всеки модел постигна най-добри резултати. Средният резултат на Astra по 11-те задачи от изследването беше 55,0% спрямо 41,6% за GPT‑5.6 Sol, а прогнозното средно време за един опит спадна от 37,0 минути за Sol до 19,2 минути за Astra.3 Вътрешен модел, използван при разработването на Astra, постигна още по-добър резултат от 63,7% по тези задачи и целта ни е да пренесем тези допълнителни подобрения в бъдещите модели.
Показател | GPT‑5.6 Sol | GPT‑6 Astra |
Среден резултат по критериите | 41,6% | 55,0% |
Прогнозно средно време за един опит | 37,0 минути | 19,2 минути |
Astra изпълни повече от изискванията на задачите за по-кратко симулирано време на опит. Двата видеоклипа по-долу показват как моделите се справиха с една и съща задача от изследването. Astra (първият клип) изпълни около 94% от критериите на задачата за приблизително 20 минути; GPT‑5.6 Sol (вторият клип) изпълни около 85% за приблизително 32 минути.
GPT‑6 Astra изпълни около 94% от критериите на задачата за приблизително 20 минути.
GPT‑5.6 Sol изпълни около 85% от критериите на задачата за приблизително 32 минути.
Ролята на Ironclad в тази работа отразява предизвикателство, добре познато на клиентите ѝ: процесът по сключване на договори трябва да се справя с нестандартни случаи, като същевременно спазва правилата, на които разчита бизнесът. Ако агент пропусне някое от тези правила по време на задача, това ограничава работата, която една софтуерна компания може уверено да му възложи. Това подчертава защо човешкият надзор остава важен, дори когато агентите се справят все по-добре със сложни задачи по договори, и защо цялостната платформа за управление на договори продължава да е необходима. Сътрудничеството с нашите изследователи дава на Ironclad възможност да включи тези проблеми в разработването на самия модел, където можем да ги проучваме заедно.
С нарастването на възможностите на моделите Ironclad може да ги използва във все повече от собствените си продукти. За правните и бизнес екипите това би могло да означава ИИ да поема по-голяма част от сложната работа по договори, като запазва механизмите за контрол, на които те разчитат.
Каним ограничен брой софтуерни компании да работят пряко с нашите изследователски и инженерни екипи по важни професионални задачи, които днешните Агенти все още не могат да изпълняват надеждно. Ако вашият екип има такава задача, бихме искали да видим конкретен пример: какво възлагате на Агента, доказателства къде се проваля и как бихте оценили успешния резултат. Партньорите трябва да могат да осигурят и хора, които познават работата в дълбочина, защитена среда за тестване и данни, които могат безопасно да се използват за изследвания. Това ни дава отправна точка, за да проучим причините за неуспеха и да измерим дали моделът се подобрява.
Ако вашият екип отговаря на това описание, кандидатствайте, за да обсъдим възможностите за изследователско сътрудничество.
Автор
Бележки под линия
- 1
- 2
Създадохме симулирани задачи въз основа на публично достъпни договори в базата данни EDGAR на Комисията по ценните книжа и борсите на САЩ (SEC), след като приложихме филтри за премахване на лична информация. За обучението и оценяването не използвахме данни на клиенти на OpenAI, вътрешни договори на OpenAI или непублични данни и договори на клиенти на Ironclad.
- 3


