Унапредување на користењето компјутери со Ironclad
Како истражувачката соработка во управувањето со договори ни помага да обучуваме и оценуваме агенти со ВИ за сложена професионална работа.
Кога го претставивме GPT‑6 Astra, покажавме колку напредувале нашите модели во користењето компјутери за професионална работа, од подготовка на документи до тестирање веб-страници. Нашата следна цел е да ги направиме агентите поспособни и поефикасни во користењето специјализиран софтвер за решавање сложени деловни проблеми. Истражуваме како да ги обучиме моделите да ги разбираат деловните правила на една компанија, да извршуваат работни текови со повеќе чекори и да проверуваат дали нивната работа ги исполнува првичните барања.
За да го забрзаме ова истражување, соработуваме директно со мал број софтверски компании што најдобро ги разбираат овие работни текови. Заедно утврдуваме кои задачи се комплексни и особено значајни и ги претвораме во истражувачки проблеми за обука и оценување на нашите модели. Со тоа, моделите стануваат поспособни и покорисни во реални деловни примени.
Наш прв партнер е Ironclad, лидер во управувањето со договори со помош на ВИ. Во тесна соработка со тимот на Ironclad, развивме задачи што бараат од агентите да поставуваат договори, одобрувања и правни одредби за повеќекратна употреба, и покажавме напредок во овие сложени работни текови. Стручноста на Ironclad беше клучна за да се дефинира што претставува успех и реалните потреби на клиентите да се вклучат директно во развојот на граничните модели. Благодарни сме за нивното партнерство и со задоволство го споделуваме она што го постигнавме заедно.
GPT‑6 Astra е нашиот прв граничен модел обучен на задачи во Ironclad. Во нашето истражувачко оценување, неговиот просечен резултат беше 32% повисок од оној на GPT‑5.6 Sol, а проценетото време по обид беше 48% пократко.1
Замислете тим за правни операции што воспоставува процес за набавка на софтвер. Можеби одделот за финансии треба да одобрува набавки над одреден износ, одделот за безбедност да разгледува одредени барања, а правниот оддел да ги проверува нестандардните одредби. Лицето што го воспоставува процесот треба да ја преточи таа кратка листа во образец за поднесување барања, шаблони за документи, правила за одобрување и евиденција за конечниот договор.
Агентот со ВИ што ја извршува истата работа мора да ги има предвид тие барања додека работи во софтверот. На пример, мора да постави одобрување од одделот за финансии за трошоци над утврдениот праг и да провери дали барањата што се над и под тој праг се насочуваат правилно. Не е доволно поединечните чекори да се точни: завршениот процес мора да функционира во сите ситуации за кои е наменет.
Вработените во Ironclad и луѓето што го користат Ironclad во OpenAI им помогнаа на нашите истражувачи да издвојат 11 задачи од правното и комерцијалното работење и набавките. Меѓу нив беа задачи како поставување договори за доверливост, креирање процеси за одобрување набавки и ажурирање правна клаузула за повеќекратна употреба за да ја одразува јурисдикцијата што ја избира подносителот на барањето. Проценуваме дека на искусен корисник оваа работа би му одзела, во просек, околу 30 до 40 минути по задача.
Секоја задача ја оценувавме според 8 до 50 критериуми, зависно од нејзината сложеност. Тоа ни овозможи да видиме кои делови моделот ги извршил правилно и каде потфрлил. Ironclad обезбеди и хостирани софтверски средини со својот производ во кои моделите можеа да ги вежбаат овие задачи. Нашите истражувачи развија синтетички задачи за обука2 засновани на репрезентативни работни текови и користеа зајакнување на учењето за да им помогнат на моделите да се подобрат преку вежбање и повратни информации. Оваа комбинација — задачи избрани заедно со луѓе што ја познаваат работата, детални критериуми и средина во која моделите можат да вежбаат — ни овозможува да постигнуваме подобрувања кај реалните задачи што се најважни за нашите клиенти.
Ги споредивме Astra и GPT‑5.6 Sol користејќи ја поставката за максимално расудување за Astra и високо расудување за Sol — поставките со кои секој модел постигна највисок резултат. Во 11-те истражувачки задачи, просечниот резултат на Astra беше 55,0%, наспроти 41,6% за GPT‑5.6 Sol, додека проценетото просечно време по обид се намали од 37,0 минути за Sol на 19,2 минути за Astra.3 Внатрешен модел користен во развојот на Astra постигна уште подобар резултат од 63,7% на овие задачи, а наша цел е овие дополнителни подобрувања да ги пренесеме во идните модели.
Показател | GPT‑5.6 Sol | GPT‑6 Astra |
Просечен резултат според критериумите | 41,6% | 55,0% |
Проценето просечно време по обид | 37,0 минути | 19,2 минути |
Astra исполни повеќе од барањата на задачите со пократко симулирано време по обид. Двете видеа подолу покажуваат како моделите ја извршија истата истражувачка задача. Astra (во првото видео) исполни околу 94% од критериумите на задачата за околу 20 минути; GPT‑5.6 Sol (во второто) исполни околу 85% за околу 32 минути.
GPT‑6 Astra исполни околу 94% од критериумите на задачата за околу 20 минути.
GPT‑5.6 Sol исполни околу 85% од критериумите на задачата за околу 32 минути.
Улогата на Ironclad во оваа работа одразува предизвик што неговите клиенти добро го познаваат: процесот на управување со договори мора да ги опфати исклучоците, а притоа да ги зачува правилата од кои зависи деловното работење. Ако агентот престане да следи некое од тие правила среде задача, тоа го ограничува опсегот на работи што една софтверска компанија може со доверба да му ги додели. Ова нагласува зошто човечкиот надзор останува важен додека агентите стануваат сѐ подобри во сложените задачи со договори и зошто сеопфатната платформа за управување со договори останува неопходна. Соработката со нашите истражувачи му овозможува на Ironclad да ги внесе овие проблеми во развојот на основниот модел, каде што можеме заедно да ги проучуваме.
Како што моделите стануваат поспособни, Ironclad добива можност да ги користи во повеќе свои производи. За правните и деловните тимови, тоа би можело да значи дека ВИ ќе преземе поголем дел од работата со сложени договори, а притоа ќе ги зачува контролните механизми на кои се потпираат тие тимови.
Покануваме мал број софтверски компании да работат директно со нашите истражувачки и инженерски тимови на важни професионални задачи што денешните агенти сѐ уште не можат сигурно да ги завршат. Ако вашиот тим има таква задача, би сакале да видиме конкретен пример: што барате од агентот да направи, докази за тоа каде потфрла и како би оцениле дали резултатот е успешен. Партнерите треба да можат да обезбедат и луѓе што темелно ја познаваат работата, безбедна средина за тестирање и податоци што можат безбедно да се користат за истражување. Тоа ни дава почетна основа за да го истражиме неуспехот и да измериме дали моделот се подобрува.
Ако вашиот тим ги исполнува овие услови, пријавете се за да ги разгледаме можностите за истражувачка соработка.
Автор
Фусноти
- 1
- 2
Креиравме симулирани задачи од договори што се јавно достапни во базата на податоци EDGAR на SEC, откако применивме филтри наменети за отстранување лични податоци. За обука или оценување не користевме податоци од клиенти на OpenAI, внатрешни договори на OpenAI, ниту податоци или договори од клиенти на Ironclad што не се јавно достапни.
- 3


