Arvutikasutuse arendamine koos Ironcladiga
Kuidas lepinguhalduse alane teaduskoostöö aitab meil treenida ja hinnata tehisintellektiagente keerukas erialatöös.
Kui tutvustasime mudelit GPT‑6 Astra, näitasime, kui kaugele on meie mudelid jõudnud arvuti kasutamises erialatööks, alates dokumentide koostamisest kuni veebisaitide testimiseni. Meie järgmine eesmärk on muuta agendid võimekamaks ja tõhusamaks eritarkvara kasutamisel keerukate äriprobleemide lahendamiseks. Uurime, kuidas treenida mudeleid mõistma ettevõtte ärireegleid, täitma mitmeetapilisi töövooge ja kontrollima, kas nende töö vastab algsetele nõuetele.
Selle teadustöö kiirendamiseks teeme otse koostööd väikese hulga tarkvaraettevõtetega, kes tunnevad neid töövooge kõige paremini. Koos selgitame välja keerukad ja suure väärtusega ülesanded ning muudame need uurimisprobleemideks, mille abil oma mudeleid treenida ja hinnata. Nii muutuvad meie mudelid lõppkokkuvõttes võimekamaks ja kasulikumaks ka ettevõtete igapäevatöös.
Meie esimene partner on Ironclad, tehisintellektipõhise lepinguhalduse eestvedaja. Tihedas koostöös Ironcladi meeskonnaga oleme välja töötanud ülesanded, mis nõuavad agentidelt lepingute, kinnituste ja korduskasutatavate õiguslike tingimuste seadistamist, ning näidanud edusamme nende keerukate töövoogude täitmisel. Ironcladi asjatundlikkus on olnud määrava tähtsusega eduka tulemuse määratlemisel ja klientide tegelike vajaduste toomisel otse tipptasemel mudelite arendusse. Oleme selle koostöö eest tänulikud ja jagame rõõmuga seda, mida oleme üheskoos saavutanud.
GPT‑6 Astra on meie esimene tipptasemel mudel, mida on treenitud Ironcladi ülesannetel. Meie uuringus oli selle keskmine hindamistulemus 32% kõrgem kui mudelil GPT‑5.6 Sol, samas kui hinnanguline aeg katse kohta oli 48% lühem.1
Võtame näiteks õigustoimingute meeskonna, kes loob tarkvara ostmise protsessi. Rahandusosakonnal võib olla vaja kinnitada ostud, mis ületavad teatud summat, turbeosakonnal üle vaadata teatud taotlused ja õigusosakonnal kontrollida tavapärasest erinevaid tingimusi. Protsessi loov inimene peab selle lühikese loetelu põhjal koostama taotlusvormi, dokumendimallid ja kinnitamisreeglid ning määrama, kuidas lõplik leping talletatakse.
Sama tööd tegev tehisintellektiagent peab neid nõudeid tarkvaras tegutsedes pidevalt silmas pidama. Näiteks peab ta seadistama rahandusosakonna kinnituse nõude kululimiiti ületavatele ostudele ning kontrollima, et nii üle kui ka alla selle piiri jäävad taotlused läbiksid õige menetluse. Üksikute sammude õigesti tegemisest ei piisa: valmis protsess peab toimima kõigis olukordades, mille jaoks see loodi.
Ironcladi töötajad ja OpenAI inimesed, kes Ironcladi kasutavad, aitasid meie teadlastel välja valida 11 ülesannet õigus-, äri- ja hanketöö valdkonnast. Nende hulka kuulusid näiteks konfidentsiaalsuslepingute seadistamine, hangete kinnitamisprotsesside loomine ja korduskasutatava lepinguklausli uuendamine nii, et see vastaks taotleja valitud jurisdiktsioonile. Meie hinnangul kuluks kogenud kasutajal selleks tööks keskmiselt umbes 30–40 minutit ülesande kohta.
Hindasime iga ülesannet olenevalt selle keerukusest 8–50 kriteeriumi alusel. Nii nägime, milliste osadega mudel hakkama sai ja kus jäi tulemus puudulikuks. Ironclad pakkus ka oma toote majutatud tarkvarakeskkondi, kus mudelid said neid ülesandeid harjutada. Meie teadlased koostasid tüüpiliste töövoogude põhjal sünteetilised treeningülesanded2 ja kasutasid kinnistavat õppimist, et aidata mudelitel harjutamise ja tagasiside kaudu paremaks saada. Tööd tundvate inimestega koos valitud ülesanded, üksikasjalikud kriteeriumid ja keskkond mudelite harjutamiseks tagavad üheskoos, et parandame mudelite võimekust just neis praktilistes ülesannetes, mis on meie klientidele kõige olulisemad.
Võrdlesime Astrat ja GPT‑5.6 Soli, kasutades Astra puhul arutlustaset Max ja Soli puhul taset Kõrge – need olid sätted, millega kumbki mudel saavutas oma parima tulemuse. Astra keskmine tulemus 11 uuringuülesandes oli 55,0%, GPT‑5.6 Solil aga 41,6%. Hinnanguline keskmine aeg katse kohta langes Soli 37,0 minutilt Astra 19,2 minutile.3 Astra arendamisel kasutatud sisemine mudel saavutas nendes ülesannetes veelgi parema tulemuse, 63,7%, ning meie eesmärk on tuua need täiendavad edusammud ka tulevastesse mudelitesse.
Mõõdik | GPT‑5.6 Sol | GPT‑6 Astra |
Keskmine tulemus hindamiskriteeriumide alusel | 41,6% | 55,0% |
Hinnanguline keskmine aeg katse kohta | 37,0 minutit | 19,2 minutit |
Astra täitis rohkem ülesandenõudeid, kulutades katse kohta vähem simuleeritud aega. Kaks allolevat klippi näitavad, kuidas mudelid sama uuringuülesandega toime tulid. Astra (esimeses klipis) täitis ligikaudu 94% ülesande kriteeriumidest hinnanguliselt 20 minutiga; GPT‑5.6 Sol (teises klipis) täitis ligikaudu 85% hinnanguliselt 32 minutiga.
GPT‑6 Astra täitis ligikaudu 94% ülesande kriteeriumidest hinnanguliselt 20 minutiga.
GPT‑5.6 Sol täitis ligikaudu 85% ülesande kriteeriumidest hinnanguliselt 32 minutiga.
Ironcladi roll selles töös peegeldab väljakutset, mida tema kliendid hästi tunnevad: lepinguprotsess peab võimaldama erandeid, järgides samal ajal reegleid, millele ettevõtte tegevus tugineb. Kui agent kaotab ülesande käigus mõne neist reeglitest silmist, piirab see tööd, mida tarkvaraettevõte saab talle kindlustundega usaldada. See rõhutab, miks inimeste järelevalve on endiselt oluline ka siis, kui agendid saavad keerukate lepinguhaldusülesannetega üha paremini hakkama, ning miks terviklik lepinguhaldusplatvorm on jätkuvalt hädavajalik. Koostöö meie teadlastega annab Ironcladile võimaluse tuua need probleemid aluseks oleva mudeli arendusprotsessi, kus saame neid ühiselt uurida.
Sedamööda, kuidas mudelid muutuvad võimekamaks, saab Ironclad neid kasutada rohkemates oma toodetes. Õigus- ja ärimeeskondade jaoks võiks see tähendada, et tehisintellekt võtab enda kanda suurema osa keerukast lepingutööst, säilitades samal ajal kontrollimehhanismid, millele need meeskonnad toetuvad.
Kutsume väikest hulka tarkvaraettevõtteid tegema otse koostööd meie teadus- ja insenerimeeskondadega oluliste erialaste ülesannete kallal, mida praegused agendid veel usaldusväärselt täita ei suuda. Kui teie meeskonnal on selline ülesanne, soovime näha konkreetset näidet: mida te agendil teha palute, tõendeid selle kohta, kus ta hätta jääb, ning seda, kuidas te hindaksite edukat tulemust. Partnerid peaksid saama kaasata ka inimesi, kes tunnevad seda tööd põhjalikult, ning pakkuda turvalist testimiskeskkonda ja andmeid, mida saab ohutult teadustöös kasutada. See annab meile lähtepunkti ebaõnnestumise uurimiseks ja mudeli arengu mõõtmiseks.
Kui see kirjeldab teie meeskonda, esitage taotlus teaduskoostöö võimaluste uurimiseks.
Autor
Joonealused märkused
- 1
- 2
Koostasime simuleeritud ülesanded SEC-i EDGAR-i andmebaasis avalikult kättesaadavate lepingute põhjal, olles eelnevalt rakendanud isikuandmete eemaldamiseks mõeldud filtreid. Me ei kasutanud treenimiseks ega hindamiseks OpenAI kliendiandmeid, OpenAI sisemisi lepinguid ega Ironcladi klientide mitteavalikke andmeid või lepinguid.
- 3


