Tietokoneen käytön kehittäminen Ironcladin kanssa
Miten sopimushallinnan tutkimusyhteistyö auttaa meitä kouluttamaan ja arvioimaan tekoälyagentteja vaativissa työtehtävissä.
Kun esittelimme GPT‑6 Astra -mallin, näytimme, miten pitkälle mallimme ovat kehittyneet tietokoneiden käytössä työtehtäviin asiakirjojen valmistelusta verkkosivustojen testaukseen. Seuraava tavoitteemme on parantaa agenttien kykyä käyttää erikoistuneita ohjelmistoja tehokkaasti monimutkaisten liiketoimintaongelmien ratkaisemiseen. Tutkimme, miten malleja voidaan kouluttaa ymmärtämään yrityksen liiketoimintasääntöjä, suorittamaan monivaiheisia työnkulkuja ja varmistamaan, että niiden työ täyttää alkuperäiset vaatimukset.
Nopeuttaaksemme tätä tutkimusta teemme suoraa yhteistyötä pienen ohjelmistoyritysten joukon kanssa, joka tuntee nämä työnkulut parhaiten. Tunnistamme yhdessä haastavia ja arvokkaita tehtäviä ja muokkaamme niistä tutkimusongelmia malliemme koulutusta ja arviointia varten. Näin malleistamme tulee lopulta kyvykkäämpiä ja hyödyllisempiä käytännön liiketoimintasovelluksissa.
Ensimmäinen kumppanimme on Ironclad, joka on tekoälypohjaisen sopimushallinnan johtavia yrityksiä. Olemme tiiviissä yhteistyössä Ironcladin tiimin kanssa kehittäneet tehtäviä, joissa agenttien on määritettävä sopimuksia, hyväksyntöjä ja uudelleenkäytettäviä sopimusehtoja, ja osoittaneet edistystä näissä monimutkaisissa työnkuluissa. Ironcladin asiantuntemus on ollut ratkaisevan tärkeää onnistumisen määrittelyssä ja asiakkaiden todellisten tarpeiden tuomisessa suoraan edistyneiden mallien kehitystyöhön. Olemme kiitollisia tästä kumppanuudesta ja kerromme innolla siitä, mitä olemme saaneet yhdessä aikaan.
GPT‑6 Astra on ensimmäinen edistynyt mallimme, jota on koulutettu Ironclad-tehtävillä. Tutkimuksessamme sen keskimääräinen arviointitulos oli 32 % parempi kuin GPT‑5.6 Solin, ja arvioitu aika yritystä kohden oli 48 % lyhyempi.1
Ajatellaan lakitoimintojen tiimiä, joka rakentaa ohjelmistojen ostoprosessia. Talousosaston on ehkä hyväksyttävä tietyn summan ylittävät ostot, tietoturvaosaston on tarkistettava tietyt pyynnöt ja lakiosaston on tarkistettava vakioehdoista poikkeavat ehdot. Prosessin rakentajan on toteutettava tämän lyhyen listan pohjalta pyyntölomake, asiakirjapohjat, hyväksyntäsäännöt ja lopullisen sopimuksen tallennus.
Samaa työtä tekevän tekoälyagentin on pidettävä nämä vaatimukset mielessä siirtyessään ohjelmiston osasta toiseen. Sen on esimerkiksi määritettävä talousosaston hyväksyntä ostorajan ylittäville hankinnoille ja tarkistettava, että rajan ylittävät ja alittavat pyynnöt etenevät oikeita reittejä. Yksittäisten vaiheiden onnistuminen ei riitä: valmiin prosessin on toimittava kaikissa tilanteissa, joita varten se on suunniteltu.
Ironcladin työntekijät ja Ironcladia OpenAI:lla käyttävät henkilöt auttoivat tutkijoitamme tunnistamaan 11 tehtävää laki-, liiketoiminta- ja hankintatyöstä. Näihin tehtäviin kuului esimerkiksi salassapitosopimusten määrittäminen, hankintojen hyväksyntäprosessien luominen sekä uudelleenkäytettävän sopimuslausekkeen päivittäminen vastaamaan pyynnön tekijän valitsemaa oikeudenkäyttöaluetta. Arvioimme, että kokeneelta käyttäjältä kuluisi tähän työhön keskimäärin noin 30–40 minuuttia tehtävää kohden.
Arvioimme jokaista tehtävää 8–50 kriteerillä sen monimutkaisuuden mukaan. Näin näimme, missä osissa malli onnistui ja missä se jäi tavoitteesta. Ironclad tarjosi myös ylläpitämiään tuotteen ohjelmistoympäristöjä, joissa mallit pystyivät harjoittelemaan näitä tehtäviä. Tutkijamme kehittivät synteettisiä koulutustehtäviä2 tyypillisten työnkulkujen pohjalta ja käyttivät vahvistusoppimista auttaakseen malleja kehittymään harjoittelun ja palautteen avulla. Työn tuntevien ihmisten kanssa valitut tehtävät, yksityiskohtaiset kriteerit ja mallien harjoitteluympäristö varmistavat yhdessä, että parannamme suoriutumista asiakkaillemme tärkeimmissä käytännön tehtävissä.
Vertasimme Astraa ja GPT‑5.6 Solia käyttäen Astralla päättelyasetusta Max ja Solilla asetusta Korkea. Näillä asetuksilla kumpikin malli saavutti parhaan tuloksensa. Tutkimuksen 11 tehtävässä Astran keskimääräinen arviointitulos oli 55,0 % ja GPT‑5.6 Solin 41,6 %. Arvioitu keskimääräinen aika yritystä kohden laski Solin 37,0 minuutista Astran 19,2 minuuttiin.3 Astran kehityksessä käytetty sisäinen malli saavutti näissä tehtävissä vielä paremman tuloksen, 63,7 %, ja tavoitteenamme on tuoda nämä lisäparannukset tuleviin malleihin.
Mittari | GPT‑5.6 Sol | GPT‑6 Astra |
Kriteeripohjaisen arvioinnin keskiarvo | 41,6 % | 55,0 % |
Arvioitu keskimääräinen aika yritystä kohden | 37,0 minuuttia | 19,2 minuuttia |
Astra täytti suuremman osan tehtävien vaatimuksista, ja simuloitu aika yritystä kohden oli lyhyempi. Alla olevat kaksi videota näyttävät, miten mallit suoriutuivat samasta tutkimuksessa käytetystä tehtävästä. Astra (ensimmäinen video) täytti noin 94 % tehtävän kriteereistä arviolta 20 minuutissa. GPT‑5.6 Sol (toinen video) täytti noin 85 % arviolta 32 minuutissa.
GPT‑6 Astra täytti noin 94 % tehtävän kriteereistä arviolta 20 minuutissa.
GPT‑5.6 Sol täytti noin 85 % tehtävän kriteereistä arviolta 32 minuutissa.
Ironcladin rooli tässä työssä kuvastaa sen asiakkaille tuttua haastetta: sopimusprosessin on pystyttävä käsittelemään poikkeuksia ja samalla noudattamaan liiketoiminnan kannalta olennaisia sääntöjä. Jos agentti unohtaa jonkin näistä säännöistä kesken tehtävän, ohjelmistoyritys ei voi yhtä luottavaisesti antaa sille tehtäviä. Tämä korostaa, miksi ihmisen valvonta on edelleen tärkeää agenttien kehittyessä monimutkaisissa sopimustehtävissä ja miksi kattava sopimushallinta-alusta on yhä välttämätön. Yhteistyö tutkijoidemme kanssa antaa Ironcladille mahdollisuuden tuoda nämä ongelmat taustalla olevan mallin kehitystyöhön, jossa voimme tutkia niitä yhdessä.
Mallien kyvykkyyden kasvaessa Ironclad voi hyödyntää niitä yhä useammissa omissa tuotteissaan. Laki- ja liiketoimintatiimeille tämä voisi tarkoittaa, että tekoäly hoitaa yhä suuremman osan monimutkaisiin sopimusprosesseihin liittyvästä työstä säilyttäen samalla tiimien tarvitsemat valvontamekanismit.
Kutsumme pienen joukon ohjelmistoyrityksiä työskentelemään suoraan tutkimus- ja kehitystiimiemme kanssa tärkeiden työtehtävien parissa, joita nykyiset agentit eivät vielä pysty suorittamaan luotettavasti. Jos tiimilläsi on tällainen tehtävä, haluaisimme nähdä konkreettisen esimerkin: mitä pyydätte agenttia tekemään, missä se todistettavasti epäonnistuu ja miten arvioisitte onnistunutta tulosta. Kumppanien tulisi myös pystyä tarjoamaan työn syvällisesti tuntevia asiantuntijoita, turvallinen testausympäristö sekä dataa, jota voi käyttää turvallisesti tutkimukseen. Tämä antaa meille lähtökohdan epäonnistumisen tutkimiseen ja mallin kehittymisen mittaamiseen.
Jos tämä kuvaa tiimiäsi, hae mukaan kartoittamaan tutkimusyhteistyön mahdollisuuksia.
Tekijät
Alaviitteet
- 1
- 2
Loimme simuloituja tehtäviä SEC:n EDGAR-tietokannassa julkisesti saatavilla olevista sopimuksista, joihin sovelsimme ensin henkilötietojen poistamiseen tarkoitettuja suodattimia. Emme käyttäneet koulutukseen tai arviointiin OpenAI-asiakasdataa, OpenAI:n sisäisiä sopimuksia emmekä Ironcladin ei-julkista asiakasdataa tai asiakassopimuksia.
- 3


