Unapređenje korištenja računara uz Ironclad
Kako nam istraživačka saradnja u oblasti ugovaranja pomaže da treniramo i evaluiramo AI agente na složenim stručnim poslovima.
Kada smo predstavili GPT‑6 Astra, pokazali smo koliko su naši modeli napredovali u korištenju računara za stručne poslove, od pripreme dokumenata do testiranja web-stranica. Naš sljedeći cilj je učiniti agente sposobnijim i efikasnijim u korištenju specijalizovanog softvera za rješavanje složenih poslovnih problema. Istražujemo kako trenirati modele da razumiju poslovna pravila kompanije, izvršavaju tokove rada u više koraka i provjeravaju ispunjava li njihov rad početne zahtjeve.
Kako bismo ubrzali ovo istraživanje, direktno sarađujemo s malim brojem softverskih kompanija koje najbolje poznaju ove tokove rada. Zajedno prepoznajemo zahtjevne zadatke od velike vrijednosti i pretvaramo ih u istraživačke probleme za treniranje i evaluaciju naših modela, čime ih u konačnici činimo sposobnijim i korisnijim u stvarnim poslovnim primjenama.
Naš prvi partner je Ironclad, lider u ugovaranju uz pomoć AI-ja. U bliskoj saradnji s timom kompanije Ironclad razvili smo zadatke koji od agenata zahtijevaju da konfigurišu ugovore, odobrenja i pravne odredbe za višekratnu upotrebu te pokazali napredak u ovim složenim tokovima rada. Stručno znanje kompanije Ironclad bilo je ključno za definisanje uspješnog rezultata i direktno uključivanje stvarnih potreba korisnika u razvoj graničnih modela. Zahvalni smo im na partnerstvu i radujemo se što možemo podijeliti ono što smo zajedno postigli.
GPT‑6 Astra je naš prvi granični model treniran na zadacima u platformi Ironclad. U našoj istraživačkoj evaluaciji njegov prosječni rezultat bio je 32% viši od rezultata modela GPT‑5.6 Sol, dok je procijenjeno vrijeme po pokušaju bilo 48% kraće.1
Zamislite tim za pravne operacije koji uspostavlja proces kupovine softvera. Odjel finansija možda treba odobriti kupovine iznad određenog iznosa, odjel sigurnosti pregledati određene zahtjeve, a pravni odjel provjeriti nestandardne odredbe. Osoba koja uspostavlja proces mora tu kratku listu pretvoriti u obrazac za podnošenje zahtjeva, predloške dokumenata, pravila odobravanja i evidenciju konačnog ugovora.
AI agent koji obavlja isti posao mora imati te zahtjeve na umu dok radi u softveru. Naprimjer, mora postaviti obavezno odobrenje odjela finansija za potrošnju iznad zadane granice i provjeriti prolaze li zahtjevi iznad i ispod nje odgovarajućim postupcima. Nije dovoljno ispravno izvršiti pojedinačne korake: završen proces mora funkcionisati u svim situacijama za koje je osmišljen.
Zaposlenici kompanije Ironclad i ljudi koji koriste Ironclad u kompaniji OpenAI pomogli su našim istraživačima da odaberu 11 zadataka iz oblasti prava, komercijalnih poslova i nabavke. Među njima su bili zadaci poput postavljanja ugovora o povjerljivosti, kreiranja procesa odobravanja nabavke i ažuriranja pravne klauzule za višekratnu upotrebu kako bi odgovarala jurisdikciji koju podnosilac zahtjeva odabere. Procjenjujemo da bi iskusnom korisniku za ovaj posao u prosjeku trebalo oko 30 do 40 minuta po zadatku.
Svaki zadatak ocjenjivali smo prema 8 do 50 kriterija, zavisno od njegove složenosti. To nam je omogućilo da vidimo koje je dijelove model ispravno izvršio, a gdje nije ispunio očekivanja. Ironclad je također osigurao hostovana softverska okruženja svog proizvoda u kojima su modeli mogli vježbati ove zadatke. Naši istraživači razvili su sintetičke zadatke za treniranje2 na osnovu reprezentativnih tokova rada i primijenili učenje s potkrepljivanjem kako bi modeli napredovali kroz vježbu i povratne informacije. Ova kombinacija — zadaci odabrani s ljudima koji poznaju posao, detaljni kriteriji i okruženje za vježbu modela — osigurava da napredujemo u zadacima iz prakse koji su našim korisnicima najvažniji.
Uporedili smo modele Astra i GPT‑5.6 Sol koristeći postavku rezonovanja Max za model Astra i Visoka za model Sol — postavke pri kojima je svaki model ostvario najbolji rezultat. Na 11 istraživačkih zadataka prosječni rezultat modela Astra bio je 55,0%, u poređenju s 41,6% za GPT‑5.6 Sol, dok je procijenjeno prosječno vrijeme po pokušaju skraćeno s 37,0 minuta za model Sol na 19,2 minute za model Astra.3 Interni model korišten u razvoju modela Astra ostvario je još bolji rezultat od 63,7% na ovim zadacima, a cilj nam je da ova dodatna poboljšanja prenesemo u buduće modele.
Mjerilo | GPT‑5.6 Sol | GPT‑6 Astra |
Prosječni rezultat prema kriterijima | 41,6% | 55,0% |
Procijenjeno prosječno vrijeme po pokušaju | 37,0 minuta | 19,2 minute |
Astra je ispunio više zahtjeva zadatka uz kraće simulirano vrijeme po pokušaju. Dva videosnimka u nastavku prikazuju kako su modeli izvršavali isti istraživački zadatak. Astra (prvi snimak) ispunio je oko 94% kriterija zadatka za procijenjenih 20 minuta; GPT‑5.6 Sol (drugi snimak) ispunio je oko 85% za procijenjene 32 minute.
GPT‑6 Astra ispunio je oko 94% kriterija zadatka za procijenjenih 20 minuta.
GPT‑5.6 Sol ispunio je oko 85% kriterija zadatka za procijenjene 32 minute.
Uloga kompanije Ironclad u ovom radu odražava izazov koji njeni korisnici dobro poznaju: proces ugovaranja mora omogućiti obradu izuzetaka, a pritom očuvati pravila o kojima poslovanje zavisi. Ako agent usred zadatka izgubi iz vida neko od tih pravila, to ograničava poslove koje mu softverska kompanija može s povjerenjem povjeriti. To pokazuje zašto je ljudski nadzor i dalje važan dok agenti postaju sve bolji u složenim zadacima ugovaranja i zašto je sveobuhvatna platforma za ugovaranje i dalje neophodna. Saradnja s našim istraživačima omogućava kompaniji Ironclad da ove probleme uključi u razvoj osnovnog modela, gdje ih možemo zajednički proučavati.
Kako modeli postaju sposobniji, Ironclad dobija priliku da ih koristi u većem broju svojih proizvoda. Za pravne i poslovne timove to bi moglo značiti da AI preuzima veći dio posla u složenom ugovaranju, uz očuvanje kontrolnih mehanizama na koje se ti timovi oslanjaju.
Pozivamo mali broj softverskih kompanija da direktno sarađuju s našim istraživačkim i inženjerskim timovima na važnim stručnim zadacima koje današnji agenti još ne mogu pouzdano izvršiti. Ako vaš tim ima takav zadatak, željeli bismo vidjeti konkretan primjer: šta tražite od agenta, dokaze o tome gdje griješi i kako biste procijenili uspješan rezultat. Partneri bi također trebali moći osigurati ljude koji temeljito poznaju taj posao, sigurno okruženje za testiranje i podatke koji se mogu sigurno koristiti za istraživanje. To nam daje polazište za istraživanje uzroka neuspjeha i mjerenje napretka modela.
Ako ovaj opis odgovara vašem timu, prijavite se da razmotrimo mogućnost istraživačke saradnje.
Autor
Fusnote
- 1
- 2
Simulirane zadatke kreirali smo na osnovu ugovora javno dostupnih u bazi EDGAR američkog SEC-a, nakon primjene filtera namijenjenih uklanjanju ličnih podataka. Za treniranje ni evaluaciju nismo koristili podatke korisnika kompanije OpenAI, interne ugovore kompanije OpenAI niti podatke ili ugovore korisnika kompanije Ironclad koji nisu javno dostupni.
- 3


