Unapređenje upotrebe računala uz Ironclad
Kako nam istraživačka suradnja u području ugovaranja pomaže trenirati i evaluirati AI agente na složenim stručnim poslovima.
Kad smo predstavili GPT‑6 Astra, pokazali smo koliko su naši modeli napredovali u upotrebi računala za stručne poslove, od pripreme dokumenata do testiranja web-mjesta. Naš je sljedeći cilj učiniti agente sposobnijima i učinkovitijima u upotrebi specijaliziranog softvera za rješavanje složenih poslovnih problema. Istražujemo kako trenirati modele da razumiju poslovna pravila tvrtke, izvršavaju radne procese u više koraka i provjeravaju ispunjava li njihov rad početne zahtjeve.
Kako bismo ubrzali ovo istraživanje, izravno surađujemo s malim brojem softverskih tvrtki koje najbolje razumiju te radne procese. Zajedno prepoznajemo zahtjevne zadatke od velike važnosti i pretvaramo ih u istraživačke probleme za treniranje i evaluaciju naših modela, čime ih u konačnici činimo sposobnijima i korisnijima u stvarnoj poslovnoj primjeni.
Naš je prvi partner Ironclad, vodeća tvrtka u području ugovaranja uz pomoć umjetne inteligencije. U bliskoj suradnji s timom tvrtke Ironclad razvili smo zadatke u kojima agenti moraju konfigurirati ugovore, odobrenja i pravne odredbe za višekratnu upotrebu te pokazali napredak u tim složenim radnim procesima. Stručno znanje tvrtke Ironclad bilo je ključno za definiranje uspješnog rezultata i izravno uključivanje stvarnih potreba korisnika u razvoj graničnih modela. Zahvalni smo na tom partnerstvu i veselimo se što možemo podijeliti ono što smo zajedno postigli.
GPT‑6 Astra naš je prvi granični model treniran na zadacima na platformi Ironclad. U našoj istraživačkoj evaluaciji njegov prosječni rezultat bio je 32 % viši od rezultata modela GPT‑5.6 Sol, dok je procijenjeno vrijeme po pokušaju bilo 48 % kraće.1
Zamislite tim za pravne operacije koji uspostavlja proces nabave softvera. Odjel financija možda mora odobriti kupnje iznad određenog iznosa, odjel sigurnosti pregledati određene zahtjeve, a pravni odjel pregledati nestandardne odredbe. Osoba koja uspostavlja proces mora taj kratki popis pretvoriti u obrazac za podnošenje zahtjeva, predloške dokumenata, pravila odobravanja i evidenciju konačnog ugovora.
AI agent koji obavlja isti posao mora imati te zahtjeve na umu dok se služi softverom. Primjerice, mora postaviti obavezno odobrenje odjela financija za potrošnju iznad zadanog praga i provjeriti slijede li zahtjevi iznad i ispod tog praga odgovarajuće postupke. Nije dovoljno ispravno izvršiti pojedinačne korake: dovršeni proces mora funkcionirati u svim situacijama za koje je osmišljen.
Zaposlenici tvrtke Ironclad i osobe koje se platformom Ironclad koriste u tvrtki OpenAI pomogli su našim istraživačima odabrati 11 zadataka iz područja prava, komercijalnih poslova i nabave. Među njima su bili zadaci poput postavljanja ugovora o povjerljivosti, izrade procesa odobravanja nabave i ažuriranja pravne klauzule za višekratnu upotrebu kako bi odgovarala jurisdikciji koju podnositelj zahtjeva odabere. Procjenjujemo da bi iskusnom korisniku za taj posao u prosjeku trebalo oko 30 do 40 minuta po zadatku.
Svaki smo zadatak ocijenili prema 8 do 50 kriterija, ovisno o njegovoj složenosti. To nam je omogućilo da vidimo koje je dijelove model ispravno izvršio, a gdje nije ispunio očekivanja. Ironclad je također osigurao hostana softverska okruženja svojeg proizvoda u kojima su modeli mogli vježbati te zadatke. Naši su istraživači razvili sintetičke zadatke za treniranje2 na temelju reprezentativnih radnih procesa te primijenili učenje s potkrepljivanjem kako bi modeli napredovali kroz vježbu i povratne informacije. Ova kombinacija — zadaci odabrani s ljudima koji poznaju posao, detaljni kriteriji i okruženje za vježbu modela — osigurava napredak u stvarnim zadacima koji su našim korisnicima najvažniji.
Usporedili smo modele Astra i GPT‑5.6 Sol uz razinu rasuđivanja Max za Astru i Visoka za Sol, postavke s kojima je svaki model postigao svoj najbolji rezultat. Na 11 istraživačkih zadataka Astra je ostvarila prosječni rezultat od 55,0 %, a GPT‑5.6 Sol 41,6 %, dok se procijenjeno prosječno vrijeme po pokušaju smanjilo s 37,0 minuta za Sol na 19,2 minute za Astru.3 Interni model upotrijebljen u razvoju Astre postigao je još bolji rezultat od 63,7 % na tim zadacima, a cilj nam je ta dodatna poboljšanja prenijeti u buduće modele.
Mjerilo | GPT‑5.6 Sol | GPT‑6 Astra |
Prosječni rezultat prema kriterijima ocjenjivanja | 41,6 % | 55,0 % |
Procijenjeno prosječno vrijeme po pokušaju | 37,0 minuta | 19,2 minute |
Astra je ispunila više zahtjeva zadatka uz kraće simulirano vrijeme po pokušaju. Dva videozapisa u nastavku pokazuju kako su modeli izvršavali isti istraživački zadatak. Astra (prvi videozapis) ispunila je oko 94 % kriterija zadatka u procijenjenih 20 minuta; GPT‑5.6 Sol (drugi videozapis) ispunio je oko 85 % u procijenjene 32 minute.
GPT‑6 Astra ispunio je oko 94 % kriterija zadatka u procijenjenih 20 minuta.
GPT‑5.6 Sol ispunio je oko 85 % kriterija zadatka u procijenjene 32 minute.
Uloga tvrtke Ironclad u ovom radu odražava izazov koji njezini korisnici dobro poznaju: proces ugovaranja mora omogućiti obradu iznimaka uz poštovanje pravila o kojima poslovanje ovisi. Ako agent tijekom zadatka izgubi iz vida neko od tih pravila, to ograničava zadatke koje mu softverska tvrtka može s povjerenjem povjeriti. To pokazuje zašto je ljudski nadzor i dalje važan, iako agenti sve bolje obavljaju složene zadatke ugovaranja, te zašto je cjelovita platforma za ugovaranje i dalje neophodna. Suradnja s našim istraživačima omogućuje tvrtki Ironclad da te probleme uključi u razvoj temeljnog modela, gdje ih možemo zajedno proučavati.
Kako modeli postaju sposobniji, Ironclad ih ima priliku upotrebljavati u sve više svojih proizvoda. Za pravne i poslovne timove to bi moglo značiti da umjetna inteligencija preuzima veći dio posla povezanog sa složenim ugovaranjem, uz očuvanje kontrola na koje se ti timovi oslanjaju.
Pozivamo mali broj softverskih tvrtki na izravnu suradnju s našim istraživačkim i inženjerskim timovima na važnim stručnim zadacima koje današnji agenti još ne mogu pouzdano izvršiti. Ako vaš tim ima takav zadatak, željeli bismo vidjeti konkretan primjer: što tražite od agenta, dokaze o tome gdje ne uspijeva te kako biste procijenili uspješnost rezultata. Partneri bi također trebali moći osigurati ljude koji temeljito poznaju taj posao, sigurno okruženje za testiranje i podatke koji se mogu sigurno upotrebljavati za istraživanje. To nam daje polazište za istraživanje uzroka neuspjeha i mjerenje napretka modela.
Ako vaš tim odgovara ovom opisu, prijavite se kako bismo razmotrili mogućnost istraživačke suradnje.
Autor
Fusnote
- 1
- 2
Simulirane zadatke izradili smo na temelju ugovora javno dostupnih u SEC-ovoj bazi podataka EDGAR nakon primjene filtara namijenjenih uklanjanju osobnih podataka. Za treniranje ni evaluaciju nismo upotrebljavali podatke korisnika tvrtke OpenAI, interne ugovore tvrtke OpenAI ni podatke ili ugovore korisnika tvrtke Ironclad koji nisu javno dostupni.
- 3


