Preskočite na glavni sadržaj
OpenAI

6. listopada 2026.

Publikacija

Unapređenje upotrebe računala uz Ironclad

Kako nam istraživačka suradnja u području ugovaranja pomaže trenirati i evaluirati AI agente na složenim stručnim poslovima.

Učitavanje…

Kad smo predstavili GPT‑6 Astra, pokazali smo koliko su naši modeli napredovali u upotrebi računala za stručne poslove, od pripreme dokumenata do testiranja web-mjesta. Naš je sljedeći cilj učiniti agente sposobnijima i učinkovitijima u upotrebi specijaliziranog softvera za rješavanje složenih poslovnih problema. Istražujemo kako trenirati modele da razumiju poslovna pravila tvrtke, izvršavaju radne procese u više koraka i provjeravaju ispunjava li njihov rad početne zahtjeve.

Kako bismo ubrzali ovo istraživanje, izravno surađujemo s malim brojem softverskih tvrtki koje najbolje razumiju te radne procese. Zajedno prepoznajemo zahtjevne zadatke od velike važnosti i pretvaramo ih u istraživačke probleme za treniranje i evaluaciju naših modela, čime ih u konačnici činimo sposobnijima i korisnijima u stvarnoj poslovnoj primjeni.

Naš je prvi partner Ironclad, vodeća tvrtka u području ugovaranja uz pomoć umjetne inteligencije. U bliskoj suradnji s timom tvrtke Ironclad razvili smo zadatke u kojima agenti moraju konfigurirati ugovore, odobrenja i pravne odredbe za višekratnu upotrebu te pokazali napredak u tim složenim radnim procesima. Stručno znanje tvrtke Ironclad bilo je ključno za definiranje uspješnog rezultata i izravno uključivanje stvarnih potreba korisnika u razvoj graničnih modela. Zahvalni smo na tom partnerstvu i veselimo se što možemo podijeliti ono što smo zajedno postigli.

GPT‑6 Astra naš je prvi granični model treniran na zadacima na platformi Ironclad. U našoj istraživačkoj evaluaciji njegov prosječni rezultat bio je 32 % viši od rezultata modela GPT‑5.6 Sol, dok je procijenjeno vrijeme po pokušaju bilo 48 % kraće.1

Pretvaranje procesa ugovaranja u zadatke za treniranje

Zamislite tim za pravne operacije koji uspostavlja proces nabave softvera. Odjel financija možda mora odobriti kupnje iznad određenog iznosa, odjel sigurnosti pregledati određene zahtjeve, a pravni odjel pregledati nestandardne odredbe. Osoba koja uspostavlja proces mora taj kratki popis pretvoriti u obrazac za podnošenje zahtjeva, predloške dokumenata, pravila odobravanja i evidenciju konačnog ugovora.

AI agent koji obavlja isti posao mora imati te zahtjeve na umu dok se služi softverom. Primjerice, mora postaviti obavezno odobrenje odjela financija za potrošnju iznad zadanog praga i provjeriti slijede li zahtjevi iznad i ispod tog praga odgovarajuće postupke. Nije dovoljno ispravno izvršiti pojedinačne korake: dovršeni proces mora funkcionirati u svim situacijama za koje je osmišljen.

Zaposlenici tvrtke Ironclad i osobe koje se platformom Ironclad koriste u tvrtki OpenAI pomogli su našim istraživačima odabrati 11 zadataka iz područja prava, komercijalnih poslova i nabave. Među njima su bili zadaci poput postavljanja ugovora o povjerljivosti, izrade procesa odobravanja nabave i ažuriranja pravne klauzule za višekratnu upotrebu kako bi odgovarala jurisdikciji koju podnositelj zahtjeva odabere. Procjenjujemo da bi iskusnom korisniku za taj posao u prosjeku trebalo oko 30 do 40 minuta po zadatku.

Svaki smo zadatak ocijenili prema 8 do 50 kriterija, ovisno o njegovoj složenosti. To nam je omogućilo da vidimo koje je dijelove model ispravno izvršio, a gdje nije ispunio očekivanja. Ironclad je također osigurao hostana softverska okruženja svojeg proizvoda u kojima su modeli mogli vježbati te zadatke. Naši su istraživači razvili sintetičke zadatke za treniranje2 na temelju reprezentativnih radnih procesa te primijenili učenje s potkrepljivanjem kako bi modeli napredovali kroz vježbu i povratne informacije. Ova kombinacija — zadaci odabrani s ljudima koji poznaju posao, detaljni kriteriji i okruženje za vježbu modela — osigurava napredak u stvarnim zadacima koji su našim korisnicima najvažniji.

Kako se Astra pokazala

Usporedili smo modele Astra i GPT‑5.6 Sol uz razinu rasuđivanja Max za Astru i Visoka za Sol, postavke s kojima je svaki model postigao svoj najbolji rezultat. Na 11 istraživačkih zadataka Astra je ostvarila prosječni rezultat od 55,0 %, a GPT‑5.6 Sol 41,6 %, dok se procijenjeno prosječno vrijeme po pokušaju smanjilo s 37,0 minuta za Sol na 19,2 minute za Astru.3 Interni model upotrijebljen u razvoju Astre postigao je još bolji rezultat od 63,7 % na tim zadacima, a cilj nam je ta dodatna poboljšanja prenijeti u buduće modele.

Mjerilo

GPT‑5.6 Sol
Razina rasuđivanja: Visoka

GPT‑6 Astra
Razina rasuđivanja: Max

Prosječni rezultat prema kriterijima ocjenjivanja

41,6 %

55,0 %

Procijenjeno prosječno vrijeme po pokušaju

37,0 minuta

19,2 minute

Astra je ispunila više zahtjeva zadatka uz kraće simulirano vrijeme po pokušaju. Dva videozapisa u nastavku pokazuju kako su modeli izvršavali isti istraživački zadatak. Astra (prvi videozapis) ispunila je oko 94 % kriterija zadatka u procijenjenih 20 minuta; GPT‑5.6 Sol (drugi videozapis) ispunio je oko 85 % u procijenjene 32 minute.

GPT‑6 Astra ispunio je oko 94 % kriterija zadatka u procijenjenih 20 minuta.

GPT‑5.6 Sol ispunio je oko 85 % kriterija zadatka u procijenjene 32 minute.

Što ova suradnja znači za Ironclad

Uloga tvrtke Ironclad u ovom radu odražava izazov koji njezini korisnici dobro poznaju: proces ugovaranja mora omogućiti obradu iznimaka uz poštovanje pravila o kojima poslovanje ovisi. Ako agent tijekom zadatka izgubi iz vida neko od tih pravila, to ograničava zadatke koje mu softverska tvrtka može s povjerenjem povjeriti. To pokazuje zašto je ljudski nadzor i dalje važan, iako agenti sve bolje obavljaju složene zadatke ugovaranja, te zašto je cjelovita platforma za ugovaranje i dalje neophodna. Suradnja s našim istraživačima omogućuje tvrtki Ironclad da te probleme uključi u razvoj temeljnog modela, gdje ih možemo zajedno proučavati.

Kako modeli postaju sposobniji, Ironclad ih ima priliku upotrebljavati u sve više svojih proizvoda. Za pravne i poslovne timove to bi moglo značiti da umjetna inteligencija preuzima veći dio posla povezanog sa složenim ugovaranjem, uz očuvanje kontrola na koje se ti timovi oslanjaju.

“Da bi umjetna inteligencija bila istinski korisna u složenim područjima ugovaranja, mora moći više od izvršavanja pojedinačnih radnji. Agenti moraju razumjeti cijeli životni ciklus ugovaranja, uključujući povezanost poslovnih procesa, uz očuvanje kontrola na koje se timovi oslanjaju. Naša suradnja s tvrtkom OpenAI uključuje te stvarne izazove u istraživački proces i pridonosi napretku tehnologije.”
— Sunita Verma, glavna direktorica za tehnologiju, Ironclad

Surađujte s nama na unapređenju umjetne inteligencije za složene stručne poslove

Pozivamo mali broj softverskih tvrtki na izravnu suradnju s našim istraživačkim i inženjerskim timovima na važnim stručnim zadacima koje današnji agenti još ne mogu pouzdano izvršiti. Ako vaš tim ima takav zadatak, željeli bismo vidjeti konkretan primjer: što tražite od agenta, dokaze o tome gdje ne uspijeva te kako biste procijenili uspješnost rezultata. Partneri bi također trebali moći osigurati ljude koji temeljito poznaju taj posao, sigurno okruženje za testiranje i podatke koji se mogu sigurno upotrebljavati za istraživanje. To nam daje polazište za istraživanje uzroka neuspjeha i mjerenje napretka modela.

Autor

OpenAI

Fusnote

  1. 1

    Ovi rezultati obuhvaćaju 11 istraživačkih zadataka, a ne sve radne procese na platformi Ironclad. Navedena vremena simulirane su procjene na temelju pretpostavljenih brzina obrade i generiranja modela, a ne izmjerene uštede vremena korisnika.

  2. 2

    Simulirane zadatke izradili smo na temelju ugovora javno dostupnih u SEC-ovoj bazi podataka EDGAR nakon primjene filtara namijenjenih uklanjanju osobnih podataka. Za treniranje ni evaluaciju nismo upotrebljavali podatke korisnika tvrtke OpenAI, interne ugovore tvrtke OpenAI ni podatke ili ugovore korisnika tvrtke Ironclad koji nisu javno dostupni.

  3. 3

    Pogledajte prethodnu fusnotu o istraživačkoj evaluaciji.