Hopp til hovedinnhold
OpenAI

6. oktober 2026

Publikasjon

Videreutvikling av datamaskinbruk med Ironclad

Slik hjelper et forskningssamarbeid innen kontraktshåndtering oss med å trene og evaluere KI-agenter på komplekse arbeidsoppgaver.

Laster inn …

Da vi lanserte GPT‑6 Astra, viste vi hvor langt modellene våre har kommet i å bruke datamaskiner til arbeidsoppgaver, fra å utarbeide dokumenter til å teste nettsteder. Det neste målet vårt er å gjøre agenter dyktigere og mer effektive i å bruke spesialisert programvare til å løse komplekse forretningsproblemer. Vi utforsker hvordan vi kan trene modeller til å forstå en virksomhets forretningsregler, gjennomføre arbeidsflyter med flere trinn og kontrollere at arbeidet oppfyller de opprinnelige kravene.

For å få fart på denne forskningen samarbeider vi direkte med et lite antall programvareselskaper som kjenner disse arbeidsflytene best. Sammen identifiserer vi utfordrende oppgaver med stor verdi og gjør dem til forskningsproblemer som brukes til å trene og evaluere modellene våre. Målet er å gjøre modellene mer kapable og nyttige i praktisk bruk i virksomheter.

Vår første partner er Ironclad, en ledende aktør innen KI-basert kontraktshåndtering. I tett samarbeid med Ironclads team har vi utviklet oppgaver som krever at agenter konfigurerer avtaler, godkjenninger og gjenbrukbare juridiske vilkår, og vist fremgang i disse komplekse arbeidsflytene. Ironclads ekspertise har vært avgjørende for å definere hva som kjennetegner et vellykket resultat, og for å bringe reelle kundebehov direkte inn i utviklingen av banebrytende modeller. Vi er takknemlige for samarbeidet og gleder oss til å dele det vi har oppnådd sammen.

GPT‑6 Astra er vår første banebrytende modell som er trent på Ironclad-oppgaver. I forskningsevalueringen vår var den gjennomsnittlige poengsummen 32 % høyere enn for GPT‑5.6 Sol, mens anslått tidsbruk per forsøk var 48 % lavere.1

Fra arbeidsflyter for kontraktshåndtering til treningsoppgaver

Tenk deg et team med ansvar for juridiske prosesser som skal sette opp en prosess for innkjøp av programvare. Økonomiavdelingen må kanskje godkjenne kjøp over et visst beløp, sikkerhetsavdelingen må kanskje vurdere enkelte forespørsler, og juridisk avdeling må kanskje gjennomgå vilkår som avviker fra standarden. Den som setter opp prosessen, må omsette denne korte listen til et skjema for forespørsler, dokumentmaler, godkjenningsregler og en registrering av den endelige avtalen.

En KI-agent som gjør det samme arbeidet, må ha disse kravene i bakhodet mens den navigerer i programvaren. Den må for eksempel konfigurere godkjenning fra økonomiavdelingen for beløp over grensen og kontrollere at forespørsler over og under grensen følger riktig saksgang. Det er ikke nok å få hvert enkelt trinn riktig: Den ferdige prosessen må fungere i alle situasjonene den er utformet for å håndtere.

Ansatte i Ironclad og personer som bruker Ironclad hos OpenAI, hjalp forskerne våre med å identifisere 11 oppgaver innen juridisk arbeid, kommersielt arbeid og innkjøp. Dette omfattet blant annet å sette opp taushetserklæringer, opprette godkjenningsprosesser for innkjøp og oppdatere en gjenbrukbar juridisk klausul slik at den gjenspeiler jurisdiksjonen den som sender forespørselen, velger. Vi anslår at en erfaren bruker i gjennomsnitt ville brukt omtrent 30 til 40 minutter per oppgave på dette arbeidet.

Vi evaluerte hver oppgave etter 8 til 50 kriterier, avhengig av hvor kompleks den var. Dette lot oss se hvilke deler modellen løste riktig, og hvor den kom til kort. Ironclad stilte også med driftede programvaremiljøer for produktet sitt, der modellene kunne øve på disse oppgavene. Forskerne våre utviklet syntetiske treningsoppgaver2 basert på representative arbeidsflyter og brukte forsterkende læring for å hjelpe modellene med å bli bedre gjennom øvelse og tilbakemeldinger. Denne kombinasjonen – oppgaver valgt ut sammen med folk som kjenner arbeidet, detaljerte kriterier og et sted der modellene kan øve – sikrer at vi forbedrer ytelsen på praktiske oppgaver som er viktigst for kundene våre.

Slik presterte Astra

Vi sammenlignet Astra og GPT‑5.6 Sol med resonnering satt til Max for Astra og Høy for Sol, innstillingene som ga hver modell høyest poengsum. På tvers av de 11 forskningsoppgavene var Astras gjennomsnittlige poengsum 55,0 %, mot 41,6 % for GPT‑5.6 Sol, mens anslått gjennomsnittlig tidsbruk per forsøk falt fra 37,0 minutter for Sol til 19,2 minutter for Astra.3 En intern modell som ble brukt i utviklingen av Astra, oppnådde et enda bedre resultat på 63,7 % på disse oppgavene. Målet vårt er at fremtidige modeller også skal dra nytte av disse ytterligere forbedringene.

Måltall

GPT‑5.6 Sol
Resonnering: Høy

GPT‑6 Astra
Resonnering: Max

Gjennomsnittlig poengsum etter vurderingskriteriene

41,6 %

55,0 %

Anslått gjennomsnittlig tidsbruk per forsøk

37,0 minutter

19,2 minutter

Astra oppfylte flere av oppgavekravene med lavere simulert tidsbruk per forsøk. De to klippene nedenfor viser hvordan modellene håndterte den samme forskningsoppgaven. Astra (først) oppfylte omtrent 94 % av oppgavekriteriene på anslagsvis 20 minutter. GPT‑5.6 Sol (deretter) oppfylte omtrent 85 % på anslagsvis 32 minutter.

GPT‑6 Astra oppfylte omtrent 94 % av oppgavekriteriene på anslagsvis 20 minutter.

GPT‑5.6 Sol oppfylte omtrent 85 % av oppgavekriteriene på anslagsvis 32 minutter.

Hva dette samarbeidet betyr for Ironclad

Ironclads rolle i dette arbeidet gjenspeiler en utfordring kundene kjenner godt: En kontraktsprosess må håndtere unntak og samtidig overholde reglene virksomheten er avhengig av. Hvis en agent mister oversikten over en av disse reglene halvveis i en oppgave, begrenser det hva et programvareselskap trygt kan be den om å gjøre. Dette understreker hvorfor menneskelig tilsyn fortsatt er viktig etter hvert som agenter blir bedre på komplekse kontraktsoppgaver, og hvorfor en komplett plattform for kontraktshåndtering fortsatt er avgjørende. Samarbeidet med forskerne våre gir Ironclad mulighet til å ta disse problemene inn i utviklingen av den underliggende modellen, slik at vi kan undersøke dem sammen.

Etter hvert som modellene blir mer kapable, får Ironclad mulighet til å bruke dem i flere av sine egne produkter. For juridiske og kommersielle team kan det bety at KI tar over mer av arbeidet med komplekse kontrakter, samtidig som kontrollmekanismene teamene er avhengige av, ivaretas.

“For at KI skal være virkelig nyttig i komplekst kontraktsarbeid, må den kunne gjøre mer enn å utføre enkelthandlinger. Agenter må forstå hele kontraktens livssyklus, inkludert hvordan virksomhetens arbeidsflyter henger sammen, samtidig som de ivaretar kontrollmekanismene teamene er avhengige av. Samarbeidet vårt med OpenAI bringer disse praktiske utfordringene inn i forskningsprosessen og bidrar til å drive teknologien fremover.”
– Sunita Verma, teknologidirektør, Ironclad

Samarbeid med oss om å videreutvikle KI for komplekse arbeidsoppgaver

Vi inviterer et lite antall programvareselskaper til å jobbe direkte med forsknings- og utviklingsteamene våre om viktige arbeidsoppgaver som dagens agenter fortsatt ikke klarer å fullføre pålitelig. Hvis teamet ditt har en slik oppgave, vil vi gjerne se et konkret eksempel: hva dere ber agenten om å gjøre, dokumentasjon på hvor den feiler, og hvordan dere ville vurdert om resultatet var vellykket. Partnere bør også kunne bidra med personer som kjenner arbeidet inngående, et sikkert testmiljø og data som trygt kan brukes til forskning. Dette gir oss et utgangspunkt for å undersøke feilen og måle om modellen blir bedre.

Hvis dette beskriver teamet ditt, kan dere søke om å utforske et forskningssamarbeid.

Forfatter

OpenAI

Fotnoter

  1. 1

    Disse resultatene gjelder de 11 forskningsoppgavene, ikke alle arbeidsflyter i Ironclad. Tidsangivelsene er simulerte estimater basert på antatt behandlings- og genereringshastighet for modellene, ikke målt tidsbesparelse for kunder.

  2. 2

    Vi laget simulerte oppgaver basert på offentlig tilgjengelige kontrakter i SECs EDGAR-database etter å ha brukt filtre utformet for å fjerne personopplysninger. Vi brukte verken kundedata fra OpenAI, OpenAIs interne kontrakter eller ikke-offentlige kundedata eller kontrakter fra Ironclad til trening eller evaluering.

  3. 3

    Se fotnoten om forskningsevalueringen ovenfor.