Gå til hovedindhold
OpenAI

6. oktober 2026

Publikation

Vi videreudvikler AI's brug af computere med Ironclad

Sådan hjælper et forskningssamarbejde om kontraktarbejde os med at træne og evaluere AI-agenter i komplekse faglige opgaver.

Indlæser ...

Da vi introducerede GPT‑6 Astra, viste vi, hvor langt vores modeller er nået med at bruge computere til arbejdsopgaver, lige fra at udarbejde dokumenter til at teste websites. Vores næste mål er at gøre agenter bedre og mere effektive til at bruge specialiseret software til at løse komplekse forretningsproblemer. Vi undersøger, hvordan vi kan træne modeller til at forstå en virksomheds forretningsregler, udføre arbejdsgange med flere trin og kontrollere, at deres arbejde opfylder de oprindelige krav.

For at sætte fart på denne forskning samarbejder vi direkte med et mindre antal softwarevirksomheder, der kender disse arbejdsgange bedst. Sammen identificerer vi udfordrende opgaver af stor værdi og omsætter dem til forskningsproblemer, som vi bruger til at træne og evaluere vores modeller. Målet er at gøre modellerne mere kompetente og nyttige i virksomhedernes daglige arbejde.

Vores første partner er Ironclad, en førende virksomhed inden for AI-baseret kontraktarbejde. I tæt samarbejde med Ironclads team har vi udviklet opgaver, der kræver, at agenter konfigurerer aftaler, godkendelser og genanvendelige juridiske vilkår, og påvist fremskridt i disse komplekse arbejdsgange. Ironclads ekspertise har været afgørende for at definere, hvad et vellykket resultat er, og for at inddrage reelle kundebehov direkte i udviklingen af banebrydende modeller. Vi er taknemmelige for samarbejdet og glæder os til at dele det, vi har opnået sammen.

GPT‑6 Astra er vores første banebrydende model, der er trænet på Ironclad-opgaver. I vores forskningsevaluering var dens gennemsnitlige score 32 % højere end GPT‑5.6 Sols, mens den anslåede tid pr. forsøg var 48 % lavere.1

Fra kontraktarbejdsgange til træningsopgaver

Forestil dig et team med ansvar for juridiske processer, som skal etablere en proces for indkøb af software. Økonomiafdelingen skal måske godkende indkøb over et bestemt beløb, sikkerhedsafdelingen skal måske gennemgå visse anmodninger, og den juridiske afdeling skal måske gennemgå vilkår, der afviger fra standarden. Den person, der etablerer processen, skal omsætte denne korte liste til en anmodningsformular, dokumentskabeloner, godkendelsesregler og en registrering af den endelige aftale.

En AI-agent, der udfører det samme arbejde, skal holde styr på disse krav, mens den navigerer rundt i softwaren. Den skal for eksempel konfigurere godkendelse fra økonomiafdelingen ved indkøb over beløbsgrænsen og kontrollere, at anmodninger over og under grænsen følger de rigtige forløb. Det er ikke nok at udføre de enkelte trin korrekt: Den færdige proces skal fungere i alle de situationer, den er designet til at håndtere.

Medarbejdere hos Ironclad og brugere af Ironclad hos OpenAI hjalp vores forskere med at identificere 11 opgaver inden for jura, kommercielt arbejde og indkøb. Opgaverne omfattede blandt andet at oprette fortrolighedsaftaler, etablere godkendelsesprocesser for indkøb og opdatere en genanvendelig juridisk klausul, så den afspejler den jurisdiktion, som den anmodende part vælger. Vi anslår, at en erfaren bruger i gennemsnit ville bruge omkring 30 til 40 minutter pr. opgave på dette arbejde.

Vi evaluerede hver opgave ud fra 8 til 50 kriterier, afhængigt af dens kompleksitet. Det gjorde det muligt at se, hvilke dele modellen løste korrekt, og hvor den kom til kort. Ironclad stillede også hostede softwaremiljøer med deres produkt til rådighed, hvor modellerne kunne øve sig på opgaverne. Vores forskere udviklede syntetiske træningsopgaver2 med udgangspunkt i repræsentative arbejdsgange og brugte forstærkende læring til at hjælpe modellerne med at blive bedre gennem øvelse og feedback. Denne kombination – opgaver udvalgt sammen med folk, der kender arbejdet, detaljerede kriterier og et sted, hvor modellerne kan øve sig – sikrer, at vi forbedrer modellernes evner til at løse de praktiske opgaver, der betyder mest for vores kunder.

Sådan klarede Astra sig

Vi sammenlignede Astra og GPT‑5.6 Sol med ræsonnering indstillet til Max for Astra og Høj for Sol – de indstillinger, hvor hver model opnåede sin højeste score. På tværs af de 11 forskningsopgaver var Astras gennemsnitlige score 55,0 % mod 41,6 % for GPT‑5.6 Sol, mens den anslåede gennemsnitlige tid pr. forsøg faldt fra 37,0 minutter for Sol til 19,2 minutter for Astra.3 En intern model, der blev brugt under udviklingen af Astra, opnåede en endnu bedre score på 63,7 % på disse opgaver, og vi arbejder på at få disse yderligere forbedringer med i fremtidige modeller.

Måleparameter

GPT‑5.6 Sol
Ræsonnering: Høj

GPT‑6 Astra
Ræsonnering: Max

Gennemsnitlig score ud fra vurderingskriterierne

41,6 %

55,0 %

Anslået gennemsnitlig tid pr. forsøg

37,0 minutter

19,2 minutter

Astra opfyldte flere af opgavekravene med et lavere simuleret tidsforbrug pr. forsøg. De to klip nedenfor viser, hvordan modellerne håndterede den samme forskningsopgave. Astra (første klip) opfyldte ca. 94 % af opgavens kriterier på anslået 20 minutter; GPT‑5.6 Sol (andet klip) opfyldte ca. 85 % på anslået 32 minutter.

GPT‑6 Astra opfyldte ca. 94 % af opgavens kriterier på anslået 20 minutter.

GPT‑5.6 Sol opfyldte ca. 85 % af opgavens kriterier på anslået 32 minutter.

Hvad samarbejdet betyder for Ironclad

Ironclads rolle i dette arbejde afspejler en udfordring, som virksomhedens kunder kender godt: En kontraktproces skal kunne håndtere undtagelser og samtidig overholde de regler, virksomheden er afhængig af. Hvis en agent mister overblikket over en af disse regler undervejs i en opgave, begrænser det, hvad en softwarevirksomhed trygt kan bede den om at udføre. Det understreger, hvorfor menneskeligt tilsyn stadig er vigtigt, efterhånden som agenter bliver bedre til komplekse kontraktopgaver, og hvorfor en komplet kontraktplatform fortsat er afgørende. Samarbejdet med vores forskere giver Ironclad mulighed for at inddrage disse problemer i udviklingen af den underliggende model, så vi kan undersøge dem sammen.

Efterhånden som modellerne bliver mere kompetente, får Ironclad mulighed for at bruge dem i flere af sine egne produkter. For juridiske og forretningsorienterede teams kan det betyde, at AI overtager mere af det komplekse kontraktarbejde, samtidig med at de kontrolmekanismer, teamene er afhængige af, bevares.

“Hvis AI for alvor skal være nyttig i komplekst kontraktarbejde, skal den kunne mere end at udføre enkelte handlinger. Agenter skal forstå hele kontraktens livscyklus, herunder hvordan forretningsprocesser hænger sammen, og samtidig bevare de kontrolmekanismer, teamene er afhængige af. Vores samarbejde med OpenAI bringer disse udfordringer fra praksis ind i forskningsprocessen og er med til at udvikle teknologien.”
—Sunita Verma, teknologidirektør, Ironclad

Samarbejd med os om at videreudvikle AI til komplekse faglige opgaver

Vi inviterer et mindre antal softwarevirksomheder til at samarbejde direkte med vores forsknings- og udviklingsteams om vigtige faglige opgaver, som nutidens agenter endnu ikke kan løse pålideligt. Hvis jeres team har sådan en opgave, vil vi gerne se et konkret eksempel: Hvad beder I agenten om at gøre, hvor kan I dokumentere, at den fejler, og hvordan ville I vurdere, om resultatet er vellykket? Partnere skal også kunne bidrage med personer, der har indgående kendskab til arbejdet, et sikkert testmiljø og data, der trygt kan bruges til forskning. Det giver os et udgangspunkt for at undersøge fejlen og måle, om modellen bliver bedre.

Hvis det passer på jeres team, kan I ansøge om at udforske et forskningssamarbejde.

Forfatter

OpenAI

Fodnoter

  1. 1

    Disse resultater dækker de 11 forskningsopgaver, ikke alle arbejdsgange i Ironclad. Tidsangivelserne er simulerede estimater baseret på antagelser om modellernes behandlings- og genereringshastighed, ikke målte tidsbesparelser hos kunder.

  2. 2

    Vi udarbejdede simulerede opgaver ud fra offentligt tilgængelige kontrakter i SEC's EDGAR-database efter at have anvendt filtre, der var designet til at fjerne personoplysninger. Vi brugte hverken OpenAI-kundedata, OpenAI's interne kontrakter eller ikkeoffentlige kundedata eller kontrakter fra Ironclad til træning eller evaluering.

  3. 3

    Se fodnoten om forskningsevalueringen ovenfor.