Computergebruik verbeteren met Ironclad
Hoe een onderzoekssamenwerking rond contractbeheer ons helpt AI-agents te trainen en evalueren op complex professioneel werk.
Bij de introductie van GPT‑6 Astra lieten we zien hoeveel vooruitgang onze modellen hebben geboekt in het gebruik van computers voor professioneel werk, van documenten opstellen tot websites testen. Ons volgende doel is agents vaardiger en efficiënter te maken in het gebruik van gespecialiseerde software om complexe bedrijfsvraagstukken op te lossen. We onderzoeken hoe we modellen kunnen trainen om bedrijfsregels te begrijpen, workflows met meerdere stappen uit te voeren en te controleren of hun werk aan de oorspronkelijke eisen voldoet.
Om dit onderzoek te versnellen, werken we rechtstreeks samen met een klein aantal softwarebedrijven die deze workflows het beste kennen. Samen identificeren we uitdagende taken die veel waarde opleveren en zetten we die om in onderzoeksvraagstukken voor het trainen en evalueren van onze modellen. Zo maken we onze modellen uiteindelijk vaardiger en nuttiger voor zakelijke toepassingen in de praktijk.
Onze eerste partner is Ironclad, een toonaangevend bedrijf in contractbeheer met AI. In nauwe samenwerking met het team van Ironclad hebben we taken ontwikkeld waarbij agents overeenkomsten, goedkeuringen en herbruikbare juridische voorwaarden moeten configureren. Daarbij hebben we vooruitgang op deze complexe workflows aangetoond. De expertise van Ironclad was essentieel om te bepalen wat een geslaagd resultaat is en om concrete klantbehoeften rechtstreeks mee te nemen in de ontwikkeling van grensverleggende modellen. We zijn dankbaar voor deze samenwerking en delen graag wat we samen hebben bereikt.
GPT‑6 Astra is ons eerste grensverleggende model dat is getraind op Ironclad-taken. In onze onderzoeksevaluatie was de gemiddelde score 32% hoger dan die van GPT‑5.6 Sol, terwijl de geschatte tijd per poging 48% korter was.1
Neem een team voor juridische bedrijfsvoering dat een proces voor software-inkoop opzet. De financiële afdeling moet mogelijk aankopen boven een bepaald bedrag goedkeuren, het beveiligingsteam moet bepaalde aanvragen beoordelen en de juridische afdeling moet afwijkende voorwaarden toetsen. Degene die het proces inricht, moet dat korte lijstje vertalen naar een intakeformulier, documentsjablonen, goedkeuringsregels en een registratie van de definitieve overeenkomst.
Een AI-agent die hetzelfde werk doet, moet die eisen in het oog houden terwijl hij door de software navigeert. De agent moet bijvoorbeeld goedkeuring door de financiële afdeling instellen voor uitgaven boven de drempelwaarde, en controleren of aanvragen boven en onder die grens de juiste route volgen. De afzonderlijke stappen correct uitvoeren is niet genoeg: het uiteindelijke proces moet werken in alle situaties waarvoor het is ontworpen.
Medewerkers van Ironclad en mensen die Ironclad bij OpenAI gebruiken, hielpen onze onderzoekers 11 taken te identificeren op juridisch, commercieel en inkoopgebied. Daaronder vielen taken zoals het opzetten van geheimhoudingsovereenkomsten, het inrichten van goedkeuringsprocessen voor inkoop en het bijwerken van een herbruikbare juridische clausule zodat die aansluit bij het rechtsgebied dat een aanvrager selecteert. We schatten dat een ervaren gebruiker voor dit werk gemiddeld ongeveer 30 tot 40 minuten per taak nodig zou hebben.
We beoordeelden elke taak aan de hand van 8 tot 50 criteria, afhankelijk van de complexiteit. Zo konden we zien welke onderdelen een model goed uitvoerde en waar het tekortschiet. Ironclad stelde ook gehoste softwareomgevingen van zijn product beschikbaar waarin de modellen deze taken konden oefenen. Onze onderzoekers ontwikkelden synthetische trainingstaken2 rond representatieve workflows en gebruikten reinforcement learning om de modellen door oefening en feedback te verbeteren. Deze combinatie van taken die zijn geselecteerd met mensen die het werk kennen, gedetailleerde criteria en een oefenomgeving voor modellen zorgt ervoor dat we vooruitgang boeken op de praktijktaken die voor onze klanten het belangrijkst zijn.
We vergeleken Astra en GPT‑5.6 Sol met redenering ingesteld op Max voor Astra en op Hoog voor Sol: de instellingen waarmee elk model het hoogst scoorde. Over de 11 onderzoekstaken behaalde Astra een gemiddelde score van 55,0%, tegenover 41,6% voor GPT‑5.6 Sol. De geschatte gemiddelde tijd per poging daalde van 37,0 minuten voor Sol naar 19,2 minuten voor Astra.3 Een intern model dat werd gebruikt bij de ontwikkeling van Astra behaalde een nog betere score van 63,7% op deze taken. We willen deze verdere verbeteringen ook in toekomstige modellen doorvoeren.
Maatstaf | GPT‑5.6 Sol | GPT‑6 Astra |
Gemiddelde score op beoordelingscriteria | 41,6% | 55,0% |
Geschatte gemiddelde tijd per poging | 37,0 minuten | 19,2 minuten |
Astra voldeed aan meer taakeisen met een kortere gesimuleerde tijd per poging. De twee video's hieronder laten zien hoe de modellen dezelfde onderzoekstaak aanpakten. Astra (de eerste video) voldeed aan ongeveer 94% van de taakcriteria in naar schatting 20 minuten; GPT‑5.6 Sol (de tweede video) aan ongeveer 85% in naar schatting 32 minuten.
GPT‑6 Astra voldeed aan ongeveer 94% van de taakcriteria in naar schatting 20 minuten.
GPT‑5.6 Sol voldeed aan ongeveer 85% van de taakcriteria in naar schatting 32 minuten.
De rol van Ironclad in dit werk weerspiegelt een uitdaging die zijn klanten goed kennen: een contractproces moet uitzonderingen aankunnen zonder afbreuk te doen aan de regels waarop een bedrijf vertrouwt. Als een agent halverwege een taak een van die regels uit het oog verliest, beperkt dat welke taken een softwarebedrijf met vertrouwen aan de agent kan overlaten. Dit onderstreept waarom menselijk toezicht belangrijk blijft naarmate agents beter worden in complexe contracttaken, en waarom een volwaardig platform voor contractbeheer essentieel blijft. Door samen te werken met onze onderzoekers kan Ironclad deze vraagstukken inbrengen bij de ontwikkeling van het onderliggende model, zodat we ze samen kunnen onderzoeken.
Naarmate modellen meer kunnen, krijgt Ironclad de kans om ze in meer eigen producten in te zetten. Voor juridische en zakelijke teams kan dit betekenen dat AI meer van het werk rond complexe contracten overneemt, met behoud van de controlemechanismen waarop die teams vertrouwen.
We nodigen een klein aantal softwarebedrijven uit om rechtstreeks met onze onderzoeks- en engineeringteams te werken aan belangrijke professionele taken die de huidige agents nog niet betrouwbaar kunnen uitvoeren. Heeft je team zo'n taak? Dan zien we graag een concreet voorbeeld: wat je de agent vraagt te doen, bewijs van waar het misgaat en hoe je zou beoordelen of het resultaat geslaagd is. Partners moeten ook mensen met grondige kennis van het werk, een veilige testomgeving en gegevens die veilig voor onderzoek kunnen worden gebruikt, kunnen inzetten. Dit geeft ons een uitgangspunt om te onderzoeken wat er misgaat en te meten of het model verbetert.
Herken je je team hierin? Meld je aan om een onderzoekssamenwerking te verkennen.
Auteurs
Voetnoten
- 1
- 2
We hebben gesimuleerde taken gemaakt op basis van openbaar beschikbare contracten uit de EDGAR-database van de SEC, nadat we filters hadden toegepast om persoonsgegevens te verwijderen. Voor training of evaluatie hebben we geen klantgegevens van OpenAI, interne contracten van OpenAI of niet-openbare klantgegevens of contracten van Ironclad gebruikt.
- 3


