Gå direkt till huvudinnehåll
OpenAI

6 oktober 2026

Publikation

Vi utvecklar datoranvändning tillsammans med Ironclad

Så hjälper ett forskningssamarbete inom avtalshantering oss att träna och utvärdera AI-agenter för komplexa arbetsuppgifter.

Laddar …

När vi introducerade GPT‑6 Astra visade vi hur långt våra modeller har kommit i att använda datorer i yrkeslivet, från att ta fram dokument till att testa webbplatser. Vårt nästa mål är att göra agenter mer kapabla och effektiva på att använda specialiserad programvara för att lösa komplexa problem i verksamheter. Vi undersöker hur modeller kan tränas att förstå ett företags verksamhetsregler, genomföra arbetsflöden i flera steg och kontrollera att arbetet uppfyller de ursprungliga kraven.

För att påskynda forskningen samarbetar vi direkt med ett mindre antal programvaruföretag som känner dessa arbetsflöden bäst. Tillsammans identifierar vi utmanande uppgifter som skapar stort värde och omvandlar dem till forskningsproblem för träning och utvärdering av våra modeller. Det ska i slutändan göra modellerna mer kapabla och användbara i praktiska affärstillämpningar.

Vår första partner är Ironclad, en ledande aktör inom AI-baserad avtalshantering. I nära samarbete med Ironclads team har vi utvecklat uppgifter där agenter behöver konfigurera avtal, godkännanden och återanvändbara juridiska villkor, och visat framsteg i dessa komplexa arbetsflöden. Ironclads expertis har varit avgörande för att definiera vad ett lyckat resultat innebär och föra in verkliga kundbehov direkt i utvecklingen av banbrytande modeller. Vi är tacksamma för samarbetet och ser fram emot att dela med oss av vad vi har åstadkommit tillsammans.

GPT‑6 Astra är vår första banbrytande modell som tränats på uppgifter i Ironclad. I vår forskningsutvärdering var dess genomsnittliga poäng 32 % högre än för GPT‑5.6 Sol, medan den uppskattade tiden per försök var 48 % lägre.1

Från avtalsflöden till träningsuppgifter

Tänk er ett team som ansvarar för juridiska processer och ska sätta upp en process för inköp av programvara. Ekonomiavdelningen kan behöva godkänna inköp över ett visst belopp, säkerhetsavdelningen kan behöva granska vissa förfrågningar och juristavdelningen kan behöva granska villkor som avviker från standarden. Den som sätter upp processen måste omsätta den korta listan i ett formulär för inkommande ärenden, dokumentmallar, regler för godkännande och en registrering av det slutliga avtalet.

En AI-agent som gör samma arbete måste hålla reda på dessa krav när den navigerar i programvaran. Den måste till exempel konfigurera godkännande från ekonomiavdelningen för inköp över beloppsgränsen och kontrollera att förfrågningar över och under gränsen följer rätt flöde. Det räcker inte att göra rätt i enskilda steg: den färdiga processen måste fungera i alla de situationer som den är utformad för att hantera.

Medarbetare på Ironclad och personer som använder Ironclad på OpenAI hjälpte våra forskare att identifiera 11 uppgifter inom juridik, affärer och inköp. Det handlade bland annat om att sätta upp sekretessavtal, skapa godkännandeprocesser för inköp och uppdatera en återanvändbar juridisk klausul så att den motsvarar den jurisdiktion som den som skickar in förfrågan väljer. Vi uppskattar att arbetet skulle ta en erfaren användare omkring 30–40 minuter per uppgift i genomsnitt.

Vi utvärderade varje uppgift mot 8–50 kriterier, beroende på hur komplex den var. Det gjorde att vi kunde se vilka delar en modell klarade och var den inte räckte till. Ironclad tillhandahöll också driftade miljöer med sin programvara där modellerna kunde öva på uppgifterna. Våra forskare utvecklade syntetiska träningsuppgifter2 utifrån representativa arbetsflöden och använde förstärkningsinlärning för att hjälpa modellerna att bli bättre genom övning och återkoppling. Kombinationen av uppgifter utvalda tillsammans med personer som kan arbetet, detaljerade kriterier och en miljö där modellerna kan öva säkerställer att vi förbättrar resultaten för de verkliga uppgifter som är viktigast för våra kunder.

Så presterade Astra

Vi jämförde Astra och GPT‑5.6 Sol med resonemangsnivån Max för Astra och Hög för Sol – de inställningar där respektive modell fick högst poäng. För de 11 forskningsuppgifterna var Astras genomsnittliga poäng 55,0 %, jämfört med 41,6 % för GPT‑5.6 Sol. Samtidigt sjönk den uppskattade genomsnittstiden per försök från 37,0 minuter för Sol till 19,2 minuter för Astra.3 En intern modell som användes under utvecklingen av Astra nådde ännu högre, 63,7 %, på dessa uppgifter, och vi siktar på att föra över dessa ytterligare förbättringar till framtida modeller.

Mått

GPT‑5.6 Sol
Resonemang: Hög

GPT‑6 Astra
Resonemang: Max

Genomsnittlig poäng enligt bedömningsmatrisen

41,6 %

55,0 %

Uppskattad genomsnittstid per försök

37,0 minuter

19,2 minuter

Astra uppfyllde fler av uppgiftens krav med kortare simulerad tid per försök. De två klippen nedan visar hur modellerna hanterade samma forskningsuppgift. Astra (första klippet) uppfyllde cirka 94 % av uppgiftens kriterier på uppskattningsvis 20 minuter; GPT‑5.6 Sol (andra klippet) uppfyllde cirka 85 % på uppskattningsvis 32 minuter.

GPT‑6 Astra uppfyllde cirka 94 % av uppgiftens kriterier på uppskattningsvis 20 minuter.

GPT‑5.6 Sol uppfyllde cirka 85 % av uppgiftens kriterier på uppskattningsvis 32 minuter.

Vad samarbetet innebär för Ironclad

Ironclads roll i arbetet speglar en utmaning som företagets kunder känner väl: en avtalsprocess måste kunna hantera undantag utan att åsidosätta de regler som verksamheten är beroende av. Om en agent tappar bort en av dessa regler halvvägs genom en uppgift begränsar det vad ett programvaruföretag tryggt kan låta den göra. Det understryker varför mänsklig tillsyn fortfarande är viktig när agenter blir bättre på komplexa avtalsuppgifter, och varför en heltäckande plattform för avtalshantering fortfarande behövs. Samarbetet med våra forskare ger Ironclad möjlighet att föra in dessa problem i utvecklingen av den underliggande modellen, där vi kan studera dem tillsammans.

När modellerna blir mer kapabla får Ironclad möjlighet att använda dem i fler av sina egna produkter. För jurist- och affärsteam kan det innebära att AI tar över mer av arbetet med komplex avtalshantering, samtidigt som de kontrollmekanismer som teamen förlitar sig på finns kvar.

“För att AI ska vara verkligt användbar inom komplex avtalshantering måste den kunna göra mer än att utföra enskilda åtgärder. Agenter behöver förstå avtalets hela livscykel, däribland hur verksamhetens arbetsflöden hänger ihop, samtidigt som de bevarar de kontrollmekanismer som teamen förlitar sig på. Vårt samarbete med OpenAI för in dessa praktiska utmaningar i forskningsprocessen och bidrar till att driva tekniken framåt.”
– Sunita Verma, teknikchef, Ironclad

Samarbeta med oss för att utveckla AI för komplexa arbetsuppgifter

Vi bjuder in ett mindre antal programvaruföretag att arbeta direkt med våra forsknings- och ingenjörsteam kring viktiga arbetsuppgifter som dagens agenter ännu inte kan utföra på ett tillförlitligt sätt. Om ert team har en sådan uppgift vill vi gärna se ett konkret exempel: vad ni ber agenten att göra, underlag som visar var den misslyckas och hur ni skulle bedöma om resultatet är lyckat. Partner bör också kunna bidra med personer som kan arbetet på djupet, en säker testmiljö och data som kan användas säkert i forskning. Det ger oss en utgångspunkt för att undersöka vad som går fel och mäta om modellen blir bättre.

Om det stämmer in på ert team, ansök om att utforska ett forskningssamarbete.

Författare

OpenAI

Fotnoter

  1. 1

    Dessa resultat gäller de 11 forskningsuppgifterna, inte alla arbetsflöden i Ironclad. Tiderna är simulerade uppskattningar baserade på antaganden om modellernas bearbetnings- och genereringshastigheter, inte uppmätta tidsbesparingar för kunder.

  2. 2

    Vi skapade simulerade uppgifter utifrån avtal som är offentligt tillgängliga i SEC:s EDGAR-databas, efter att ha tillämpat filter utformade för att ta bort personuppgifter. Vi använde inte OpenAI:s kunddata eller interna avtal, och inte heller icke-offentliga kunddata eller avtal från Ironclad, för träning eller utvärdering.

  3. 3

    Se fotnoten om forskningsutvärderingen ovan.