Zum Hauptinhalt springen
OpenAI

6. Oktober 2026

Publikation

Computernutzung mit Ironclad weiterentwickeln

Wie eine Forschungskooperation im Vertragsmanagement uns hilft, KI-Agenten für komplexe berufliche Aufgaben zu trainieren und zu evaluieren.

Laden …

Als wir GPT‑6 Astra vorstellten, zeigten wir, welche Fortschritte unsere Modelle bei der Computernutzung für berufliche Aufgaben gemacht haben, vom Erstellen von Dokumenten bis zum Testen von Websites. Unser nächstes Ziel ist es, Agenten im Umgang mit spezialisierter Software leistungsfähiger und effizienter zu machen, damit sie komplexe geschäftliche Probleme lösen können. Wir untersuchen, wie sich Modelle darauf trainieren lassen, die Geschäftsregeln eines Unternehmens zu verstehen, mehrstufige Arbeitsabläufe auszuführen und zu prüfen, ob ihre Arbeit die ursprünglichen Anforderungen erfüllt.

Um diese Forschung zu beschleunigen, arbeiten wir direkt mit einer kleinen Zahl von Softwareunternehmen zusammen, die diese Arbeitsabläufe am besten kennen. Gemeinsam identifizieren wir anspruchsvolle Aufgaben mit hohem Nutzen und machen sie zu Forschungsaufgaben für das Training und die Evaluierung unserer Modelle. So werden unsere Modelle leistungsfähiger und nützlicher für praktische Anwendungen in Unternehmen.

Unser erstes Partnerunternehmen ist Ironclad, ein führender Anbieter für KI-gestütztes Vertragsmanagement. In enger Zusammenarbeit mit dem Team von Ironclad haben wir Aufgaben entwickelt, bei denen Agenten Vereinbarungen, Genehmigungen und wiederverwendbare Vertragsbestimmungen konfigurieren müssen. Dabei konnten wir Fortschritte bei diesen komplexen Arbeitsabläufen nachweisen. Ironclads Fachwissen war entscheidend dafür, Erfolgskriterien zu definieren und die tatsächlichen Bedürfnisse von Kundenunternehmen direkt in die Entwicklung von Frontier-Modellen einzubringen. Wir sind dankbar für diese Partnerschaft und freuen uns, unsere gemeinsamen Ergebnisse vorzustellen.

GPT‑6 Astra ist unser erstes Frontier-Modell, das mit Ironclad-Aufgaben trainiert wurde. In unserer Forschungsevaluierung lag seine durchschnittliche Bewertung 32 % über der von GPT‑5.6 Sol, während die geschätzte Zeit pro Versuch 48 % geringer war.1

Vertragsabläufe in Trainingsaufgaben überführen

Nehmen wir ein Team für Rechtsprozesse, das einen Ablauf für den Softwarekauf einrichtet. Die Finanzabteilung muss möglicherweise Käufe ab einem bestimmten Betrag genehmigen, das Sicherheitsteam bestimmte Anfragen prüfen und die Rechtsabteilung von den Standards abweichende Vertragsbestimmungen prüfen. Die Person, die den Prozess einrichtet, muss aus dieser kurzen Liste ein Anfrageformular, Dokumentvorlagen, Genehmigungsregeln und eine Dokumentation der endgültigen Vereinbarung erstellen.

Ein KI-Agent, der dieselbe Arbeit erledigt, muss diese Anforderungen im Blick behalten, während er die Software bedient. Er muss beispielsweise für Ausgaben oberhalb des Schwellenwerts eine Genehmigung durch die Finanzabteilung einrichten und prüfen, ob Anfragen oberhalb und unterhalb dieses Werts die richtigen Wege durchlaufen. Einzelne Schritte richtig auszuführen, reicht nicht aus: Der fertige Prozess muss in allen Situationen funktionieren, für die er vorgesehen ist.

Beschäftigte von Ironclad und Personen, die Ironclad bei OpenAI nutzen, halfen unseren Forschenden, 11 Aufgaben aus den Bereichen Recht, kaufmännische Tätigkeiten und Beschaffung zu identifizieren. Dazu gehörten Aufgaben wie das Einrichten von Geheimhaltungsvereinbarungen, das Erstellen von Genehmigungsprozessen für die Beschaffung und das Anpassen einer wiederverwendbaren Vertragsklausel an den von der anfragenden Person gewählten Rechtsraum. Wir schätzen, dass eine erfahrene Person für diese Arbeit durchschnittlich etwa 30 bis 40 Minuten pro Aufgabe benötigen würde.

Wir haben jede Aufgabe je nach Komplexität anhand von 8 bis 50 Kriterien bewertet. So konnten wir erkennen, welche Teile ein Modell richtig erledigte und wo es die Anforderungen nicht erfüllte. Ironclad stellte außerdem gehostete Softwareumgebungen seines Produkts bereit, in denen die Modelle diese Aufgaben üben konnten. Unsere Forschenden entwickelten synthetische Trainingsaufgaben2 für repräsentative Arbeitsabläufe und nutzten Reinforcement Learning, damit sich die Modelle durch Übung und Feedback verbessern konnten. Diese Kombination aus gemeinsam mit Fachleuten ausgewählten Aufgaben, detaillierten Kriterien und einer Übungsumgebung für Modelle stellt sicher, dass wir Fortschritte bei den praktischen Aufgaben erzielen, die für unsere Kundenunternehmen am wichtigsten sind.

Wie Astra abschnitt

Wir verglichen Astra und GPT‑5.6 Sol mit der Reasoning-Einstellung „Max“ für Astra und „Hoch“ für Sol. Mit diesen Einstellungen erzielte das jeweilige Modell die höchsten Bewertungen. Über die 11 Forschungsaufgaben hinweg erreichte Astra eine durchschnittliche Bewertung von 55,0 %, verglichen mit 41,6 % für GPT‑5.6 Sol. Die geschätzte durchschnittliche Zeit pro Versuch sank dabei von 37,0 Minuten bei Sol auf 19,2 Minuten bei Astra.3 Ein internes Modell, das bei der Entwicklung von Astra eingesetzt wurde, erzielte bei diesen Aufgaben noch bessere 63,7 %. Wir wollen diese weiteren Verbesserungen in künftige Modelle einbringen.

Kennzahl

GPT‑5.6 Sol
Reasoning: Hoch

GPT‑6 Astra
Reasoning: Max

Durchschnittliche Bewertung nach Kriterienraster

41,6 %

55,0 %

Geschätzte durchschnittliche Zeit pro Versuch

37,0 Minuten

19,2 Minuten

Astra erfüllte mehr Aufgabenanforderungen bei geringerem simuliertem Zeitaufwand pro Versuch. Die beiden folgenden Clips zeigen, wie die Modelle dieselbe Forschungsaufgabe bearbeiteten. Astra (erster Clip) erfüllte etwa 94 % der Aufgabenkriterien in geschätzten 20 Minuten; GPT‑5.6 Sol (zweiter Clip) erfüllte etwa 85 % in geschätzten 32 Minuten.

GPT‑6 Astra erfüllte etwa 94 % der Aufgabenkriterien in geschätzten 20 Minuten.

GPT‑5.6 Sol erfüllte etwa 85 % der Aufgabenkriterien in geschätzten 32 Minuten.

Was diese Zusammenarbeit für Ironclad bedeutet

Ironclads Rolle bei dieser Arbeit spiegelt eine Herausforderung wider, die Unternehmen, die Ironclad nutzen, gut kennen: Ein Vertragsprozess muss Ausnahmen handhaben und zugleich die Regeln einhalten, auf die ein Unternehmen angewiesen ist. Verliert ein Agent während einer Aufgabe eine dieser Regeln aus dem Blick, schränkt das die Aufgaben ein, die ihm ein Softwareunternehmen verlässlich übertragen kann. Das unterstreicht, warum menschliche Aufsicht weiterhin wichtig ist, auch wenn Agenten komplexe Vertragsaufgaben immer besser bewältigen, und warum eine umfassende Vertragsplattform unverzichtbar bleibt. Durch die Zusammenarbeit mit unseren Forschenden kann Ironclad diese Probleme in die Entwicklung des zugrunde liegenden Modells einbringen, wo wir sie gemeinsam untersuchen können.

Mit zunehmender Leistungsfähigkeit der Modelle bietet sich Ironclad die Möglichkeit, sie in mehr eigenen Produkten einzusetzen. Für Rechtsabteilungen und andere Unternehmensteams könnte das bedeuten, dass KI mehr Arbeit bei komplexen Vertragsprozessen übernimmt und dabei die Kontrollmechanismen wahrt, auf die diese Teams angewiesen sind.

“Damit KI in komplexen Bereichen des Vertragsmanagements wirklich nützlich ist, muss sie mehr leisten als einzelne Aktionen auszuführen. Agenten müssen den gesamten Vertragslebenszyklus verstehen, einschließlich der Zusammenhänge zwischen Geschäftsabläufen. Dabei müssen sie die Kontrollmechanismen wahren, auf die Teams angewiesen sind. Unsere Zusammenarbeit mit OpenAI bringt diese Herausforderungen aus der Praxis in den Forschungsprozess ein und hilft, die Technologie weiterzuentwickeln.”
Sunita Verma, Chief Technology Officer, Ironclad

Entwickle mit uns KI für komplexe berufliche Aufgaben weiter

Wir laden eine kleine Zahl von Softwareunternehmen ein, direkt mit unseren Forschungs- und Entwicklungsteams an wichtigen beruflichen Aufgaben zu arbeiten, die heutige Agenten noch nicht zuverlässig erledigen können. Wenn dein Team eine solche Aufgabe hat, möchten wir gern ein konkretes Beispiel sehen: Was soll der Agent tun, wo scheitert er nachweislich und wie würdet ihr ein erfolgreiches Ergebnis beurteilen? Partnerunternehmen sollten außerdem Fachleute mit fundierter Kenntnis der Arbeit, eine sichere Testumgebung und Daten bereitstellen können, die sich sicher für Forschungszwecke nutzen lassen. Das gibt uns einen Ausgangspunkt, um das Scheitern zu untersuchen und zu messen, ob sich das Modell verbessert.

Autor:in

OpenAI

Fußnoten

  1. 1

    Diese Ergebnisse beziehen sich auf die 11 Forschungsaufgaben, nicht auf alle Arbeitsabläufe in Ironclad. Die Zeitangaben sind simulierte Schätzungen auf Grundlage angenommener Verarbeitungs- und Generierungsgeschwindigkeiten der Modelle, keine gemessenen Zeitersparnisse bei Kundenunternehmen.

  2. 2

    Wir haben simulierte Aufgaben aus Verträgen erstellt, die in der EDGAR-Datenbank der SEC öffentlich zugänglich sind. Zuvor haben wir Filter angewendet, die personenbezogene Informationen entfernen sollen. Für Training und Evaluierung haben wir weder Kundendaten von OpenAI noch interne Verträge von OpenAI oder nicht öffentliche Daten oder Verträge von Ironclad-Kundenunternehmen verwendet.

  3. 3

    Siehe die obige Fußnote zur Evaluierung im Rahmen der Forschung.