Přeskoč na hlavní obsah
OpenAI

6. října 2026

Publikace

S Ironclad posouváme schopnosti AI používat počítače

Jak nám výzkumná spolupráce v oblasti smluvních procesů pomáhá trénovat a hodnotit AI agenty při složité odborné práci.

Načítání…

Když jsme představili GPT‑6 Astra, ukázali jsme, jak daleko naše modely pokročily v používání počítačů pro odbornou práci, od přípravy dokumentů po testování webů. Naším dalším cílem je zlepšit schopnosti a efektivitu agentů při používání specializovaného softwaru k řešení složitých firemních problémů. Zkoumáme, jak modely trénovat, aby rozuměly firemním pravidlům, prováděly vícekrokové pracovní postupy a ověřovaly, že jejich práce splňuje původní požadavky.

Abychom tento výzkum urychlili, spolupracujeme přímo s několika softwarovými společnostmi, které těmto pracovním postupům rozumějí nejlépe. Společně vybíráme náročné úkoly s velkým přínosem a převádíme je na výzkumné problémy pro trénování a hodnocení našich modelů. Díky tomu budou naše modely schopnější a užitečnější při reálném využití ve firmách.

Naším prvním partnerem je Ironclad, přední společnost v oblasti správy smluv s využitím AI. V úzké spolupráci s týmem společnosti Ironclad jsme vytvořili úkoly, v nichž agenti musí nastavovat smlouvy, schvalovací postupy a opakovaně použitelné smluvní podmínky, a ukázali jsme pokrok ve zvládání těchto složitých pracovních postupů. Odborné znalosti společnosti Ironclad byly zásadní pro vymezení toho, co znamená úspěšný výsledek, i pro přímé promítnutí skutečných potřeb zákazníků do vývoje průkopnických modelů. Za toto partnerství jsme vděční a těší nás, že se můžeme podělit o to, čeho jsme společně dosáhli.

GPT‑6 Astra je náš první průkopnický model trénovaný na úkolech z platformy Ironclad. V našem výzkumném hodnocení dosáhl průměrného skóre o 32 % vyššího než GPT‑5.6 Sol, zatímco odhadovaný čas na jeden pokus byl o 48 % kratší.1

Jak převádíme smluvní pracovní postupy na trénovací úkoly

Představte si tým zajišťující provoz právního oddělení, který nastavuje proces nákupu softwaru. Nákupy nad určitou částku může být nutné nechat schválit finančním oddělením, některé žádosti musí posoudit bezpečnostní tým a nestandardní podmínky může být potřeba předložit právnímu oddělení. Člověk, který proces nastavuje, musí tento stručný seznam převést do formuláře pro zadávání žádostí, šablon dokumentů, schvalovacích pravidel a záznamu konečné smlouvy.

AI agent, který vykonává tutéž práci, musí mít tyto požadavky na paměti po celou dobu práce v softwaru. Musí například nastavit schvalování finančním oddělením při překročení výdajového limitu a ověřit, že žádosti nad i pod tímto limitem procházejí správnými postupy. Nestačí správně provést jednotlivé kroky: hotový proces musí fungovat ve všech situacích, pro které byl navržen.

Zaměstnanci společnosti Ironclad a lidé, kteří její platformu používají v OpenAI, pomohli našim výzkumníkům vybrat 11 úkolů z oblasti práva, obchodu a nákupu. Patřilo mezi ně například nastavení dohod o mlčenlivosti, vytváření schvalovacích procesů pro nákup nebo úprava opakovaně použitelné smluvní doložky tak, aby odpovídala jurisdikci zvolené žadatelem. Odhadujeme, že zkušenému uživateli by tato práce zabrala v průměru přibližně 30 až 40 minut na úkol.

Každý úkol jsme podle jeho složitosti hodnotili na základě 8 až 50 kritérií. Díky tomu jsme viděli, které části model zvládl správně a kde měl nedostatky. Ironclad také poskytl hostovaná prostředí svého produktu, v nichž si modely mohly tyto úkoly procvičovat. Naši výzkumníci vytvořili syntetické trénovací úkoly2 založené na typických pracovních postupech a pomocí učení posilováním modelům umožnili zlepšovat se procvičováním a zpětnou vazbou. Kombinace úkolů vybraných s lidmi, kteří danou práci znají, podrobných kritérií a prostředí pro procvičování zajišťuje, že modely zlepšujeme v reálných úkolech, které jsou pro naše zákazníky nejdůležitější.

Jak si vedl model Astra

Porovnali jsme modely Astra a GPT‑5.6 Sol, přičemž u modelu Astra jsme použili úroveň uvažování Max a u modelu Sol úroveň Vysoká. S těmito nastaveními dosáhl každý z modelů nejvyššího skóre. V 11 výzkumných úkolech dosáhl model Astra průměrného skóre 55,0 % oproti 41,6 % u GPT‑5.6 Sol, zatímco odhadovaný průměrný čas na jeden pokus klesl z 37,0 minut u modelu Sol na 19,2 minuty u modelu Astra.3 Interní model používaný při vývoji modelu Astra dosáhl v těchto úkolech ještě lepšího výsledku 63,7 %. Naším cílem je přenést tato další zlepšení do budoucích modelů.

Metrika

GPT‑5.6 Sol
Úroveň uvažování: Vysoká

GPT‑6 Astra
Úroveň uvažování: Max

Průměrné skóre podle hodnoticích kritérií

41,6 %

55,0 %

Odhadovaný průměrný čas na jeden pokus

37,0 minut

19,2 minuty

Model Astra splnil více požadavků úkolů za kratší simulovaný čas na jeden pokus. Dvě videa níže ukazují, jak si modely poradily se stejným výzkumným úkolem. Model Astra (v prvním videu) splnil přibližně 94 % kritérií úkolu za odhadovaných 20 minut; GPT‑5.6 Sol (ve druhém videu) splnil přibližně 85 % za odhadovaných 32 minut.

GPT‑6 Astra splnil přibližně 94 % kritérií úkolu za odhadovaných 20 minut.

GPT‑5.6 Sol splnil přibližně 85 % kritérií úkolu za odhadovaných 32 minut.

Co tato spolupráce znamená pro Ironclad

Role společnosti Ironclad v tomto výzkumu odráží problém, který její zákazníci dobře znají: smluvní proces musí zvládat výjimky a zároveň zachovávat pravidla, na nichž fungování firmy závisí. Pokud agent v průběhu úkolu některé z těchto pravidel ztratí ze zřetele, omezuje to rozsah činností, které mu softwarová společnost může s důvěrou svěřit. To ukazuje, proč je lidský dohled důležitý i v době, kdy agenti zvládají složité smluvní úkoly stále lépe, a proč je komplexní platforma pro správu smluv i nadále nezbytná. Spolupráce s našimi výzkumníky umožňuje společnosti Ironclad přenést tyto problémy přímo do vývoje samotného modelu, kde je můžeme společně zkoumat.

S rostoucími schopnostmi modelů má Ironclad příležitost využívat je ve více vlastních produktech. Pro právní a obchodní týmy by to mohlo znamenat, že AI převezme větší část práce spojené se složitými smluvními procesy a přitom zachová kontrolní mechanismy, na které se tyto týmy spoléhají.

“Aby byla AI skutečně užitečná ve složitých oblastech smluvní agendy, musí zvládat víc než jen jednotlivé úkony. Agenti musí rozumět celému životnímu cyklu smluv včetně návazností mezi firemními pracovními postupy a zároveň zachovávat kontrolní mechanismy, na které týmy spoléhají. Naše spolupráce s OpenAI přenáší tyto praktické výzvy do výzkumu a pomáhá posouvat technologii kupředu.”
— Sunita Verma, technologická ředitelka společnosti Ironclad

Rozvíjejte s námi AI pro složitou odbornou práci

Zveme omezený počet softwarových společností k přímé spolupráci s našimi výzkumnými a technickými týmy na důležitých odborných úkolech, které dnešní agenti ještě nedokážou spolehlivě dokončit. Pokud váš tým takový úkol řeší, rádi bychom viděli konkrétní příklad: co od agenta požadujete, doložení toho, kde selhává, a podle čeho byste posuzovali úspěšný výsledek. Partneři by také měli být schopni zapojit lidi s hlubokou znalostí dané práce, poskytnout zabezpečené prostředí pro testování a data, která lze bezpečně využít pro výzkum. Tím získáme výchozí bod pro zkoumání příčin selhání a měření toho, zda se model zlepšuje.

Pokud to odpovídá možnostem vašeho týmu, přihlaste se a prozkoumejte s námi možnosti výzkumné spolupráce.

Autor

OpenAI

Poznámky pod čarou

  1. 1

    Tyto výsledky se týkají 11 výzkumných úkolů, nikoli všech pracovních postupů v platformě Ironclad. Uvedené časy jsou odhady ze simulací založené na předpokládané rychlosti zpracování a generování modelu, nikoli naměřené časové úspory zákazníků.

  2. 2

    Simulované úkoly jsme vytvořili ze smluv veřejně dostupných v databázi EDGAR americké Komise pro cenné papíry (SEC), na které jsme nejprve použili filtry určené k odstranění osobních údajů. K trénování ani hodnocení jsme nepoužili data zákazníků OpenAI, interní smlouvy OpenAI ani neveřejná data či smlouvy zákazníků společnosti Ironclad.

  3. 3

    Viz výše uvedená poznámka k výzkumnému hodnocení.