Zlepšujeme používanie počítača s Ironclad
Ako nám výskumná spolupráca v oblasti práce so zmluvami pomáha trénovať a hodnotiť AI agentov pri zložitej odbornej práci.
Keď sme predstavili GPT‑6 Astra, ukázali sme, ako ďaleko sa naše modely posunuli v používaní počítača na odbornú prácu, od prípravy dokumentov po testovanie webov. Naším ďalším cieľom je zlepšiť schopnosť agentov efektívne využívať špecializovaný softvér na riešenie zložitých firemných problémov. Skúmame, ako trénovať modely, aby rozumeli pravidlám firmy, vykonávali viackrokové pracovné postupy a overovali, či ich práca spĺňa pôvodné požiadavky.
Na urýchlenie tohto výskumu priamo spolupracujeme s malým počtom softvérových spoločností, ktoré týmto pracovným postupom rozumejú najlepšie. Spoločne identifikujeme náročné úlohy s veľkým prínosom a pretvárame ich na výskumné problémy na trénovanie a hodnotenie našich modelov. Vďaka tomu sú naše modely schopnejšie a užitočnejšie pri reálnom využití vo firmách.
Naším prvým partnerom je Ironclad, popredná spoločnosť v oblasti práce so zmluvami pomocou AI. V úzkej spolupráci s tímom Ironclad sme vytvorili úlohy, pri ktorých musia agenti nastavovať zmluvy, schvaľovanie a opakovane použiteľné právne podmienky, a preukázali sme pokrok pri zvládaní týchto zložitých pracovných postupov. Odborné znalosti spoločnosti Ironclad boli zásadné pri definovaní úspešného výsledku a pri prenášaní skutočných potrieb zákazníkov priamo do vývoja prelomových modelov. Za toto partnerstvo sme vďační a teší nás, že sa môžeme podeliť o spoločné výsledky.
GPT‑6 Astra je náš prvý prelomový model trénovaný na úlohách v prostredí Ironclad. V našom hodnotení v rámci výskumu dosiahol priemerné skóre o 32 % vyššie než GPT‑5.6 Sol, pričom odhadovaný čas na jeden pokus bol o 48 % kratší.1
Predstavte si tím zodpovedný za právne procesy, ktorý nastavuje proces nákupu softvéru. Nákupy nad určitú sumu môže byť potrebné schváliť na finančnom oddelení, niektoré žiadosti môže musieť posúdiť bezpečnostné oddelenie a neštandardné podmienky právne oddelenie. Človek, ktorý proces nastavuje, musí z tohto krátkeho zoznamu vytvoriť vstupný formulár, šablóny dokumentov, pravidlá schvaľovania a záznam o konečnej zmluve.
AI agent vykonávajúci rovnakú prácu musí mať tieto požiadavky na pamäti počas celej práce v softvéri. Musí napríklad nastaviť schvaľovanie finančným oddelením pri prekročení výdavkového limitu a overiť, či sa žiadosti nad aj pod týmto limitom spracúvajú správnym postupom. Nestačí správne vykonať jednotlivé kroky: hotový proces musí fungovať vo všetkých situáciách, na ktoré bol navrhnutý.
Zamestnanci spoločnosti Ironclad a ľudia, ktorí Ironclad používajú v OpenAI, pomohli našim výskumníkom identifikovať 11 úloh z právnej, obchodnej a nákupnej agendy. Patrilo k nim napríklad nastavovanie dohôd o mlčanlivosti, vytváranie procesov schvaľovania nákupov a aktualizácia opakovane použiteľnej právnej doložky tak, aby zodpovedala jurisdikcii zvolenej žiadateľom. Odhadujeme, že skúsenému používateľovi by táto práca zabrala v priemere približne 30 až 40 minút na úlohu.
Každú úlohu sme hodnotili podľa 8 až 50 kritérií v závislosti od jej zložitosti. Takto sme mohli zistiť, ktoré časti model zvládol správne a kde mal nedostatky. Ironclad poskytol aj hostované softvérové prostredia svojho produktu, v ktorých si modely mohli tieto úlohy precvičovať. Naši výskumníci vytvorili syntetické tréningové úlohy2 na základe reprezentatívnych pracovných postupov a pomocou učenia posilňovaním pomáhali modelom zlepšovať sa precvičovaním a spätnou väzbou. Táto kombinácia úloh vybraných spolu s ľuďmi, ktorí danej práci rozumejú, podrobných kritérií a prostredia na precvičovanie zabezpečuje, že modely zlepšujeme v reálnych úlohách, ktoré sú pre našich zákazníkov najdôležitejšie.
Porovnali sme modely Astra a GPT‑5.6 Sol s úrovňou uvažovania „Maximálna“ pre model Astra a „Vysoká“ pre model Sol, teda s nastaveniami, pri ktorých každý z nich dosiahol najvyššie skóre. V 11 výskumných úlohách dosiahol model Astra priemerné skóre 55,0 % oproti 41,6 % pri modeli GPT‑5.6 Sol. Odhadovaný priemerný čas na jeden pokus pritom klesol z 37,0 minúty pri modeli Sol na 19,2 minúty pri modeli Astra.3 Interný model použitý pri vývoji modelu Astra dosiahol v týchto úlohách ešte lepší výsledok, 63,7 %, a naším cieľom je preniesť tieto ďalšie zlepšenia do budúcich modelov.
Metrika | GPT‑5.6 Sol | GPT‑6 Astra |
Priemerné skóre podľa hodnotiacich kritérií | 41,6 % | 55,0 % |
Odhadovaný priemerný čas na jeden pokus | 37,0 minúty | 19,2 minúty |
Model Astra splnil viac požiadaviek úloh za kratší simulovaný čas na jeden pokus. Dve videá nižšie ukazujú, ako modely zvládli tú istú výskumnú úlohu. Model Astra (v prvom videu) splnil približne 94 % kritérií úlohy za odhadovaných 20 minút; GPT‑5.6 Sol (v druhom videu) splnil približne 85 % za odhadovaných 32 minút.
GPT‑6 Astra splnil približne 94 % kritérií úlohy za odhadovaných 20 minút.
GPT‑5.6 Sol splnil približne 85 % kritérií úlohy za odhadovaných 32 minút.
Úloha spoločnosti Ironclad v tomto projekte odráža výzvu, ktorú jej zákazníci dobre poznajú: zmluvný proces musí zvládať výnimky a zároveň zachovávať pravidlá, od ktorých firma závisí. Ak agent počas plnenia úlohy stratí zo zreteľa niektoré z týchto pravidiel, obmedzuje to rozsah práce, ktorú mu softvérová spoločnosť môže s dôverou zveriť. To zdôrazňuje, prečo je ľudský dohľad stále dôležitý, aj keď sa agenti zlepšujú v zložitých úlohách pri práci so zmluvami, a prečo je naďalej nevyhnutná komplexná platforma na správu zmlúv. Spolupráca s našimi výskumníkmi umožňuje spoločnosti Ironclad preniesť tieto problémy do vývoja samotného modelu, kde ich môžeme spoločne skúmať.
S rastúcimi schopnosťami modelov má Ironclad príležitosť využívať ich vo viacerých svojich produktoch. Pre právne a obchodné tímy by to mohlo znamenať, že AI prevezme väčšiu časť náročnej práce so zmluvami a zároveň zachová kontrolné mechanizmy, na ktoré sa tieto tímy spoliehajú.
Pozývame malý počet softvérových spoločností na priamu spoluprácu s našimi výskumnými a technickými tímami na dôležitých odborných úlohách, ktoré dnešní agenti ešte nedokážu spoľahlivo dokončiť. Ak váš tím rieši takúto úlohu, radi by sme videli konkrétny príklad: čo od agenta požadujete, doklady o tom, kde zlyháva, a ako by ste posúdili úspešný výsledok. Partneri by mali vedieť zapojiť aj ľudí, ktorí danej práci dôkladne rozumejú, poskytnúť bezpečné prostredie na testovanie a údaje, ktoré možno bezpečne použiť na výskum. Získame tak východisko na preskúmanie zlyhania a meranie toho, či sa model zlepšuje.
Ak to zodpovedá vášmu tímu, prihláste sa a preskúmajte možnosti výskumnej spolupráce.
Autor
Poznámky pod čiarou
- 1
- 2
Simulované úlohy sme vytvorili zo zmlúv verejne dostupných v databáze EDGAR americkej Komisie pre cenné papiere a burzy (SEC) po použití filtrov určených na odstránenie osobných údajov. Na trénovanie ani hodnotenie sme nepoužili údaje zákazníkov OpenAI, interné zmluvy OpenAI ani neverejné údaje či zmluvy zákazníkov spoločnosti Ironclad.
- 3


