Datoru izmantošanas pilnveide kopā ar Ironclad
Kā pētnieciskā sadarbība līgumu pārvaldības jomā palīdz mums apmācīt un novērtēt MI aģentus sarežģītu profesionālu uzdevumu izpildē.
Iepazīstinot ar GPT‑6 Astra, mēs parādījām, cik tālu mūsu modeļi ir attīstījušies datoru izmantošanā profesionālam darbam — no dokumentu sagatavošanas līdz vietņu testēšanai. Mūsu nākamais mērķis ir uzlabot aģentu spējas un efektivitāti specializētas programmatūras izmantošanā sarežģītu biznesa problēmu risināšanai. Mēs pētām, kā apmācīt modeļus izprast uzņēmuma darbības noteikumus, izpildīt vairāku soļu darbplūsmas un pārbaudīt sava darba atbilstību sākotnējām prasībām.
Lai paātrinātu šo pētniecību, mēs tieši sadarbojamies ar nelielu skaitu programmatūras uzņēmumu, kuri šīs darbplūsmas pārzina vislabāk. Kopā mēs apzinām sarežģītus, vērtīgus uzdevumus un pārvēršam tos pētniecības uzdevumos modeļu apmācībai un novērtēšanai, tādējādi uzlabojot mūsu modeļu spējas un noderīgumu reālā uzņēmumu darbā.
Mūsu pirmais partneris ir Ironclad — līderis MI risinājumu izmantošanā līgumu pārvaldībā. Cieši sadarbojoties ar Ironclad komandu, esam izstrādājuši uzdevumus, kuros aģentiem jākonfigurē līgumi, apstiprinājumi un atkārtoti izmantojami juridiskie noteikumi, un esam parādījuši progresu šo sarežģīto darbplūsmu izpildē. Ironclad zināšanas ir bijušas izšķiroši svarīgas, lai definētu veiksmīgu rezultātu un reālās klientu vajadzības tieši iekļautu robežšķirtnes modeļu izstrādē. Esam pateicīgi par šo partnerību un ar prieku dalāmies kopīgi paveiktajā.
GPT‑6 Astra ir mūsu pirmais robežšķirtnes modelis, kas apmācīts ar Ironclad uzdevumiem. Mūsu pētniecības novērtējumā tā vidējais vērtējums bija par 32 % augstāks nekā GPT‑5.6 Sol, savukārt aplēstais laiks vienam mēģinājumam bija par 48 % īsāks.1
Iedomājieties juridisko procesu komandu, kas veido programmatūras iegādes procesu. Finanšu nodaļai var būt jāapstiprina pirkumi virs noteiktas summas, drošības nodaļai — jāpārskata noteikti pieprasījumi, bet juridiskajai nodaļai — jāizvērtē nestandarta noteikumi. Procesa veidotājam šis īsais saraksts jāpārvērš pieprasījuma veidlapā, dokumentu veidnēs, apstiprināšanas noteikumos un galīgā līguma ierakstā.
MI aģentam, kas veic šo pašu darbu, šīs prasības jāpatur prātā visā darbā ar programmatūru. Piemēram, tam jākonfigurē finanšu nodaļas apstiprinājums izdevumiem virs noteiktā sliekšņa un jāpārbauda, vai pieprasījumi virs un zem šī sliekšņa tiek virzīti pareizi. Nepietiek ar pareizi izpildītiem atsevišķiem soļiem: gatavajam procesam jādarbojas visās situācijās, kurām tas paredzēts.
Ironclad darbinieki un OpenAI darbinieki, kuri izmanto Ironclad, palīdzēja mūsu pētniekiem noteikt 11 uzdevumus juridiskajā, komercdarbības un iepirkumu jomā. To vidū bija tādi uzdevumi kā konfidencialitātes līgumu konfigurēšana, iepirkumu apstiprināšanas procesu izveide un atkārtoti izmantojamas juridiskās klauzulas atjaunināšana, lai tā atbilstu pieprasījuma iesniedzēja izvēlētajai jurisdikcijai. Pēc mūsu aplēsēm pieredzējušam lietotājam katrs uzdevums vidēji aizņemtu aptuveni 30 līdz 40 minūtes.
Katru uzdevumu vērtējām pēc 8 līdz 50 kritērijiem atkarībā no tā sarežģītības. Tas ļāva redzēt, kuras daļas modelis izpildīja pareizi un kur tā sniegums bija nepietiekams. Ironclad arī nodrošināja sava produkta mitinātas programmatūras vides, kurās modeļi varēja trenēties šo uzdevumu izpildē. Mūsu pētnieki izstrādāja sintētiskus apmācības uzdevumus2, balstoties uz tipiskām darbplūsmām, un izmantoja stimulēto mācīšanos, lai palīdzētu modeļiem pilnveidoties ar praksi un atgriezenisko saiti. Šī kombinācija — uzdevumi, kas atlasīti kopā ar darba pārzinātājiem, detalizēti kritēriji un vide, kurā modeļiem trenēties, — nodrošina, ka uzlabojam sniegumu tieši tajos reālās dzīves uzdevumos, kas mūsu klientiem ir vissvarīgākie.
Mēs salīdzinājām Astra un GPT‑5.6 Sol, izmantojot spriestspējas iestatījumu „Max” modelim Astra un „Augsts” modelim Sol — iestatījumus, ar kuriem katrs modelis ieguva augstāko vērtējumu. Visos 11 pētniecības uzdevumos Astra vidējais vērtējums bija 55,0 %, salīdzinot ar 41,6 % modelim GPT‑5.6 Sol, savukārt aplēstais vidējais laiks vienam mēģinājumam samazinājās no 37,0 minūtēm modelim Sol līdz 19,2 minūtēm modelim Astra.3 Astra izstrādē izmantots iekšējais modelis šajos uzdevumos sasniedza vēl labāku rezultātu — 63,7 %, un mūsu mērķis ir šos papildu uzlabojumus ieviest nākamajos modeļos.
Rādītājs | GPT‑5.6 Sol | GPT‑6 Astra |
Vidējais vērtējums pēc kritērijiem | 41,6 % | 55,0 % |
Aplēstais vidējais laiks vienam mēģinājumam | 37,0 minūtes | 19,2 minūtes |
Astra izpildīja vairāk uzdevumu prasību, simulācijā katram mēģinājumam patērējot mazāk laika. Divos tālāk redzamajos videoklipos parādīts, kā modeļi veica vienu un to pašu pētniecības uzdevumu. Astra (pirmajā) izpildīja aptuveni 94 % uzdevuma kritēriju, pēc aplēsēm tam veltot 20 minūtes; GPT‑5.6 Sol (otrajā) izpildīja aptuveni 85 %, pēc aplēsēm tam veltot 32 minūtes.
GPT‑6 Astra izpildīja aptuveni 94 % uzdevuma kritēriju, pēc aplēsēm tam veltot 20 minūtes.
GPT‑5.6 Sol izpildīja aptuveni 85 % uzdevuma kritēriju, pēc aplēsēm tam veltot 32 minūtes.
Ironclad loma šajā darbā atspoguļo tā klientiem labi zināmu izaicinājumu: līgumu pārvaldības procesā jāspēj apstrādāt izņēmumus, vienlaikus ievērojot uzņēmumam būtiskos noteikumus. Ja aģents uzdevuma gaitā aizmirst kādu no šiem noteikumiem, tas ierobežo darbu klāstu, ko programmatūras uzņēmums var tam droši uzticēt. Tas uzsver, kāpēc cilvēku uzraudzība joprojām ir svarīga, pat ja aģenti arvien labāk veic sarežģītus līgumu pārvaldības uzdevumus, un kāpēc pilnvērtīga līgumu pārvaldības platforma aizvien ir neaizstājama. Sadarbība ar mūsu pētniekiem ļauj Ironclad pievērst uzmanību šīm problēmām jau pamatā esošā modeļa izstrādes procesā, kur varam tās kopīgi pētīt.
Pieaugot modeļu spējām, Ironclad rodas iespēja tos izmantot arvien vairākos savos produktos. Juridiskajām un biznesa komandām tas varētu nozīmēt, ka MI uzņemas lielāku daļu sarežģītā darba ar līgumiem, vienlaikus saglabājot kontroles mehānismus, uz kuriem šīs komandas paļaujas.
Aicinām nelielu skaitu programmatūras uzņēmumu sadarboties tieši ar mūsu pētniecības un inženieru komandām, pievēršoties svarīgiem profesionāliem uzdevumiem, kurus pašreizējie aģenti vēl nespēj uzticami izpildīt. Ja jūsu komandai ir šāds uzdevums, vēlamies redzēt konkrētu piemēru: ko jūs lūdzat aģentam izdarīt, pierādījumus tam, kur tas kļūdās, un kā jūs vērtētu veiksmīgu rezultātu. Partneriem jāspēj arī piesaistīt cilvēkus, kuri padziļināti pārzina attiecīgo darbu, nodrošināt drošu testēšanas vidi un datus, ko var droši izmantot pētniecībā. Tas dod mums pamatu kļūmes izpētei un ļauj izmērīt, vai modeļa sniegums uzlabojas.
Ja tas atbilst jūsu komandai, piesakieties, lai apspriestu sadarbības iespējas pētniecībā.
Autors
Zemsvītras piezīmes
- 1
- 2
Mēs izveidojām simulētus uzdevumus, izmantojot SEC datubāzē EDGAR publiski pieejamus līgumus, kuriem pirms tam piemērojām filtrus personas informācijas noņemšanai. Apmācībai vai novērtēšanai neizmantojām OpenAI klientu datus, OpenAI iekšējos līgumus vai publiski nepieejamus Ironclad klientu datus vai līgumus.
- 3


