Lumaktaw sa pangunahing content
OpenAI

Oktubre 6, 2026

Publikasyon

Pagsulong ng paggamit ng computer kasama ang Ironclad

Paano nakatutulong ang pagtutulungan sa pananaliksik tungkol sa pamamahala ng kontrata upang sanayin at suriin ang mga AI agent sa masalimuot na propesyonal na gawain.

Naglo-load…

Nang ipakilala namin ang GPT‑6 Astra, ipinakita namin kung gaano na kalayo ang narating ng aming mga modelo sa paggamit ng computer para sa propesyonal na gawain, mula sa paghahanda ng mga dokumento hanggang sa pagsubok ng mga website. Ang susunod naming layunin ay gawing mas mahusay at episyente ang mga agent sa paggamit ng espesyal na software upang lutasin ang masasalimuot na problema sa negosyo. Pinag-aaralan namin kung paano sasanayin ang mga modelo na maunawaan ang mga patakaran sa negosyo ng isang kumpanya, magsagawa ng mga workflow na may maraming hakbang, at tiyaking natutugunan ng kanilang ginawa ang orihinal na mga kinakailangan.

Upang mapabilis ang pananaliksik na ito, direkta kaming nakikipagtulungan sa ilang kumpanya ng software na may pinakamalalim na pag-unawa sa mga workflow na ito. Sama-sama naming tinutukoy ang mahihirap at mahahalagang gawain at ginagawa itong mga problemang pag-aaralan para sa pagsasanay at pagsusuri ng aming mga modelo. Sa huli, layunin nitong gawing mas mahusay at kapaki-pakinabang ang aming mga modelo sa aktuwal na paggamit sa negosyo.

Ang una naming partner ay ang Ironclad, isang nangunguna sa pamamahala ng kontrata gamit ang AI. Sa malapit na pakikipagtulungan sa team ng Ironclad, nakabuo kami ng mga gawaing nangangailangan sa mga agent na mag-configure ng mga kasunduan, pag-apruba, at magagamit-muling legal na tuntunin, at naipakita namin ang pag-unlad sa masasalimuot na workflow na ito. Malaki ang naitulong ng kadalubhasaan ng Ironclad sa pagtukoy kung ano ang matagumpay na resulta at sa direktang pagsasama ng tunay na pangangailangan ng mga customer sa pagbuo ng mga frontier na modelo. Nagpapasalamat kami sa kanilang pakikipagtulungan at nasasabik kaming ibahagi ang sama-sama naming nagawa.

Ang GPT‑6 Astra ang una naming frontier na modelo na sinanay sa mga gawain sa Ironclad. Sa aming pagsusuri sa pananaliksik, 32% na mas mataas ang average na marka nito kaysa sa GPT‑5.6 Sol, habang 48% na mas maikli ang tinatayang oras sa bawat pagsubok.1

Paggawang mga gawain sa pagsasanay ng mga workflow sa pamamahala ng kontrata

Isipin ang isang legal operations team na naghahanda ng proseso para sa pagbili ng software. Maaaring kailangang aprubahan ng departamento ng Pananalapi ang mga pagbiling lampas sa itinakdang halaga, suriin ng departamento ng Seguridad ang ilang kahilingan, at suriin ng Legal na departamento ang mga tuntuning hindi pamantayan. Kailangang gumawa ang taong naghahanda ng proseso ng form para sa mga kahilingan, mga template ng dokumento, mga patakaran sa pag-apruba, at tala ng pinal na kasunduan mula sa maikling listahang iyon.

Kailangang tandaan ng isang AI agent na gumagawa ng parehong gawain ang mga kinakailangang iyon habang ginagamit nito ang software. Halimbawa, dapat nitong itakda na kailangan ang pag-apruba ng Pananalapi para sa paggastos na lampas sa itinakdang halaga, at tiyaking tama ang prosesong dinaraanan ng mga kahilingang mas mataas at mas mababa rito. Hindi sapat na tama ang bawat indibidwal na hakbang: kailangang gumana ang nabuong proseso sa lahat ng sitwasyong idinisenyo nitong hawakan.

Tinulungan ng mga empleyado ng Ironclad at mga gumagamit ng Ironclad sa OpenAI ang aming mga mananaliksik na tumukoy ng 11 gawain sa larangan ng batas, komersyo, at pagbili. Kabilang dito ang paghahanda ng mga kasunduan sa hindi pagsisiwalat, pagbuo ng mga proseso ng pag-apruba sa pagbili, at pag-update ng isang magagamit-muling legal na sugnay upang umayon ito sa hurisdiksyong pipiliin ng humihiling. Tinataya naming aabutin ang isang bihasang user ng humigit-kumulang 30 hanggang 40 minuto sa bawat gawain, sa karaniwan.

Sinuri namin ang bawat gawain ayon sa 8 hanggang 50 pamantayan, depende sa pagiging masalimuot nito. Dahil dito, nakita namin kung aling mga bahagi ang nagawa nang tama ng modelo at kung saan ito nagkulang. Naglaan din ang Ironclad ng mga naka-host na software environment ng kanilang produkto kung saan maaaring magsanay ang mga modelo sa mga gawaing ito. Bumuo ang aming mga mananaliksik ng mga sintetikong gawain sa pagsasanay2 batay sa mga workflow na kumakatawan sa karaniwang paggamit, at gumamit ng pagpapatibay ng pag-aaral upang tulungang humusay ang mga modelo sa pamamagitan ng pagsasanay at feedback. Sa kombinasyong ito—mga gawaing pinili kasama ang mga taong nakauunawa sa trabaho, detalyadong pamantayan, at lugar kung saan makapagsasanay ang mga modelo—natitiyak naming napapahusay namin ang pagganap sa mga aktuwal na gawaing pinakamahalaga sa aming mga customer.

Ang naging pagganap ng Astra

Inihambing namin ang Astra at GPT‑5.6 Sol gamit ang antas na Max sa pangangatwiran para sa Astra at Mataas para sa Sol, ang mga setting kung saan nakakuha ng pinakamataas na marka ang bawat modelo. Sa 11 gawain sa pananaliksik, 55.0% ang average na marka ng Astra kumpara sa 41.6% ng GPT‑5.6 Sol, habang bumaba ang tinatayang average na oras sa bawat pagsubok mula sa 37.0 minuto ng Sol tungo sa 19.2 minuto ng Astra.3 Isang panloob na modelong ginamit sa pagbuo ng Astra ang nakakuha ng mas mataas pang 63.7% sa mga gawaing ito, at layunin naming maihatid ang mga karagdagang paghusay na ito sa mga susunod na modelo.

Sukatan

GPT‑5.6 Sol
Antas ng pangangatwiran: Mataas

GPT‑6 Astra
Antas ng pangangatwiran: Max

Average na marka ayon sa rubrik

41.6%

55.0%

Tinatayang average na oras sa bawat pagsubok

37.0 minuto

19.2 minuto

Mas maraming kinakailangan ng gawain ang natugunan ng Astra sa mas maikling oras sa simulation sa bawat pagsubok. Ipinapakita ng dalawang clip sa ibaba kung paano isinagawa ng mga modelo ang iisang gawain sa pananaliksik. Natugunan ng Astra (una) ang humigit-kumulang 94% ng mga pamantayan ng gawain sa tinatayang 20 minuto; natugunan naman ng GPT‑5.6 Sol (pangalawa) ang humigit-kumulang 85% sa tinatayang 32 minuto.

Natugunan ng GPT‑6 Astra ang humigit-kumulang 94% ng mga pamantayan ng gawain sa tinatayang 20 minuto.

Natugunan ng GPT‑5.6 Sol ang humigit-kumulang 85% ng mga pamantayan ng gawain sa tinatayang 32 minuto.

Ang kahulugan ng pagtutulungang ito para sa Ironclad

Makikita sa papel ng Ironclad sa gawaing ito ang isang hamong pamilyar sa mga customer nito: kailangang mahawakan ng proseso ng pamamahala ng kontrata ang mga eksepsyon nang napapanatili ang mga patakarang inaasahan ng negosyo. Kung makaligtaan ng isang agent ang isa sa mga patakarang iyon habang ginagawa ang isang gawain, nalilimitahan ang mga gawaing maipagkakatiwala rito ng isang kumpanya ng software. Ipinapakita nito kung bakit mahalaga pa rin ang pangangasiwa ng tao habang humuhusay ang mga agent sa masalimuot na gawain sa pamamahala ng kontrata, at kung bakit kailangan pa rin ang isang kumpletong platform para rito. Sa pakikipagtulungan sa aming mga mananaliksik, naisasama ng Ironclad ang mga problemang ito sa pagbuo ng pinagbabatayang modelo, kung saan maaari naming sama-samang pag-aralan ang mga ito.

Habang lumalawak ang kakayahan ng mga modelo, may pagkakataon ang Ironclad na gamitin ang mga ito sa mas marami nitong produkto. Para sa mga legal at business team, maaaring mangahulugan ito na mas malaking bahagi ng masalimuot na pamamahala ng kontrata ang magagawa ng AI, habang napapanatili ang mga kontrol na inaasahan ng mga team na iyon.

“Upang tunay na makatulong ang AI sa masasalimuot na bahagi ng pamamahala ng kontrata, hindi sapat na kumpletuhin lang nito ang mga indibidwal na aksyon. Kailangang maunawaan ng mga agent ang buong siklo ng pamamahala ng kontrata, kabilang ang ugnayan ng mga workflow ng negosyo, habang napapanatili ang mga kontrol na inaasahan ng mga team. Sa aming pakikipagtulungan sa OpenAI, naisasama ang mga hamong ito mula sa aktuwal na paggamit sa proseso ng pananaliksik at natutulungang umunlad ang teknolohiya.”
—Sunita Verma, Punong Opisyal ng Teknolohiya, Ironclad

Makipagtulungan sa amin upang isulong ang AI para sa masalimuot na propesyonal na gawain

Nag-aanyaya kami ng ilang kumpanya ng software na direktang makipagtulungan sa aming mga research at engineering team sa mahahalagang propesyonal na gawaing hindi pa maaasahang makumpleto ng mga agent ngayon. Kung may ganitong gawain ang inyong team, nais naming makakita ng kongkretong halimbawa: ano ang ipinapagawa ninyo sa agent, ebidensya kung saan ito pumapalya, at paano ninyo tutukuyin kung matagumpay ang resulta. Dapat ding makapaglaan ang mga partner ng mga taong may malalim na kaalaman sa gawain, isang ligtas na kapaligiran para sa pagsubok, at data na ligtas na magagamit sa pananaliksik. Magiging panimulang batayan namin ito sa pagsisiyasat sa pagkabigo at pagsukat kung humuhusay ang modelo.

May-akda

OpenAI

Mga talababa

  1. 1

    Saklaw ng mga resultang ito ang 11 gawain sa pananaliksik, hindi ang lahat ng workflow sa Ironclad. Ang mga oras ay pagtataya sa pamamagitan ng simulation batay sa ipinagpalagay na bilis ng pagproseso at pagbuo ng output ng modelo, hindi sa sinukat na oras na natipid ng mga customer.

  2. 2

    Gumawa kami ng mga simulated na gawain mula sa mga kontratang bukas sa publiko sa EDGAR database ng SEC matapos maglapat ng mga filter na idinisenyo upang alisin ang personal na impormasyon. Hindi kami gumamit ng data ng mga customer ng OpenAI, mga panloob na kontrata ng OpenAI, o data o kontrata ng mga customer ng Ironclad na hindi bukas sa publiko para sa pagsasanay o pagsusuri.

  3. 3

    Tingnan ang talababa sa itaas tungkol sa pagsusuri sa pananaliksik.