Үндсэн агуулга руу алгасах
OpenAI

2026 оны аравдугаар сарын 6

Нийтлэл

Ironclad-тай хамт компьютер ашиглах чадварыг ахиулах нь

Гэрээний чиглэлийн судалгааны хамтын ажиллагаа мэргэжлийн нарийн төвөгтэй ажилд хиймэл оюун ухааны агентуудыг сургаж, үнэлэхэд хэрхэн тусалж байна вэ?

Ачаалж байна…

Бид GPT‑6 Astra-г танилцуулахдаа баримт бичиг бэлтгэхээс эхлээд вэбсайт турших хүртэл мэргэжлийн ажилд компьютер ашиглах тал дээр манай загварууд хэр ахисныг харуулсан. Бидний дараагийн зорилго бол бизнесийн нарийн төвөгтэй асуудлыг шийдэхийн тулд тусгай зориулалтын программ хангамж ашиглах агентуудын чадавх, үр ашгийг нэмэгдүүлэх юм. Бид загваруудыг компанийн бизнесийн дүрмийг ойлгох, олон алхамт ажлын урсгалыг гүйцэтгэх, хийсэн ажил нь анхны шаардлагыг хангаж байгаа эсэхийг шалгах чадварт хэрхэн сургахыг судалж байна.

Энэ судалгааг хурдасгахын тулд бид эдгээр ажлын урсгалыг хамгийн сайн мэддэг цөөн тооны программ хангамжийн компанитай шууд хамтран ажиллаж байна. Бид хамтдаа хүнд хэцүү, өндөр ач холбогдолтой ажлуудыг тодорхойлж, загваруудаа сургах, үнэлэх судалгааны даалгавар болгон хувиргаж байна. Ингэснээр загваруудаа бизнесийн бодит хэрэглээнд илүү чадвартай, хэрэгцээтэй болгоно.

Бидний анхны түнш бол хиймэл оюун ухаанд суурилсан гэрээний шийдлээр тэргүүлэгч Ironclad юм. Ironclad-ын багтай нягт хамтран ажиллаж, агентуудаас гэрээ, зөвшөөрөл олгох үйл явц, дахин ашиглаж болох хууль зүйн нөхцөлүүдийг тохируулахыг шаардсан даалгаврууд боловсрууллаа. Эдгээр нарийн төвөгтэй ажлын урсгалыг гүйцэтгэхэд ахиц гарсныг ч харууллаа. Амжилтыг хэрхэн тодорхойлох, хэрэглэгчдийн бодит хэрэгцээг хил хязгаарын загварын хөгжүүлэлтэд шууд тусгахад Ironclad-ын мэргэжлийн мэдлэг, туршлага шийдвэрлэх үүрэг гүйцэтгэсэн. Бид тэдний хамтын ажиллагаанд талархаж, хамтдаа хүрсэн үр дүнгээ хуваалцаж байгаадаа баяртай байна.

GPT‑6 Astra бол Ironclad-ын даалгавруудаар сургасан манай анхны хил хязгаарын загвар юм. Манай судалгааны үнэлгээнд түүний дундаж оноо GPT‑5.6 Sol-ынхоос 32%-иар өндөр байсан бол нэг оролдлогод зарцуулах тооцоолсон хугацаа 48%-иар бага байлаа.1

Гэрээний ажлын урсгалыг сургалтын даалгавар болгох нь

Хууль зүйн үйл ажиллагааны баг программ хангамж худалдан авах үйл явцыг зохион байгуулж байна гэж бодъё. Тодорхой дүнгээс давсан худалдан авалтыг санхүүгийн баг зөвшөөрөх, зарим хүсэлтийг аюулгүй байдлын баг хянах, стандарт бус нөхцөлүүдийг хууль зүйн баг нягтлах шаардлагатай байж болно. Үйл явцыг зохион байгуулж буй хүн энэ товч жагсаалтад тулгуурлан хүсэлт хүлээн авах маягт, баримт бичгийн загвар, зөвшөөрөл олгох дүрэм болон эцсийн гэрээний бүртгэлийг бий болгох ёстой.

Ижил ажил хийж буй хиймэл оюун ухааны агент программ хангамжид ажиллах явцдаа эдгээр шаардлагыг байнга анхаарах ёстой. Жишээлбэл, зарлагын босгоос давсан тохиолдолд санхүүгийн багаас зөвшөөрөл авах тохиргоо хийж, уг босгоос дээш болон доош дүнтэй хүсэлтүүд зохих дарааллаар дамжиж байгаа эсэхийг шалгах ёстой. Алхам бүрийг зөв хийх нь хангалтгүй: бэлэн болсон үйл явц нь шийдвэрлэхээр төлөвлөсөн бүх нөхцөлд ажиллах ёстой.

Ironclad-ын ажилтнууд болон OpenAI-д Ironclad ашигладаг хүмүүс манай судлаачдад хууль зүй, худалдаа, худалдан авалтын хүрээнд 11 даалгавар тодорхойлоход тусалсан. Үүнд нууц хадгалах гэрээг тохируулах, худалдан авалтад зөвшөөрөл олгох үйл явц бий болгох, хүсэлт гаргагчийн сонгосон эрх зүйн харьяалалд нийцүүлэн дахин ашиглах гэрээний заалтыг шинэчлэх зэрэг даалгавар багтсан. Туршлагатай хэрэглэгч эдгээр даалгаврын нэгийг гүйцэтгэхэд дунджаар 30–40 минут зарцуулна гэж бид тооцоолж байна.

Бид даалгавар бүрийг нарийн төвөгтэй байдлаас нь хамааран 8–50 шалгуураар үнэлсэн. Ингэснээр загвар аль хэсгийг зөв гүйцэтгэж, хаана дутуу ажилласныг харах боломжтой болсон. Ironclad мөн загварууд эдгээр даалгаврыг дадлагажуулах боломжтой, серверт байршуулсан бүтээгдэхүүнийхээ программын орчнуудыг гаргаж өгсөн. Манай судлаачид төлөөлөхүйц ажлын урсгалуудад тулгуурлан сургалтын хиймэл даалгаврууд2 боловсруулж, загваруудыг дадлага болон эргэх холбоогоор сайжруулахын тулд бататгах сургалт ашигласан. Ажлаа сайн мэддэг хүмүүстэй хамт сонгосон даалгавар, нарийвчилсан шалгуур, загваруудын дадлага хийх орчин гэсэн энэ хослол нь хэрэглэгчдэд маань хамгийн чухал бодит ажлуудын гүйцэтгэлийг сайжруулж байгааг баталгаажуулдаг.

Astra хэрхэн гүйцэтгэсэн бэ?

Бид Astra болон GPT‑5.6 Sol-ыг харьцуулахдаа тус бүрийн хамгийн өндөр оноо авсан тохиргоог буюу Astra-д сэтгэн бодох Max түвшнийг, Sol-д сэтгэн бодох Өндөр түвшнийг ашигласан. Судалгааны 11 даалгаварт Astra-гийн дундаж оноо 55.0%, GPT‑5.6 Sol-ынх 41.6% байсан бол нэг оролдлогын тооцоолсон дундаж хугацаа Sol-ын 37.0 минутаас Astra-гийн 19.2 минут болж буурсан.3 Astra-г хөгжүүлэхэд ашигласан дотоод загвар эдгээр даалгаварт бүр илүү өндөр буюу 63.7%-ийн үзүүлэлтэд хүрсэн бөгөөд бид энэ нэмэлт ахицыг ирээдүйн загваруудад нэвтрүүлэхээр зорьж байна.

Үзүүлэлт

GPT‑5.6 Sol
Сэтгэн бодох Өндөр түвшин

GPT‑6 Astra
Сэтгэн бодох Max түвшин

Шалгуурын дагуух дундаж оноо

41.6%

55.0%

Нэг оролдлогын тооцоолсон дундаж хугацаа

37.0 минут

19.2 минут

Тооцоолсон хугацаагаар Astra нэг оролдлогод бага цаг зарцуулж, даалгаврын илүү олон шаардлагыг хангасан. Доорх хоёр бичлэгт загварууд судалгааны ижил даалгаврыг хэрхэн гүйцэтгэснийг харууллаа. Astra (эхний бичлэг) тооцоолсноор 20 орчим минутад даалгаврын шалгуурын ойролцоогоор 94%-ийг хангасан бол GPT‑5.6 Sol (хоёр дахь бичлэг) 32 орчим минутад ойролцоогоор 85%-ийг хангасан.

GPT‑6 Astra тооцоолсноор 20 орчим минутад даалгаврын шалгуурын ойролцоогоор 94%-ийг хангасан.

GPT‑5.6 Sol тооцоолсноор 32 орчим минутад даалгаврын шалгуурын ойролцоогоор 85%-ийг хангасан.

Энэ хамтын ажиллагаа Ironclad-д ямар ач холбогдолтой вэ?

Энэ ажилд Ironclad-ын оролцоо нь тус компанийн хэрэглэгчдэд танил нэгэн сорилттой холбоотой: гэрээ байгуулах явцад онцгой тохиолдлуудыг шийдвэрлэхийн зэрэгцээ бизнесийн үйл ажиллагааны үндэс болсон дүрмийг мөрдөх ёстой. Агент даалгавраа гүйцэтгэх явцдаа эдгээр дүрмийн аль нэгийг орхигдуулбал программ хангамжийн компани түүнд итгэлтэйгээр даатгаж болох ажлын хүрээ хязгаарлагдана. Агентууд гэрээний нарийн төвөгтэй ажлыг илүү сайн гүйцэтгэдэг болсон ч хүний хяналт яагаад чухал хэвээр байгааг, мөн гэрээний иж бүрэн платформ яагаад зайлшгүй хэрэгтэйг энэ нь харуулж байна. Манай судлаачидтай хамтран ажилласнаар Ironclad эдгээр асуудлыг суурь загварын хөгжүүлэлтэд тусгаж, бид хамтдаа судлах боломжтой болж байна.

Загваруудын чадавх сайжрахын хэрээр Ironclad тэдгээрийг өөрийн илүү олон бүтээгдэхүүнд ашиглах боломжтой болно. Ингэснээр хууль зүйн болон бизнесийн багуудын хувьд гэрээний нарийн төвөгтэй ажлын илүү их хэсгийг хиймэл оюун ухаанд даатгахын зэрэгцээ өөрсдийн түшиглэдэг хяналтын механизмыг хэвээр хадгалах боломж бүрдэж болох юм.

“Хиймэл оюун ухаан гэрээний нарийн төвөгтэй ажилд үнэхээр хэрэгтэй байхын тулд тус тусын үйлдлийг гүйцэтгэхээс илүүг хийх ёстой. Агентууд гэрээний бүх үе шатыг, тэр дундаа багуудын түшиглэдэг хяналтын механизмыг хадгалангаа бизнесийн ажлын урсгалууд хэрхэн хоорондоо холбогддогийг ойлгох хэрэгтэй. OpenAI-тай хамтран ажилласнаар бид эдгээр бодит сорилтыг судалгааны үйл явцад тусгаж, технологийн хөгжилд ахиц гаргахад тусалж байна.”
—Сунита Верма, Ironclad-ын технологи хариуцсан захирал

Мэргэжлийн нарийн төвөгтэй ажилд зориулсан хиймэл оюун ухааныг хөгжүүлэхээр бидэнтэй хамтран ажиллаарай

Өнөөгийн агентууд найдвартай гүйцэтгэж хараахан чадахгүй байгаа мэргэжлийн чухал ажлууд дээр манай судалгаа, инженерчлэлийн багуудтай шууд хамтран ажиллахыг бид цөөн тооны программ хангамжийн компанид урьж байна. Танай багт ийм ажил байгаа бол агентаар юу хийлгэхийг хүсэж байгаа, тэр хаана алдаж буйг харуулах баримт, амжилттай үр дүнг хэрхэн үнэлэх зэрэг тодорхой жишээг бид үзэхийг хүсэж байна. Түншүүд мөн тухайн ажлыг гүнзгий мэддэг мэргэжилтнүүдийг оролцуулж, туршилтын аюулгүй орчин болон судалгаанд аюулгүй ашиглаж болох өгөгдөл гаргаж өгөх боломжтой байх ёстой. Ингэснээр бид алдааг судалж, загвар сайжирч байгаа эсэхийг хэмжих эхлэлээ тавина.

Зохиогч

OpenAI

Зүүлт

  1. 1

    Эдгээр үр дүн нь Ironclad-ын бүх ажлын урсгалд бус, судалгааны 11 даалгаварт хамаарна. Энд дурдсан хугацаа нь загварын боловсруулалт болон хариу үүсгэх хурдыг таамаглан тооцсон утга бөгөөд хэрэглэгчдийн хэмнэсэн цагийг хэмжсэн үзүүлэлт биш юм.

  2. 2

    Бид SEC-ийн EDGAR өгөгдлийн санд нийтэд нээлттэй байгаа гэрээнүүдэд хувийн мэдээллийг арилгах зориулалттай шүүлтүүр хэрэглэсний дараа тэдгээрт тулгуурлан туршилтын даалгаврууд үүсгэсэн. Бид сургалт, үнэлгээнд OpenAI-ийн хэрэглэгчдийн өгөгдөл, OpenAI-ийн дотоод гэрээнүүд, эсвэл Ironclad-ын хэрэглэгчдийн нийтэд нээлттэй бус өгөгдөл, гэрээг ашиглаагүй.

  3. 3

    Дээрх судалгааны үнэлгээний зүүлтийг үзнэ үү.