Համակարգչի օգտագործման կարողությունների զարգացում՝ Ironclad-ի հետ
Ինչպես է պայմանագրային ոլորտում հետազոտական համագործակցությունն օգնում մեզ ուսուցանել և գնահատել ԱԲ ագենտներին բարդ մասնագիտական աշխատանքներում։
Երբ ներկայացրինք GPT‑6 Astra-ն, ցույց տվեցինք, թե որքան են առաջադիմել մեր մոդելները մասնագիտական աշխատանքի համար համակարգիչներ օգտագործելու հարցում՝ փաստաթղթերի պատրաստումից մինչև կայքերի փորձարկում։ Մեր հաջորդ նպատակն է զարգացնել ագենտների՝ մասնագիտացված ծրագրային ապահովում օգտագործելու կարողություններն ու արդյունավետությունը՝ բիզնեսի բարդ խնդիրներ լուծելու համար։ Մենք ուսումնասիրում ենք, թե ինչպես սովորեցնել մոդելներին հասկանալ ընկերության բիզնես կանոնները, կատարել բազմաքայլ աշխատանքային գործընթացներ և ստուգել, որ իրենց աշխատանքը համապատասխանում է սկզբնական պահանջներին։
Այս հետազոտությունն արագացնելու համար մենք անմիջականորեն համագործակցում ենք ծրագրային ապահովման սահմանափակ թվով ընկերությունների հետ, որոնք լավագույնս են հասկանում այս աշխատանքային գործընթացները։ Միասին մենք ընտրում ենք բարդ ու մեծ արժեք ունեցող առաջադրանքներ և դրանք վերածում հետազոտական խնդիրների՝ մեր մոդելների ուսուցման ու գնահատման համար։ Արդյունքում մեր մոդելները դառնում են ավելի կարողունակ և օգտակար բիզնեսում գործնական կիրառության համար։
Մեր առաջին գործընկերը Ironclad-ն է՝ ԱԲ-ի կիրառմամբ պայմանագրերի կառավարման ոլորտի առաջատարներից մեկը։ Սերտորեն աշխատելով Ironclad-ի թիմի հետ՝ մենք մշակել ենք առաջադրանքներ, որոնցում ագենտները պետք է կարգավորեն պայմանագրերը, հաստատման ընթացակարգերը և բազմակի օգտագործման իրավական պայմանները։ Մենք նաև ցույց ենք տվել առաջընթաց այս բարդ աշխատանքային գործընթացներում։ Ironclad-ի փորձառությունն առանցքային է եղել հաջողության չափանիշները սահմանելու և հաճախորդների իրական կարիքներն անմիջապես առաջադեմ մոդելների մշակման գործընթացում ներառելու համար։ Մենք երախտապարտ ենք այս գործընկերության համար և ուրախ ենք կիսվել մեր համատեղ ձեռքբերումներով։
GPT‑6 Astra-ն մեր առաջին առաջադեմ մոդելն է, որն ուսուցանվել է Ironclad-ի առաջադրանքների վրա։ Մեր հետազոտական գնահատման ընթացքում դրա միջին միավորը 32%-ով ավելի բարձր էր, քան GPT‑5.6 Sol-ինը, իսկ մեկ փորձի գնահատված տևողությունը՝ 48%-ով ավելի կարճ։1
Պատկերացրեք իրավաբանական գործառնությունների թիմ, որը ծրագրային ապահովման գնման գործընթաց է ձևավորում։ Կարող է անհրաժեշտ լինել, որ ֆինանսական բաժինը հաստատի որոշակի գումարը գերազանցող գնումները, անվտանգության բաժինը ստուգի որոշ հայտեր, իսկ իրավաբանական բաժինն ուսումնասիրի ոչ ստանդարտ պայմանները։ Գործընթացը կարգավորող անձն այս կարճ ցանկի հիման վրա պետք է ստեղծի հայտի ձևաթուղթ, փաստաթղթերի ձևանմուշներ, հաստատման կանոններ և վերջնական պայմանագրի գրանցում։
Նույն աշխատանքը կատարող ԱԲ ագենտը պետք է ծրագրում աշխատելու ողջ ընթացքում հաշվի առնի այդ պահանջները։ Օրինակ՝ այն պետք է սահմանի ֆինանսական բաժնի հաստատման պահանջ ծախսերի շեմը գերազանցող հայտերի համար և ստուգի, որ այդ շեմից բարձր ու ցածր գումարներով հայտերն անցնում են համապատասխան ընթացակարգերով։ Առանձին քայլերը ճիշտ կատարելը բավարար չէ. պատրաստի գործընթացը պետք է գործի բոլոր այն իրավիճակներում, որոնց համար նախատեսված է։
Ironclad-ի աշխատակիցները և OpenAI-ում Ironclad օգտագործող մասնագետներն օգնեցին մեր հետազոտողներին ընտրել 11 առաջադրանք՝ իրավաբանական, առևտրային և գնումների աշխատանքներից։ Դրանց թվում էին, օրինակ, գաղտնիության պահպանման համաձայնագրերի կարգավորումը, գնումների հաստատման գործընթացների ստեղծումը և բազմակի օգտագործման իրավական դրույթի թարմացումը՝ հայտատուի ընտրած իրավազորությանը համապատասխան։ Մեր գնահատմամբ՝ փորձառու օգտատիրոջից այս աշխատանքը կպահանջեր միջինում մոտ 30–40 րոպե՝ յուրաքանչյուր առաջադրանքի համար։
Յուրաքանչյուր առաջադրանք գնահատել ենք 8-ից 50 չափանիշով՝ կախված դրա բարդությունից։ Սա թույլ տվեց տեսնել, թե որ մասերն էր մոդելը ճիշտ կատարում, և որտեղ էր թերանում։ Ironclad-ը տրամադրել է նաև իր արտադրանքի ծրագրային միջավայրեր՝ տեղակայված սերվերներում, որտեղ մոդելները կարող էին վարժվել՝ կատարելով այս առաջադրանքները։ Մեր հետազոտողները բնորոշ աշխատանքային գործընթացների հիման վրա մշակել են սինթետիկ ուսուցման առաջադրանքներ2 և կիրառել ամրապնդումով ուսուցում՝ օգնելու մոդելներին բարելավվել գործնական վարժությունների և հետադարձ կապի միջոցով։ Աշխատանքին քաջատեղյակ մասնագետների հետ ընտրված առաջադրանքների, մանրամասն չափանիշների և մոդելների վարժվելու միջավայրի համադրությունն ապահովում է, որ մենք բարելավենք մեր հաճախորդների համար առավել կարևոր իրական առաջադրանքների կատարումը։
Մենք համեմատել ենք Astra-ն և GPT‑5.6 Sol-ը՝ Astra-ի համար ընտրելով դատողության Max, իսկ Sol-ի համար՝ Հզոր կարգավորումը։ Հենց այս կարգավորումներով էր յուրաքանչյուր մոդելը ստացել իր ամենաբարձր միավորը։ 11 հետազոտական առաջադրանքներում Astra-ի միջին միավորը կազմել է 55,0%՝ GPT‑5.6 Sol-ի 41,6%-ի դիմաց, իսկ մեկ փորձի գնահատված միջին տևողությունը Sol-ի 37,0 րոպեից նվազել է մինչև Astra-ի 19,2 րոպեն։3 Astra-ի մշակման ընթացքում օգտագործված ներքին մոդելն այս առաջադրանքներում հասել է ավելի բարձր՝ 63,7% արդյունքի, և մենք նպատակ ունենք այս լրացուցիչ բարելավումները ներդնել ապագա մոդելներում։
Ցուցանիշ | GPT‑5.6 Sol | GPT‑6 Astra |
Միջին միավորն ըստ գնահատման չափանիշների | 41,6% | 55,0% |
Մեկ փորձի գնահատված միջին տևողություն | 37,0 րոպե | 19,2 րոպե |
Astra-ն բավարարել է առաջադրանքների ավելի շատ պահանջներ՝ յուրաքանչյուր փորձի համար ծախսելով սիմուլյացիայով գնահատված ավելի քիչ ժամանակ։ Ստորև բերված երկու տեսանյութերը ցույց են տալիս, թե ինչպես են մոդելները կատարել նույն հետազոտական առաջադրանքը։ Astra-ն (առաջին տեսանյութում) բավարարել է առաջադրանքի չափանիշների մոտ 94%-ը՝ ըստ գնահատման՝ 20 րոպեում, իսկ GPT‑5.6 Sol-ը (երկրորդում)՝ մոտ 85%-ը՝ 32 րոպեում։
GPT‑6 Astra-ն բավարարել է առաջադրանքի չափանիշների մոտ 94%-ը՝ ըստ գնահատման՝ 20 րոպեում։
GPT‑5.6 Sol-ը բավարարել է առաջադրանքի չափանիշների մոտ 85%-ը՝ ըստ գնահատման՝ 32 րոպեում։
Այս աշխատանքում Ironclad-ի դերն արտացոլում է իր հաճախորդներին քաջ ծանոթ մի խնդիր. պայմանագրային գործընթացը պետք է կարողանա գործ ունենալ բացառությունների հետ՝ պահպանելով բիզնեսի համար կարևոր կանոնները։ Եթե ագենտն առաջադրանքի կատարման ընթացքում մոռանում է այդ կանոններից մեկը, դա սահմանափակում է այն աշխատանքների շրջանակը, որոնք ծրագրային ապահովման ընկերությունը կարող է վստահորեն հանձնարարել նրան։ Սա ընդգծում է, թե ինչու է մարդկային վերահսկողությունը մնում կարևոր, նույնիսկ երբ ագենտներն ավելի լավ են կատարում բարդ պայմանագրային առաջադրանքները, և ինչու է պայմանագրերի կառավարման լիարժեք հարթակը շարունակում անհրաժեշտ լինել։ Մեր հետազոտողների հետ աշխատանքը Ironclad-ին հնարավորություն է տալիս այս խնդիրները ներառել հիմքում ընկած մոդելի մշակման գործընթացում, որտեղ կարող ենք դրանք միասին ուսումնասիրել։
Մոդելների հնարավորությունների ընդլայնմանը զուգահեռ Ironclad-ը կարող է դրանք օգտագործել իր ավելի շատ արտադրանքներում։ Իրավաբանական և բիզնես թիմերի համար սա կարող է նշանակել, որ ԱԲ-ն կստանձնի բարդ պայմանագրային աշխատանքների ավելի մեծ մասը՝ պահպանելով վերահսկողության այն մեխանիզմները, որոնց վրա այդ թիմերը հենվում են։
Հրավիրում ենք ծրագրային ապահովման սահմանափակ թվով ընկերությունների՝ անմիջականորեն աշխատելու մեր հետազոտական և ինժեներական թիմերի հետ կարևոր մասնագիտական առաջադրանքների վրա, որոնք այսօրվա ագենտները դեռ չեն կարող հուսալիորեն կատարել։ Եթե ձեր թիմն ունի նման առաջադրանք, կցանկանայինք տեսնել կոնկրետ օրինակ՝ ինչ եք հանձնարարում ագենտին, ինչ փաստեր են ցույց տալիս, թե որտեղ է այն ձախողվում, և ինչպես կգնահատեիք հաջող արդյունքը։ Գործընկերները պետք է նաև կարողանան ներգրավել աշխատանքը խորությամբ իմացող մասնագետների, տրամադրել փորձարկման անվտանգ միջավայր և տվյալներ, որոնք կարելի է անվտանգ օգտագործել հետազոտության համար։ Սա մեզ ելակետ է տալիս՝ ուսումնասիրելու ձախողումը և չափելու, թե արդյոք մոդելը բարելավվում է։
Եթե ձեր թիմը համապատասխանում է այս նկարագրությանը, դիմեք՝ քննարկելու հետազոտական համագործակցության հնարավորությունը։
Հեղինակ
Ծանոթագրություններ
- 1
- 2
Մենք սիմուլյացիոն առաջադրանքներ ենք ստեղծել SEC-ի EDGAR տվյալների բազայում հանրամատչելի պայմանագրերի հիման վրա՝ նախ կիրառելով անձնական տեղեկությունների հեռացման համար նախատեսված զտիչներ։ Ուսուցման կամ գնահատման համար չենք օգտագործել OpenAI-ի հաճախորդների տվյալները, OpenAI-ի ներքին պայմանագրերը կամ Ironclad-ի հաճախորդների ոչ հրապարակային տվյալներն ու պայմանագրերը։
- 3


