Մոդելների մշակման տեմպը կիբերկրիտիկական կարողությունների դարաշրջանում
Վերջին մի քանի շաբաթվա ընթացքում երկու իրադարձություն ընդգծեցին ավելի ու ավելի կարողունակ ԱԲ համակարգերի հետ կապված աճող ռիսկերը OpenAI-Hugging Face միջադեպը և, առանձին, նախնական ապացույցներն այն մասին, որ մեր առաջիկա մոդելներից մեկը՝ Astra-ն, կարող է համապատասխանել Պատրաստվածության շրջանակով սահմանված կիբերանվտանգության կրիտիկական կարողության շեմին: Այս զարգացումները, մեր ներքին հետազոտությունների արագ առաջընթացի հետ մեկտեղ, ավելի հրատապ են դարձրել ուսուցման գործընթացի բոլոր փուլերում մշտադիտարկման, համապատասխանեցման և զսպման պաշտպանական միջոցներն ամրապնդելու մեր աշխատանքը։
Մոդելների կարողությունների աճին զուգահեռ մեծանում են նաև դրանց ներքին մշակման և փորձարկման ռիսկերը։ Մշտադիտարկման, համապատասխանեցման և անվտանգության մեր չափանիշները պետք է առաջ անցնեն այդ ռիսկերից։ Մենք ցանկանում էինք անհրաժեշտ ժամանակ հատկացնել այդ չափանիշներին համապատասխանելու համար, ուստի ժամանակավորապես դանդաղեցրինք մասշտաբավորման տեմպը։ Դրա շրջանակում երկու շաբաթով դադարեցրինք ներդրման համար նախատեսված մեր նորագույն մոդելների՝ ամրապնդմամբ ուսուցումը (RL), մինչ լրացուցիչ ամրապնդում և նախափորձարկումներ էինք անցկացնում մեր հետազոտական միջավայրերում և ընդլայնում մշտադիտարկման համակարգերի ծածկույթը։ Մեր նախատեսած ամենախոշոր առաջադեմ RL գործարկումը դեռևս կասեցված է, մինչ փոքր մասշտաբով ուսուցում և գնահատումներ ենք անցկացնում՝ մոդելի վարքը գնահատելու, պաշտպանական միջոցները վավերացնելու և շարունակելուց առաջ համապատասխանեցման վերաբերյալ ավելի հիմնավոր ապացույցներ հավաքելու։
Համապատասխանեցումը՝ ԱԲ համակարգերի նախատեսված վարքն ու մարդկային վերահսկողությանը ենթարկվելն ապահովելու աշխատանքը, վաղուց մեր հետազոտական ծրագրի առանցքում է։ Այժմ պահանջում ենք համապատասխանեցված վարքի ավելի հիմնավոր ապացույցներ ուսուցման բոլոր փուլերում՝ հիմնվելով արդեն ընթացող հետազոտությունների և գնահատումների վրա։ Ավելի ու ավելի կարողունակ համակարգերի համապատասխանեցվածության պահպանումը մարտահրավեր է, որին պետք է արձագանքի ամբողջ ոլորտը։ Առաջիկա մոդելների առաջընթացից ստացվող ազդակները հստակ ցույց են տալիս, որ մեզ ավելի լայն մոտեցում է պետք, որը հիմնվում է ներկայիս Պատրաստվածության շրջանակի վրա և դուրս գալիս դրա սահմաններից։
Կարծում ենք, որ կարևոր է թափանցիկ ներկայացնել, թե ինչպես է փոխվում մեր մոտեցումը։ Ստորև ներկայացնում ենք մեր հետազոտական գործընթացներում և ենթակառուցվածքում արդեն կատարված փոփոխություններն ու ընթացիկ աշխատանքը։
Ավելի կարողունակ մոդելներ մշակելու մեր մոտեցումը հիմնված է միմյանց լրացնող երեք պաշտպանական միջոցների վրա.
- Մշտադիտարկում, որը հայտնաբերում է մտահոգիչ վարքագիծը և թույլ տալիս արձագանքել դրան։
- Համապատասխանեցում, որը նվազեցնում է վնասակար կամ չարտոնված գործողությունների հավանականությունը։
- Անվտանգության միջոցներ, որոնք սահմանափակում են ԱԲ համակարգերի հասանելիությունն ու ազդեցությունը։
Ակնկալում ենք, որ շուտով անվտանգության աշխատանքների մեծ մասը, ներառյալ այլ մոդելներից պաշտպանությունը, կիրականացնեն մոդելները։ Դա թույլ կտա երեք պաշտպանական միջոցներն էլ մասշտաբավորել մոդելի կարողություններին համընթաց, ինչը վճռորոշ ենք համարում։
Այս պաշտպանական միջոցները կիրառում ենք հետազոտության և ներդրման ողջ ընթացքում՝ հարմարեցնելով դրանք յուրաքանչյուր մոդելի կարողություններին, գործառնական միջավայրին և ռիսկի մակարդակին։
Առաջադեմ մոդելների կիբերանվտանգության կարողությունների աճին զուգահեռ բարձրացնում ենք դրանց ուսուցման և գնահատման միջավայրերի անվտանգության չափանիշները։ Այս չափանիշներին համապատասխանելը պահանջել է զգալի ինժեներական աշխատանք և առաջադեմ հետազոտությունների համար հանգեցրել մեծ ծախսերի ու ուշացումների։ OpenAI-Hugging Face միջադեպից* անմիջապես հետո հետազոտական կլաստերներում դադարեցրինք առաջադեմ մոդելների այն ինֆերենսը, որոնք կարող էին կոդ գործարկել կամ համացանց մուտք ունեցող գործիքներ օգտագործել։ Բավական արագ վերականգնեցինք կոդի գործարկման ավելի սահմանափակ ու անվտանգ ուղին, ապա յուրաքանչյուր աշխատանքային բեռն առանձին ուսումնասիրեցինք՝ պարզելու, թե արդյոք այն կարող է անվտանգ վերսկսվել։ Որոշ հետազոտական աշխատանքային բեռներ վերսկսվեցին այս նոր վերահսկման միջոցներով, իսկ մյուսները լրացուցիչ փոփոխություններ էին պահանջում։
Հաջորդ շաբաթների ընթացքում սահմանել և սկսել ենք կիրառել անվտանգության ավելի խիստ պահանջներ առաջադեմ հետազոտական աշխատանքային բեռների համար։ Օրինակ՝
- Աշխատանքային բեռների մեկուսացում. այժմ պահանջում ենք ավելի խիստ մեկուսացում («սանդբոքսներ») այն աշխատանքային բեռների համար, որոնք գործարկում են մոդելի ստեղծած կամ այլ կերպ անվստահելի կոդ։ Սա վերաբերում է նաև այն ծրագրակազմին, որը կարող է խոցվել մոդելի արդյունքները մշակելիս։
- Ցանցային մեկուսացում. ներդրել ենք լրացուցիչ վերահսկման միջոցներ՝ բարձր ռիսկով և անվստահելի աշխատանքային բեռները համացանցից մեկուսացնելու համար։ Այս միջոցները նախագծել ենք այնպես, որ աշխատանքային բեռի կամ օժանդակ ծառայության մեկանգամյա խափանումն ինքնին չհանգեցնի համացանց կամ այլ ներքին ցանցեր չարտոնված մուտքի:
- Անվտանգության շարունակական փորձարկում. վերակազմավորել ենք մեր միջավայրը՝ հնարավոր խոցելի համօգտագործվող ծառայությունները հեռացնելու, մշտապես գործող արտոնությունները նվազեցնելու և անվտանգության ու վստահության սահմանները բարելավելու համար։ Բարելավում ենք նաև անվտանգության գրանցամատյանները հավաքելու և մշտադիտարկելու մեր կարողությունը։ Վերջապես, ներդրումներ ենք կատարում ավտոմատացման մեջ՝ մեր մոդելներով նմանակված հարձակումների պայմաններում այս սահմաններն անընդհատ փորձարկելու համար։
Այս վերահսկման միջոցները միասին ապահովում են բազմաշերտ պաշտպանություն և օգնում մեր հետազոտական միջավայրը պաշտպանել հարձակումներից։ Այսօր Astra-ին կամ կիբերմոդելներին առնչվող աշխատանքային բեռների համար պահանջում ենք անվտանգության ամենախիստ միջոցները, քանի որ պարզել ենք, որ Astra մոդելները կարող են ունենալ կրիտիկական մակարդակի կիբերկարողություններ։ Այս պաշտպանական միջոցները վերաբերում են նաև կիբերոլորտին առնչվող մյուս բոլոր աշխատանքային բեռներին։
Թեև Astra-ի ուսուցման և գնահատման որոշ աշխատանքներ համապատասխանում են այդ պահանջներին, աշխատանքային բեռների զգալի մասը կասեցված կմնա, մինչև դրանք ամբողջությամբ տեղափոխվեն ու կատարելագործվեն՝ անվտանգության նոր նշաձողին հասնելու համար։ Առաջնահերթ ենք համարում անվտանգության և համապատասխանեցման աշխատանքային բեռներն առաջինը նոր միջավայրեր տեղափոխելը։
Մշտադիտարկումը վաղուց մեր մոդելների մշակման գործընթացի կարևոր մասն է՝ ներառյալ ներքին կոդավորող ագենտների մշտադիտարկումը և երկարատև աշխատաշրջանները։ Մշտադիտարկման մեր ջանքերը հատկապես կենտրոնացած էին առաջադեմ մոդելների ներքին տեղակայումների և առաջադեմ RL ուսուցման գործարկումների վրա։ Դրանք համարում էինք ամենաբարձր ռիսկով աշխատանքային բեռները, քանի որ կարող են համատեղել մոդելի առաջադեմ կարողությունները գործիքների, զգայուն համակարգերի և ներքին կամ արտաքին ցանցերի հասանելիության հետ։ Դրանք չէին կիրառվում գործիքներ օգտագործող ինֆերենսի և ուսուցման բոլոր գործարկումների նկատմամբ։ Մշտադիտարկման նոր համակարգի ներդրմամբ վերանայել և ընդլայնել ենք մեր մոտեցումը։
Մշտադիտարկման նոր համակարգը բազմափուլ է։ Այն սկսվում է ակտիվացման դասակարգիչներից (մոդելի ներքին գործունեությունն ուսումնասիրող հայտնաբերիչներից), որոնք աշխատում են յուրաքանչյուր նմուշառված թոքենի դեպքում և հնարավոր մտահոգությունները փոխանցում ավելի ու ավելի կատարելագործված ու մեծ հաշվողական հզորություն օգտագործող ավտոմատ քննիչներին։ Այդ համակարգերն ուսումնասիրում են գործիքներով կատարված գործողությունները, հասանելի դատողությունը և գործունեության ամբողջ հաջորդականությունը՝ չարտոնված մուտք, տվյալների գողություն, կործանարար վարք ու պաշտպանական միջոցները շրջանցելու փորձեր հայտնաբերելու համար։ Նպատակ ունենք նախազգուշացում ուղարկել մտահոգիչ գործողությունը մշտադիտարկման համակարգով հայտնաբերելուց հետո 30 րոպեի ընթացքում։ Եթե մշտադիտարկման համակարգը հայտնաբերում է անվտանգության կրիտիկական սահմանի հավանական խախտում, ստեղծում է ամենաբարձր առաջնահերթության նախազգուշացում։ Մեր ներկայիս ներդրման դեպքում անվտանգության, պաշտպանվածության և հետազոտական թիմերը շտապ ծանուցում են ստանում։ Եթե նրանք 30 րոպեի ընթացքում չեն կարող վերջնականապես պարզել, որ ազդանշանը կեղծ դրական է, այդ թիմերից ակնկալվում է կասեցնել գործողությունը։
Այս մշտադիտարկումը պարտադիր է Sol-ի կամ ավելի բարձր կարողությամբ մոդելների՝ գործիքներ օգտագործող բոլոր RL ուսուցումների և գնահատումների համար։ Օգոստոսի 7-ին պարզեցինք, որ Astra-ն կարող է կրիտիկական կիբերկարողություններ ունենալ, և դրանից հետո մշտադիտարկման լրացուցիչ պահանջ սահմանեցինք գործիքներ օգտագործող Astra-ի բոլոր արտածումների համար, (ոչ միայն RL ուսուցման և գնահատումների)։
Այս պաշտպանական միջոցները զգալի հաշվողական ռեսուրսներ են պահանջում։ Մեր ներկայիս գնահատմամբ՝ մշտադիտարկման հավելյալ ծախսը կազմում է վերահսկվող ինֆերենսի հաշվողական ռեսուրսների մոտ 20%-ը, թեև արժեքը զգալիորեն տարբերվում է ուսուցման և գնահատման աշխատանքային բեռների միջև։ Այս համակարգի մասին ավելի մանրամասն կպատմենք առաջիկա բլոգային հրապարակման մեջ։
Համապատասխանեցման հետազոտությունը մեր առաքելության առանցքում է։ Մեր առաքելությունն է ապահովել, որ արհեստական ընդհանուր բանականությունն օգուտ բերի ողջ մարդկությանը։ Երբ մոդելները ձեռք բերեն առաջադեմ կարողություններ, օրինակ՝ կիբերհարձակում իրականացնելու ունակություն, և գործեն ավելի բարդ միջավայրերում, չհամապատասխանեցված վարքագծերը՝ պարգևի խաբեությունը (ուսուցման ընթացքում բարձր պարգև ստանալու ուղիներ գտնելը՝ առանց նախատեսված արդյունքին իրականում հասնելու), խաբեությունը կամ չարտոնված մուտքը, ավելի ու ավելի լուրջ ռիսկեր կստեղծեն։
Ամենաբարձր կարողունակությամբ մոդելների RL գործարկումների դեպքում այժմ համապատասխանեցման մեր հիմնական մեթոդները կիրառում ենք ուսուցման գործընթացի ավելի շատ փուլերում։ Դա ներառում է պարգևատրման մոդելների բարելավումը՝ տարբեր առաջադրանքներում ու միջավայրերում վտանգավոր վարքագիծը հայտնաբերելու և դրա դրսևորումը զսպելու համար, մոդելներին իրենց գործողությունների, կարողությունների ու սահմանափակումների մասին ավելի ազնիվ լինելու ուսուցումը և պարգևների, գնահատիչների, գործիքների կամ վերահսկողության թուլությունները շահագործող վարքագծի նվազեցումը։ Ընդլայնում ենք նաև այն վարքագծերի ուսուցման ընդգրկումը, որոնք կարող են վնաս պատճառել, երբ մոդելները փոխազդում են արտաքին համակարգերի կամ ռեսուրսների հետ։
Շարունակում ենք մեծ ներդրումներ կատարել համապատասխանեցման հետազոտությունների մեջ, ընդլայնել գնահատումների ծածկույթը և մեր ստացած արդյունքներն օգտագործել ուսուցումն ու պաշտպանական միջոցները կատարելագործելու համար։ Մոտ ապագայում նախատեսում ենք շատ ավելին ներկայացնել համապատասխանեցման մեր հետազոտությունների մասին՝ ներառյալ մոդելների վարքի վերաբերյալ մեր բացահայտումները և ի հայտ եկած նոր մարտահրավերները։
Մենք կզարգացնենք Պատրաստվածության շրջանակը՝ այս պաշտպանական միջոցները միավորելով ուսուցման և տեղակայման ողջ ընթացքում ու ավելի լավ արտացոլելով ապագա մոդելների կարողությունները և դրանց գործառնական միջավայրերը։ Այդ կարողություններին համընթաց մասշտաբավորվող մեթոդների մշակումը կպահանջի շարունակական ներդրումներ մոդելների աջակցությամբ իրականացվող անվտանգության, ավելի արդյունավետ մշտադիտարկման և համապատասխանեցման հետազոտությունների հետագա առաջընթացի մեջ։ Մեր մոտեցման զարգացմանը զուգահեռ մտադիր ենք ներգրավել արտաքին կազմակերպությունների և ավելի շատ տեղեկություններ կիսել մեր ձեռք բերած արդյունքների մասին։
Առաջադեմ մոդելների կարողություններն արագորեն աճում են։ Դրանք հասկանալու, համապատասխանեցնելու և պաշտպանելու մեր կարողությունները պետք է առաջ անցնեն այդ զարգացումից։
*Առաջիկա շաբաթներին կհրապարակենք մեր ստացած արդյունքներն ամփոփող տեխնիկական զեկույց։

