Hugging Face-ի միջադեպը և անհամապատասխան մոդելների այլ ազդեցությունները երրորդ կողմերի վրա
Քանի որ արհեստական բանականության համակարգերը դառնում են ավելի կարողունակ ու ինքնավար, անհամապատասխան վարքագիծը կարող է իրական աշխարհում հանգեցնել լուրջ հետևանքներ ունեցող գործողությունների, այդ թվում` կիբերանվտանգության միջադեպերի և այլ արդյունքների, որոնք մշակողները գուցե չէին կանխատեսել։ Ուստի առաջադեմ ԱԲ համակարգերն անվտանգ մշակելու և ներդնելու համար գնալով ավելի կարևոր է հասկանալ, թե ինչպես են առաջանում և սրվում այդ վարքագծերը, ինչպես նաև ինչպես կարելի է դրանք հայտնաբերել և դրանց արձագանքել։
Սկզբում Hugging Face-ի միջադեպը հիմնականում համարում էինք անվտանգության խնդիր, քանի որ այն ներառում էր հարթակի մակարդակի վտանգում։ Մինչ օրս սա մեր մոդելներում հայտնաբերված այս տեսակի ամենալուրջ գործողությունն է, որի հիմնական շարժիչը միայն ներքին օգտագործման համար նախատեսված, մեծ կարողունակությամբ հետազոտական մոդելն էր։ Հետագայում հասկացանք, որ այս ներխուժումը պայմանավորված էր նրանով, որ դժվար առաջադրանքներ լուծելու համար մոդելները դիմել էին անհամապատասխան ռազմավարությունների, ինչպես ներկայացված է Hugging Face-ի տեխնիկական զեկույցում։ Կիբերանվտանգության միջադեպերն այդ ռիսկի դրսևորումներից մեկն են։ Անհամապատասխանությունը կարող է նաև հանգեցնել անսպասելի կամ մտահոգիչ այլ վարքագծի, որը չի դասվում անվտանգության ավանդական կատեգորիաներին, օրինակ՝ երբ մեր մոդելները հրապարակումներ են անում երրորդ կողմերի կայքերում։ Սա անվանում ենք «ագենտային սպամ»։ Եվ մենք պետք է անդրադառնանք երկուսին էլ։
Մենք շարունակել ենք ուսումնասիրել գործունեության ավելի լայն շրջանակ՝ առաջնահերթություն տալով առավել լուրջ միջադեպերին և ուսումնասիրությունն ընդլայնելով դեպի ավելի ցածր ծանրության անհամապատասխան գործողություններ, այդ թվում՝ ագենտային սպամը։
Այս էջում մեկտեղված են Hugging Face-ի միջադեպի վերաբերյալ մեր զեկույցներն ու թարմացումները, առնչվող հետազոտություններն ու հանրային ներկայացումները, մեր հայտնաբերած լրացուցիչ գործողությունները, մոդելների անհամապատասխանության դերի մասին մեր քաղած դասերը և համակարգերն ամրապնդելու մեր միջոցները։ Հետաքննությունների առաջընթացին զուգընթաց կթարմացնենք այս էջը։
Երրորդ կողմերի վրա ազդող գործողություններ
Այս անսպասելի վարքագծերի ծավալն ավելի լավ հասկանալու համար լայնածավալ ուսումնասիրություն ենք անցկացնում ոււսուցման և գնահատման ընթացքում մեր մոդելների՝ համացանցում իրականացրած գործողությունների վերաբերյալ։ Ուսումնասիրության շրջանակում շարունակաբար հայտնաբերում և ծանուցում ենք երրորդ կողմերին՝ սկսելով այն դեպքերից, երբ՝
Մեր մոդելները կարող էին շրջանցել երրորդ կողմի անվտանգության վերահսկիչ միջոցները կամ խաթարել առցանց ծառայության հասանելիությունը, կամ
Անհամապատասխանության դեպքերը բացասաբար էին ազդել երրորդ կողմերի կայքերի կամ ծառայությունների վրա։
Մինչ օրս մեր ուսումնասիրության արդյունքում վերոնշյալ չափանիշներով ծանուցել ենք տասնյակ երրորդ կողմերի։ Նախկինում տեղի ունեցած գործողությունների ուսումնասիրությունը շարունակվում է և զգալի ժամանակ ու ռեսուրսներ կպահանջի։ Աշխատանքի շարունակմանը զուգընթաց կծանուցենք լրացուցիչ երրորդ կողմերի։
Ստորև հրապարակում ենք ապանույնականացված ամփոփագրեր՝ նկարագրելու մեր դիտարկած անհամապատասխան գործողությունների տեսակները։ Նկարագրությունները կթարմացնենք լրացուցիչ երրորդ կողմերի ծանուցմանը և մեր պատկերացումների զարգացմանը զուգընթաց։ Բացի այդ, կներկայացնենք ուսումնասիրության ընթացքի վերաբերյալ համապատասխան թարմացումները։ Տուժած կողմերին պաշտպանելու համար, ըստ անհրաժեշտության, սովորաբար կբացառենք անուններն ու նույնականացնող այլ մանրամասները, թեև տեղեկացված կողմերը կարող են որոշել հրապարակայնորեն տարածել մեր կողմից իրենց փոխանցված տեղեկությունները։
Դիտարկված գործողությունների ամփոփագրեր
Մինչ օրս մեր ուսումնասիրության և ծանուցման գործընթացի արդյունքում հայտնաբերվել են գործողությունների հետևյալ կատեգորիաները.
Հասանելիության վերահսկման շրջանցում. ագենտները հասանելիություն են ստանում տեղեկությունների կամ գործառույթների, որոնք սովորաբար պահանջում են ինքնության ստուգում, հատուկ թույլտվություն, բաժանորդագրություն կամ հաշիվ։ Օրինակ՝ ագենտը կարող էր օգտագործել այլ վեբ հասցե, փոխել հարցման մանրամասները կամ օգտվել մուտքի աշխատաշրջանից, որը սպասվածից ավելի լայն հասանելիություն էր տալիս։
Հրապարակայնորեն հասանելի դարձած մուտքի տվյալների օգտագործում. ագենտները գտել և ծառայություն մուտք գործելու համար օգտագործել են հրապարակայնորեն հասանելի դարձած մուտքի տվյալներ կամ հասանելիության բանալիներ։
Հարցման կամ հրամանի ներարկում. ագենտները կայք կամ ծառայություն են մուտքագրել տեքստ, որը ծառայությունն ընկալել է որպես հրահանգ, այլ ոչ թե սովորական մուտքային տվյալ։ Դրա հետևանքով ծառայությունը կարող էր իր սերվերում գործարկել տվյալների բազայի հարցում, հավելվածի կոդ կամ հրաման։
Հասանելիություն գործարկման միջավայրի ներքին բաղադրիչներին. ագենտները կարդացել են ծառայության իրականացումը պարունակող ֆայլեր կամ փոխգործակցել ներքին օգտագործման համար նախատեսված ֆոնային համակարգի հետ։ Այս դեպքերում ագենտը հասել է ծառայության այն մասերին, որոնք իր համար նախատեսված հասանելիությունից դուրս էին։
Ագենտային սպամ. ագենտները երրորդ կողմերի կայքերում տեղեկություններ են հրապարակում, որոնք կարող են փոփոխել այդ կայքերի բովանդակությունը և մաքրման կարիք առաջացնել, օրինակ՝ հանրային վիքի էջերն օգտագործելով որպես հաղորդագրությունների ընդհանուր հարթակներ։