Անցնել հիմնական բովանդակությանը
OpenAI

30 սեպտեմբերի, 2026 թ.

Ապահովություն

Մոդելների դիստիլյացիայի համակարգված արշավի խափանումը

Բեռնվում է…

Վերջերս մենք հայտնաբերեցինք և խափանեցինք համակարգված արշավ, որի նպատակն էր մեր մոդելներից պաշտպանված դատողություններ կորզելը։ Առաջին նման գործողությունները նկատվել էին հուլիսի առաջին շաբաթվա ընթացքում։ Այս գործունեությունը համապատասխանում է չարամիտ դիստիլյացիայի բնույթին. այն մի մոդելի ելքային տվյալների կամ դատողությունների համակարգված և չարտոնված օգտագործումն է՝ մեկ այլ մոդել ուսուցանելու, վերարտադրելու կամ բարելավելու համար։ Պաշտպանված դատողությունը առաջադրանքի լուծման ընթացքի՝ մոդելի ներքին գրառումն է։ Դրա կորզումը կարող է բացահայտել վերջնական պատասխանում չներառված տեղեկություններ և օգնել ուրիշներին վերարտադրելու մոդելի կարողությունները։

Արշավն իրականացնողները չեն կոտրել մեր գաղտնագրումը, չեն ներխուժել տվյալների բազա և ուղղակի հասանելիություն չեն ստացել օգտատերերի պահված զրույցներին։ Փոխարենը՝ նրանք մանիպուլյացիայի են ենթարկել մոդելների հետ փոխազդեցությունները, որպեսզի պաշտպանված դատողությունները վերարտադրվեն հարցում կատարողին տեսանելի ձևերով։ Դա արվել է համակարգված և մեծ մասշտաբով՝ խախտելով մեր ծառայության օգտագործման պայմանները։ Այս մանիպուլյացիայի հիմքում ընկած խոցելիությունը հատուկ չէ միայն OpenAI-ի մոդելներին։ Մենք դրա մասին տեղեկություններ ենք փոխանցել ոլորտի գործընկերներին Frontier Model Forum-ի միջոցով՝ չարամիտ դիստիլյացիայի դեմ համատեղ պաշտպանությունն ամրապնդելու համար։

Մինչ այս նյութը հրապարակելը մենք ուսումնասիրել ենք գործունեության ծավալն ու հնարավոր ազդեցությունը, ներդրել ռիսկի նվազեցման մեր միջոցները, տեղեկություններով փոխանակվել հետազոտողների ու ոլորտի գործընկերների հետ և ստացել նրանց արձագանքները՝ համոզվելու, որ այս տեսակի հարձակումներից պաշտպանության միջոցներ են գործում։ Ռիսկերի նվազեցման և հետաքննության լրացուցիչ աշխատանքները շարունակվում են։ Կարծում ենք՝ մեր բացահայտումներն այժմ ներկայացնելը կօգնի ամբողջ էկոհամակարգին ամրապնդելու իր պաշտպանությունը։

Ինչ ենք նկատել

Մենք նկատել ենք պաշտպանված դատողությունները նոր եղանակներով կորզելու փորձեր։ Օրինակ՝ արշավն իրականացնողները մի զրույցից պատճենել են գաղտնագրված դատողությունները և մեկ այլ զրույցում մոդելին խնդրել վերծանել ու տեքստով վերարտադրել թաքնված դատողությունների բովանդակությունը։

Անվտանգության անկախ հետազոտողները⁠(բացվում է նոր պատուհանում) նույնպես պատասխանատու բացահայտման ընթացակարգով մեր ուշադրությանն են ներկայացրել մոդելների միջև փոխազդեցությանն ու զրույցի խտացմանն առնչվող հարակից խոցելիություններ։ Մենք ուսումնասիրել ենք նրանց բացահայտումները և հաստատել, որ նրանց հայտնաբերած հարձակման ուղիներն իրական էին։ Նրանց աշխատանքն օգնեց մեզ հասկանալ հարձակումների այս ավելի լայն դասը և արագացնել ռիսկերի նվազեցման միջոցների ներդրումը։

Գործունեությունը սկսվել է հուլիսի 1-ին՝ սկզբում փոքր ծավալով։ Հուլիսի 24-ին և 25-ին մենք նկատել ենք ծավալի կտրուկ աճ՝ ավելի քան 4 000 օգտատերերի կողմից արված 16 000 հարցում1, որոնցում կիրառվել է կորզման համապատասխան ձևանմուշ։ Հետագա հետաքննությամբ հայտնաբերվել է հարցումների հարակից ձևանմուշներով գործունեություն՝ ավելի քան 15 000 օգտատերերից բաղկացած խմբում։ Մինչև հուլիսի 28-ը մենք ամբողջությամբ խափանել ենք այդ գործունեությունը։

Ժամանակի ընթացքում գործունեությունը փոփոխվել է՝ վերահաստատելով, որ չարամիտ դիստիլյացիան անվտանգության ավելի լայն խնդիր է, որը պահանջում է բազմաշերտ, հարմարվող պաշտպանություն։

Ովքեր են կանգնած այս գործունեության հետևում. մեր գնահատականը

Պարզ չէ՝ արդյոք համապատասխան ժամանակահատվածում մեր նկատած բոլոր իրականացնողները գործել են մեկ ընդհանուր կողմի անունից։ Այնուամենայնիվ, գործունեության հիմնական խմբերից մեկը մենք վերագրում ենք Kimi-ն մշակած Moonshot AI-ի հետ կապ ունեցող անձանց։

Ինչու է սա կարևոր

Չարամիտ դիստիլյացիան ռիսկեր է ստեղծում ինչպես ընդհանուր, այնպես էլ ազգային անվտանգության համար։ Կորզված դատողությունները կարող են օգտագործվել մեկ այլ մոդել ուսուցանելու համար՝ առանց պահպանելու սկզբնական մոդելի՝ օգտատիրոջը ցուցադրվող արդյունքների նկատմամբ կիրառվող պաշտպանական միջոցները։ Մեծ մասշտաբով դիստիլյացիան կարող է նաև արագացնել զարգացած կարողությունների փոխանցումը՝ առանց անվտանգության մեջ համարժեք ներդրումներ պահանջելու։ Այս մտահոգություններն ավելի են սրվում, երբ մոդելները կարողություններ են ձեռք բերում երկակի նշանակության ոլորտներում։

Այս ռիսկը հատուկ չէ միայն OpenAI-ին։ Ինչպես նշվեց վերևում, նմանատիպ մեթոդները կարող են ազդել նաև այլ զարգացած ԱԲ համակարգերի վրա։ Ուստի սա անվտանգության ընդհանուր խնդիր է, որը պահանջում է ամբողջ ոլորտի համակարգված աշխատանքը։

Ինչպես ենք արձագանքել

Դիստիլյացիայի այս վերջին արշավը չեզոքացնելու համար մենք համատեղել ենք հաշիվների նկատմամբ պատժամիջոցները, տեխնիկական վերահսկողության միջոցները և գործընկերների հետ համակարգված աշխատանքը։ Մենք արգելափակել կամ սահմանափակել ենք խարդախության համար օգտագործվող հաշիվները, խստացրել գրանցման և ենթակառուցվածքի վերահսկողությունը և ընդլայնել առնչվող ցանցերի մշտադիտարկումը։

Մենք նաև ամրապնդել ենք թաքնված դատողությունների պաշտպանությունը՝ օգտատերերի, աշխատանքային տարածքների, կազմակերպությունների և մոդելների ընտանիքների միջև։ Մենք փակել ենք այն ուղին, որը մեկ այլ օգտատիրոջ գաղտնագրված դատողություններն արդեն ունեցող անձին թույլ էր տալիս դրանք կրկին ներկայացնել մոդելին և վերականգնել բովանդակությունը։ Նաև ավելացրել ենք ստուգումներ՝ հայտնաբերելու և կասեցնելու այն հոսքային ելքային տվյալները, որոնք կարող են բացահայտել դատողությունները։ Երբ հարակից գործունեությունը տեղափոխվել է երրորդ կողմի ծառայություններ, մենք աշխատել ենք այդ ծառայությունները մատուցողների հետ՝ ներգրավված հաշիվները հայտնաբերելու և դրանց գործունեությունը խափանելու համար։

Վերջապես, մենք համապատասխան բացահայտումներով կիսվել ենք Frontier Model Forum-ի և տեղեկությունների փոխանակման համապատասխան պետական ուղիների միջոցով, որպեսզի առաջադեմ մոդելների այլ մշակողներն ու պետական հատվածի գործընկերները կարողանան որոնել նմանատիպ գործունեություն և ամրապնդել սեփական պաշտպանությունը։ Համակարգերը, որոնք թույլ են տալիս տեղափոխել կամ կրկին օգտագործել դատողությունների գրառումները, կարող են բախվել հարակից ռիսկերի։

Հաջորդ քայլերը

Ակնկալում ենք, որ չարամիտ դիստիլյացիայի փորձերն ավելի բարդ կդառնան, քանի որ առաջադեմ մոդելները կատարելագործվում են, իսկ նման գործունեություն իրականացնողները փնտրում են դրանց կարողություններն ընդօրինակելու ավելի էժան եղանակներ։ Այս գործունեությունից պաշտպանվելը պահանջում է վերահսկողության բազմաշերտ միջոցներ և շարունակական հարմարվողականություն։

Այս աշխատանքը դեռ ավարտված չէ։ Գործընկերների ենթակառուցվածքում տեղակայված համակարգերին անհրաժեշտ է նույն պաշտպանությունը, ինչ մեր սեփական ծառայություններին։ Իսկ գործիքների ելքային տվյալների միջոցով հարձակումներից պաշտպանվելու համար պետք է ստուգել ոչ միայն սովորական տեսանելի տեքստը։ Մենք շարունակում ենք բարելավել գործիքների պաշտպանությունը, ընդլայնել դասակարգիչների ծածկույթը, կատարելագործել մոդելների մերժման մեխանիզմները և համապատասխան վերահսկողության միջոցները տարածել ամպային ծառայություններ մատուցող գործընկերների շրջանում։

Մեր արձագանքը կշարունակի կենտրոնանալ երեք ուղղության վրա՝ կորզման դեմ ավելի ուժեղ տեխնիկական պաշտպանություն, համակարգված արշավների ավելի արդյունավետ հայտնաբերում և դրանց դեմ միջոցների կիրառում, ինչպես նաև ոլորտի ու պետական կառույցների միջև սպառնալիքների մասին տեղեկությունների ավելի խորացված փոխանակում։

Հեղինակ

OpenAI

Ծանոթագրություններ

  1. 1

    Այս թվերը վերաբերում են կորզման փորձերին, որոնք պարտադիր չէ, որ հաջողված լինեն։