Անցնել հիմնական բովանդակությանը
OpenAI

21 հուլիսի, 2026 թ.

Ապահովություն

OpenAI-ն և Hugging Face-ը համատեղ լուծում են մոդելի գնահատման ժամանակ անվտանգության միջադեպը

Բեռնվում է…

Մենք իրականացնում ենք մանրակրկիտ ուսումնասիրություն արտաքին խորհրդատուների հետ համատեղ և Անվտանգության և ապահովության կոմիտեի վերահսկողությամբ։ Վերանայման ավարտից հետո առաջիկա շաբաթներին կհրապարակենք մեր քաղած դասերի վերաբերյալ տեխնիկական զեկույց։

Թարմացում՝ 2026 թվականի հուլիսի 28-ին:

  • Առաջիկա թողարկման համար նախատեսված ոչ մի մոդել ներգրավված չի եղել Hugging Face-ի շահագործման մեջ։ Մեր բլոգային գրառման մեջ հիշատակված նախաթողարկման մոդելը միայն ներքին օգտագործման համար նախատեսված հետազոտական նախատիպ է և երբեք նախատեսված չի եղել հանրային թողարկման համար։ Միջադեպից հետո մենք այն ապաակտիվացրինք, գաղտնագրեցինք և սահմանափակեցինք դրա հասանելիությունը հետազոտական մուտքից։
  • ExploitGym-ի գնահատման միջավայրը մոդելներին ուղղակի ինտերնետ հասանելիություն չէր տրամադրում։ Ինտերնետ հասանելիություն ստանալու համար մոդելները հայտնաբերել և շահագործել են Artifactory(բացվում է նոր պատուհանում)-ում առկա՝ նախկինում անհայտ զերո-դեյ խոցելիություն, որը փաթեթների ռեեստրի քեշավորման պրոքսի է։ Մենք այս խոցելիության մասին, ինչպես նաև մեր ուսումնասիրության շրջանակներում մեր մոդելների հայտնաբերած Artifactory-ի այլ խոցելիությունների մասին, հայտնել ենք մատակարարին։ 
  • Մենք շարունակում ենք համագործակցել Hugging Face-ի հետ, այդ թվում՝ նպաստելով նրանց հետդեպքային վերլուծությանը(բացվում է նոր պատուհանում), մինչ մեր ուսումնասիրությունը շարունակվում է։ Մենք նրանց նաև ներառել ենք մեր «Կիբերպաշտպանության վստահելի հասանելիություն» ծրագրում։ 
  • Մինչ օրս իրականացված մեր ուսումնասիրության հիման վրա՝ մենք չենք հայտնաբերել որևէ այլ ակտիվություն, որը ծանրությամբ կամ մասշտաբով համարժեք լինի Hugging Face-ի առնչությամբ մեր ներկայացրած դեպքին, որն ընդգրկում էր հարթակի մակարդակի կոմպրոմետացում։
  • Hugging Face-ի ներխուժման և մեր մոդելների ավելի լայն գործունեության շարունակական ուսումնասիրության ընթացքում մենք հայտնաբերել ենք փոքրաթիվ դեպքեր, երբ մոդելները նույնականացրել և օգտագործել են այլ հանրային հասանելի ծառայություններում հաշվի մակարդակի հրապարակայնորեն բացահայտված հավատարմագրեր։ Սա ներառում է չորս հաշիվ չորս ծառայություններում՝ որպես Hugging Face-ի միջադեպի մաս (և մի քանի հաշիվ, որոնց հասանելիություն է ստացվել այլ գնահատումների շրջանակում)։ Այս չորս հաշիվներից մեկն օգտագործվել է որպես ելքային փոխանցման ռելե և միջանկյալ տեղակայման ուղի, իսկ մեկ այլ հաշիվ օգտագործվել է տվյալների պահպանման համար։ Մնացած երկու հաշիվներին մոդելները մուտք են գործել միայն կարդալու ռեժիմով, և դրանք չեն օգտագործվել Hugging Face-ի վտանգմանը նպաստելու նպատակով։ Մենք կշարունակենք անմիջապես ծանուցել ծառայությունների սեփականատերերին և չենք տեսել ապացույցներ, որ այս մատակարարների կամ նրանց ծառայություններում առկա այլ հաշիվների վրա ավելի լայն ազդեցություն է եղել։
  • Մոդելները լրացուցիչ օգտագործել են մի շարք հանրայինորեն հասանելի ծառայություններ, ներառյալ կոդի տեղադրման կայքեր, հարցումների գրանցման ծառայություններ, սքրինշոթի ծառայություններ և այլ վեբ գործիքներ։ Այս դեպքերում հարթակի կամ հաշվի մակարդակով խախտում չի եղել։ 
  • Մենք լրջորեն ենք վերաբերվում մեր պատասխանատվությանը՝ բացահայտելու և պատրաստվելու ավելի ու ավելի հզոր արհեստական բանականության համակարգերից բխող ռիսկերին։ Մեր վերանայումն ավարտելուց հետո մենք այն կքննարկենք Անվտանգության և ապահովության կոմիտեի և Անվտանգության խորհրդատվական խմբի հետ՝ մեր Պատրաստվածության շրջանակի ներքո։

Անցյալ շաբաթ Hugging Face-ը հայտնեց նոր տեսակի անվտանգության միջադեպի մասին(բացվում է նոր պատուհանում) իրենց ենթակառուցվածք ներխուժած և վտանգած ԱԲ ագենտին հայտնաբերելուց և զսպելուց հետո: Մենք ակնկալում ենք, որ նման դեպքերը ավելի սովորական կդառնան կիբեռ կարողություններով օժտված մոդելների տարածման հետ մեկտեղ։ Հետաքննությունից հետո այժմ գիտենք, որ այս կոնկրետ միջադեպը պայմանավորված էր OpenAI մոդելների համակցված գործարկմամբ՝ ներառյալ GPT‑5.6 Sol-ը և նախաթողարկման փուլում գտնվող ավելի հզոր մոդելը: Բոլոր այս մոդելները գնահատման նպատակներով ունեին կիբերանվտանգության հետ կապված սահմանափակումների նվազեցված մերժումներ, երբ ներքին փորձարկում էին անցնում կիբեռ կարողությունների բենչմարքի(բացվում է նոր պատուհանում) շրջանակում։

Մենք այս միջադեպը համարում ենք նորագույն կիբեռ հնարավորություններով օժտված աննախադեպ կիբեռմիջադեպ և դրան արձագանքում ենք համապատասխանաբար։ Այս փուլում կիսվում ենք նախնական բացահայտումներով, որպեսզի օգնենք պաշտպաններին հասկանալ, թե ինչ է տեղի ունեցել, և ավելի ճիշտ գնահատել, թե մոդելներն այժմ ինչի են ունակ։ Մենք կշարունակենք Hugging Face-ի հետ համատեղ իրականացնել մանրակրկիտ հետաքննություն և մեր հետաքննության ավարտից հետո ավելի շատ մանրամասներ կհայտնենք խոցելիությունների, միջադեպի և բացահայտումների մասին:

Ինչ տեղի ունեցավ այս միջադեպի ընթացքում

Այս միջադեպը տեղի ունեցավ ներքին գնահատման ընթացքում, որտեղ մոդելներին հարցումներ են տրվում՝ կիրառել առաջադեմ շահագործում բարդ հարձակման ուղիներով՝ նրանց կիբեռ կարողությունները քանակապես չափելու նպատակով։ Մենք առավելագույն կիբեռ կարողությունները գնահատում ենք՝ այս գնահատումն իրականացնելով առանց արտադրական դասակարգիչների, որոնք օգտագործվում են մոդելներին բարձր ռիսկային կիբեռ գործունեությունից զերծ պահելու համար։ Մեր բենչմարքերն աշխատում են խիստ մեկուսացված միջավայրում, որտեղ ցանցային հասանելիությունը սահմանափակված է փաթեթների տեղադրմամբ՝ ներքին հոսթինգով գործող երրորդ կողմի ծրագրաշարի միջոցով, որը ծառայում է որպես պրոքսի և քեշ փաթեթների պահոցների համար։

Մոդելները հայտնաբերեցին և շղթայաբար կապակցեցին OpenAI-ի հետազոտական միջավայրի և Hugging Face-ի արտադրական ենթակառուցվածքի խոցելիությունները՝ փորձարկման լուծումները անմիջապես Hugging Face-ի արտադրական տվյալների բազայից ստանալու համար։ Բոլոր ապացույցները վկայում են, որ մոդելները գերկենտրոնացած էին ExploitGym-ի լուծում գտնելու վրա՝ դիմելով ծայրահեղ քայլերի բավականին նեղ փորձարկման նպատակին հասնելու համար։

Մեր մեկուսացված փորձարկման միջավայրում աշխատելիս մեր մոդելները գնահատման խնդիրը լուծելու նպատակով զգալի ծավալի հաշվարկային ռեսուրսներ են ծախսել բաց ինտերնետ հասանելիություն ստանալու միջոց գտնելու վրա։ Հասանելիություն ստանալու համար մոդելները հայտնաբերեցին և շահագործեցին zero-day խոցելիություն փաթեթների պահոցի քեշավորման միջնորդ սերվերում, (որի մասին մենք արդեն պատասխանատու կերպով հայտնել ենք մատակարարին)։ Այս հասանելիությամբ մեր մոդելները մեր հետազոտական փորձարկման միջավայրում իրականացրին արտոնությունների բարձրացման և կողմնային տեղաշարժի մի շարք գործողություններ, մինչև հասան ինտերնետ հասանելիությամբ հանգույցի։

Ինտերնետ հասանելիություն ստանալուց հետո մոդելները եզրակացրին, որ Hugging Face-ը հնարավոր է հոսթավորում է մոդելներ, տվյալների հավաքածուներ և ExploitGym-ի լուծումներ։ Սա իմանալով՝ մոդելը որոնեց և հաջողությամբ գտավ գաղտնի տեղեկություններին հասանելիություն ստանալու ուղիներ, որոնք կարող էր օգտագործել գնահատումը շրջանցելու համար։ Օրինակներից մեկում մոդելը շղթայեց մի քանի հարձակման վեկտորներ, այդ թվում՝ գողացված հավատարմագրերի և zero-day խոցելիությունների օգտագործումը՝ Hugging Face-ի սերվերներում հեռակա կոդի կատարման ուղի գտնելու համար։ OpenAI-ի անվտանգության թիմը ներքին կարգով հայտնաբերեց այս անոմալ ակտիվությունը։

Hugging Face-ի անվտանգության թիմն ու ագենտները իրենց ենթակառուցվածքում հայտնաբերեցին և կանգնեցրին ակտիվությունը և, մինչև մեր թիմերի կապ հաստատելը, արդեն սկսել էին զսպումն ու քրեագիտական վերակազմավորումը իրենց բաց կոդով մոդելների միջոցով։ Մենք ակտիվորեն աշխատում ենք նրանց հետ՝ միջադեպի հետաքննությունը շարունակելու համար։ Մենք երախտապարտ ենք Hugging Face-ին հետաքննության և շտկման հարցերում արագ և սերտ համագործակցության համար։

Գործողություններ, որոնք ձեռնարկում ենք հիմա

  1. Հետաքննության շրջանակում ենթակառուցվածքի կազմաձևումներում ներդնում ենք խիստ վերահսկողական միջոցներ հետազոտական աշխատանքի արագության որոշակի նվազման գնով, մինչև խոցելիությունները շտկվեն։ Մենք պարբերաբար տեղեկացնում ենք մեր Անվտանգության և պաշտպանության կոմիտեին այս վերահսկողությունների և դրանց ազդեցության մասին։
  2. Մենք աշխատում ենք Hugging Face-ի հետ՝ միջադեպի դատափորձագիտական հետաքննություն իրականացնելու նպատակով։
  3. Մենք պատասխանատու կերպով հայտնել ենք ներքին հոսթինգով գործող երրորդ կողմի ծրագրաշարում հայտնաբերված zero-day խոցելիության մասին և աշխատում ենք նրանց հետ՝ այն շտկելու ուղղությամբ։
  4. Մենք Hugging Face-ին ներգրավել ենք վստահելի հասանելիության ծրագրում և աջակցում ենք նրանց թիմերին՝ արագորեն օգտագործելու մեր մոդելների կարողությունները իրենց պաշտպանությունն ուժեղացնելու համար։
  5. Մենք բարելավում և ավելացնում ենք ավելի ուժեղ պաշտպանություններ ապագա ուսուցման և գնահատումների շուրջ։ Այս շաբաթ հրապարակեցինք բլոգային գրառում երկարաժամկետ հորիզոնով մոդելների դարաշրջանում անվտանգության և համապատասխանեցման բարելավման մասին։ Այս տեղակայման պաշտպանիչ միջոցները միտումնավոր միացված չէին այս գնահատման ընթացքում, քանի որ այն նպատակ ուներ ստուգել կիբեռանվտանգության խոցելիությունները։ Այս միջադեպը ցույց է տալիս, որ պետք է էլ ավելի ուժեղացնել մեր մոդելի համապատասխանեցումը, կիբեռանվտանգության պաշտպանությունը գնահատման ժամանակ և մոնիթորինգը ներքին փորձարկումների ընթացքում։

Մեր մոտեցումը առաջադեմ կիբեռ կարողությունների գնահատմանը

Ինչպես վերջերս հայտնել էինք, ԱԲ-ն արագացնում է խոցելիությունների հայտնաբերումն ու շահագործումը։ Այս միջադեպի հիմնական դասն այն է, որ մոդելների պաշտպանվածությունն ու անվտանգությունը պետք է համընթաց լինեն արագ զարգացող կարողություններին։ Մենք ուժեղացնում ենք մոդելի մշակման ընթացքում կիրառվող մեկուսացման, մոնիթորինգի, հասանելիության վերահսկման և գնահատման գործելակերպերը։

Միացյալ Թագավորության AISI-ի գնահատումը ցույց է տալիս, որ GPT‑5.6 Sol-ի նման մոդելներն ավելի ու ավելի ունակ են երկար ժամանակային հորիզոններում շարունակելու բարդ, բազմաքայլ կիբեռ գործողություններ։ Այս միջադեպը վկայում է, որ այդ տեսական կարողությունները կիրառելի են նաև իրական միջավայրերում։

Միացյալ Թագավորության ԱԲ անվտանգության ինստիտուտի գծապատկեր, որը համեմատում է վերջին բաց քաշի մոդելներն ու առաջադեմ մոդելները երկար ժամանակային հորիզոնով կիբեռ տիրույթներում։

Միջադեպը նաև հստակ ցույց է տալիս, որ առաջադեմ մոդելները կարող են իրական համակարգերում գտնել և շահագործել հարձակման նոր ուղիներ՝ առանց ելակոդին հասանելիություն ունենալու։ Այն ընդգծում է, որ առաջադեմ կիբեռ կարողությունները պետք է զարգացվեն ավելի ուժեղ պաշտպանիչ միջոցների և պաշտպանական գործիքների հետ մեկտեղ։

Մենք կարծում ենք, որ կիբեռանվտանգության առաջադեմ կարողություններով օժտված մոդելները պետք է օգնեն անվտանգության թիմերին գտնել խոցելիությունները նախքան հարձակվողները, հասկանալ, թե ինչպես կարելի է խոցելիությունները շղթայակցվել, և դրանք վերացնել մեքենայական արագությամբ։ Մենք օգտագործում ենք այս հնարավորությունները՝ շարունակելու ամրապնդել ենթակառուցվածքի կազմաձևման և մոդելի գնահատման միջավայրերի պաշտպանությունները: Ուսումնասիրմանը և սովորելուն զուգընթաց` մենք կկիսվենք մեր ձեռքբերումներով ու լավագույն փորձի օրինակներով։ Մենք խրախուսում ենք մյուս պաշտպաններին դիմել վստահելի հասանելիության համար և արդեն հիմա փորձարկել այս մոդելները՝ այդ կարողությունները վերածելու ավելի լավ կանխարգելման, ավելի արագ հայտնաբերման և միջադեպերին ավելի արդյունավետ արձագանքման։

«Մենք երախտապարտ ենք OpenAI-ի հետ այս և այլ թեմաների շուրջ համագործակցության համար։» Այս միջադեպը, հնարավոր է՝ իր տեսակի մեջ առաջինը, հաստատում է այն համոզմունքը, որին մենք վաղուց ենք հավատում. արհեստական բանականության անվտանգությունը չի լուծվի գաղտնի աշխատող որևէ առանձին ընկերության կողմից։ «Դա կլուծվի բաց և համագործակցային ձևով՝ արհեստական բանականությանը լայն հասանելիություն ապահովելով յուրաքանչյուր պաշտպանի համար՝ ամենուր։»
Քլեմ Դելանգ, համահիմնադիր և գլխավոր գործադիր տնօրեն, Hugging Face

Հեղինակ

OpenAI