OpenAI мен Hugging Face модельді бағалау кезіндегі қауіпсіздік оқиғасын шешу үшін серіктесті
Өткен аптада Hugging Face өз инфрақұрылымының қауіпсіздігін бұзған ЖИ агентін анықтап, оның әрекетін тоқтатқаннан кейін қауіпсіздік оқиғасының жаңа түрі туралы хабарлады(жаңа терезеде ашылады). Кибермүмкіндіктері барған сайын артып келе жатқан модельдер кеңінен тараған сайын, мұндай оқиғалар жиілейді деп күтеміз. Тергеу нәтижесінде бұл оқиға кибермүмкіндіктер бенчмаркі(жаңа терезеде ашылады) бойынша ішкі тестілеуден өтіп жатқан бірнеше OpenAI моделінің, соның ішінде GPT‑5.6 Sol мен одан да қабілетті, әлі шығарылмаған модельдің бірлескен әрекетінен туындағанын анықтадық. Бағалау мақсатында осы модельдердің барлығында киберқауіпсіздікке байланысты бас тарту шектеулері төмендетілген болатын.
Біз бұл оқиғаны ең заманауи кибермүмкіндіктер қатысқан бұрын-соңды болмаған кибероқиға деп санаймыз және соған сай әрекет етіп жатырмыз. Осы кезеңде қорғаушыларға не болғанын түсінуге және модельдердің қазіргі мүмкіндіктерін дұрыс бағамдауға көмектесу үшін алдын ала қорытындылармен бөлісіп отырмыз. Hugging Face-пен бірге жан-жақты тергеуді жалғастырамыз және тергеу аяқталған кезде осалдықтар, оқиға және қорытындылар туралы көбірек мәлімет бөлісеміз.
Бұл оқиға модельдердің кибермүмкіндіктерін сандық тұрғыдан бағалау мақсатында оларға күрделі шабуыл жолдары арқылы осалдықтарды озық деңгейде пайдалануға бағыттайтын көмексөздер берілетін ішкі бағалау кезінде болды. Модельдердің тәуекелі жоғары киберәрекеттерді орындауына жол бермейтін өндірістік орта жіктеуіштерін қоспай, осы бағалауды жүргізу арқылы олардың ең жоғары кибермүмкіндіктерін анықтаймыз. Бенчмарктеріміз қатаң оқшауланған ортада орындалады. Желіге қолжеткізу пакет тізілімдеріне арналған прокси және кэш ретінде жұмыс істейтін, ішкі ортада орналастырылған үшінші тарап бағдарламалық құралы арқылы пакеттерді орнату мүмкіндігімен ғана шектелген.
Модельдер OpenAI зерттеу ортасы мен Hugging Face өндірістік инфрақұрылымындағы бірнеше осалдықты анықтап, оларды өзара байланыстырып пайдалану арқылы сынақ тапсырмаларының дайын шешімдерін тікелей Hugging Face өндірістік дерекқорынан алды. Барлық дерек модельдердің ExploitGym тапсырмасының шешімін табуға шамадан тыс шоғырланып, ауқымы тар сынақ мақсатына жету үшін төтенше әрекеттерге барғанын көрсетеді.
Оқшауланған тестілеу ортамызда жұмыс істеген кезде модельдер бағалау тапсырмасын шешу үшін ашық интернетке шығу жолын табуға айтарлықтай инференстік есептеу ресурсын жұмсады. Қолжеткізу үшін модельдер пакет тізілімінің кэш-проксиіндегі нөлдік күндік осалдықты анықтап, пайдаланды. Біз бұл осалдық туралы жеткізушіге белгіленген тәртіппен хабарладық. Осыдан кейін модельдер интернетке қолжетімді түйінге жеткенге дейін зерттеу-тестілеу ортамызда жүйелік құқықтарын жоғарылату және желі ішінде басқа ресурстарға өту әрекеттерін бірнеше рет орындады.
Интернетке қол жеткізгеннен кейін модельдер Hugging Face платформасында ExploitGym-ге арналған модельдер, дерекжиындар және шешімдер орналастырылуы мүмкін деген қорытындыға келді. Осыны түсінген модель бағалау нәтижесін бұрмалау үшін қолдануға болатын құпия ақпаратқа қол жеткізу жолдарын іздеп, оларды сәтті тапты. Бір жағдайда модель ұрланған тіркелгі деректері мен нөлдік күндік осалдықтарды пайдалануды қоса алғанда, бірнеше шабуыл векторын өзара байланыстырып, Hugging Face серверлерінде қашықтан код орындауға мүмкіндік беретін жолды анықтады. OpenAI қауіпсіздік тобы бұл қалыптан тыс әрекетті ішкі бақылау барысында анықтады.
Hugging Face қауіпсіздік тобы мен агенттері өз инфрақұрылымындағы әрекетті анықтап, тоқтатты. Командаларымыз байланысқа шыққан кезде олар өздерінің ашық бастапқы кодты модельдерін пайдаланып, оқиғаны оқшаулау және оның барысын криминалистикалық тұрғыдан қайта құру жұмыстарын бастап қойған еді. Оқиғаны одан әрі тергеу үшін олармен белсенді жұмыс істеп жатырмыз. Тергеу мен осалдықтарды жою бойынша Hugging Face-тің жедел әрі тығыз ынтымақтастығына ризамыз.
- Тергеу аясында осалдықтар түзетілгенге дейін зерттеу қарқынын баяулатуға тура келсе де, инфрақұрылым конфигурациясына қатаң бақылау тетіктерін енгізіп жатырмыз. Осы бақылау тетіктері мен олардың әсері туралы қауіпсіздік және қорғаныс комитетіне тұрақты түрде есеп беріп отырамыз.
- Оқиғаны цифрлық криминалистика әдістерімен тергеу үшін Hugging Face-пен бірлесіп жұмыс істеп жатырмыз.
- Ішкі инфрақұрылымда орналастырылған үшінші тарап бағдарламалық құралынан анықталған нөлдік күндік осалдық туралы жауапты жариялау қағидаттарына сай хабарладық. Қазір бағдарламалық құрал жеткізушісімен бірге осалдықты түзету жұмыстарын жүргізіп жатырмыз.
- Біз Hugging Face-ті Сенімді қолжеткізу бағдарламасына қостық және олардың командаларына қорғаныс тетіктерін жақсарту үшін модельдеріміздің мүмкіндіктерін жедел қолдануға қолдау көрсетіп жатырмыз.
- Алдағы оқыту және бағалау үдерістеріне арналған қорғаныс шараларын жетілдіріп, қосымша күшейтілген қауіпсіздік тетіктерін енгізіп жатырмыз. Осы аптада ұзақ мерзімді тапсырмаларды орындайтын модельдер дәуірінде қауіпсіздік пен сәйкестікті жақсарту туралы блог жарияладық. Бұл бағалау киберосалдықтарды тексеруге бағытталғандықтан, өрістету кезінде қолданылатын қауіпсіздік тетіктері әдейі қосылмады. Бұл оқиға модельдің қауіпсіздік талаптарына сәйкестігін, бағалау кезіндегі киберқорғанысты және ішкі тестілеу барысындағы мониторингті одан әрі күшейту қажет екенін көрсетті.
Жақында бөліскеніміздей, ЖИ осалдықтарды анықтау мен пайдалануды жеделдетіп жатыр. Бұл оқиғадан шығатын негізгі қорытынды — модельдердің қорғалуы мен қауіпсіздігі олардың қарқынды дамып жатқан мүмкіндіктерімен қатар жетілдірілуі керек. Модельдерді әзірлеу кезінде қолданылатын оқшаулау, мониторинг, қолжеткізуді басқару және бағалау тәжірибелерін күшейтіп жатырмыз.
UK AISI бағалауы GPT‑5.6 Sol сияқты модельдердің күрделі, көп кезеңді кибероперацияларды ұзақ уақыттық ауқымдарында барған сайын тұрақты түрде жүргізе алатынын көрсетеді. Бұл оқиға осы теориялық мүмкіндіктердің нақты жағдайларда да іске асатынын аңғартады.

Бұл оқиға озық модельдердің бастапқы кодқа қол жеткізбестен нақты жүйелердегі жаңа шабуыл бағыттарын анықтап, пайдалана алатынын да айқын көрсетті. Озық кибермүмкіндіктер күшейтілген қауіпсіздік тетіктерімен және қорғаныс құралдарымен қатар әзірленуі керек.
Киберқауіпсіздік саласында озық мүмкіндіктері бар модельдер қауіпсіздік топтарына әлсіз тұстарды шабуылдаушылардан бұрын анықтауға, бірнеше осалдықтың өзара қалай байланыстырылып пайдаланылатынын түсінуге және оларды машиналық жылдамдықпен жоюға көмектесуі керек деп санаймыз. Бұл мүмкіндіктерді инфрақұрылым конфигурациясы мен модельдерді бағалау орталарының қорғанысын одан әрі күшейту үшін пайдаланып жатырмыз. Жаңа мәліметтер алған сайын қорытындыларымыз бен озық тәжірибелерімізді бөлісетін боламыз. Басқа қорғаныс мамандарын сенімді қолжеткізу бағдарламасына өтінім беруге және осы модельдерді қазірден сынап көруге шақырамыз. Бұл қауіптердің алдын алуды жақсартуға, оларды жылдамырақ анықтауға және оқиғаларға тиімдірек ден қоюға мүмкіндік береді.
«Осы және өзге мәселелер бойынша OpenAI-мен бірлесіп жұмыс істеп жатқанымызға ризамыз. Өз санатындағы алғашқы оқиға болуы ықтимал бұл жағдай біз көптен бері сеніп келген қағиданы дәлелдейді: ЖИ қауіпсіздігі мәселесін жасырын жұмыс істейтін бір ғана компания шеше алмайды. Оны ашық әрі бірлескен жұмыс арқылы, әлемнің кез келген жеріндегі әрбір қорғаушыға ЖИ-ға кең қолжетімділік беру арқылы ғана шеше аламыз».


