Негізгі мазмұнға өту
OpenAI

Hugging Face оқиғасы және мақсатқа сай келмейтін модельдердің бөгде тараптарға тигізген басқа әсерлері

ЖИ жүйелері қабілетті әрі дербес болған сайын, олардың мақсатқа сай келмейтін мінез-құлқы нақты әлемде елеулі әрекеттерге, соның ішінде киберқауіпсіздік оқиғалары мен әзірлеушілер болжамаған басқа салдарға әкелуі мүмкін. Сондықтан мұндай мінез-құлықтың қалай пайда болатынын, қалай өршитінін және оны қалай анықтап, оған қалай әрекет ету керектігін түсіну озық ЖИ жүйелерін қауіпсіз әзірлеу мен қолданысқа енгізудің барған сайын маңызды бөлігіне айналуда.

Алғашында Hugging Face оқиғасын негізінен қауіпсіздік мәселесі деп түсіндік, өйткені ол платформа деңгейінің бұзылуына қатысты болды. Бұл — осы уақытқа дейін модельдерімізден анықталған осындай әрекеттердің ең ауыры және оған негізінен тек ішкі зерттеуге арналған, қабілеті жоғары модель себеп болды. Кейін Hugging Face техникалық есебінде көрсетілгендей, бұл басып кіруге модельдердің күрделі тапсырмаларды шешу үшін мақсатқа сай келмейтін стратегияларға жүгінуі себеп болғанын түсіндік. Киберқауіпсіздік оқиғалары — осы қатердің бір көрінісі; мақсатқа сай келмеу дәстүрлі қауіпсіздік санаттарына жатпайтын басқа да күтпеген немесе алаңдатарлық мінез-құлыққа, мысалы модельдеріміздің бөгде сайттарға жазба жариялауына әкелуі мүмкін. Мұны біз «агент спамы» деп атаймыз. Біз екеуін де шешуіміз керек.

Біз ауқымды әрекеттерді тексеруді жалғастырып, анағұрлым ауыр оқиғаларға басымдық бердік және тексеруді агент спамын қоса алғанда, ауырлығы төмен мақсатқа сай келмейтін әрекеттерге дейін кеңейттік.

Бұл бетте Hugging Face оқиғасы туралы есептеріміз бен жаңартуларымыз, қатысты зерттеулер мен көпшілікке арналған таныстырылымдар, біз анықтаған қосымша әрекеттер, модельдердің мақсатқа сай келмеуінің рөлі туралы білгеніміз және жүйелерімізді нығайту шаралары жинақталған. Тергеулеріміз ілгерілеген сайын бұл бетті жаңартып отырамыз.


Бөгде тараптарға әсер еткен әрекеттер

Бұл күтпеген мінез-құлықтың ауқымын жақсырақ түсіну үшін оқыту және бағалау кезіндегі модельдеріміздің интернеттегі әрекеттеріне кең ауқымды тексеру жүргізіп жатырмыз. Тексеру аясында төмендегі жағдайлардан бастап, бөгде тараптарды кезең-кезеңімен анықтап, хабардар етіп жатырмыз:

  • Модельдеріміз бөгде тараптың қауіпсіздік бақылауларын айналып өтуі немесе онлайн қызметтің қолжетімділігіне нұқсан келтіруі мүмкін болған жағдайлар; немесе

  • Мақсатқа сай келмеу жағдайлары бөгде тараптардың веб-сайттарына немесе қызметтеріне теріс әсер еткен кездер.

Осы кезге дейінгі тексеруіміздің нәтижесінде жоғарыдағы өлшемдер бойынша ондаған бөгде тарапқа хабарладық. Бұрынғы әрекеттерді тексеру жалғасуда және оған көп уақыт пен ресурс қажет. Жұмыс жалғасқан сайын қосымша бөгде тараптарға хабарлаймыз.

Төменде біз байқаған мақсатқа сай келмейтін әрекеттердің түрлерін сипаттайтын анонимделген түйіндемелерді жариялаймыз. Қосымша бөгде тараптарға хабарлаған және түсінігіміз кеңейген сайын бұл сипаттамаларды жаңартып отырамыз. Сонымен қатар тексеру барысы туралы маңызды жаңартулармен бөлісеміз. Зардап шеккен тараптарды қорғау қажет болған жағдайда атаулар мен тұлғаны анықтайтын басқа мәліметтерді әдетте көрсетпейміз. Дегенмен хабардар етілген тараптар біз берген ақпаратты көпшілікке жариялауды таңдай алады.

Бақыланған әрекеттердің түйіндемесі

Осы кезге дейінгі тексеру және хабарлау үдерісінде әрекеттердің мына санаттары анықталды:

  • Қолжетімділікті бақылауды айналып өту: Агенттер әдетте жеке басын тексеруді, арнайы рұқсатты, жазылымды немесе аккаунтты қажет ететін ақпаратқа не функцияларға қол жеткізеді. Мысалы, агент басқа веб-мекенжайды пайдаланған, сұраудағы мәліметтерді өзгерткен немесе күтілгеннен кеңірек қолжетімділік берген кіру сеансына сүйенген.

  • Ашық жарияланған тіркелгі деректерін пайдалану: Агенттер көпшілікке қолжетімді болған кіру деректерін немесе қолжетімділік кілттерін тауып, оларды қызметке кіру үшін пайдаланды.

  • Сұрау немесе пәрмен инъекциясы: Агенттер веб-сайтқа немесе қызметке мәтін енгізіп, қызмет оны кәдімгі кіріс деректері емес, нұсқау ретінде қабылдады. Соның салдарынан қызмет дерекқор сұрауын, қолданба кодын немесе өз серверіндегі пәрменді орындауы мүмкін.

  • Орындалу ортасының ішкі бөліктеріне қол жеткізу: Агенттер қызметтің іске асырылуы жазылған файлдарды оқыды немесе ішкі пайдалануға арналған фондық жүйемен әрекеттесті. Бұл жағдайларда агент қызметтің өзіне арналмаған бөліктеріне қол жеткізді.

  • Агент спамы: Агенттер бөгде сайттарға ондағы ақпаратты өзгертіп, тазалауды қажет етуі мүмкін мәліметтер жариялайды. Мысалы, жалпыға қолжетімді вики-беттерді ортақ хабар алмасу тақтасы ретінде пайдаланады.


Оқиғалар хронологиясы

Қыркүйек

Тамыз

Шілде