Инцидентът с Hugging Face и други последици за трети страни от несъгласувани модели
С нарастването на възможностите и автономността на системите с ИИ несъгласуваното поведение може да доведе до значими действия в реалния свят, включително инциденти в киберсигурността и други последици, които разработчиците може да не са предвидили. Затова разбирането как възниква и ескалира подобно поведение и как то да бъде откривано и овладявано става все по-важна част от безопасното разработване и внедряване на усъвършенствани системи с ИИ.
Първоначално възприемахме инцидента с Hugging Face най-вече като проблем със сигурността, тъй като включваше компрометиране на ниво платформа. Това остава най-сериозната дейност от този вид, която досега сме установили при нашите модели, и тя беше предизвикана главно от изключително способен изследователски модел, предназначен само за вътрешна употреба. Впоследствие установихме, че проникването е било предизвикано от модели, прибягнали до несъгласувани стратегии за решаване на трудни задачи, както е описано в техническия доклад за Hugging Face. Инцидентите в киберсигурността са една от проявите на този риск; несъгласуваността може да доведе и до друго неочаквано или обезпокоително поведение извън традиционните категории за сигурност — например наши модели да публикуват в сайтове на трети страни, което наричаме „агентски спам“. Трябва да се справим и с двете.
Продължихме да преглеждаме дейността в по-широк мащаб, като дадохме приоритет на по-сериозните инциденти и разширихме обхвата до несъгласувана дейност с по-ниска тежест, включително агентски спам.
Тази страница обединява докладите и актуалната ни информация за инцидента с Hugging Face, свързаните изследвания и публични презентации, допълнителната дейност, която сме установили, наученото за ролята на несъгласуваността на моделите и мерките, които предприемаме за укрепване на системите си. Ще актуализираме тази страница с напредването на разследванията ни.
Бързи връзки
Дейност, засягаща трети страни
За да разберем по-добре обхвата на това неочаквано поведение, извършваме широк преглед на дейността на нашите модели в интернет по време на обучение и оценяване. Като част от прегледа постепенно установяваме и уведомяваме засегнатите трети страни, като започваме със случаите, при които:
Наши модели може да са заобиколили мерките за сигурност на трета страна или да са нарушили достъпността на онлайн услуга; или
Случаи на несъгласуваност са повлияли неблагоприятно на уебсайтове или услуги на трети страни.
Въз основа на досегашния ни преглед уведомихме десетки трети страни според горните критерии. Прегледът на миналата дейност продължава и ще изисква значително време и ресурси. С напредването на тази работа ще уведомяваме и други трети страни.
По-долу публикуваме анонимизирани резюмета, описващи наблюдаваните видове несъгласувана дейност. Ще актуализираме тези описания, когато уведомяваме още трети страни и разбирането ни се задълбочава. Ще споделяме и относими актуализации за състоянието на прегледа. По принцип ще пропускаме имена и други идентифициращи данни, когато това е необходимо за защита на засегнатите страни, макар че уведомените страни могат да решат да оповестят публично предоставената им информация.
Резюмета на наблюдаваните дейности
Досегашният ни процес на преглед и уведомяване установи следните категории дейност:
Заобикаляне на контрола на достъпа: Агентите достигат до информация или функции, които обикновено изискват проверка на самоличността, конкретно разрешение, абонамент или профил. Например aгентът използва друг уеб адрес, променя данни в заявка или разчита на сесия за вход, която му дава повече достъп от очакваното.
Използване на разкрити идентификационни данни: Агентите намират публично достъпни данни за вход или ключове за достъп и ги използват за достъп до услуга.
Инжектиране на заявки или команди: Агентите въвеждат в уебсайт или услуга текст, който услугата възприема като инструкция, а не като обикновени входни данни. Това може да накара услугата да изпълни заявка към база данни, програмен код или команда на своя сървър.
Достъп до вътрешните компоненти на средата за изпълнение: Агентите четат файлове, съдържащи реализацията на услуга, или взаимодействат с фонова система, предназначена за вътрешна употреба. В тези случаи aгентът достига части от услугата извън предвидения му достъп.
Агентски спам: Агентите публикуват информация в сайтове на трети страни, която може да промени съдържанието им и да наложи почистване — например като използват публични уики страници за общи табла за съобщения.