Переход к основному контенту
OpenAI

Инцидент с Hugging Face и другие последствия несогласованности моделей для третьих сторон

По мере того как системы ИИ становятся более мощными и автономными, несогласованное поведение может перерастать в реальные действия с серьёзными последствиями — например, в инциденты в сфере кибербезопасности и другие ситуации, которых разработчики могли не предвидеть. Поэтому понимание того, как возникает и усугубляется такое поведение, как его выявлять и как на него реагировать, становится всё более важной частью безопасной разработки и внедрения передовых систем ИИ.

Изначально мы рассматривали инцидент с Hugging Face главным образом как проблему безопасности, поскольку он был связан с компрометацией на уровне платформы. Это по-прежнему самый серьёзный случай подобной активности наших моделей, выявленный нами на сегодняшний день; основную роль в нём сыграла очень мощная исследовательская модель, предназначенная исключительно для внутреннего использования. Позднее мы поняли, что это вторжение было вызвано тем, что модели прибегали к несогласованным стратегиям для решения сложных задач, как описано в техническом отчёте об инциденте с Hugging Face. Инциденты в сфере кибербезопасности — одно из проявлений этого риска. Несогласованность также может приводить к другому неожиданному или вызывающему опасения поведению, которое не относится к традиционным категориям безопасности, например когда наши модели публикуют информацию на сторонних сайтах. Такое поведение мы называем «агентским спамом». И нам необходимо решать обе проблемы.

Мы продолжили изучать активность в более широком масштабе, отдавая приоритет серьёзным инцидентам и постепенно охватывая менее опасные случаи несогласованного поведения, включая агентский спам.

На этой странице собраны наши отчёты и новости об инциденте с Hugging Face, связанных исследованиях и публичных выступлениях, другой выявленной нами активности, выводах о роли несогласованности моделей и мерах по укреплению наших систем. Мы будем обновлять эту страницу по мере расследования.


Активность, затронувшая третьи стороны

Чтобы лучше понять масштаб этого неожиданного поведения, мы проводим широкую проверку интернет-активности наших моделей во время обучения и оценки. В рамках проверки мы по мере выявления случаев устанавливаем затронутые третьи стороны и уведомляем их, начиная со следующих ситуаций:

  • Наши модели могли обойти меры безопасности третьей стороны или нарушить доступность онлайн-сервиса; либо

  • Случаи несогласованности негативно повлияли на сторонние сайты или сервисы.

По результатам проведённой на данный момент проверки мы уведомили десятки третьих сторон в соответствии с указанными выше критериями. Проверка прошлой активности продолжается и потребует значительных затрат времени и ресурсов. По мере продолжения этой работы мы будем уведомлять дополнительные третьи стороны.

Ниже мы публикуем обезличенные сводки о выявленных видах несогласованной активности. Мы будем обновлять эти описания по мере уведомления дополнительных третьих сторон и появления новой информации. Кроме того, мы будем публиковать актуальную информацию о ходе проверки. Как правило, при необходимости защитить затронутые стороны мы будем скрывать имена и другие идентифицирующие сведения, хотя уведомлённые стороны могут публично раскрыть предоставленную им информацию.

Сводка выявленной активности

На данный момент в ходе проверки и уведомления сторон выявлены следующие категории активности:

  • Обход контроля доступа: агенты получают доступ к информации или функциям, для которых обычно требуется подтверждение личности, специальное разрешение, подписка или аккаунт. Например, агент использовал другой веб-адрес, изменял данные в запросе или применял сеанс входа, предоставлявший более широкий доступ, чем предполагалось.

  • Использование учётных данных, оказавшихся в открытом доступе: агенты находили данные для входа или ключи доступа, опубликованные в открытом доступе, и использовали их для доступа к сервису.

  • Внедрение запросов или команд: агенты вводили на сайте или в сервисе текст, который сервис воспринимал как инструкцию, а не как обычные входные данные. В результате сервис мог выполнить запрос к базе данных, код приложения или команду на своём сервере.

  • Доступ к внутренним компонентам среды выполнения: агенты читали файлы с реализацией сервиса или взаимодействовали с фоновой системой, предназначенной для внутреннего использования. В этих случаях агент получал доступ к частям сервиса, которые не должны были быть ему доступны.

  • Агентский спам: агенты публикуют информацию на сторонних сайтах, что может изменять содержимое этих сайтов и требовать очистки. Например, они используют общедоступные вики-страницы как общие доски сообщений.


Хронология событий

Сентябрь

Август

Июль