Пресечение скоординированной кампании по дистилляции моделей
Недавно мы выявили и пресекли скоординированную кампанию по извлечению защищённых рассуждений из наших моделей. Первые признаки этой активности были зафиксированы в первую неделю июля. Эта деятельность соответствует признакам злонамеренной дистилляции — систематического и несанкционированного использования ответов или рассуждений одной модели для обучения, воспроизведения или улучшения другой. Защищённые рассуждения — это внутренняя запись хода решения задачи моделью. Их извлечение может раскрыть информацию, не включённую в итоговый ответ, и помочь другим воспроизвести возможности модели.
Участники кампании не взламывали наше шифрование, не получали несанкционированного доступа к базе данных или прямого доступа к сохранённым перепискам пользователей. Вместо этого они манипулировали взаимодействиями с моделями, добиваясь воспроизведения защищённых рассуждений в доступном для отправителя запроса виде. Эти действия были скоординированными, масштабными и нарушали наши условия использования. Уязвимость к таким манипуляциям свойственна не только моделям OpenAI. Мы поделились информацией о ней с отраслевыми партнёрами через Frontier Model Forum, чтобы укрепить коллективную защиту от злонамеренной дистилляции.
До публикации мы изучили масштаб и возможные последствия этой деятельности, внедрили собственные меры противодействия, а также обменялись информацией с исследователями и отраслевыми партнёрами и получили их отзывы, чтобы обеспечить защиту от атак такого типа. Расследование и работа над дополнительными мерами защиты продолжаются. Мы считаем, что публикация полученных сведений сейчас поможет всей экосистеме укрепить свою защиту.
Мы наблюдали попытки извлечь защищённые рассуждения новыми способами. В частности, участники копировали зашифрованные рассуждения из одного диалога и просили модель в другом диалоге расшифровать скрытое содержимое и воспроизвести его текст.
Независимые исследователи безопасности(открывается в новом окне) также сообщили нам в рамках ответственного раскрытия об аналогичных уязвимостях, связанных с взаимодействием разных моделей и сжатием контекста диалогов. Мы изучили их выводы и подтвердили, что выявленные ими способы атаки действительно работают. Их работа помогла нам лучше понять весь этот класс атак и ускорить внедрение мер защиты.
Активность началась 1 июля и поначалу оставалась невысокой. Затем, 24 и 25 июля, мы зафиксировали резкие всплески: более 4 000 пользователей отправили 16 000 запросов1 с характерным шаблоном извлечения. В ходе дальнейшего расследования мы выявили связанные шаблоны промптов в группе из более чем 15 000 пользователей. К 28 июля мы полностью пресекли эту активность.
Со временем методы менялись, что ещё раз показало: злонамеренная дистилляция — это более широкая проблема безопасности, требующая многоуровневой, адаптивной защиты.
Неясно, действовали ли все участники, которых мы наблюдали в этот период, от имени одной стороны. Однако основную группу связанных действий мы приписываем лицам, связанным с Moonshot AI — разработчиком Kimi.
Злонамеренная дистилляция создаёт риски как для безопасного использования ИИ, так и для национальной безопасности. Извлечённые рассуждения могут использоваться для обучения другой модели без сохранения защитных механизмов, которые применяются к ответам исходной модели, показываемым пользователю. В больших масштабах дистилляция также может ускорить перенос передовых возможностей без сопоставимых вложений в безопасность. Эти риски усиливаются по мере того, как модели приобретают возможности в областях двойного назначения.
Этот риск касается не только OpenAI. Как отмечалось выше, подобные методы могут затрагивать и другие передовые системы ИИ. Это общая проблема безопасности, требующая координации усилий всей отрасли.
Мы противодействовали этой недавней кампании по дистилляции, сочетая меры в отношении аккаунтов, технические средства защиты и координацию с партнёрами. Мы заблокировали мошеннические аккаунты или ограничили их доступ, усилили контроль при регистрации и на уровне инфраструктуры, а также расширили мониторинг связанных сетей аккаунтов.
Мы также усилили защиту скрытых рассуждений между пользователями, рабочими пространствами, организациями и семействами моделей. Мы закрыли возможность повторно подавать модели зашифрованные рассуждения другого пользователя и восстанавливать их содержимое, если они уже оказались в чьём-либо распоряжении. Кроме того, мы добавили проверки, которые выявляют и задерживают потоковый вывод, способный раскрыть рассуждения. Когда связанная с кампанией активность проходила через сторонние сервисы, мы работали с их поставщиками, чтобы выявить задействованные аккаунты и пресечь их деятельность.
Наконец, мы передали соответствующие сведения через Frontier Model Forum и надлежащие государственные каналы обмена информацией, чтобы другие разработчики передовых моделей и партнёры из госсектора могли выявлять подобную активность и укреплять собственную защиту. Системы, которые позволяют переносить или повторно использовать артефакты рассуждений, могут сталкиваться с аналогичными рисками.
Мы ожидаем, что попытки злонамеренной дистилляции будут становиться изощрённее по мере совершенствования передовых моделей и поиска более дешёвых способов воспроизвести их возможности. Для защиты от такой деятельности нужны многоуровневые меры контроля и постоянная адаптация.
Эта работа ещё не завершена. Модели, развёрнутые у партнёров, нуждаются в той же защите, что и наши собственные сервисы. А для противодействия атакам через результаты работы инструментов нужны меры, которые проверяют не только обычный видимый текст. Мы продолжаем совершенствовать защиту инструментов, расширять охват классификаторов, улучшать механизмы отказа моделей и внедрять соответствующие меры контроля у облачных партнёров.
Мы продолжим работу по трём направлениям: усиление технической защиты от извлечения, совершенствование выявления и пресечения скоординированных кампаний, а также углубление обмена информацией об угрозах между отраслью и государством.

