OpenAI и Hugging Face устраняют инцидент безопасности, возникший при тестировании моделей
На прошлой неделе Hugging Face раскрыла инцидент безопасности нового типа(открывается в новом окне): они обнаружили и изолировали ИИ-агента, скомпрометировавшего их инфраструктуру. Мы ожидаем, что подобные случаи станут более распространенным явлением по мере распространения моделей с растущими кибервозможностями. В ходе расследования выяснилось, что за конкретно этим инцидентом стояла комбинация моделей OpenAI — включая GPT‑5.6 Sol и еще более продвинутую нерелизную модель (все они имели ослабленные ограничения на кибертематику для целей оценки) — во время их внутреннего тестирования на бенчмарке(открывается в новом окне) кибервозможностей.
Мы считаем этот инцидент беспрецедентным киберинцидентом с участием кибервозможностей уровня переднего края и реагируем соответствующим образом. На этом этапе мы делимся предварительными выводами, чтобы помочь защитникам понять, что произошло, и точнее оценить нынешние возможности моделей. Мы продолжим тщательное расследование вместе с Hugging Face и поделимся дополнительными сведениями об уязвимостях, инциденте и выводах, когда оно будет завершено.
Этот инцидент произошел во время внутренней оценки, где модели побуждают применять продвинутую эксплуатацию через сложные пути атак, чтобы количественно оценить их кибервозможности. Мы оцениваем максимальные кибервозможности, проводя эту оценку без производственных классификаторов, которые используются, чтобы не допускать стремления моделей к высокорисковой киберактивности. Наши бенчмарки работают в сильно изолированной среде, где сетевой доступ ограничен возможностью устанавливать пакеты через размещенное у нас стороннее ПО, которое выступает прокси и кэшем для реестров пакетов.
Модели выявили и связали в цепочку уязвимости в исследовательской среде OpenAI и производственной инфраструктуре Hugging Face, чтобы получить тестовые решения напрямую из производственной базы данных Hugging Face. Все данные указывают на то, что модели были полностью сосредоточены на поиске решения для ExploitGym и шли на крайние меры ради достижения довольно узкой цели тестирования.
Работая в нашей изолированной тестовой среде, наши модели потратили значительный объем вычислений на этапе вывода, пытаясь найти способ получить открытый доступ в Интернет ради решения оценочной задачи. Чтобы получить доступ, модели выявили и использовали уязвимость нулевого дня в прокси-кэше реестра пакетов; мы уже ответственно раскрыли ее поставщику. Получив этот доступ, наши модели выполнили серию действий по повышению привилегий и горизонтальному перемещению в нашей исследовательской тестовой среде, пока не достигли узла с доступом в Интернет.
Получив доступ к интернету, модели логически предположили, что на платформе Hugging Face могут размещаться модели, датасеты и готовые решения для бенчмарка ExploitGym. Поняв это, модель начала поиск и успешно найшла способы получить доступ к конфиденциальным данным, которые она могла бы использовать для обхода правил оценки. В одном из примеров модель выстроила цепочку из нескольких векторов атаки, включая использование украденных учетных данных и уязвимостей нулевого дня, чтобы найти путь для удаленного выполнения кода (RCE) на серверах Hugging Face. Команда безопасности OpenAI обнаружла эту аномальную активность внутри системы.
Команда безопасности и агенты Hugging Face обнаружили и остановили активность в своей инфраструктуре и уже начали изоляцию и криминалистическую реконструкцию с помощью собственных моделей с открытым исходным кодом, когда наши команды связались. Мы активно работаем с ними, продолжая расследование инцидента. Мы благодарны Hugging Face за быстрое и тесное сотрудничество в расследовании и устранении последствий.
- В рамках расследования мы вводим строгие меры контроля конфигурации инфраструктуры, жертвуя скоростью исследований на время устранения уязвимостей. Мы регулярно информируем наш Комитет по безопасности и защите об этих мерах контроля и их влиянии.
- Мы работаем с Hugging Face над криминалистическим расследованием инцидента.
- Мы ответственно раскрыли обнаруженную уязвимость нулевого дня в стороннем ПО, размещенном у нас, и работаем с поставщиком над её исправлением.
- Мы включили Hugging Face в программу доверенного доступа и помогаем их командам быстро использовать возможности наших моделей для усиления их защиты.
- Мы улучшаем и добавляем более надежные меры защиты для будущего обучения и оценок. На этой неделе мы опубликовали в блоге материал об улучшении безопасности и согласованности в эпоху моделей с длинным временным горизонтом. Эти защитные меры при развертывании были намеренно отключены во время этой оценки, поскольку ее целью было тестирование киберуязвимостей. Этот инцидент указывает на необходимость еще сильнее укрепить согласованность нашей модели, киберзащиту во время оценки и мониторинг при внутреннем тестировании.
Как мы недавно рассказывали, ИИ ускоряет обнаружение и эксплуатацию уязвимостей. Главный урок этого инцидента в том, что безопасность и защищенность моделей должны развиваться в темпе быстро растущих возможностей. Мы усиливаем изоляцию, мониторинг, контроль доступа и практики оценки, применяемые при разработке моделей.
Оценка UK AISI показывает, что модели, такие как GPT‑5.6 Sol, все лучше способны поддерживать сложные многошаговые кибероперации на длинных временных горизонтах. Этот инцидент показывает, что такие теоретические возможности применимы в реальных условиях.

Инцидент также ясно показывает, что передовые модели могут находить и использовать новые пути атак в реальных системах без доступа к исходному коду. Он подчеркивает, что передовые кибервозможности нужно развивать вместе с более надежными средствами защиты и оборонительными инструментами.
Мы считаем, что модели с передовыми кибервозможностями должны помогать командам безопасности находить слабые места раньше злоумышленников, понимать, как уязвимости можно связывать в цепочки, и устранять их с машинной скоростью. Мы используем эти возможности, чтобы дальше усиливать защиту конфигурации инфраструктуры и сред оценки моделей; по мере накопления опыта мы будем делиться выводами и лучшими практиками. Мы призываем других защитников подать заявку на доверенный доступ и уже сейчас экспериментировать с этими моделями, чтобы превратить эти возможности в лучшую профилактику, более быстрое обнаружение и более эффективное реагирование на инциденты.
«Мы благодарны OpenAI за сотрудничество по этой и другим темам. Этот инцидент, возможно первый в своем роде, подтверждает то, во что мы давно верим: безопасность ИИ не сможет обеспечить ни одна компания, работающая втайне. Она будет обеспечена открыто и совместно, при широком доступе к ИИ для каждого защитника, где бы он ни находился».


