Переход к основному контенту
OpenAI

18 августа 2026 г.

КомпанияПубликация

Темпы разработки ИИ-моделей в эпоху критических киберугроз

Загрузка…

За последние несколько недель два события подчеркнули растущие риски, связанные со всё более мощными системами ИИ: инцидент с OpenAI и Hugging Face и, отдельно, предварительные данные о том, что одна из наших будущих моделей, Astra, может достичь порога критических возможностей в сфере кибербезопасности согласно нашей Программе готовности. В совокупности эти события и стремительный прогресс наших внутренних исследований и повысили актуальность работы по усилению мер мониторинга, согласования и сдерживания на всех этапах обучения.

По мере роста возможностей моделей увеличиваются и риски, связанные с их внутренней разработкой и тестированием. Наши стандарты мониторинга, согласования и безопасности должны опережать эти риски. Чтобы выделить необходимое время на соблюдение этих стандартов, мы временно замедлили масштабирование. В частности, мы на две недели приостановили обучение с подкреплением (RL) наших новейших моделей, предназначенных для развёртывания, чтобы дополнительно укрепить исследовательские среды, провести их тестирование методом красной команды и расширить охват систем мониторинга. Крупнейший из запланированных запусков RL для передовых моделей по-прежнему приостановлен: прежде чем продолжить, мы проводим обучение и оценки в меньшем масштабе, чтобы изучить поведение модели, проверить защитные меры и собрать больше подтверждений согласованности.

Согласование — работа, направленная на то, чтобы системы ИИ действовали в соответствии с замыслом и подчинялись контролю человека, — уже давно лежит в основе нашей исследовательской программы. Теперь мы требуем более убедительных подтверждений согласованного поведения на всех этапах обучения, опираясь на уже ведущиеся исследования и оценки. Поддержание согласованности всё более мощных систем — задача, которую предстоит решать всей отрасли. Наблюдаемые нами признаки прогресса будущих моделей ясно показывают, что нужен более широкий подход, который опирается на действующую Программу готовности и выходит за её рамки.

Мы считаем важным открыто рассказывать о том, как меняется наш подход. Ниже мы рассказываем об уже внесённых изменениях в исследовательские процессы и инфраструктуру, а также о продолжающейся работе.

Усиление защитных мер для более мощных моделей

Наш подход к разработке более мощных моделей основан на трёх взаимодополняющих мерах защиты:

  1. Мониторинг, который выявляет вызывающее опасения поведение и позволяет на него реагировать.
  2. Согласование, которое снижает вероятность вредоносных или несанкционированных действий.
  3. Меры безопасности, которые ограничивают доступ систем ИИ и их возможности воздействия.

Мы ожидаем, что вскоре модели будут выполнять бо́льшую часть работы по обеспечению безопасности, включая защиту от других моделей. Это позволит всем трём мерам защиты масштабироваться вместе с возможностями моделей, что мы считаем крайне важным.

Мы применяем эти меры защиты как в исследованиях, так и при развёртывании, адаптируя их к возможностям каждой модели, рабочей среде и уровню риска.

Защита наших исследовательских сред

По мере усиления возможностей передовых моделей в сфере кибербезопасности мы повышаем стандарты защиты сред, в которых обучаем и оцениваем эти модели. Соблюдение этих стандартов потребовало значительной инженерной работы, крупных затрат и задержек в исследованиях передовых моделей. Сразу после инцидента с OpenAI и Hugging Face мы приостановили инференс передовых моделей в исследовательских кластерах в тех случаях, когда модели могли выполнять код или использовать инструменты с доступом в интернет. Мы довольно быстро восстановили более ограниченный и безопасный способ выполнения кода, а затем отдельно проверили каждую рабочую нагрузку, чтобы определить, можно ли безопасно возобновить её выполнение. Некоторые исследовательские нагрузки были возобновлены с новыми средствами контроля, а для других потребовались дополнительные изменения.

В последующие недели мы определили более строгие требования безопасности для исследовательских нагрузок передовых моделей и начали их внедрять. Например:

  • Изоляция рабочих нагрузок: теперь мы требуем более строгой изоляции («песочниц») для рабочих нагрузок, в рамках которых выполняется сгенерированный моделью или иной недоверенный код. Это также относится к программному обеспечению, которое может быть скомпрометировано при обработке выходных данных модели.
  • Сетевая изоляция: мы внедрили дополнительные средства контроля, изолирующие от интернета высокорисковые и недоверенные рабочие нагрузки. Эти средства контроля устроены так, чтобы компрометация отдельной рабочей нагрузки или вспомогательного сервиса сама по себе не позволяла получить несанкционированный доступ к интернету или другим внутренним сетям.
  • Непрерывное тестирование безопасности: мы перенастроили среду, удалив потенциально уязвимые общие сервисы, сократив постоянные привилегии и укрепив границы безопасности и доверия. Мы также совершенствуем сбор и мониторинг журналов безопасности. Наконец, мы инвестируем в автоматизацию, используя наши модели для непрерывной проверки этих границ с помощью имитации атак.

В совокупности эти средства контроля обеспечивают эшелонированную защиту и помогают защищать нашу исследовательскую среду от атак. Сейчас мы требуем самого строгого уровня защиты для рабочих нагрузок, связанных с Astra или кибермоделями, поскольку пришли к выводу, что модели Astra могут обладать критическим уровнем кибервозможностей. Эти меры защиты также применяются ко всем остальным рабочим нагрузкам, связанным с кибербезопасностью.

Хотя часть обучения и оценок Astra соответствует этим требованиям, многие рабочие нагрузки остаются приостановленными до полного переноса и доработки в соответствии с новым стандартом безопасности. В первую очередь мы переносим в новые среды рабочие нагрузки, связанные с безопасностью и согласованием.

Расширение мониторинга цепочки рассуждений (CoT)

Мониторинг давно играет важную роль в процессе разработки наших моделей, включая мониторинг внутренних агентов для программирования и длительных сеансов. Особое внимание мы уделяли мониторингу внутренних развёртываний передовых моделей и запусков их RL-обучения. Мы считали их рабочими нагрузками с наивысшим риском, поскольку они могут сочетать расширенные возможности моделей с доступом к инструментам, чувствительным системам, а также внутренним или внешним сетям. Такой мониторинг применялся не ко всем запускам инференса и обучения с использованием инструментов. Мы пересмотрели и расширили свой подход, внедрив новую систему мониторинга.

Новая система мониторинга состоит из нескольких этапов. Сначала классификаторы активаций — детекторы, анализирующие внутреннюю активность модели, — проверяют каждый отобранный токен и передают потенциально опасные случаи всё более сложным автоматизированным системам анализа, требующим больших вычислительных ресурсов. Эти системы анализируют действия с инструментами, доступные рассуждения и полную последовательность действий, выявляя несанкционированный доступ, кражу данных, разрушительное поведение и попытки обойти защитные меры. Мы стремимся выдавать предупреждение в течение 30 минут после выявления системой мониторинга вызывающей опасения активности. Если система мониторинга выявляет вероятное нарушение критической границы безопасности, она создаёт предупреждение наивысшего приоритета. В текущей реализации оповещения получают команды по безопасности, защите и исследованиям. Если в течение 30 минут они не смогут достоверно установить, что срабатывание было ложным, эти команды должны приостановить активность.

Такой мониторинг обязателен для всего обучения RL и всех оценок с использованием инструментов для моделей уровня Sol и выше. После того как 7 августа мы установили, что Astra может обладать критическими кибервозможностями, мы ввели дополнительное требование мониторинга для всего инференса Astra с инструментами, а не только для обучения RL и оценок.

Эти меры защиты требуют значительных вычислительных ресурсов. По текущим оценкам, затраты на мониторинг составляют около 20% вычислительных ресурсов отслеживаемого инференса, хотя для разных задач обучения и оценки они существенно различаются. Подробнее об этой системе мы расскажем в одной из следующих публикаций в блоге.

Развитие исследований в области согласования

Исследования в области согласования занимают центральное место в нашей миссии. Наша миссия — сделать так, чтобы общий искусственный интеллект приносил пользу всему человечеству. По мере того как модели приобретают расширенные возможности, например способность проводить кибератаки, и начинают работать в более сложных средах, несогласованное поведение — такое как манипуляция системой вознаграждений (поиск способов получать высокое вознаграждение при обучении без фактического достижения требуемого результата), обман или несанкционированный доступ — будет создавать всё более серьёзные риски.

В циклах RL для наиболее мощных моделей мы теперь применяем основные методы согласования на большем числе этапов обучения. В частности, мы совершенствуем модели вознаграждения, чтобы лучше выявлять и пресекать небезопасное поведение в разных задачах и средах; обучаем модели честнее сообщать о своих действиях, возможностях и ограничениях; а также снижаем вероятность поведения, при котором модели используют уязвимости в механизмах вознаграждения, системах оценки, инструментах или надзоре. Мы также расширяем охват обучения для типов поведения, которые могут причинить вред при взаимодействии моделей с внешними системами или ресурсами.

Мы продолжаем активно инвестировать в исследования согласования, расширять охват оценок и применять полученные знания при обучении и разработке защитных мер. В ближайшем будущем мы планируем гораздо подробнее рассказать об исследованиях согласования, включая полученные сведения о поведении моделей и любые обнаруженные нами новые проблемы.

Что дальше

Мы будем развивать Программу готовности, чтобы объединить эти меры защиты на этапах обучения и развёртывания, а также лучше учитывать возможности будущих моделей и среды, в которых они работают. Разработка методов, способных масштабироваться вместе с этими возможностями, потребует постоянных инвестиций в безопасность с использованием моделей, более эффективный мониторинг и дальнейшее развитие исследований согласования. По мере развития нашего подхода мы намерены привлекать внешние организации и активнее делиться полученными знаниями.

Возможности передовых моделей стремительно растут. Наши способности понимать, согласовывать и защищать их должны развиваться ещё быстрее.


*В ближайшие недели мы опубликуем технический отчёт с полученными выводами.