Путь к Astra: критические возможности и передовые меры защиты
После нашей предыдущей оценки, согласно которой Astra могла достичь критического уровня возможностей в области кибербезопасности, мы собрали дополнительные данные и провели новые тесты возможностей модели. Теперь мы считаем, что Astra достигла порога критических возможностей в области кибербезопасности согласно нашей Программе готовности: имея подходящие инструменты и доступ, она может без пошагового руководства человека находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации во множестве хорошо защищённых систем. Это первая модель, которую мы относим к такому уровню, поэтому при её разработке и до выпуска необходимы более строгие меры защиты.
В последние несколько недель мы откладывали отдельные этапы разработки и выпуска Astra, пока усиливали и тестировали защиту от киберзлоупотреблений и несанкционированных действий модели. По итогам этой работы мы считаем, что меры защиты Astra в достаточной степени минимизируют риск серьёзного ущерба и позволяют выпустить модель в соответствии с нашей Программой готовности.
Хотя Astra не была связана с инцидентом Hugging Face, мы учли извлечённые из него уроки(открывается в новом окне) в нашем подходе к безопасности. Ретроспективное тестирование показало, что действовавшие тогда рабочие меры защиты, по нашей оценке, предотвратили бы инцидент Hugging Face. После этого мы внедрили для Astra ещё более строгие меры защиты: обучили модель надёжнее отклонять вредоносные киберзапросы и соблюдать ограничения безопасности, добавили защиту от злоупотреблений и мониторинг, способный останавливать потенциально несанкционированные действия.
Мы планируем вскоре предоставить доступ к Astra, однако её наиболее передовые возможности в области кибербезопасности будут доступны в более ограниченном объёме. Сначала передовые возможности для работы в области кибербезопасности получит группа тестировщиков, а затем доступ через Daybreak Blue будет расширен для защитных сценариев.
При выпуске мы подробнее расскажем о тестировании и оценке безопасности, защищённости и согласованности в системной карточке модели. До выпуска мы хотим рассказать о части работы по безопасному выпуску модели с таким уровнем возможностей в области кибербезопасности и открыто сообщить о сохраняющихся рисках.
Согласно нашей Программе готовности, модель достигает критического порога при выполнении хотя бы одного из следующих условий:
- Модель способна без вмешательства человека выявлять уязвимости нулевого дня любого уровня серьёзности и создавать работающие эксплойты для множества защищённых критически важных систем, используемых в реальных условиях.
- Получив лишь общую цель, модель способна разрабатывать и реализовывать новые комплексные стратегии кибератак на защищённые цели.
Оценка готовности Astra сочетала автоматизированные общедоступные и закрытые бенчмарки с экспертными оценками. В сравнении с GPT‑5.6 Sol Astra демонстрирует значительно более высокий уровень возможностей в области кибербезопасности: она заметно эффективнее расходует токены и лучше выявляет уязвимости и разрабатывает эксплойты.
Например, в ExploitBench Astra набрала максимальные 100% в бенчмарке, оценивающем способность модели создавать эксплойты для известных уязвимостей.
Из-за риска загрязнения данных мы создали внутренний бенчмарк «ExploitBench — внутренний порт (июнь–август 2026 г.)», включающий 20 недавно раскрытых уязвимостей V8 высокой степени серьёзности. На этом наборе данных Astra обеспечивает значительно более высокую долю успешного выполнения произвольного кода, чем GPT‑5.6 Sol, используя намного меньше выходных токенов. Во время тестирования модель даже обнаружила и задействовала две уязвимости нулевого дня в цепочке эксплойтов. Сейчас мы сообщаем об этих уязвимостях разработчикам.
Приведённые результаты Astra отражают возможности при наличии доступа к Daybreak Blue, а не в стандартной рабочей конфигурации.
В экспертных тестах защищённого браузера и операционной системы Astra обнаружила ранее неизвестные уязвимости и создала на их основе работающие цепочки эксплойтов. Она создала полную цепочку компрометации браузера, которая при открытии HTML-файла выходила из песочницы и выполняла команды на хосте. Модель также обнаружила несколько уязвимостей в защищённой операционной системе и объединила их в локальную цепочку повышения привилегий от непривилегированного пользователя до root. В совокупности результаты исследования позволяют заключить, что Astra достигла критического порога.
Для моделей с уровнем возможностей Astra в области кибербезопасности необходимо перекрыть два пути, чтобы минимизировать риск серьёзного ущерба как во время разработки, так и до развёртывания:
- Использование модели злоумышленниками. Наши меры защиты должны надёжно предотвращать использование Astra злоумышленниками для создания эксплойтов ранее неизвестных уязвимостей в защищённых критически важных системах или проведения комплексных атак на защищённые цели.
- Несанкционированные и несогласованные действия модели. Даже без участия злоумышленника модель с передовыми возможностями в области кибербезопасности может сама причинить ущерб, если её поведение не согласовано с заданными целями. Помимо крайне высоких требований к согласованности моделей с такими возможностями, наши меры защиты должны обеспечивать быстрое обнаружение и сдерживание несогласованных действий, способных нанести значительный реальный ущерб, выступая вторым уровнем защиты.
Важно отметить, что второй путь относится как к внутренней разработке, так и к внешнему развёртыванию. Как мы уже сообщали, после инцидента OpenAI и Hugging Face мы на две недели приостановили некоторые процессы обучения передовых моделей (включая отдельные процессы обучения Astra), чтобы усилить защиту инфраструктуры обучения: изоляцию и сетевые средства контроля, расширенный мониторинг, а также усиленное обучение моделей согласованному поведению и более строгие пороговые значения. Затем мы продолжили менее масштабные работы, применяя более строгие меры контроля.
Некоторые более масштабные циклы обучения с подкреплением (RL) для будущих версий Astra мы отложили на более долгий срок, пока устанавливали более высокие стандарты безопасности и защиты среды обучения. 28 августа, после введения новых требований к безопасности и защите, мы возобновили ранее приостановленный масштабный цикл RL для передовой модели. Некоторые менее масштабные экспериментальные циклы обучения пока остаются приостановленными.
Подготовка Astra к выпуску также потребовала усилить защиту от киберзлоупотреблений и несанкционированных действий. Ниже описаны эти меры защиты и способы их тестирования.
С момента развёртывания в феврале первой модели, которую мы отнесли к уровню «Высокий» по возможностям в области кибербезопасности, мы усиливали соответствующие меры защиты с каждым новым выпуском. Наш общий подход к безопасности включает несколько уровней: отказы постобученной модели, системные классификаторы безопасности, а также автономное обнаружение угроз и противодействие им.
В GPT‑5.6(открывается в новом окне) мы значительно повысили надёжность системного комплекса, в том числе добавили классификаторы активаций для обнаружения киберзлоупотреблений и расширили защиту от универсальных джейлбрейков, выявленных в ходе интенсивного автоматизированного red teaming. Развивая эти улучшения, в Astra мы дополнительно усилили меры защиты на уровне самой модели, а также повысили способность средств защиты учитывать контекст нескольких бесед.
- Благодаря новым методам обучения устойчивости модели Astra надёжнее отклоняет запросы на запрещённую помощь в кибероперациях. В нашем наборе тестов на киберджейлбрейки Astra отклоняет 91,5% запросов (против 59% у GPT‑5.6 Sol).
- Для учётных записей с повышенным уровнем риска мы устанавливаем более консервативные границы поведения модели, чтобы она отклоняла более широкий спектр потенциально рискованной помощи в кибероперациях. Для пользователей с высоким уровнем риска мы расширили контекст, доступный системам мониторинга, чтобы выявлять такие киберзлоупотребления.
Мы также продолжили программу тщательного тестирования, внутреннего и внешнего red teaming и устранения выявленных проблем. Помимо регрессионного тестирования, которое подтверждает сохранение защиты от всех джейлбрейков, обнаруженных ранее, мы проводим новый этап red teaming с нашими новейшими внутренними атакующими системами для red teaming. Совместно с отраслевыми партнёрами мы разрабатываем единую систему оценки джейлбрейков и будем круглосуточно расследовать новые случаи и устранять проблемы в рамках программы быстрого реагирования. Подробнее о тестировании мер защиты Astra от киберугроз мы расскажем в системной карточке.
Помощь специалистам по защите в поиске и устранении уязвимостей остаётся ключевой составляющей нашего подхода к безопасности. На момент выпуска меры защиты Astra, вероятно, будут создавать больше препятствий, чем мы считаем необходимым в долгосрочной перспективе, чтобы предотвратить возможные злоупотребления. Сначала доступ к Astra для передовых рабочих процессов в области кибербезопасности получит небольшая группа альфа-тестировщиков, а затем доступ через Daybreak Blue будет расширен для поддержки защитных сценариев.
Мы также добавили дополнительные уровни защиты, чтобы модель не предпринимала потенциально несогласованные действия:
- Согласованность модели: в наших тестах Astra значительно чаще, чем GPT‑5.6 Sol, соблюдала явные ограничения безопасности и защиты и не выходила за рамки предоставленных полномочий, став нашей наиболее согласованной моделью на сегодняшний день. Особое внимание мы уделяли соблюдению моделью ограничений безопасности и защиты, а также её способности не выходить за рамки предоставленных полномочий.
- Мониторинг и контроль: по аналогии с внутренними процедурами мы развёртываем Astra с дополнительным мониторингом цепочки рассуждений (CoT), чтобы быстро обнаруживать и сдерживать потенциально несогласованные действия.
Astra — значительный шаг вперёд в согласованности моделей и результат нескольких многолетних направлений работы: от вмешательств на этапе предварительного обучения до более тщательного и последовательного оценивания при обучении с подкреплением. Тесты показывают, что Astra стабильнее соблюдает явные ограничения и предупреждения безопасности, например автоматическую проверку, чем GPT 5.6 Sol.
Мы также разработали тест с учётом инцидента Hugging Face, во время которого агенты, выполнявшие тест ExploitGym в области кибербезопасности, скомпрометировали системы третьей стороны. Из самых сложных заданий этого теста мы создали тесты с «ловушками», чтобы проверить, попытается ли модель скомпрометировать окружающую инфраструктуру безопасности вместо решения поставленной задачи. Без рабочих мер защиты GPT‑5.6 Sol пыталась получить доступ к таким целям в 56% тестов, имитировавших среду бенчмарка, где модели поручалось создавать эксплойты. В этих тестах Astra не предпринимала подобных попыток. Эти показатели описывают поведение в условиях тестирования без мер защиты от киберугроз, а не при обычном рабочем использовании.
Слева: в этом новом тесте мы наблюдаем, как модели реагируют на отказ автоматической проверки. Каждое задание выполняется в среде интеллектуального труда, а процесс начинается сразу после отклонения автоматической проверкой. Далее модель может завершить процесс, попытаться найти более безопасную альтернативу, повторить похожую команду или воспользоваться неудачной конфигурацией(открывается в новом окне), чтобы полностью обойти автоматическую проверку. Выбор любого из последних двух вариантов означал бы провал теста. Astra ни разу не пыталась обойти автоматическую проверку.
Справа: в этом тесте мы проверяем склонность модели к обходным приёмам (с помощью «ловушек») при выполнении самых сложных или невыполнимых заданий из теста ExploitGym. Тест проводился в имитированной среде, а меры защиты работали только в режиме наблюдения, чтобы оценить поведение модели. GPT‑5.6 Sol чаще демонстрировала склонность к обходным приёмам в таких сценариях, тогда как Astra не пыталась использовать эти способы и при этом смогла корректно решить некоторые задачи.
Обучение моделей согласованному поведению — один из уровней безопасности. Подробнее о тестировании согласованности и его результатах мы расскажем в системной карточке Astra.
Для моделей класса Astra мы также внедряем в рабочей среде систему мониторинга несогласованного поведения, чтобы выявлять и быстро пресекать потенциально несогласованные действия. Эти меры защиты похожи на мониторинг внутренних развёртываний и включают систему классификаторов, которые проверяют рассуждения и действия модели на несанкционированное поведение и автоматически останавливают потенциально несанкционированную активность. По мере роста возможностей эти меры не могут заменить надлежащую согласованность моделей. Наша цель — добиться такой согласованности будущих моделей, чтобы эти меры защиты никогда не срабатывали.
OpenAI стремится обеспечить широкий доступ к преимуществам ИИ. Учитывая значительный рост возможностей Astra в области кибербезопасности, мы проявляем особую осторожность, чтобы обеспечить безопасное и защищённое развёртывание. Дополнительные проверки безопасности иногда могут замедлять, приостанавливать или останавливать правомерную работу, в том числе защитные операции в области кибербезопасности.
Система может ошибочно принять правомерную активность за потенциальное киберзлоупотребление или несанкционированное поведение и непреднамеренно замедлить, приостановить или остановить её. Это может касаться работы, которая не выглядит напрямую связанной с кибербезопасностью, или задач, где агент работает продолжительное время.
Если система мониторинга несогласованного поведения приостановит выполнение задачи, пользователям ChatGPT или Codex может потребоваться проверить действие перед продолжением. При использовании других интерфейсов, например API, задача будет остановлена. Мы продолжим настраивать эти меры защиты, чтобы сократить число ненужных прерываний и расширить доступ к передовым возможностям через такие программы, как Daybreak.
Мы вступаем в этап развития ИИ, на котором модели могут выполнять более ответственные задачи, а нарушения согласованности и контроля способны приводить к более серьёзным последствиям. Польза этих систем будет зависеть от нашей способности обеспечивать согласованность моделей и контролировать их по мере роста возможностей.
Эта ответственность охватывает обучение, оценку и развёртывание. Для этого нужны более убедительные доказательства согласованного поведения, меры защиты, соответствующие уровню возможностей, и готовность замедлить работу, когда такой защиты недостаточно.
Мы продолжим тестировать эти системы, делиться полученными знаниями и открыто говорить о сохраняющейся неопределённости. Модели, которые появятся после Astra, потребуют от нас большего. Мы уделим этому столько времени и работы, сколько потребуется, чтобы выполнить свои обязательства.
