GPT‑Red: самоулучшение ради устойчивости
Обучаем сильных автоматизированных специалистов по безопасности и red teaming для повышения устойчивости.
Кратко
Проблема
Red teaming необходим для обнаружения уязвимостей и повышения устойчивости наших моделей. Однако нынешние подходы плохо масштабируются и создают узкое место.
Наши новейшие модели уже насытили часто используемые оценки устойчивости.
Нам нужно развивать методы, которые позволяют безопасности и согласованию масштабироваться вместе с возможностями моделей.
Что мы сделали
Мы обучили GPT‑Red — автоматизированную модель для red teaming, которая масштабирует нашу способность находить уязвимости, чтобы устранять их до более широкого развертывания.
GPT‑Red — сильная модель для red teaming, и наши предыдущие модели весьма уязвимы к ее промпт-инъекциям.
Мы используем GPT‑Red для состязательного обучения GPT‑5.6, делая ее гораздо устойчивее к промпт-инъекциям.
Мы продолжим масштабировать этот подход наряду с red teaming с участием людей и сторонних экспертов, многоуровневыми средствами защиты и мониторингом в реальном времени.
ИИ-системы часто сталкиваются со сторонними данными через браузеры, подключенные приложения, локальные файлы и другие инструменты. Эти возможности необходимы для выполнения реальных задач, но они также создают больше возможностей для злоумышленников влиять на поведение модели. Например, третья сторона может встроить тщательно составленную инструкцию, призванную обманом заставить модель загрузить чувствительные данные на внешний сервер, в письмо, веб-страницу, ответ инструмента или репозиторий кода.
Human red teaming — критически важная часть нашей работы по безопасности: он помогает выявлять эти уязвимости до развертывания и внедрять нужные защитные меры. Но один только human red teaming трудно масштабировать. Проектирование и проведение таких упражнений требует много времени, что ограничивает скорость выявления новых режимов отказа и их учета в более сильных защитах. Кроме того, хотя эти упражнения дают ценные примеры успешных атак, они не способны обеспечить объем и разнообразие состязательных данных, необходимых для повышения устойчивости модели через обучение.
Чтобы не отставать от все более способных моделей, red teaming тоже должен масштабироваться. С этой целью мы обучаем автоматизированные модели для red teaming, предназначенные только для внутреннего использования: они выявляют уязвимости до развертывания и генерируют атаки во время обучения моделей, чтобы повышать устойчивость. Мы считаем, что автоматизированный red teaming открывает важную форму самоулучшения для безопасности: использование сегодняшних моделей, чтобы напрямую помогать делать будущие модели безопаснее.
GPT‑Red — итог этих усилий и наша лучшая на сегодня автоматизированная модель для red teaming в области безопасности. Подобно тому как специалисты по red teaming составляют атаки, модель движется к цели: отправляет промпт, наблюдает, как на него отвечают модели GPT, и повторяет итерации. Мы обучали GPT‑Red на вычислительном масштабе, сопоставимом с некоторыми из крупнейших посттренировочных запусков OpenAI, — это беспрецедентный объем вычислений, выделенный исключительно на повышение безопасности.
Мы напрямую включаем GPT‑Red в процесс обучения наших продакшен-моделей. В результате GPT‑5.6 Sol стала нашей самой устойчивой к промпт-инъекциям моделью на сегодняшний день: на нашем самом сложном бенчмарке прямых промпт-инъекций у нее в 6 раз меньше сбоев, чем у лучшей продакшен-модели всего четырьмя месяцами ранее. Масштабируемость нашего подхода позволяет рассчитывать на еще более сильные результаты в будущем, по мере того как мы продолжаем обучать более сильных специалистов по red teaming.
GPT‑Red обучается с помощью self-play и обучения с подкреплением: модель и набор разнообразных защитных LLM одновременно обучаются на широком наборе сценариев red teaming. GPT‑Red получает вознаграждение за вызов действительного сбоя, например успешной промпт-инъекции, а защитные модели — за отражение атаки и выполнение исходных задач. По мере того как защитные модели становятся устойчивее, GPT‑Red приходится находить более сильные и разнообразные атаки.
Чтобы поддержать обучение через self-play, мы создаем обширный набор реалистичных сценариев, в которые могут быть вставлены промпт-инъекции. В каждой среде есть модель угроз, которая определяет, чем может управлять GPT‑Red и что считается успешной атакой. Например, GPT‑Red может управлять частью локального файла, баннером на веб-странице, телом письма или выводом инструмента.
К концу обучения GPT‑Red становится очень сильным атакующим: он способен взломать почти все модели, против которых его ставят, включая внутренние модели и модели, используемые в рабочей среде, вплоть до GPT‑5.5. После завершения обучения GPT‑Red мы использовали её для генерации промпт-инъекций при обучении GPT‑5.6, благодаря чему модель стала высокоустойчивой к атакам GPT‑Red.
Мы держим GPT‑Red отдельно от моделей, которые развертываем. Так вредоносные возможности, которые мы специально обучаем в GPT‑Red, не попадают в руки злоумышленников, а модели, используемые в рабочей среде, получают повышенную устойчивость.
GPT‑Red очень эффективна против совокупности защитных моделей и сценариев red teaming, на которых она обучалась. Мы также оцениваем, полезна ли эта модель как универсальный агент для red teaming для укрепления безопасности в OpenAI в целом. Для этого мы проверяем эффективность GPT‑Red в новых средах безопасности и на новых целевых моделях.
Сначала мы оцениваем способность GPT‑Red обобщать на новые сценарии red teaming с помощью воспроизведенной версии арены косвенных промпт-инъекций из работы Dziemian et al. (2025)(открывается в новом окне). В этом испытании специалисты по red teaming и GPT‑Red независимо предлагали атаки против GPT‑5.1 в наборе заранее заданных сред. Эти сценарии и цели red teaming отличаются от тех, на которых обучался GPT‑Red. GPT‑Red достигает значительно более высокой доли успешных атак: успех в 84% сценариев против 13% у людей.
GPT‑Red показывает отличные результаты как автоматизированная модель для red teaming. На внутренней копии арены косвенных промпт-инъекций из работы Dziemian et al. (2025) GPT‑Red способна генерировать успешные атаки против GPT‑5.1 в существенно большем числе сценариев, чем специалисты по red teaming.
Главная проверка специалиста по red teaming — способность достигать целевых вредоносных целей против реальных агентных систем при неполном знании базовой модели и устройства обвязки системы. В первом эксперименте в такой постановке мы противопоставили GPT‑Red торговому автомату с ИИ в офисе OpenAI (похожему на Project Vend(открывается в новом окне)), созданному Andon Labs. Мы дали GPT‑Red описание системы, возможность отправлять атаки и наблюдать вызовы инструментов симулированного агента, который близко повторяет реальное развертывание. После нескольких итераций над атаками GPT‑Red применила свою атаку к агенту, работающему в реальной среде, и достигла всех трех вредоносных целей:
- Изменить цену дорогого товара в наличии на минимально допустимую — $0.50;
- Заказать новый товар стоимостью более $100 и предложить его за $0.50; и
- Отменить заказ другого клиента.
Мы сообщили об этих уязвимостях, и новые защитные меры уже активно тестируются.
GPT‑Red способна взломать работающего автономного агента Vendy, который управляет торговым автоматом. GPT‑Red смогла заставить агента, работающего в реальной среде, снизить цены на дорогие товары и отменить заказы других клиентов: сначала атаки проверялись в симуляции, а затем переносились на работающего агента.
Мы также используем GPT‑Red для атаки на агента Codex CLI (на базе GPT‑5.4 mini) в наборе из 10 отложенных сценариев эксфильтрации данных. Мы сравниваем эту модель с базовым вариантом GPT‑5.5 с промптом, чтобы изучить влияние нашей процедуры обучения на качество red teaming в отложенных задачах. GPT‑Red одновременно эффективнее — она успешно заставляет агента эксфильтровать чувствительные данные в большем числе сценариев — и экономичнее по токенам.
GPT‑Red эффективнее и экономичнее взламывает работающих агентов Codex. Мы тестируем эту модель на агенте Codex на базе GPT‑5.4 Mini в специальном наборе из 10 задач по эксфильтрации данных.
Главная цель GPT‑Red — повысить устойчивость наших моделей. За последние шесть месяцев мы обучали все более сильные модели для red teaming — предшественницы GPT‑Red — с наращиванием вычислительных ресурсов и использовали их при обучении каждой следующей модели, развертываемой в рабочей среде, начиная с GPT‑5.3. Со временем каждый новый релиз GPT становился устойчивее.
Например, ранняя версия GPT‑Red обнаружила новый класс прямых промпт-инъекций, известный как атаки «Ложная цепочка рассуждений (CoT)». На GPT‑5.1 успешность этих атак превышала 95%, а для GPT‑5.6 Sol сейчас ниже 10%. Аналогично несколько наших бенчмарков косвенных промпт-инъекций для атак в инструментах разработчика и браузинге были насыщены нашей новейшей моделью (>97% точности).
Устойчивость к самой GPT‑Red также существенно выросла. В широком наборе сред для проверки устойчивости доля успешных атак GPT‑Red со временем монотонно снижалась. В нашем последнем релизе модели GPT‑5.6 Sol дает сбой лишь на 0,05% прямых промпт-инъекций GPT‑Red.
По мере масштабирования обучения через self-play на задачах с промпт-инъекциями мы обнаруживали новые угрозы, способные взламывать существующие модели. В то же время это масштабирование существенно повысило устойчивость к таким атакам. Доля успешных атак вычисляется как средняя успешность всех попыток GPT‑Red в отложенных средах.
Модель может казаться безопаснее, если чаще отказывается от запросов или становится менее способной. Модель, которая делает меньше, естественно сложнее атаковать, но такая устойчивость бесполезна.
Мы тщательно оцениваем как общие передовые возможности, так и специально разработанные нами задачи на чрезмерные отказы. Мы видим, что все обычные возможности сохраняются, а устойчивость значительно улучшается. Это показывает, что прирост устойчивости связан с лучшим сопротивлением вредоносным инструкциям, а не с неправильным использованием инструментов или отказом от легитимных запросов по умолчанию.
ИИ-агенты уже используются для улучшения возможностей наших моделей следующего поколения. Мы считаем, что с GPT‑Red начали запускать аналогичный маховик для безопасности: сегодняшние модели могут помогать делать завтрашние модели более устойчивыми, согласованными и заслуживающими доверия. Мы продолжим масштабировать вычисления и данные, а также улучшать алгоритмы, чтобы обучать будущие версии GPT‑Red, более сильные, чем нынешняя модель. А они, в свою очередь, помогут сделать будущие релизы GPT безопаснее.
Позже на этой неделе мы выпустим препринт с дополнительными подробностями.


