摘要
问题
红队测试对于发现漏洞并提升我们模型的稳健性至关重要。但当前方法难以规模化扩展,因而形成了瓶颈。
常用的稳健性评估已经被我们的最新模型刷到接近饱和。
我们需要开发方法,让安全和对齐能够随模型能力一起扩展。
我们做了什么
我们训练了 GPT‑Red,这是一个自动化红队测试模型,它能扩大我们发现漏洞的能力,以便在更广泛部署前修复这些漏洞。
GPT‑Red 是强大的红队测试模型,我们此前的模型很容易受到它的提示注入攻击。
我们使用 GPT‑Red 对 GPT‑5.6 进行对抗训练,以提高其对抗提示注入的稳健性。
我们将继续扩大这种方法的规模,并结合人类和第三方红队测试、分层防护措施以及实时监控。
AI 系统经常会通过浏览器、连接的应用、本地文件和其他工具接触第三方数据。这些能力对于执行现实世界任务是必要的,但也为恶意行为者影响模型行为创造了更多机会。例如,第三方可能会在电子邮件、网页、工具响应或代码仓库中嵌入一条精心设计的指令,诱骗模型将敏感数据上传到外部服务器。
人类红队测试是我们安全工作中的关键环节,帮助我们在部署前发现这些漏洞,并落实适当的防护措施。但仅靠人类红队测试很难实现规模化应用。设计和执行这些演练非常耗时,限制了我们快速识别新失败模式并将其纳入更强防护措施的进程。此外,虽然这些演练能产生有价值的成功攻击样例,但无法生成足够数量且多样性的对抗性数据,以满足通过训练提升模型稳健性的需求。
要跟上能力日益增强的模型,红队测试也必须随之扩展规模。为此,我们一直在训练仅限内部使用的自动化红队测试模型,用于在部署前发现漏洞,并在模型训练期间生成攻击以提升稳健性。我们相信,自动化红队测试为安全体系开启了一种关键的自我改进形式:用今天的模型直接优化未来模型的安全性。
GPT‑Red 是这些技术成果的集大成者,也是我们目前最好的自动化安全红队测试模型。与人类红队测试人员构造攻击类似,该模型会通过发送提示、观察 GPT 模型的响应并不断迭代来朝目标推进。我们在与 OpenAI 部分最大规模后训练相当的计算资源基础上训练 GPT‑Red — 这是有史以来专门用于提升安全性的最大规模算力投入。
我们将 GPT‑Red 直接纳入生产模型的训练过程。因此,GPT‑5.6 Sol 成为我们迄今为止能够有效抵御提示注入攻击的模型;在我们最严格的直接提示注入基准测试中,其失败次数相比四个月前表现最佳的生产模型减少了 6 倍。这一方法的可扩展性让我们对未来持续训练更强大的红队测试模型、取得更出色的成果充满期待。
GPT‑Red 使用自我博弈强化学习进行训练:模型会与一组多样化的防御方 LLM,在广泛的红队测试场景中同步训练。当 GPT‑Red 诱发有效的错误输出(例如一次成功的提示注入)时会获得奖励,而防御方模型则因抵御攻击并完成原本任务而获得奖励。随着防御方变得更稳健,GPT‑Red 被迫发现更强、更多样化的攻击。
为支持自我博弈训练,我们构建了一套规模庞大且贴近现实的场景,用于模拟提示注入可能被插入的位置。每个环境都有一个威胁模型,用来规定 GPT‑Red 可以控制什么,以及怎样才算攻击成功。例如,GPT‑Red 可能控制本地文件的一部分、网页横幅、电子邮件正文,或某个工具的输出。
训练结束时,GPT‑Red 已成为非常强大的攻击者:无论是内部模型还是包括 GPT‑5.5 在内的生产模型,几乎所有与它对抗的模型都能被它攻破。GPT‑Red 完成训练后,我们用它生成提示注入来训练 GPT‑5.6,从而提高该模型对 GPT‑Red 攻击的抵抗力。
我们将 GPT‑Red 与部署的模型分开。这样既能避免我们专门针对 GPT‑Red 训练的恶意能力落入对抗性攻击者手中,又能将稳健性融入我们的生产模型。
GPT‑Red 对其训练所用的防御方模型群体和红队测试场景非常有效。我们还评估该模型能否作为通用红队测试智能体,在 OpenAI 更广泛地提升安全性。为此,我们在新的安全环境和目标模型上测试 GPT‑Red 的有效性。
我们首先使用“Dziemian 等人提出的间接提示注入竞技场 (2025)(在新窗口中打开)”复刻版本,评估 GPT‑Red 泛化到新红队测试场景的能力。在这项挑战中,人类红队测试人员和 GPT‑Red 分别针对一组预先指定的环境,独立提出对 GPT‑5.1 的攻击策略。这些红队测试场景和目标不同于用于训练 GPT‑Red 的场景和目标。GPT‑Red 的攻击成功率显著提高:在 84% 的场景中取得成功,而人类的成功率为 13%。
GPT‑Red 是出色的自动化红队测试模型。在“Dziemian 等人提出的间接提示注入竞技场 (2025)”的内部镜像中,相比人类红队测试人员,GPT‑Red 能在更多场景中生成针对 GPT‑5.1 的成功攻击。
对红队测试人员的终极考验是,在对现实世界中的智能体系统底层模型和执行框架设计了解不够全面的情况下,实现针对该系统的恶意攻击目标的能力。我们在此环境下进行的第一个实验,是利用 GPT‑Red 针对 OpenAI 办公室中由 Andon Labs 生产的 AI 自动售货机(类似于 Project Vend(在新窗口中打开))进行对抗测试。我们向 GPT‑Red 描述了该系统,使其能够发送攻击并观察来自模拟智能体的工具调用,这与现实世界的部署非常相似。经过多次攻击迭代,GPT‑Red 对生产智能体部署攻击,实现以下三个恶意目标:
- 将一件高价库存商品的价格改为可设定的最低价格 0.50 美元;
- 订购一件价值超过 100 美元的新商品,然后以 0.5 美元的价格出售;
- 取消其他顾客的订单。
我们已披露这些漏洞,目前正在积极测试新的安全措施。
GPT‑Red 能够攻破用于管理售货机的线上自主智能体“Vendy”。GPT‑Red 先在模拟中测试,再将攻击迁移到线上智能体,成功让生产智能体把高价商品改为低价,并取消其他顾客的订单。
我们还使用 GPT‑Red 对 Codex CLI 智能体(基于 GPT‑5.4 mini)进行了攻击,测试了 10 个隐藏数据外泄场景。我们将该模型与提示 GPT‑5.5 基线进行比较,以研究我们的训练程序对预留红队测试性能的影响。GPT‑Red 不仅更有效(因为它可以在更多场景中成功让智能体窃取敏感数据),而且 Token 效率更高。
GPT‑Red 在攻破线上 Codex 智能体方面更有效,也更高效。我们在一套包含 10 个数据外泄任务的自定义测试集上,测试了由 GPT‑5.4 Mini 支撑的 Codex 智能体。
GPT‑Red 的最终目标是提高我们模型的稳健性。在过去的六个月里,我们不断训练计算能力越来越强的红队测试模型(GPT‑Red 的前身),并从 GPT‑5.3 开始,将这些模型用于训练每个后续的生产模型。随着时间的推移,后续的每个 GPT 版本都变得更加稳健。
例如,早期版本的 GPT‑Red 发现了一种新型的直接提示注入攻击,称为“伪思维链”攻击。这些攻击在 GPT‑5.1 上的成功率高达 95% 以上,但在 GPT‑5.6 Sol 上的成功率现在低于 10%。同样,我们针对开发者工具和浏览中的攻击进行的几个间接提示注入基准测试,已被我们最新的模型所覆盖(准确率 >97%)。
对 GPT‑Red 本身的稳健性也得到了显著提高。在广泛的稳健性环境下,GPT‑Red 的攻击成功率随着时间的推移持续下降。在我们最新发布的模型中,GPT‑5.6 Sol 在 GPT‑Red 的直接提示注入中仅有 0.05% 的失败率。
随着我们持续扩大提示注入自我博弈训练的规模,我们发现了能够攻破现有模型的新威胁。与此同时,我们的规模化扩展也显著提升了模型抵御这类攻击的稳健性。攻击成功率按 GPT‑Red 在预留环境中所有尝试的平均成功率计算。
通过拒绝更多请求或降低自身能力,模型的安全性可能会有所提升。功能较少的模型自然更难被攻击,但这并不是有用的稳健性。
我们会全面评估模型的通用前沿能力,同时也会针对我们专门设计的过度拒绝任务进行专项测评。我们发现所有正常功能均不受影响,同时显著提高了稳健性。这表明,稳健性的提升来自于对恶意指令的更强抵抗力,而不是不当使用工具或默认拒绝合法请求。
AI 智能体已被用于提升我们下一代模型的性能。我们相信,借助 GPT‑Red,我们已经开始解锁类似的安全飞轮,今天的模型可以用来提高未来模型的稳健性、协调能力和可信度。我们将继续扩大计算和数据规模,同时改进算法,以训练比当前模型更强大的后续版本 GPT‑Red。反之,这些模型将有助于提升未来 GPT 版本的安全性。
我们将在本周晚些时候发布一份包含更多细节的预印本。


