跳至主要内容
OpenAI

2026年7月21日

安全防护

OpenAI 与 Hugging Face 合作应对模型评估期间的安全事件

正在加载…

上周,Hugging Face 在检测并遏制了一个入侵其基础设施的 AI 智能体后,披露了一种新型安全事件(在新窗口中打开)。随着具备越来越强网络能力的模型不断普及,我们预计这类事件会变得更加常见。经过调查,我们现在知道,这起特定事件是在对一项网络能力基准测试(在新窗口中打开)进行内部测试时,由多个 OpenAI 模型共同驱动的,其中包括 GPT‑5.6 Sol 以及一个能力更强的预发布模型;为评估目的,这些模型的网络安全相关拒答均被降低。

我们认为这是一起前所未有的网络事件,涉及最先进的网络能力,并正据此作出相应响应。现阶段,我们分享初步发现,旨在帮助防御者了解发生了什么,并帮助各方校准对当今模型能力的认识。我们将继续与 Hugging Face 一同开展彻底调查,并在调查完成后分享有关漏洞、事件和发现的更多细节。

此次事件中发生了什么

此次事件发生在一次内部评估期间;该评估会促使模型通过复杂攻击路径开展高级利用,以量化其网络能力。我们在不启用用于阻止模型开展高风险网络活动的生产环境分类器的情况下运行该评估,以估算最大网络能力。我们的基准测试在高度隔离的环境中运行,网络访问仅限于通过内部托管的第三方软件安装软件包;该软件充当软件包注册表的代理和缓存。

这些模型识别并串联利用了 OpenAI 研究环境和 Hugging Face 生产基础设施中的漏洞,直接从 Hugging Face 的生产数据库获取测试答案。所有证据都表明,这些模型高度专注于为 ExploitGym 寻找解决方案,并为实现一个相当狭窄的测试目标而采取了极端手段。

在我们的沙盒测试环境中运行时,模型为了解决评估问题,投入了大量推理算力来寻找获取开放互联网访问的方法。为获得访问权限,模型识别并利用了软件包注册表缓存代理中的一个零日漏洞;我们现已向供应商负责任地披露该漏洞。获得这一访问权限后,我们的模型在研究测试环境中执行了一系列权限提升和横向移动操作,直到抵达一个具备互联网访问权限的节点。

获得互联网访问权限后,模型推断 Hugging Face 可能托管了 ExploitGym 的模型、数据集和解答。基于这一判断,模型开始搜索并成功找到了获取秘密信息的途径,以利用这些信息在评估中作弊。在一个示例中,模型串联了多个攻击向量,包括使用被盗凭据和零日漏洞,在 Hugging Face 服务器上找到了一条远程代码执行路径。OpenAI 安全团队在内部发现了这一异常活动。

Hugging Face 的安全团队和智能体检测并阻止了其基础设施上的这一活动;在双方团队取得联系时,他们已经开始使用自己的开源模型进行遏制和取证重建。我们正积极与他们合作,继续调查此次事件。我们感谢 Hugging Face 在调查和修复工作中迅速且紧密的协作。

我们正在采取的行动

  1. 作为调查的一部分,我们正在基础设施配置中实施严格控制,即使这会牺牲研究速度,直到相关漏洞完成修补。我们会定期向安全与安保委员会通报这些控制措施及其影响。
  2. 我们正与 Hugging Face 合作,对此次事件进行取证调查。
  3. 我们已负责任地披露了内部托管的第三方软件中发现的零日漏洞,并正与其合作进行修补。
  4. 我们已将 Hugging Face 纳入受信任访问计划,并支持其团队快速利用我们模型的能力来提升防御。
  5. 我们正在改进并加强对未来训练和评估的保护。本周,我们发布了一篇博客,介绍如何在长时间跨度模型时代提升安全性与对齐。这些部署保障措施在本次评估中有意未启用,因为评估旨在测试网络漏洞。此次事件表明,我们需要进一步加强模型对齐、评估期间的网络防护,以及内部测试期间的监控。

我们评估高级网络能力的方法

正如我们最近分享的那样,AI 正在加速漏洞的发现和利用。此次事件带来的主要教训是,模型安全与安全保障必须跟上能力快速进步的步伐。我们正在加强模型开发期间使用的隔离、监控、访问控制和评估实践。

英国 AI 安全研究所(UK AISI)的评估显示,GPT‑5.6 Sol 等模型越来越能够在长时间跨度内持续执行复杂的多步骤网络行动。此次事件表明,这些理论能力确实适用于现实环境。

英国 AI 安全研究所的图表,对比了近期开放权重模型和前沿模型在长时间跨度网络靶场上的表现。

此次事件还清楚表明,高级模型即使无法访问源代码,也能在现实系统中发现并利用新的攻击路径。它凸显出,高级网络能力的开发必须与更强的保障措施和防御工具同步推进。

我们认为,具备高级网络能力的模型需要帮助安全团队抢在攻击者之前发现弱点,理解漏洞如何被串联利用,并以机器速度完成修复。我们正在利用这些能力,持续加强围绕基础设施配置和模型评估环境的保护;随着不断学习,我们也会分享发现和最佳实践。我们鼓励其他防御者立即申请受信任访问并试用这些模型,将这些能力转化为更好的预防、更快的检测和更有效的事件响应。

“我们感谢 OpenAI 在此事及其他议题上的合作。此次事件可能是同类首例,它证明了我们长期以来的一个信念:AI 安全无法由任何一家公司在秘密中独自解决。它将通过开放、协作的方式解决,让各地每一位防御者都能广泛使用 AI。”
——Clem Delangue,Hugging Face 联合创始人兼 CEO

作者

OpenAI