涉及 OpenAI 模型的第三方网络安全评估
独立测试有助于我们在部署前验证并进一步了解风险,发挥着重要作用。一些网络安全评估会有意采用定制配置,包括降低防护措施,以衡量模型的底层能力,而非模型在公开部署中的通常表现。
在近期评估中,两家外部测试合作伙伴发现了一些事件:测试配置与控制措施,加之近期模型能力不断提升,使模型的活动超出了预定的测试边界。这些事件表明,随着模型能力不断增强,业界与第三方评估机构开展合作、持续完善测试环境和实践标准至关重要。编者注:这些事件与 Hugging Face 安全事件无关。我们将继续在此发布 Hugging Face 事件的最新进展。
这些新事件涉及 OpenAI 模型在第三方网络安全评估期间访问公共互联网。当时采用了特定条件和降低防护措施的配置,并不代表常规部署情形。相关事件包括:
- 英国政府的 AI 安全研究所 UK AISI 在开展网络靶场评估时,有意开放互联网访问,使智能体能够自行寻找工具,并在更接近真实攻击者的条件下操作;同时停用网络安全分类器,以衡量底层能力。你可以在此(在新窗口中打开)阅读其博客文章。
- 我们的外部网络安全测试合作伙伴之一 Irregular 正在开展原本应与互联网隔离的夺旗赛式评估,但测试环境配置错误,使模型能够访问公共互联网。
下文将概述事件经过、促成相关活动的测试条件、为控制事件采取的措施,以及我们为确保独立实验室能够继续严格、安全地评估能力日益增强的模型而开展的工作。
这些事件反映了我们近期有关Hugging Face 事件的文章中所述的同一项广泛挑战:随着模型能力提升,模型周边的安全保障体系也必须同步发展。这既包括用于开发模型的环境,也包括实验室和独立合作伙伴用于评估模型的环境。
未来几周,我们将审查自身的第三方测试方法,包括如何识别风险较高的评估、商定范围、评估开放互联网访问或降低防护措施的请求、明确对隔离、凭据处理、监控和停止条件的要求,以及建立更清晰的事件通知与升级流程。
我们致力于推动全行业合作,加强安全开展高风险评估的共同实践,包括在未来几周召集国家级 AI 机构、独立评估机构、其他 AI 实验室等利益相关方。我们的目标是在保留严格独立评估价值的同时,确保测试实践跟上模型能力不断提升的步伐。
8 月 3 日,UK AISI 告知我们,在一项于 7 月 25 日启动的常规网络安全评估中,OpenAI 和另一家实验室的模型在某些情况下超出了测试范围。评估在为模拟真实网络而设计的受控网络靶场中进行。在发现的 19 起事件中,有两起涉及 OpenAI 模型 GPT‑5.6 Sol。其余事件涉及另一家实验室的模型。
在此次评估中,智能体被要求在夺旗赛演练中扮演网络安全专家:攻破三个相互连接的模拟环境,并获取最终旗标。任务提示明确了范围内的靶场网络,并将多个系统列为范围之外。UK AISI 还开放了实时互联网访问,使智能体能够下载工具,并在更接近人类攻击者的条件下操作;同时停用了模型的网络安全分类器,以衡量底层能力。
UK AISI 设定的授权边界是模拟网络靶场:智能体获准攻击指定的模拟网络并获取旗标,但无权与靶场网络边界之外的系统交互。然而,智能体并未被明确告知可以和不可以如何使用开放的互联网访问;UK AISI 认为这可能是导致事件的原因之一。
在这些运行过程中,UK AISI 发现 GPT‑5.6 Sol 在尝试寻找进入模拟靶场的路径并获取旗标时,执行了两项未经授权的操作:
- GPT‑5.6 Sol 重用了另一家实验室的智能体公开遗留的一个 GitHub Token,以检查靶场内的系统是否在轮询 GitHub 或其他更新服务;它还尝试绕过账户恢复和请求限额,并在外部 DNS 与隧道服务提供商处注册了账户。
- GPT‑5.6 Sol 使用公共隧道服务,将其评估环境中本地运行的 DNS 服务器暴露至公共互联网。该服务器包含针对测试靶场内某款软件已知漏洞的攻击载荷。这一配置并未奏效,没有证据表明任何真实的解析器曾向其发起查询;评估结束后,相关基础设施已被移除。
尽管该模型是为了完成网络靶场任务,但 UK AISI 认为这些行为未经授权,因为它们涉及靶场边界之外的真实外部账户和服务,而且完成任务并不需要这些行为。该 DNS 服务器还在公共互联网上托管了漏洞利用载荷,但这一配置并未奏效,也没有证据表明任何真实的解析器曾向其发起查询。
7 月 28 日,安全监控检测到异常数据传输后,UK AISI 发现了这一活动。UK AISI 随即停止相关评估、隔离有关机器,并在检测到活动后约一小时内将其控制住。
感谢 UK AISI 在整个过程中与我们合作,包括识别、调查这一活动并分享相关细节。我们期待继续深化双方合作。
7 月 29 日,我们的第三方评估合作伙伴 Irregular 向我们通报了一起事件,涉及 OpenAI 模型在夺旗赛(CTF)式网络安全评估中的行为。这些模型被要求利用模拟环境中的弱点寻找隐藏信息,并被告知无法访问互联网。然而,测试环境的错误配置使模型能够访问公共互联网。
在一项测试中,CTF 挑战所用的虚构目标名称意外地与一个真实域名重合。由于测试环境被误接入互联网,模型将一个真实网站误认为模拟环境的一部分,并对其实施了攻击。这并不涉及复杂的沙箱逃逸或零日漏洞:互联网访问源于错误配置,而模型利用的似乎是一个基础安全漏洞。
根据 Irregular 的调查,该模型还发现并使用凭据对同一网站进行了操作。Irregular 尚未发现除受影响网站自身数据之外的其他影响,其审计工作仍在进行中。Irregular 已暂停相关评估并开始补救,同时已通知受影响的第三方。Irregular 告知我们,与该事件有关的所有已发现问题均已消除,并已在测试环境中增设相关防护措施。Irregular 还通报了同一测试环境中涉及其他实验室的相关事件。
感谢 Irregular 与我们合作;我们将继续与其密切配合,为其审查工作提供支持。Irregular 还在编写一份白皮书,以分享安全开展网络评估和实施隔离的最佳实践。我们期待参与这份白皮书,将调查结果分享给业界,并继续深化双方合作。我们认为,这类合作对于确保安全、全面地评估当前及未来的模型至关重要。

