跳至主要内容
OpenAI

Hugging Face 事件及失准模型对其他第三方造成的影响

随着 AI 系统的能力和自主性不断提升,失准行为可能转化为现实世界中影响重大的行动,包括网络安全事件及开发者可能未曾预料的其他后果。因此,了解这些行为如何出现、如何升级,以及开发者应如何检测和应对,正日益成为安全构建和部署先进 AI 系统的重要环节。

由于 Hugging Face 事件涉及平台级入侵,我们最初主要将其视为安全问题。它仍是我们目前在自有模型中发现的最严重的同类活动,主要由一个能力很强、仅供内部使用的研究模型推动。此后,我们认识到,此次入侵源于模型为完成高难度任务而采取的不当策略,Hugging Face 技术报告对此已有记录。网络安全事件是这一风险的其中一种表现;失准还可能导致传统安全范畴之外其他意外或令人担忧的行为,例如我们的模型在第三方网站上发帖 — 我们将其称为“智能体垃圾信息”。这两类问题我们都必须解决。

我们持续审查更广泛的活动,优先处理较严重的事件,并逐步扩大到严重程度较低的失准活动,包括智能体垃圾信息。

本页面汇集了我们对 Hugging Face 事件的报告和最新进展、相关研究和公开演讲、我们发现的其他活动、对模型失准影响的认知,以及为强化系统而采取的措施。随着调查工作的推进,我们将更新本页面。


影响第三方的活动

为了更好地了解这些意外行为的范围,我们一直在广泛审查自有模型在训练和评估期间的互联网活动。审查过程中,我们会持续识别和通知第三方,并优先处理以下事件:

  • 我们的模型可能绕过了第三方的安全控制体系,或可能影响了在线服务的可用性;或者

  • 失准案例对第三方网站或服务造成了负面影响。

根据目前的审查结果,我们已依据上述标准通知了数十个第三方。我们仍在审查过往活动,这项工作需要投入大量时间和资源。随着工作的推进,我们将通知更多第三方。

下文将以匿名摘要形式,介绍我们观察到的失准活动类型;随着我们逐步通知更多第三方并加深认识,我们将持续更新这些说明。此外,我们还将分享有关审查状态的最新信息。为保护受影响方,我们通常会在必要时省略名称和其他身份识别信息,但已获知情况的相关方可以选择公开分享我们向其提供的信息。

观察到的活动摘要

我们目前的审查和通知流程发现了以下几类活动:

  • 绕过访问控制:智能体获取了通常需要身份验证、特定权限、订阅或账户才能访问的信息或功能。例如,智能体使用不同的网址、更改请求中的详细信息,或利用权限超出预期的登录会话。

  • 使用暴露的凭据:智能体发现公开的登录信息或访问密钥,并用它们访问服务。

  • 查询或命令注入:智能体向网站或服务输入文本,而服务将其视为指令,而非普通输入。这可能导致服务在其服务器上运行数据库查询、应用程序代码或命令。

  • 访问运行时内部资源:智能体读取了包含服务实现的文件,或与仅供内部使用的后台系统交互。在这些案例中,智能体访问了预期权限范围之外的服务内容。

  • 智能体垃圾信息:智能体在第三方网站上发布信息,可能改变网站内容并需要清理,例如将公共 Wiki 页面用作共享留言板。


事件时间线

9 月

8 月

7 月