OpenAI-Hugging Face 事件(在新窗口中打开)是网络安全领域的一个分水岭,因为它让我们得以一窥典型威胁行为者的能力将在未来几个月如何演变。过去几周,我与许多组织进行了交流,一个共同主题十分明确:它们知道自己必须以前所未有的速度,全面提升网络安全能力和实践水平。本文将介绍我们如何保护 OpenAI、其他组织现在可以采取哪些具体措施,以及为何必须立即行动。
世界各地开发的 AI 模型越来越能够自动执行现实网络攻击中的部分环节,使长期存在的安全缺口更容易被发现和利用 — 从深藏在人类编写的软件中的缺陷,到被遗忘的权限,皆是如此。同样的 AI 能力也为防御者提供了发现并修复这些薄弱环节的新方法,但他们必须立即行动。如果企业果断行动,包括夯实基础,并利用 AI 大幅增强团队能力,我们就能让互联网变得前所未有地安全。
在 OpenAI-Hugging Face 事件中,一个智能体集群不仅自主攻入了 OpenAI 的研究基础设施,还渗透了另一家公司的生产基础设施。它串联利用了多种漏洞,从此前未知的安全缺陷到已泄露至互联网的用户账户凭据。越来越明显的是,每家公司的技术债务(在新窗口中打开)背后都隐藏着重大缺陷,防御者必须抢在攻击者之前发现并修复它们。
为了让防御者获得相对于攻击者的优势,今年早些时候,我们开始仅向受信防御者提供网络安全能力。此后,多家公司发布了具备网络安全能力的开放权重模型,与前沿水平仅相差数月。其中最新的模型似乎计划于 8 月底发布(在新窗口中打开),并很可能显著加快威胁形势的演变。
AI 驱动的攻击者很快便能发现许多现有系统中长期存在的缺陷,但 AI 也会让防御者更容易发现、确定优先级并修复这些缺陷。安全攻防仍是一场猫鼠游戏,但 AI 可能会改变其经济逻辑(在新窗口中打开),从根本上让防御者占据优势。例如,我们已开始专门训练模型编写安全性超越人类水平的代码。我们的模型也极其擅长数学证明,可用于形式化验证软件安全性,而人类一直难以完成这种验证。
OpenAI-Hugging Face 事件发生后,我让 ChatGPT 工作(使用公开可用的 GPT‑5.6 Sol)评估 gregbrockman.com(在新窗口中打开) 的安全性。这是一个简单的静态网站,托管在 AWS 上,以 Cloudflare 作为前端入口,所以我原以为不会有太大的漏洞攻击面。
大约 15 分钟内,它就发现了 13 个问题。其中许多问题单独来看可能无法利用,但我可以想象,如果把它们与其他漏洞串联起来,便可能造成重大影响。我没有配置 DNS 记录来防止攻击者冒充我发送邮件;网站使用了不安全版本的 jQuery;Cloudflare 通过未加密的 HTTP 将请求转发至 AWS。
随后,我让 ChatGPT 工作修复这些问题,它在一小时内全部完成。它在我的浏览器中打开 Cloudflare 控制面板,通过点击多个按钮正确配置 DNS、TLS 和高级安全设置;从网站中彻底移除 jQuery;将网站从 AWS 迁移到 Cloudflare Pages;并开始分阶段部署 DMARC(在新窗口中打开)。
而这还只是我的个人网站。这个小例子表明,我们现有的模型可以充当网络安全守护者:发现人工无暇处理或缺乏专业知识应对的长尾问题(它修复的许多设置我只是略有了解,无法立即说出正确的配置方法),然后按照经过适当调整的发布计划完成修复。
Hugging Face 事件表明,我们低估了 AI 模型在现实世界中的网络攻击能力。为此,我们正在加强安全要求,这也进一步提升了现有安全研究和内部安全工作的紧迫性。
我想借此分享 OpenAI 当前采用的部分安全防护方法,希望能对其他组织有所帮助。为了保护 OpenAI,我们正大力投资于基础控制措施 — 把基本功做好 — 同时借助前沿智能增强防御能力。这项策略有四大支柱。
第一,我们正利用模型帮助保护代码安全。Codex(包括我们的安全插件)会验证代码变更、识别漏洞,并帮助开发者在部署前修复问题。我们的目标并不是简单地产生更多需要人工验证的安全发现,而是要在代码上线前发现其中真正的漏洞,并缩短从发现问题到安全部署修复方案所需的周期。随着我们不断训练模型生成日益安全的代码,我们的目标是从新编写的代码中消除某些类型的软件漏洞。
第二,我们正让模型持续参与基础设施防御。目前,我们几乎所有初始安全警报都会先由智能系统分类处置,再交由人工介入。这有助于减少防御人员的繁重工作、缩短响应时间,并让他们把时间投入最能发挥自身技能的环节 — 辨别、判断和运用专业知识。我们正逐步将这些检测结果与范围受限的自动响应相连接,同时仍由人工负责影响最大的决策。目标是确保我们能以机器速度检测并响应安全问题。
第三,我们正利用前沿智能持续枚举、探测和识别潜在攻击路径。通过识别漏洞、配置错误、权限过高的身份或意外形成的信任边界,我们能够在攻击者利用这些缺口前迅速发现并将其封堵。这让我们能够持续评估、监控和测试各产品、基础设施及系统中的安全不变量,也就是我们认为始终成立的安全属性。
最后,我们还在大力投入,在全公司范围内夯实基础安全能力。我们继续投资于安全架构和控制措施,采用纵深防御、最小权限等策略,并在设计系统时确保只有多项独立控制措施同时失效,才可能发生灾难性事件。在 AI 时代,网络隔离、工作负载加固、监控以及安全的补丁安装与部署等传统安全控制措施将比以往更加重要。
时间至关重要,防御者需要以空前速度落实以下步骤。下文会提到 OpenAI 的技术,但生态系统中也有许多竞品值得评估。具体使用哪款工具并非关键,重要的是立即让防御团队用上强大的 AI。
- 争取组织层面的承诺和支持。安全风险正在迅速变化 — 请确保安全与工程团队获得必要的支持、协作与资源,以快速应对这些风险。与团队开展桌面推演,模拟这些攻击在组织中可能以何种形式出现,以及你们将如何响应。
- 为安全团队配备智能体。开始使用 Codex、Codex Security 插件(在新窗口中打开)或其他强大的智能体编程和安全工具。在获得批准的前提下,允许它访问安全团队需要评估的代码库、基础设施配置和技术文档。不必等到在全公司铺开后再行动;现在就从最高优先级的系统开始。
- 为智能体配备安全专业能力。从社区支持的技能(在新窗口中打开)入手,其中包括静态分析、安全专项代码审查、漏洞变体分析、软件供应链风险等安全工作流。然后围绕组织的架构、安全标准、威胁模型和处置手册构建自己的技能。
- 立即对自己的系统开展安全评估。优先评估面向互联网的服务、身份验证流程、基础设施即代码、部署流水线以及处理敏感信息的系统。随着团队信心增强,逐步扩大扫描范围。
- 着手清理现有的漏洞积压。向智能体提供代码扫描结果、依赖项警报、安全工单、漏洞赏金报告和以往评估结果。让它对这些发现进行分类处置,区分可利用的问题与噪声,识别代码库其他位置的相关漏洞,并建议应优先修复哪些问题。
- 将安全审查直接纳入开发流程。使用智能体在代码变更合并前进行审查,并在 CI 中运行安全检查。检查身份验证错误、访问控制绕过、凭据暴露、不安全的依赖项和默认设置、扩大生产系统访问权限的变更,以及其他漏洞。
- 让智能体协助修复发现的问题。对于已验证的问题,让它生成并验证有针对性的补丁、编写回归测试,并确认漏洞无法再复现。对影响重大的变更保留人工审查,但应消除从确认真实问题到向工程师提交安全修复方案之间不必要的延误。
- 逐步实现检测分类处置自动化。不要一开始就试图构建自主运行的安全运营中心。首先对一个代码仓库运行只读安全扫描,或让智能体以只读方式访问现有日志,审查此前已解决的警报。让它汇总证据并建议处置方式,同时仍由人工作出每一项决定。随着信心增强,逐步过渡到仅提供建议的 Pull Request 扫描、实时警报分类处置,再到自动关闭符合严格限定条件的误报。
- 提前准备好 AI 辅助取证调查能力。申请网络安全受信访问权限(在新窗口中打开),让团队获准使用 GPT‑Daybreak‑Blue 开展经授权的防御工作,包括事件响应、检测工程和恶意软件分析。练习使用这项能力分析日志、遥测数据和安全警报。
- 开展实验和黑客周活动,快速迭代。面对即将到来的新世界,我们需要构建各种新工具、改变工作方式,并提升每个人的能力。鼓励员工开展实验,安排黑客周来构建新能力,并专注于快速迭代,实现问题中各个小环节的自动化。快速、渐进的进展会产生复利式的防御成效;随着团队信心增强,还可逐步扩大自主运行范围。
没有哪家公司能独力完成这一切。我们呼吁 AI 实验室、安全厂商、企业和维护者共享经过验证的发现、修复方案及实用处置手册,让一家组织的发现能够增强整个生态系统。
防御者的机遇窗口已经开启。未来几个月,每个组织都需要开始大幅提高安全体系的自动化程度,才能维持安全;随着 AI 持续进步,安全社区必须立即行动,制定能够让防御者能力增速超过攻击者的工具、实践和处置手册。这需要付出前所未有的巨大努力,但只要我们团结起来,就能创造一个比过去所能想象的更加安全的世界。


