应对关键网络能力的下一个前沿
随着模型能力不断增强,既能强化网络防御,也能让攻击以前所未有的速度和规模展开,网络安全形势正迅速变化。
过去几天,我们对即将推出的模型之一 Astra 进行了最新内部评估,结果表明其智能体编程和网络安全能力取得了显著进展。结合这些结果与专家评估,我们昨晚得出结论:按照我们的准备框架(在新窗口中打开),目前无法排除其具备关键网络能力的可能性。
我们公开这一信息,是因为我们认为,向公众以及安全与安保领域的相关群体透明说明这一潜在的能力变化十分重要。
我们于 2023 年 12 月首次发布准备框架,当时模型在生物、化学、网络安全和 AI 自我改进方面的能力远未达到这一水平。我们制定这一框架,是为了指导我们识别能力进展,并规划公司在这些能力出现时应采取的行动。包括 GPT‑5.6‑Sol 在内的先前模型均接受过前沿网络能力评估,结果处于高(而非关键)阈值。
根据我们的准备框架,如果一个模型无需人工干预,便能在许多经过强化的现实关键系统中识别并开发出各种严重级别的有效零日漏洞利用程序;或者仅根据一个宏观的预期目标,便能针对经过强化的目标构思并执行端到端的新型网络攻击策略,该模型即达到网络安全能力的关键阈值。
我们仍在对该模型进行基准测试和评估,但初步评估显示其性能足够强劲,因此目前无法排除其达到关键能力级别的可能性。Astra 是一款即将推出的模型,并未参与对 Hugging Face 的漏洞利用攻击。
因此,我们扩大了对防护措施和安全控制的稳健性测试,以确保这些措施适用于部署此类能力。我们还在内部采取了以下措施,确保该模型后续的开发安全可靠:
- 我们正在对能力更强的模型及相关活动实施更严格的安全控制,包括隔离测试环境、限制网络和工具访问、加强模型权重保护与加密、增加监控和检测能力,以及采用沙盒执行。
- 对于尚未达到这些强化安全控制要求的 Astra 相关内部活动,我们将暂停开展。
- 我们已对 Astra 的所有智能体应用实施全面监控,包括训练和评估,以发现高风险操作及目标偏离情况。监控系统会评估模型的思维链,并触发安全响应,以审查和中止高风险活动。
- 我们将与相关政府机构及部分 AI 安全组织合作,测试该模型的能力。
- 我们将向第三方测试合作伙伴提供建议的安全控制措施,帮助其安全开展风险较高的评估和工作负载。
这一框架已指导我们应对过其他能力转变。2025 年 6 月,当我们的模型接近准备框架规定的生物领域高能力阈值时,我们曾概述正在采取的措施,包括强化防护措施、扩大测试、与外部专家合作,以及部署额外的安全控制。我们正在这里运用同样的原则。
我们认为,具备先进网络能力的模型应帮助防御者抢在攻击者之前发现并修复漏洞。我们致力于与各国政府、安全研究机构和公民社会携手合作,确保 Astra 及后续模型的前沿能力得到负责任的部署和广泛应用,造福全人类。

