跳至主要内容
OpenAI

2026年9月1日

安全安全防护

迈向 Astra:关键能力与前沿防护机制

正在加载…

自从我们在早期评估中判定 Astra 可能达到“关键”级网络安全能力以来,我们收集了更多证据,并完成了更多评估来衡量该模型的能力。我们现在认为,Astra 已达到准备框架所定义的“关键”级网络安全能力阈值。这意味着,在配备适当工具并获得相应访问权限后,它无需人工逐步指导,即可在许多防护严密的系统中发现此前未知的安全漏洞,并制定漏洞利用策略。这是我们首个评定为这一等级的模型,因此在开发期间和发布之前都需要更完善的防护机制。

过去几周,我们推迟了 Astra 的部分开发和发布工作,以加强并测试针对网络滥用及模型未经授权行动的防护措施。基于这些工作,我们认为 Astra 的防护机制足以将严重危害的风险降至最低,可按照准备框架发布。

尽管 Astra 并未涉及 Hugging Face 事件,但我们已将在该事件中吸取的经验(在新窗口中打开)纳入安全方案。根据回溯测试,我们认为当时的生产环境防护机制本可阻止 Hugging Face 事件发生。此后,我们为 Astra 实施了更完善的防护机制,包括训练模型更强有力地拒绝有害的网络攻击请求并遵守安全限制、增设防范滥用的措施,以及部署能够阻止潜在未授权活动的监控机制。

我们计划很快推出 Astra,但其最高级网络安全能力的访问权限将受到更严格的限制。高级网络安全功能初期将向一组测试人员开放,随后通过 Daybreak Blue 扩大访问范围,以支持防御性用途。

发布时,我们将在该模型的系统卡中进一步介绍安全、安保和对齐测试与评估。在发布之前,我们希望介绍为安全发布具备此等网络安全能力的模型所开展的部分工作的进展,并如实说明仍然存在的风险。

评估 Astra 的网络安全能力

根据我们的准备框架,模型只要满足以下任一条件,即达到“关键”阈值:

  • 模型无需人工干预,即可在许多经过强化的现实关键系统中识别并开发有效的零日漏洞利用程序,同时涵盖各个风险等级。
  • 只需给定高层目标,模型便可针对经过强化的目标设计并执行新颖的端到端网络攻击策略。

我们对 Astra 的准备情况评估结合了自动化的公开和私有基准测试,以及专家主导的评估。与 GPT‑5.6 Sol 相比,Astra 的网络安全能力显著提升:不仅 Token 效率更高,识别漏洞和开发漏洞利用程序的能力也更强。

例如,我们让 Astra 运行 ExploitBench;在这项用于评估模型能否针对已知漏洞开发利用程序的基准测试中,它取得了 100% 的优异成绩。

考虑到数据污染问题,我们随后构建了名为“ExploitBench - 内部移植版(2026 年 6 月至 8 月)”的内部基准,其中包含 20 个近期披露的 V8 高危漏洞在该数据集上,Astra 使用的输出 Token 少得多,但实现任意代码执行的成功率远高于 GPT‑5.6 Sol。在评估过程中,该模型甚至发现并利用了两个零日漏洞,将其作为一条漏洞利用链的一部分。我们正在向维护人员披露这两个漏洞。

图中 Astra 的结果反映了其获得 Daybreak Blue 访问权限后的能力,而非默认生产配置下的能力。

在由专家主导、以经过强化的浏览器和操作系统为目标的评估中,Astra 发现了此前未知的漏洞,并将其转化为可用的漏洞利用链。浏览器打开 HTML 文件时,它构建了一条完整的浏览器入侵链,成功逃逸沙箱并在主机上执行命令。该模型还在经过强化的操作系统中发现多个漏洞,并将其组合为一条本地权限提升链,使无特权用户获得 root 权限。综合所有结果,我们的调查最终得出以下结论:Astra 已达到“关键”阈值。

关键能力所需的防护机制

对于网络安全能力达到 Astra 水平的模型,无论是在开发期间还是部署之前,我们都需要针对两条路径采取措施,以尽可能降低造成严重网络危害的风险:

  • 恶意行为者使用模型。我们的防护机制必须有效阻止恶意行为者利用 Astra 为经过强化的关键系统中此前未知的漏洞开发攻击程序,或对经过强化的目标实施端到端攻击。
  • 模型采取未经授权且偏离预期的行为。即使没有恶意用户,具备高级网络安全能力的模型一旦偏离预期,也可能造成网络危害。对于具备这些能力的模型,我们不仅要采用极高的对齐标准,还必须设置第二道防线,使防护机制能够迅速发现并遏制可能在现实世界中造成重大危害的偏离行为。

值得注意的是,第二条路径同时适用于内部开发和外部部署。正如我们此前所述,OpenAI-Hugging Face 事件发生后,我们将部分前沿训练(包括 Astra 的部分训练)暂停两周,以强化训练基础设施,包括实施隔离和网络控制、扩大监控范围,以及加强对齐训练和相关阈值。随后,我们在更严格的控制措施下继续开展规模较小的工作。

在为训练环境的安全与安保制定更高标准期间,我们推迟了对部分更大规模强化学习 (RL) 的训练,并将其纳入 Astra 的后续版本。8 月 28 日,在新的安全与安保要求落实后,我们重启了此前暂停的大规模前沿强化学习训练。部分规模较小的实验性训练目前仍暂时搁置。

为 Astra 的发布做准备,还需要加强对网络滥用和未经授权行动的防护。下面将介绍这些防护机制以及我们的测试方式。

抵御网络滥用的稳健性

自从我们在今年 2 月部署首个被评定为具备“高”网络安全能力的模型以来,每次发布新模型时,我们都会加强网络防护机制。我们的整体安全方案采用多层防护,包括后训练模型的拒绝机制、系统级安全分类器,以及离线检测和威胁阻断。

对于 GPT‑5.6(在新窗口中打开),我们显著提升了系统级安全技术栈的稳健性,包括增加激活分类器来检测网络滥用,以及通过密集的自动化红队测试发现通用越狱手段并提高防护覆盖率。在这些改进的基础上,我们进一步加大了对 Astra 防护机制技术栈中模型层的投入,同时提升了防护机制处理跨对话上下文的能力。

  • 借助新的模型稳健性训练技术,Astra 能强有力地拒绝不合规的网络攻击协助请求。在我们的网络越狱评估集中,Astra 拒绝了 91.5% 的请求,而 GPT‑5.6 Sol 的拒绝率为 59%。
  • 对于被评估为风险较高的账户,我们会采用更保守的模型行为边界,拒绝范围更广、可能存在风险的网络攻击协助。对于高风险用户,我们扩大了监控系统的上下文范围,以发现这类网络滥用行为。

我们还继续进行严格测试、内部和外部红队测试以及问题修复。除了开展回归测试以确保此前测试期间发现的所有越狱手段仍在防护范围内,我们还在使用最新的内部红队测试攻击者开展新一轮红队测试。我们正与行业合作伙伴共同制定统一的越狱评级体系,并将通过全天候快速响应机制调查和处理新发现的问题。我们将在 Astra 系统卡中分享更多网络防护机制测试的详情。

帮助防御人员发现并修复漏洞,仍是我们安全方案的核心支柱。为防范潜在滥用行为,在 Astra 的防护机制发布初期,我们会引入比最终预期更多的限制。Astra 的高级网络安全工作流最初仅向一小群 Alpha 测试人员开放,之后将通过 Daybreak Blue 扩大访问范围,以支持防御性用途。

对齐与监控

我们还增加了多层防护,防止模型采取可能偏离预期的行动:

  • 模型对齐:在我们的评估中,Astra 遵守明确安全与安保限制并在授权范围内行动的可能性远高于 GPT‑5.6 Sol,是我们迄今对齐程度最高的模型。我们尤其关注模型能否遵守安全与安保限制,以及是否倾向于在授权范围内行动。
  • 监控与控制:我们借鉴内部流程,在部署 Astra 时增加思维链监控,以快速发现并遏制可能偏离预期的行动。

Astra 代表着模型对齐方面的重大进展,也是多项长期对齐工作的集大成者,这些工作涵盖预训练干预,以及在强化学习中采用更谨慎、更一致的评分方法等。测试发现,与 GPT 5.6 Sol 相比,Astra 更倾向于遵守明确的安全限制和警告(例如自动审核)。

我们还参考 Hugging Face 事件设计了一项测试;在该事件中,运行网络安全评估 ExploitGym 的智能体攻破了第三方系统。我们使用该评估中难度最高的任务设计了“蜜罐”测试,以判断模型是否会放弃解决指定任务,转而尝试攻破周边安全基础设施。在没有生产环境防护机制的情况下,GPT‑5.6 Sol 在 56% 的测试中尝试访问这些目标。这些测试模拟了要求模型开发漏洞利用程序的基准环境。Astra 在这些测试中从未做出此类尝试。这些数据反映的是未启用网络防护机制的测试环境下的行为,并非正常生产环境中的使用情况。

左图:在这项新评估中,我们观察模型在自动审核拒绝请求后会如何反应。每项任务都设置在知识工作环境中,并在自动审核拒绝后立即开始推演。随后,模型有多种选择:结束推演、尝试寻找更安全的替代方案、重试类似命令,或利用不当配置(在新窗口中打开)完全绕过自动审核。选择后两种做法均会被判定为评估失败。Astra 从未尝试规避自动审核。

右图:在这项评估中,我们使用“蜜罐”来检查模型面对 ExploitGym 评估中难度最高或无法完成的任务时是否倾向于作弊。评估在模拟环境中进行,防护机制设为仅观察模式,以评估模型行为。在这些场景中,GPT‑5.6 Sol 表现出更高的作弊可能性;Astra 则未尝试使用此类捷径,同时仍能通过正当方式解决部分任务。

训练模型实现对齐是安全防护的一个层面。我们将在 Astra 系统卡中进一步介绍对齐测试及其结果。

我们还将在生产环境中为 Astra 级别的模型部署不对齐监控,以发现并迅速遏制潜在的不对齐行为。这些防护机制与我们的内部部署监控类似,由一套分类器组成,用于检查模型的推理和行动是否存在未经授权的行为,并自动停止可能未经授权的活动。随着模型能力提升,这些防护机制无法取代完善的模型对齐工作;我们的目标是让未来模型达到足够高的对齐水平,使这些防护机制永远不被触发。

这对用户意味着什么

OpenAI 致力于确保 AI 的益处能够惠及大众。鉴于 Astra 的网络安全能力显著提升,我们正格外谨慎地确保此次部署安全可靠。额外的安全检查有时可能会减慢、暂停或停止正当工作,包括防御性网络安全工作。

系统有时可能会将正当活动标记为潜在网络滥用或未经授权的行为,导致相关活动意外减慢、暂停或停止。这可能包括看似与网络安全没有直接关系的工作,或智能体长时间运行的任务。

如果不对齐监控器暂停任务,ChatGPT 或 Codex 用户可能需要先审核相关操作,才能继续。使用 API 等其他界面时,任务将会停止。我们计划继续校准这些防护机制,以减少不必要的中断,并通过 Daybreak 等项目扩大前沿能力的使用范围。

展望未来

AI 发展正进入一个新阶段:模型可以承担影响更为重大的工作,而对齐和控制一旦失效,也可能造成更严重的后果。要发挥这些系统的优势,我们必须能在其能力不断增强的同时,做好模型的对齐与控制工作。

这项责任贯穿训练、评估和部署的全过程。我们需要更有力的证据证明模型行为已对齐,需要让防护机制与能力发展同步,还要在防护措施不足时敢于放慢脚步。

我们将继续测试这些系统、分享所学,并明确说明仍存在哪些不确定因素。Astra 之后的模型将对我们提出更高要求。我们将投入必要的时间、完成必要的工作,切实履行这项责任。