跳至主要内容
OpenAI

2026年9月3日

安全

安全概述:GPT‑6 Astra

正在加载…

今天,我们正式发布 GPT‑6 Astra,这是迄今我们广泛部署的能力最强的模型。Astra 是首个依据我们的准备框架达到网络安全能力“关键”级别的模型。

关于此次发布的安全性,最重要的信息如下:

  1. GPT‑6 Astra 的网络能力显著提升,已达到我们的“关键”级门槛。这意味着,在具备适当工具和访问权限的情况下,GPT‑6 Astra 无需人工逐步指导,就能在众多防护严密的系统中发现此前未知的安全漏洞,并开发新的漏洞利用方式。因此,我们大幅加强了防护措施,以防模型因滥用或未对齐而执行有害的网络操作。我们还采取措施保护 Astra 及类似模型的内部开发与部署,包括实施更严格的隔离、加密检查点、全面监控包括思维链(CoT)在内的完整轨迹,以及在内部使用前执行具有阻断效力的对齐评估流程。
  2. GPT‑6 Astra 的稳健性显著优于前代模型。通过采用新的稳健性安全训练技术,GPT‑6 Astra 抵御越狱的能力显著优于 GPT‑5.6 Sol,在较长轨迹中也是如此。这一结论来自离线测试,以及我们严格开展的内部和外部越狱测试与修复工作。对于被标记为潜在高风险的用户,我们还专门训练了模型,使其能够将拒绝边界调整得更加保守,覆盖更广泛的双重用途风险。我们使用回归测试,确保 Astra 能够抵御此前测试阶段发现的越狱攻击;同时使用最新的内部红队攻击模型开展了新一轮自动化红队测试,以验证改进效果。
  3. GPT‑6 Astra 的对齐程度优于 GPT‑5.6 Sol。Astra 在模型对齐方面实现了重大进步,相关改进贯穿预训练数据的构成以及强化学习期间的评分流程。我们公布了一套新的对齐评估(在新窗口中打开)。结果显示,GPT‑6 Astra 更能遵守安全与安保边界,并将行为限制在授权范围内。在一项使用超过 54,000 项内部 Codex 任务(在新窗口中打开)的模拟中,Astra 因较高严重程度的未对齐行为而被标记的次数也只有 Sol 的大约一半。
  4. 我们正在广泛部署未对齐监控。我们认为,模型对齐是防止模型出现潜在未对齐行为的主要手段。不过,监控可以让我们广泛了解前沿模型的行为,从而发现进一步改善对齐与安全性的机会。此外,监控还可作为一道额外的防线,应对已检测到的未对齐行为。基于这些原因,我们还为 Astra 外部部署中所有使用工具的推理加入了未对齐监控,尽管这会产生巨大的计算成本。该系统与我们的内部配置相似。
  5. 与 GPT‑5.6 Sol 相比,GPT‑6 Astra 的可监控性有所下降。我们对 GPT‑6 Astra 的可监控性(在新窗口中打开)可控性(在新窗口中打开)进行了深入研究。我们发现,与 GPT‑5.6 Sol 相比,GPT‑6 Astra 更能控制自己的思维链,也更少在思维链中包含可能暴露其行为的信息。在对抗性情境下(即我们促使模型规避监控时),模型能够在评估中策略性地隐藏实力而不被发现;当被要求执行某些破坏任务(在新窗口中打开)时,有时还能避开我们的内部监控。我们尚未发现模型使用隐写式思维链推理的证据(例如将隐藏推理掩藏在普通且看似无关的文本中),这表明规避风险可能主要局限于较低层次的推理任务。
    • 这些发现表明,在对抗性条件下,Astra 系列模型可能会避开我们的思维链监控。目前,这些发现主要基于对抗性评估(即我们指示模型规避监控的情况);而总体对齐评估显示,Astra 整体违反安保和安全限制的可能性低于 GPT‑5.6 Sol。
    • 不过,我们高度重视这一趋势。随着模型能力不断增强,我们将继续研究这些发现及其对可监控性的影响。OpenAI 一直致力于保留并运用思维链监控,而保持思维链的可监控性是该研究项目的核心目标。不过,这些结果也凸显了开发新型对齐审计技术的重要性,不能只依靠检查模型的思维链。
  6. GPT‑6 Astra 能以更负责任的方式应对网页浏览和办公场景:GPT‑6 Astra 抵御提示词注入的能力显著优于 GPT‑5.6 Sol。我们还测试了模型在真实浏览和专业计算机环境中的行为。结果显示,与 GPT‑5.6 Sol 相比,该模型执行未对齐且可能造成破坏的操作(例如未经授权的交易、数据丢失、过度访问或绕过控制措施)的可能性显著降低。在智能体场景中处理有害请求时,它的行为也更加安全,例如协助策划暴力袭击或实施欺诈的请求。
  7. GPT‑6 Astra 在较高风险场景中显著更加安全。面对来自生产环境和对抗性人工红队测试的高难度请求时,GPT‑6 Astra 的响应比 GPT‑5.6 Sol 更加安全。在安全处理不安全请求和避免不必要地拒绝无害请求方面,Astra 实现了帕累托改进。这些改进也适用于高严重程度场景,即伤害风险源于更广泛的上下文,而非明确请求本身。对于未满 18 岁的用户,Astra 也能更一致地应用适龄安全边界。

如需了解更多信息,请参阅完整系统卡(在新窗口中打开)