过去几周的两项进展凸显出,能力日益增强的 AI 系统正带来不断上升的风险:一是 OpenAI-Hugging Face 事件;二是初步证据表明,我们即将推出的模型之一 Astra 可能已达到 网络安全关键能力门槛,即符合我们 准备框架中的相关标准。这些进展,加上内部研究的快速推进,使我们更迫切地需要在训练流程的各个阶段加强监控、对齐和遏制保障措施。
随着模型能力增强,内部开发和测试模型所伴随的风险也在上升。我们的监控、对齐和安全标准必须领先于这些风险。为了留出达到这些标准所需的时间,我们暂时放慢了扩展步伐。其中包括暂停两周对拟部署的最新模型进行强化学习(RL)训练,以便进一步加固研究环境、开展红队测试,并扩大监控系统的覆盖范围。我们计划开展的最大规模前沿强化学习训练仍处于暂停状态。在继续推进之前,我们正通过较小规模的训练和评估来考察模型行为、验证保障措施,并积累更多对齐证据。
对齐,即让 AI 系统按预期行事并接受人类监督,长期以来一直是我们研究计划的核心。在现有研究和评估的基础上,我们现在要求在整个训练过程中提供更有力的行为对齐证据。如何让能力日益增强的系统保持对齐,是整个领域都需要解决的挑战。即将推出的模型所展现的进展信号清楚表明,我们需要采用更全面的方法:既以现行准备框架为基础,又超越其范围。
我们认为,有必要公开说明我们的方法正在发生怎样的变化。下面,我们将介绍已对研究流程和基础设施做出的调整,以及仍在推进的工作。
我们开发更强大模型的方法建立在三项相互强化的保障措施之上:
- 监控:发现令人担忧的行为,使我们能够及时应对。
- 对齐:降低有害或未经授权的行为发生的可能性。
- 安全措施:限制 AI 系统能够访问或影响的对象。
我们预计,模型很快将承担大部分安全工作,包括防御其他模型。这将使三项保障措施都能随模型能力同步扩展,我们认为这一点至关重要。
我们将这些保障措施贯穿研究与部署,并根据每个模型的能力、运行环境和风险水平进行调整。
随着前沿模型具备更强的网络安全能力,我们正在提高其训练和评估环境的安全标准。达到这些标准需要大量工程投入,也给前沿研究带来了高昂成本和延误。OpenAI-Hugging Face 事件*发生后,我们立即暂停了研究集群中的部分前沿模型推理任务,涉及可能执行代码或使用可访问互联网工具的运行。我们很快恢复了一条权限更受限、更安全的代码执行路径,随后逐一审查各项工作负载,以确定能否安全恢复。部分研究工作负载在这些新控制措施下恢复,其他工作负载则需要进一步调整。
在随后几周里,我们制定并开始实施更严格的前沿研究工作负载安全要求。例如:
- 工作负载隔离:对于执行模型生成代码或其他不受信任代码的工作负载,我们现在要求采用更严格的隔离措施(“沙箱”)。这也适用于处理模型输出时可能遭到入侵的软件。
- 网络隔离:我们实施了更多控制措施,将较高风险和不受信任的工作负载与互联网隔离。这些控制措施经过专门设计,确保单个工作负载或支持服务遭到入侵时,不会仅凭这一点就导致互联网或其他内部网络遭到未经授权的访问。
- 持续安全测试:我们重新配置了环境,以移除可能存在漏洞的共享服务、减少常驻权限,并改善安全边界和信任边界。我们也在提升安全日志的收集和监控能力。最后,我们正在投资于自动化,利用模型持续以模拟攻击测试这些边界。
这些控制措施共同构成纵深防御,有助于保护我们的研究环境免受攻击。目前,涉及 Astra 或网络安全模型的工作负载必须采用最高级别的安全保障措施,因为我们已认定 Astra 模型可能具备关键级别的网络安全能力。这些保障措施也适用于所有其他网络安全相关工作负载。
部分 Astra 训练和评估已符合这些要求,但大量工作负载仍处于暂停状态,直至完全迁移并强化到符合新的安全标准。我们正优先将安全和对齐工作负载迁移至这些新环境。
监控长期以来一直是模型开发流程的重要组成部分,包括监控内部编程智能体和长时间运行的会话。我们的监控工作尤其关注前沿模型的内部部署和前沿强化学习训练运行。我们认为这些工作负载风险最高,因为它们可能同时具备先进的模型能力,并能访问工具、敏感系统以及内部或外部网络。这些监控并未应用于所有使用工具的推理和训练运行。我们通过新的监控设置修订并扩展了现有方法。
新的监控设置采用多阶段机制:首先由激活分类器(检查模型内部活动的检测器)检查每个采样 Token,再将潜在问题逐级上报给日益复杂、需要更高算力的自动调查系统。这些系统会检查工具操作、可用的推理信息和完整活动序列,以发现未经授权的访问、数据窃取、破坏性行为以及规避保障措施的企图。我们的目标是在监控系统发现可疑活动后的 30 分钟内发出警报。如果监控系统发现可能违反关键安全边界的行为,就会生成最高优先级警报。在当前实施方案中,安全、安保和研究团队会收到传呼通知。如果这些团队无法在 30 分钟内确定该标记为误报,就应暂停相关活动。
对于能力达到 Sol 或更高水平的模型,所有涉及工具的强化学习训练和评估都必须接受这类监控。8 月 7 日,我们认定 Astra 可能具备关键网络安全能力后,又对所有使用工具的 Astra 推理增加了监控要求,而不再仅限于强化学习训练和评估。
这些保障措施需要投入可观的算力。根据目前估算,监控开销约相当于被监控推理算力的 20%,但不同训练和评估工作负载的成本差异很大。我们将在后续博客文章中详细介绍这一系统。
对齐研究是我们使命的核心。我们的使命是确保通用人工智能造福全人类。随着模型获得网络攻击能力等先进能力,并在更复杂的环境中运行,奖励操纵(在训练中设法获得高奖励,却并未真正实现预期结果)、欺骗或未经授权的访问等未对齐行为将带来越来越严重的风险。
对于能力最强模型的强化学习训练,我们现在会在训练流程的更多阶段应用核心对齐技术。其中包括:改进奖励模型,以便更好地发现并抑制不同任务和环境中的不安全行为;训练模型,使其更诚实地说明自身的行为、能力和局限;减少利用奖励、评分器、工具或监督机制弱点的行为。对于模型与外部系统或资源交互时可能造成伤害的行为,我们也在扩大训练覆盖范围。
我们将继续大力投入对齐研究、扩大评估覆盖范围,并将研究所得用于指导训练和保障措施。我们计划近期分享更多对齐研究成果,包括对模型行为的新认识,以及发现的任何新型挑战。
我们将完善准备框架,把这些保障措施贯穿训练和部署,并更准确地反映未来模型的能力及其运行环境。要开发能够随这些能力同步扩展的方法,就必须持续投资于模型辅助安全、更有效的监控,并不断推进对齐研究。随着方法不断完善,我们计划邀请外部组织参与,并分享更多研究所得。
前沿模型的能力正在迅速提升。我们理解、对齐和保护这些模型的能力必须始终领先一步。
*我们将在未来几周发布一份技术报告,介绍从中获得的经验。

