迈向前沿 AI 训练的安全论证
我们认为,我们正进入一个新时代:在继续任何前沿强化学习训练运行之前,都应要求提供结构化的安全文档。理想情况下,此类文档应达到“安全论证”的标准,即其他安全关键行业所采用的全面、结构化、基于证据的风险论证。我们将安全论证视为努力实现的长远目标。同时,我们也认识到,要使 AI 模型的安全论证达到航空或核电领域同等的严谨程度,仍面临挑战,因为 AI 能力每提升到一个新层级,都会涌现出新的复杂性。我们正在制定一个框架,将这些实践规范化。
以下是一些初步指南,我们认为它们应纳入前沿 AI 训练的安全论证。这些最佳实践反映了我们目前积累的经验。随着我们持续迭代内部流程、审慎推进开发,我们预计这些实践也将不断完善。我们现在分享这些实践,是为了公开我们当前的思考,并邀请社区提出反馈。请注意,本文聚焦于前沿强化学习训练;内部和外部部署则需要考虑范围广泛得多的对齐属性。
安全论证应涵盖技术栈的三个方面:对齐训练、隔离和监控。这些防护措施有助于确保模型不会尝试采取失对齐行动;即使尝试了,也难以突破隔离,并且监控系统能在造成危害前发现这些行为。
模型对齐:第一道防线应是通过训练使模型对齐,即让模型可靠地按照我们的预期行事。具体可包括:
训练环境与评分:在训练中避免对奖励作弊行为给予正向强化,从而降低模型形成失对齐行为的风险。具体可包括:
自动化数据集审查:使用智能体查找并修复存在缺陷的强化学习环境。这些环境可能使失对齐行为轨迹通过利用漏洞而非预期行为获得高奖励;修复它们可减少失对齐行为在训练中得到强化的机会。
人工数据集审查:在自动化红队测试之外,对数据集进行人工审查和质量检查,以识别可能无意中强化失对齐行为的缺陷任务。
评分器调优:调整评分器,对模型在训练中试图利用或攻击强化学习环境漏洞的行为施加惩罚。
历史运行分析:使用分类器分析以往实验的运行轨迹,确保评分器按预期工作。
对齐测量:开展评测,跟踪模型的失对齐倾向,以衡量对齐训练的有效性。具体可包括:
离线对齐评测:在前沿模型训练运行期间开展对齐评测,判断训练是否达到预期效果,并调查任何明显退步。
回测:利用以往事件对对齐评测进行回测,确认评测能够检测出此前失对齐的模型,且没有对特定事件过拟合。
跟踪评测投机行为:跟踪可能导致行为变化的评测感知或元博弈行为(模型意识到自己正在接受测试),例如在对齐评测中启用评测感知和元博弈监控器,并设定明确的阻断阈值。
最坏情况压力测试:诱发最坏情况下的不当行为,并验证至少有一项评测能够检测到该行为。
避免基于思维链进行训练:在强化学习中,不要让自动评分器看到思维链,以防模型逐渐学会规避思维链监控器。
隔离: 确保沙箱和安全防护足够坚固,即使模型发生失对齐,也能阻止有害行动。具体可包括:
多层基础设施安全防护:大力投入,加固模型运行的沙箱以及承载沙箱的研究基础设施,确保在发生沙箱逃逸时仍有额外一层保护。
隔离红队测试:在安全分析的约束下,使用前沿训练运行中的模型检查点,对这些系统反复开展红队测试,查找并修补漏洞,从而改善沙箱、研究基础设施及边界的安全性。还应对模型在训练期间可能接触的所有服务(例如,互联网缓存)开展红队测试。
跨样本通信:仅允许通过经批准的途径(例如,多智能体工具)开展高带宽跨样本通信,并关闭基础设施中带宽高且容易被智能体发现的侧信道。
不可篡改的交互记录:对所有强化学习训练、评测和内部部署,以不可更改的方式保存智能体交互记录(例如,存入一次写入型存储账户),并保留合理时长,以支持可靠的事件调查,防止意外修改。
监控:建立实时监控系统,在模型开始采取失对齐行动时,发现任何潜在的失对齐问题,并在严重事件发生前迅速处理高优先级问题。具体可包括:
强制保障可监控性:通过设有明确阈值的可监控性评测和监控规避评测,确保模型始终可被监控,以尽早发现令人担忧的行为。
对已知问题保持高召回率:确保监控系统在留出集评测中对以往事件具有高召回率。
及时更新监控器评测:为新的运行构建代表全新风险的评测数据点,使监控器召回率和精确率的测量结果持续反映当前情况。
快速响应:设置高优先级警报,通过呼叫值班人员或自动暂停受影响的运行,确保在规定的服务级别协议(SLA)时限内、模型造成危害之前采取行动(例如,白天发生事件时呼叫安全值班人员和运行负责人,夜间则在警报未获确认时自动暂停运行)。
除了技术防护建议,我们也一直在制定操作层面的最佳实践,用于前沿 AI 训练运行的安全论证。这些实践可包括:
异议(事前剖析):安全论证起草完成后,应由另一团队的成员撰写异议意见,找出论证中可能存在的漏洞,并给出与实际风险相称的判断。训练团队随后应作出回应,以完善安全论证。
审批:安全论证应由高层领导成员审查,每位审查者均应有权否决该次训练运行,确保运行受到多重内部制衡(例如,由研究部门负责人或副总裁、安全负责人和首席科学家审查)。
问责:负责某次训练运行的高层领导(例如,研究部门负责人或研究副总裁)应对安全论证和任何事件响应负责,并将这些责任纳入绩效考核等机制,从而也激励训练团队推动安全与对齐工作。
暂停:如果发现足以使安全论证失效的问题(例如,新的安全问题),应确保已有操作手册、技术控制措施和服务级别协议(SLA),以暂停该论证涵盖的所有运行。
内部透明度:应向内部监督机构(例如,安全与安保委员会)开放安全论证文档。
审计:应向审计人员提供充分的访问权限,使其能够核实安全论证的主张是否有效、可靠,并指出发现的缺漏。
升级上报:应建立明确的失对齐问题升级上报流程,制定失对齐严重程度分级表,并安排失对齐问题值班人员,在运行中的问题达到特定严重程度时呼叫高管(例如,首席执行官)。
技术控制:应使人员和智能体难以启动不合规的运行。监控和自动暂停等安全功能应在失效时默认阻止运行(例如,未启用适当监控时应无法启动运行,也不应允许从强化学习训练、评测或内部部署环境中禁用监控器)。
回滚能力:应能够轻松识别失对齐模型在训练流程中的所有下游用途(例如,数据生成或评分),以便在必要时消除失对齐输出带来的影响。
残余风险的完整列举:安全论证应尽可能全面地列出当前已实施的缓解措施未能覆盖的残余风险,为是否接受风险的决策提供充分依据。
以上是我们目前的建议,OpenAI 正在逐步落实这些建议。我们预计,未来几周内这些实践还将持续完善。
我们也一直在制定调查严重 AI 失对齐事件的最佳实践。实验室应尽可能从每起事件中吸取经验教训(类似于其他高风险行业的调查实践(在新窗口中打开)),以防止此类事件再次发生。具体措施可包括:
内部透明度: 由于调查可能需要较长时间才能完成,应定期向内部通报事件调查进展(例如,对正在进行的调查每日通报)。在安全且与工作相关的前提下,员工应有明确渠道获得更多访问权限,包括查阅原始交互记录和对失对齐模型进行采样。
失对齐根因:研究人员应从训练动态中查明根因(例如,通过有针对性的消融或重采样实验),了解失对齐行为是如何引入的,从而更深入地理解失对齐的科学机制,并更好地预防此类问题。
事后复盘:应从操作和文化层面开展事后复盘,了解导致事件发生的所有因素,例如问题为何被引入,以及为何在事件发生前未被发现或升级上报。
检测:我们应开发能够发现引发此类事件倾向的对齐测试方法,而不是直接利用从事件中获取的信息(例如,交互记录或事件摘要)进行针对性的迭代优化。应根据事件构建评测,作为“回归测试”,以确保未来的模型在高度相似的事件情境中不会表现出失对齐倾向。
公开披露:调查结束后,应向公众公开调查结果、复盘报告和操作层面的调整。应尽快通知受影响的第三方。


