跳至主要内容
OpenAI

2026年9月22日

安全

有效第三方评估的优先事项与原则

正在加载…

前沿 AI 实验室肩负着安全训练、评估和部署模型的重大责任。第三方评估是履行这一责任的关键一环:它能拓宽 AI 安全领域的参与渠道,让世界了解相关情况,并督促实验室对清晰且有独立证据支持的安全主张负责。

作为调控前沿 AI 发展节奏的工作的一部分,OpenAI 致力于支持独立评估,并在训练、评估和部署各环节提供深入访问权限。这些访问权限应使评估方能够质疑我们的假设、发现我们可能遗漏的风险,并就保障措施的有效性独立得出结论。

长期以来,我们一直在模型开发和部署流程的不同阶段与第三方评估方合作。我们还将第三方评估纳入准备框架的实践,并支持倡导更严格、更可问责流程的组织和立法。在这些合作中,我们提供了深入的访问方式,包括技术保障措施的相关信息、可见的思维链访问权限,以及前所未有的保密数据访问权限和内部部署访问权限,以支持事件响应和监控系统红队测试。本文分享的优先事项和原则,重点针对我们与私营及非营利领域的独立评估组织就技术安全评估开展的合作。这些内容是对我们与政府开展测试和评估工作的补充;由于各方的角色和责任不同,可能需要采取不同方法。

要实现有效评估,需要有力的独立性机制、科学严谨性、可靠的安全实践和明确的职责。实验室有责任在保护敏感信息的同时,为有意义的审查创造条件。实验室和独立评估方共同肩负着做好这项工作的责任,并应遵循共享的安全与安保实践国际标准开展工作。下文将提出四个需要深入评估的优先领域,以及开展严谨、安全、独立工作的原则。

评估的优先领域

第三方评估在回答具体且影响重大的问题时最有价值:证据是否支持实验室的安全论证和安全主张?评估是否充分检验了其拟衡量的风险?保障措施在真实条件下是否有效?

本文所述评估将根据所考察的安全问题采取不同形式。我们预计会并行支持多项评估,评估周期各不相同,有些持续数周,有些则持续数月。第三方评估也可以是部署前工作的一部分,并可能为部署决策提供参考;但本文所述工作通常期限更长,且不针对特定发布,而是着眼于长期深入考察特定安全主张。

在阐述优先领域和原则时,我们会提到安全主张与安全论证。这些术语的含义如下:

安全主张:关于模型或系统的能力、行为或保障措施,涉及其安全性且可依据证据评估的具体论断。安全主张应明确其所针对的风险和条件,以及相关假设与局限。

安全论证:以证据为支撑的结构化论证,用于说明模型或系统的风险为何在训练、评估或部署等特定活动中得到了充分管理。安全论证将各项安全主张与其支持证据联系起来,并明确说明可能影响结论的假设、不确定性和剩余风险。

我们提出四个需要深入评估的优先领域,以及开展严谨、安全、独立工作的原则。

  1. 对涵盖训练、评估、内部部署和外部部署的安全论证开展独立评估。

    评估安全论证需要具备对齐、控制方法(如监控)、网络安全、生物和化学滥用以及红队测试方面的专业知识。安全论证由多项主张构成,包括训练、能力评估和保障措施;既可整体评估,也可分部分评估(参见下文优先事项 2 和 3)。可能需要多名评估方利用各自的专业知识,审查安全论证的不同部分。这些评估综合起来,应回答以下问题:

    1. 训练、评估和部署的安全论证是否有充分证据支持?在训练、评估和部署期间,是否遵循了安全论证规定的条件?

    2. 我们的安全论证是否涵盖评估过程中发现的最紧迫风险?各项安全主张是否支持整体安全论证?是否存在缺口或需要改进的领域?

    3. 是否采用了有效方法,识别并减少训练中可能奖励欺骗、奖励操纵、破坏性行动或规避限制行为的激励?

  2. 评估内部和外部部署中的关键保障措施

    我们的保障措施体系不断演进,以适应持续变化的能力与环境。我们的保障措施贯穿训练、内部部署和外部部署。目前,这些措施包括模型级保障措施、执行保障措施、安全保障措施以及对齐失范 (misalignment) 监控系统,覆盖控制丧失,以及网络、生物和化学领域滥用等多种风险。技术合作既能发现现有保障措施的弱点,也能改进评估方法并加快标准制定,为未来调控前沿 AI 发展节奏的公共政策提供更坚实的技术基础 — 尤其是在安全与安保标准尚处于起步阶段的内部部署领域。

    独立评估应考察这些保障措施的实际效果及其可能存在的不足,例如:

    1. 在采用“灰盒”访问的情况下,保障措施能否抵御对抗性测试(越狱),并能否充分防范使用者借助模型提升高风险领域(如网络安全和生物领域)相关能力所带来的风险?我们的对抗性测试和红队测试是否涵盖最重要的风险?

    2. 在获准开展且符合真实运行条件的测试中,智能体如何与访问控制、沙箱以及检测和响应系统等网络防御机制交互?哪些防御措施能够预防、检测或遏制有害行动,又会在哪些方面失效?

    3. 无论是内部部署还是外部部署,我们的对齐失范监控系统是否存在可能导致失控或严重对齐失范的关键缺口?随着模型能力提升,思维链监控作为安全或对齐证据来源的可靠性如何?

    4. 是否在所有相关训练、评估和部署环节实施了适当且不易被禁用的监控?

    5. 保障措施的实施程度是否与能力相称?

  3. 评估涵盖准备框架风险类别(化学与生物风险、网络安全、AI 自我改进)的能力评估,以及针对对齐失范风险的对齐评估

    我们的准备框架要求针对关键的前沿风险领域开展评估。随着阈值被突破、评估趋于饱和,持续更新以下两类评估并确保其覆盖范围与质量至关重要:一是用于衡量准备框架风险领域相关能力的评估,二是旨在评估严重对齐失范风险的对齐评估。

    相关问题包括:

    1. 用于评估准备框架风险的评估,是否充分涵盖准备框架对风险阈值的定义?这些评估的阈值设置是否正确?

    2. 当模型持续取得最高分时,是否会更新评估?新测试能否切实衡量更高级的能力?

    3. 我们的对齐评估是否充分涵盖严重对齐失范风险?可能遗漏哪些重要行为或条件?

  4. 独立调查重大对齐失范事件

    独立调查对多种重大 AI 安全事件都具有重要价值。本文重点关注模型对齐失范,包括模型未经授权采取行动或逃避监督;即使不存在蓄意滥用,这些行为也可能暴露对齐方法和保障措施的弱点。

    在某些情况下,如 OpenAI Hugging Face 事件,引入独立第三方开展独立的对齐失范事件调查可能有所助益。参与事件调查的第三方必须具备调查所需的专业能力,包括在适用情况下具备网络取证、对齐和大规模思维链分析方面的专业能力,并拥有足够的人员和资源及时开展调查。事件响应可能涉及敏感的内部数据和第三方数据,因此部分细节可能不宜公开或开放访问。独立调查的结果也能为模型的安全论证提供依据,用于评估关于模型对齐情况以及针对既往对齐失范问题所采取整改措施之有效性的主张。

    对于对齐失范事件,我们优先开展以下方面的独立评估:

    1. 事件期间出现了哪些模型行为或对齐失范问题?主要诱因是什么?

    2. 保障措施和整改能否有效降低未来发生类似事件的风险?

有效评估的原则

  • 范围明确且经共同商定的评估主张:评估应先确定双方共同商定的范围,再明确界定安全主张,并在评估活动开始前预先登记。第三方与实验室应明确,这些主张是受评公司希望提交评估的主张,还是第三方评估方希望独立评估、且实验室同意接受评估的主张。有些主张可能不在评估范围内,原因很多,包括第三方无法获取数据、评估方专业能力不足,或在评估紧迫时受到合理的时间限制。实验室和评估方应建立流程,考虑在原定范围之外发现的重大风险,包括是否有必要进一步调查。结论应结合共同商定的范围,明确说明哪些内容经过了评估,哪些没有。

  • 适度访问:在法律、安全和知识产权限制允许的情况下,评估方应尽可能获得与评估商定主张相称的访问权限。如果直接访问不切实际或无法实现,评估方可与公司的指定代表合作,或探索间接访问或隐私保护机制,以保护底层信息。

  • 透明的方法与标准:评估方应说明所采用的方法、评估标准和不确定性,并在已有成熟标准时予以采用。如果相关标准尚不存在,评估方应清楚说明所用标准的依据。报告应区分直接发现与解释,说明不确定性,并明确证据支持哪些结论。

  • 专业能力与独立性:评估方应证明具备相关技术专长,并识别、披露和处理组织及个人层面的利益冲突,包括经济激励、与开发者的关系,以及此前参与受评工作的情况。保障措施的设计应确保商业压力和薪酬安排不会影响评估结果,措施可包括回避制度或适当的隔离期。

  • 安全与保密:评估方应证明其具备信息安全实践,并对人员实施可强制执行的保密措施,保护力度应与所访问系统和信息的敏感程度相称。这些保护措施应涵盖知识产权、敏感信息和评估记录。如果评估方无法在自身环境中满足安全要求,或所访问的数据特别敏感,则通过公司管理的设备或在公司场所内访问,可能是适当的安排。

  • 可采取行动的评估结果与整改时间:评估应指出具体缺口,并提供足够细节,便于实验室加以解决。在适当情况下,应在发布报告前给予实验室合理的整改期限。在相关情况下,报告还应说明对智能体开发者、部署方和防御方的启示,并提供切实可行的实施建议。

  • 负责任的发布实践:评估报告应以证据为基础,在保护敏感及保密信息的同时尽可能公开分享。如果无法向公众完整披露,可向适当的监督机构(如治理机构或公司董事会)提交保密报告,以促进问责。应制定有原则的删减保护措施和政策,并明确反馈及纠正不准确信息的预期,以维持独立性与保密性之间的平衡。评估方应保持编辑独立性,同时确保保密措施和知识产权保护得到落实。评估方应采用明确的删减政策,允许实验室申请删减敏感信息;同时,评估方可以注明哪些内容进行了实质性删减,以及这对评估报告有何影响。

展望未来

我们致力于支持独立评估方,并通过未来的法律和私人治理机构,建立更清晰、共享的国际标准,以开展有效的第三方评估。独立评估生态系统仍在发展,我们将通过支持并携手多元化的独立评估方群体来推动其成长;这些评估方在前沿安全问题上拥有深厚专业知识。任何单一第三方都无法、也不应全面涵盖紧迫的前沿安全问题。我们将审慎而有计划地提升自身能力,并推动不断发展的第三方生态系统就最佳实践和原则达成一致。我们正与多个第三方讨论符合上述优先领域的提案。