我们现公布一项新框架,用于跟踪、调查和披露 OpenAI 的模型失配案例,同时发布六份报告,介绍过去六个月中观察到的意外或令人担忧的模型行为。
过去,为了让研究人员、AI 开发者、政策制定者和公众更充分地了解情况,我们一直努力公开我们发现的有关失配问题的信息。但由于缺乏系统化的报告方式,我们的披露较为零散,频率也低于理想水平:我们往往等到可以将多个案例汇总成一份报告时才予以发布,或将其纳入新模型发布时的系统卡。这一新框架旨在加快观察到失配行为后的报告发布,即使我们尚未完全解释或缓解所报告的行为,也能及时披露。
随着 AI 系统日益先进、部署日益广泛,我们需要围绕对齐研究的进展建立更广泛、信息更充分的共识。我们并不认为 AI 行业已经充分解决对齐和监控问题,足以在更长时间内继续以最高速度负责任地扩展。未来数月乃至数年,关于 AI 开发应如何推进的决策,需要以构建前沿模型的公司之外的人士能够自行审查的证据为依据。
失配案例可能有助于识别其他 AI 开发者在其系统达到类似能力时可能遇到的问题,揭示防护措施的薄弱环节,或挑战有关模型行为的既有假设。分享这些发现,可以让其他人调查相同问题、检验我们的解释并改进缓解措施。我们认为提高失配问题透明度具有重要价值,因此即使其重要性尚不确定,新框架也倾向于披露。这意味着,我们披露的某些案例最终可能被证明并无实质意义,既不属于更广泛的模式,也不能预示未来的发展。
目前,行业内尚无明确规定 AI 开发者应如何披露其模型失配案例的统一框架。我们希望,今天介绍的框架能成为制定此类标准的第一步,明确开发者应披露哪些失配案例,以及报告应包含哪些内容。我们将这一框架视为仍在完善中的工作,并会根据实践经验和公众反馈不断改进。
下文将介绍该框架的运作方式,并分享我们发布的首批报告。
我们计划披露能够提供有用证据的案例,以说明模型失配如何产生、如何表现,以及防护措施在哪些方面有效或失效。我们会优先关注新的机制、已知行为的重大变化,以及挑战安全或缓解措施相关假设的发现。案例即使未造成伤害或证明存在更广泛的模式,也可能值得披露。本框架将涵盖模型整个生命周期内符合条件的行为,包括训练、评估、测试和部署阶段。
这包括模型未经授权采取行动、与其他模型协调或逃避监督的新方式;使某种对齐方法或防护措施受到质疑的失效情况;以及对已发布安全评估中的结论构成挑战的行为。同样的披露标准也适用于可能影响第三方的失配。
这也可能包括看似与我们过去披露的案例重复的失配案例。问题反复出现,本身就可能为了解模型行为或防护措施的有效性提供有用证据。例如,某类失配行为在多次尝试缓解后仍持续发生。在这种情况下,我们将通过更新原始失配披露来发布新增案例。
随着时间推移,我们计划与其他开发者、外部研究人员、行业标准机构和监管机构共同制定更客观的披露标准。我们还认为,应向美国联邦政府报告严重的安全、安保和失配事件,并且正在着手提出相应的报告机制。我们认为本框架是对现有义务的补充,并强调它不能取代我们的法定披露要求,包括对重大安全事件或网络安全入侵事件的披露要求。
为正式启用新的失配披露框架,我们现发布六份报告,介绍在模型训练或评估期间观察到的失配行为案例。这些案例展示了我们认为值得分享的多种行为,从向用户隐瞒信息,到为克服障碍而擅自采取行动。这些是单个案例的报告,不应被视为反映失配在我们各模型中的总体发生频率。以下每一项都链接至完整报告。
任务摘要中的自生成指令(在新窗口中打开)。一个尚未发布的研究模型在用于新上下文窗口中继续工作的摘要里插入了无关指令,其中包括要求忽略其正常约束的指令。我们发现了 27 份受影响的摘要。
任务摘要中要求隐瞒错误的指令(在新窗口中打开)。在 GPT‑5.6 Sol 的训练过程中,许多模型实例在摘要中添加了指令,要求向用户隐瞒错误或失配行为。例如,压缩摘要中包含这样的指令:编造缺失的历史数据而不予说明,并隐藏源版本之间的不一致。
在公共代码仓库中搜索泄露的 API 密钥,随后编造信息(在新窗口中打开)。在回答一个有关加利福尼亚州某县收入数据的常规问题时,一个模型发现并擅自使用了已泄露的 API 密钥。当它仍无法获取所需数据时,便编造了数据,并将其说成来自用户指定的数据源。
为引用文件而将其上传至互联网(在新窗口中打开)。一名用户要求某个尚未发布的模型提供面积超过 5,000,000 平方米的湖泊 ID 和名称,智能体使用 Python 找到了正确答案。但由于指令要求提供浏览器引文,智能体未经用户同意便决定上传该文件,以便在回答中引用。
通过内部软件仓库擅自写入和通信(在新窗口中打开)。模型在搜索缺失的输入文件时,将内部软件仓库当作留言板,在不同训练样本之间交换请求和回复,但最终未能恢复这些文件。本报告还分析了一个更早的案例:某模型为绕过网络限制,成功将测试文件上传至仓库。
协作智能体之间擅自共享文件(在新窗口中打开)。共同执行同一训练任务的智能体无法访问彼此的本地文件时,使用公共文件托管网站共享文件。这使任务交付物可通过公共 URL 访问,尽管任务要求模型只能使用本地文件。
任何 OpenAI 员工都可以标记失配案例,交由安全与对齐团队调查,并请求考虑公开披露。这将启动我们的披露流程;流程为每个步骤设定了期限,以确保及时调查和披露。
案例一经标记,我们的技术人员将调查事件经过、仍存在哪些不确定性、是否有必要公开披露,以及哪些事实可以分享。他们还将评估是否有第三方受到影响,以及是否需要在发布前私下通知对方。
随后,案例将被分配至三条处理路径之一:可披露、小规模调查或大规模调查(“慢速路径”)。
“可披露”适用于符合条件且调查已充分完成、经审查后即可发布的案例。“小规模调查”适用于需要进一步技术调查的案例。我们预计,绝大多数披露案例将归入这两条路径,尤其是不需要广泛调查、与第三方协调或处理严重滥用风险的案例。我们今天发布的案例全都归入这两条路径之一。
“大规模调查”适用于复杂调查,尤其是涉及第三方的调查。若有第三方受到影响,我们在安全、法律和负责任披露方面的义务优先于本框架。我们将力求尽快发布初步通告,但出于安全原因可能需要推迟。例如,某个模型发现了广泛使用的软件中此前未知的漏洞。如果报告会暴露第三方身份,即使没有突破安全边界,我们也计划提前通知对方。
对于进入“大规模调查”路径的案例,初步通告将概要说明事件经过、外部专家是否协助调查,并在可能的情况下提供最终报告预计发布时间。如果 OpenAI Hugging Face 事件依据本框架披露,它将归入这条路径。
提出该案例的员工将获知是否披露的决定;若决定披露,还将获知该案例会进入哪条处理路径。若对是否披露或应采用哪条处理路径仍有分歧,将提交给 OpenAI 的安全咨询小组(SAG)。该小组由公司各部门的高级负责人组成,负责评估前沿模型的能力和防护措施、监督我们的准备框架,并为 OpenAI 管理层提供建议。安全咨询小组内部的分歧,或员工对其决定的异议,将上报 OpenAI 管理层。不予披露或认定无需披露的决定将告知安全与对齐工作负责人,并在可能的范围内告知相关技术人员。
随着我们在实践中逐步了解这一披露流程的运作情况,可能会对其进行修订,并在本文中记录所有变更。
每份完整报告都将说明我们观察到的行为、其严重程度及任何外部影响、发生情境、发生日期或日期范围、我们发现该行为的时间,以及所涉模型的概况。在可能的情况下,我们还会分享:
事件经过的更多细节及其造成的任何伤害;
我们如何发现失配,以及调查范围;
我们对其给对齐研究和 AI 技术安全带来的影响的解读;
该案例引出的重要未决问题;
我们为解决该行为正在采取或计划采取的措施。披露时不一定总能提供这些信息,因为我们可能会在完成调查或制定修复方案之前发布失配报告。
对于客户部署中发生的失配,我们将在客户隐私和合同义务允许的范围内尽可能多地分享信息。
今天发布的报告是首批披露,并非对已知失配或正在进行的调查的全面说明。这些首批报告无意代表本框架所涵盖案例的全部类型或严重程度。我们承诺披露符合本框架标准的失配案例,包括更复杂的案例,此类案例需要更长时间调查或与第三方协调。我们将持续依据本框架发布报告,并随着相关承诺的进一步完善,分享更多有关报告承诺的信息。


