跳至主要内容
OpenAI

2025年10月29日

产品发布

推出 gpt-oss-safeguard

全新的开放安全推理模型(120b 和 20b 版本),支持自定义安全策略

正在加载…

今天,我们发布了用于安全分类任务的开放权重 (open-weight) 推理模型 gpt-oss-safeguard 的研究预览版,提供两种规模:gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b。这些模型是我们 gpt-oss 开放模型的微调版本,并在相同的宽松 Apache 2.0 许可证下发布,允许任何人自由使用、修改和部署。这两款模型即日起均可从 Hugging Face(在新窗口中打开) 下载。

gpt-oss-safeguard 模型在推理阶段 (inference time) 运用推理能力 (reasoning) 直接解读开发者提供的策略:根据开发者的需求对用户消息、补全内容 (completion) 和完整对话进行分类。开发者始终掌握使用何种策略的决定权,因此生成的回复将更契合开发者的实际应用场景。该模型采用思维链,开发者可以审查该思维链,以了解模型如何得出决策。此外,由于策略是在推理阶段提供的,而非被训练进模型中,开发者可以轻松地迭代修改策略以提升性能。这种我们最初为内部使用而开发的方法,比传统训练分类器的方法(通过大量带标签的示例间接推断决策边界)要灵活得多。

gpt-oss-safeguard 使开发者能够划定最适合其应用场景的策略界限。例如,一个电子游戏讨论论坛可能希望制定一项策略,对讨论游戏作弊的帖子进行分类;或者一个产品评论网站可能希望利用自定义策略来筛选疑似虚假的评论。

该模型同时接收两个输入(一项策略以及需要在该策略下进行分类的内容),并会输出内容所属类别的结论及其背后的推理过程。开发者自行决定是否以及如何在自己的安全流水线中使用这些结论。我们发现,这种基于推理的方法在以下情况中表现得尤为出色:

  • 潜在危害正在显现或不断演变,策略需要快速适应。
  • 领域情况复杂、差异细微,小型分类器难以处理。
  • 开发者没有足够的样本来为平台上的每一种风险训练高质量的分类器。
  • 提供高质量、可解释的标签比低延迟更为重要。

我们发布了 gpt-oss-safeguard 预览版,以听取研究界和安全社区的反馈,进一步迭代提升模型性能。在几个月的时间里,我们与 ROOST(在新窗口中打开) 合作推进了这一开放权重版本的发布,以明确开发者的核心需求、测试模型并编写开发者文档。作为此次发布的一部分,ROOST 将建立一个模型社区(在新窗口中打开)(同样于今日上线),旨在探索如何利用开放式 AI 模型保护网络空间。伴随此次发布,我们还公开了一份简短的技术报告,详细说明了此预览版模型的安全性能。

系统级安全:安全分类器的作用

在安全方面,我们坚信纵深防御 (defense in depth) 的理念。我们训练模型以确保安全回复,并实施额外的保护层,以便在我们的策略下检测和处理潜在的不安全输入与输出。长期以来,旨在区分特定风险领域内安全与不安全内容的安全分类器,一直是我们自己的模型以及其他大型语言模型的主要防线。

传统的安全分类器(例如通过我们的 Moderation API(在新窗口中打开) 提供的分类器),是在预定义的安全策略下,通过人工整理数以千计的安全与不安全内容示例开发而成的。分类器通过这些训练数据学习如何区分安全与不安全的输出。在这种传统方法中,分类器实际上从未见过安全策略本身。相反,它试图通过寻找被标记为不安全的内容中的相似之处,以及不安全与安全内容之间的差异,来推断用于标记示例的底层策略。

传统分类器通常具有高性能、低延迟和低运营成本等优势。但是,收集足够数量的训练示例可能既耗时又昂贵,而且更新或更改策略需要重新训练分类器。

gpt-oss-safeguard 的不同之处在于,其推理能力允许开发者应用任何策略,包括他们自己编写或从其他来源获取的策略,且这种推理能力有助于模型在新编写的策略上实现泛化。除了安全策略外,gpt-oss-safeguard 还可以采用其他对特定产品和平台至关重要的方式对内容进行标注。

标题为“使用 gpt-oss-safeguard 进行基于策略的推理”的流程图。开发者提供的策略与用户提供的内容一同输入至 GPT-OSS-Safeguard。模型先生成思维链 (chain-of-thought),随后输出策略决策;其中一条标有“策略迭代 (policy iteration)”的循环线反馈回来,以改进策略。图例说明了开发者输入、用户输入以及模型输出。

我们如何在内部使用安全推理

我们主要的推理模型现在能够直接学习我们的安全策略,并运用其推理能力来判断何为安全。这种我们称为审慎对齐 (deliberative alignment) 的方法,较早期的安全训练方法有了显著的进步;它使得我们的推理模型在能力不断增强的同时,在多个维度上的安全性甚至超越了未具备推理能力的前代模型。但推理能力的作用不仅限于训练模型本身,它还为纵深防御 (defense in depth) 创造了新的可能。基于推理的方法更具灵活性,受限于过往训练细节的程度也更低,这些优势在很多时候足以弥补其带来的额外算力成本与延迟。

gpt-oss-safeguard 是我们内部开发的一种方法的开放权重实现,该方法用于我们名为 Safety Reasoner 的工具中。我们首先针对策略标注任务进行强化微调,通过奖励机制鼓励模型给出与人类专家一致的正确判断。由此,模型学会了如何依据策略进行推理并得出判断。如今,借助 Safety Reasoner,我们能够在生产环境中动态更新安全策略,所需时间少于重新训练分类器。这使得 Safety Reasoner 成为迭代式部署的关键工具:当我们将新模型部署到生产环境时,我们通常会从更严格的策略开始,并在需要时投入相对大量的算力,让 Safety Reasoner 能够谨慎地执行这些策略。随着我们对生产环境风险的理解不断加深,我们会对策略进行调整。在我们最近的一些产品发布中,用于安全推理的算力最高曾占到总算力的 16%。

Safety Reasoner 已成为我们安全防御体系的核心组件。对于图像生成和 Sora 2,它对输出内容进行动态、逐步的评估,以实时识别并拦截不安全的生成内容。在生物学和自残等领域,我们运行类似于 Moderation API 中使用的小型、快速且高召回率的分类器,来确定哪些内容属于关注领域,然后再使用 Safety Reasoner 对这些内容进行审查。Safety Reasoner 根据详细的分类体系对模型输出进行分类,以确定最佳的响应方式,并成为 GPT‑5 和 ChatGPT Agent 等系统中多层防护机制的一部分。而现在,gpt-oss-safeguard 模型将这种方法开放给所有人使用。

gpt-oss-safeguard 的表现如何

我们在内部和外部评估集上对 gpt-oss-safeguard 模型进行了评估。

在内部评估中,我们在推理阶段同时向 gpt-oss-safeguard 提供了多项策略。对于每个测试输入,我们评估 gpt-oss-safeguard 是否能在所有提供的策略下正确地对文本进行分类。这是一项极具挑战性的任务 — 只有当模型针对所有包含的策略做出的分类与金标准数据集 (golden set) 标签完全一致时,才会被判定为准确。

在多策略准确率方面,我们的 gpt-oss-safeguard 模型和内部的 Safety Reasoner 均优于 gpt-5-thinking 及 gpt-oss 开放模型。考虑到 gpt-oss-safeguard 模型的规模较小,表现优于 gpt-5-thinking 尤为令人惊讶。

我们进一步在伴随 2022 年研究论文(在新窗口中打开)发布的内容审核数据集(在新窗口中打开)上,以及在 ToxicChat(在新窗口中打开)(一个基于开源聊天机器人用户查询的公开基准测试)上对这些模型进行了评估。

在 2022 年内容审核评估集中,我们使用内部安全策略进行了评估(调整了其中一项策略以适应后续的变化)。gpt-oss-safeguard 的表现略微优于所有其他受测模型,包括我们的内部 Safety Reasoner 和 gpt-5-thinking,尽管 Safety Reasoner 与 gpt-oss-safeguard 之间的差距在统计学上并不显著。

对于 ToxicChat,我们使用了一个根据部分内部策略改写的简短人工编写提示词进行评估。我们的内部 Safety Reasoner 再次优于 gpt-5-thinking,同时 gpt-5-thinking 和 Safety Reasoner 均略微优于 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b。我们认为,相对较小的规模使得 gpt-oss-safeguard 依然是此类任务的更优选择。

局限性

gpt-oss-safeguard 存在两项具体局限。首先,我们观察到,使用数以万计的高质量标注样本训练出来的分类器在内容分类方面的表现,仍然可能优于直接基于策略进行推理的 gpt-oss-safeguard。对于更复杂的风险,如果追求更高的性能,花时间训练一个专属分类器可能是更好的选择。

其次,gpt-oss-safeguard 可能会消耗大量时间和算力,这使得它难以大规模应用于平台上的全部内容。在内部,我们通过 Safety Reasoner 采用多种方式来解决这个问题:(1) 我们使用更小、更快的分类器来确定需要评估哪些内容;(2) 在某些情况下,我们异步使用 Safety Reasoner,在保持低延迟用户体验的同时,保留了在检测到不安全内容时进行干预的能力。

未来展望:继续与社区共建

gpt-oss-safeguard 是 OpenAI 首套与社区共建的开放安全模型。作为早期测试的一部分,我们与来自 SafetyKit、ROOST、Tomoro 和 Discord 的信任与安全专家共同对 gpt-oss-safeguard 进行了迭代。ROOST 首席技术官 Vinay Rao 表示:“gpt-oss-safeguard 是首款采用‘自带策略和危害定义 (bring your own policies and definitions of harm)’设计的开源推理模型。各组织理应有权自由研究、修改和使用关键的安全技术,并具备创新的能力。在我们的测试中,它在理解不同策略、解释推理过程,以及在应用策略时把握细微差别方面表现出色,我们相信这将对开发者和安全团队大有裨益。”

我们将继续与社区一起迭代以完善开放的安全工具,包括通过 ROOST 模型社区 (ROOST Model Community, RMC)。RMC 汇集了安全从业人员和研究人员,分享将开源 AI 模型融入安全工作流的最佳实践,包括评估结果和模型反馈。访问 RMC GitHub 代码库(在新窗口中打开)进一步了解此项合作及参与方式。

要开始使用这些模型进行构建,请从 Hugging Face(在新窗口中打开) 下载。

作者

OpenAI