阻断一起有组织的模型蒸馏行动
我们近期发现并阻断了一起有组织的行动,其目的是从我们的模型中提取受保护的推理内容。我们最早在 7 月的第一周观察到相关活动。这类活动符合对抗性蒸馏的特征:未经授权,系统性地利用一个模型的输出或推理内容,帮助训练、复现或改进另一个模型。受保护的推理内容是模型完成任务时的内部记录;提取这些内容可能会暴露最终回答中未披露的信息,并帮助他人复现模型的能力。
这些操作者并未破解我们的加密机制、入侵数据库,也未直接访问存储的用户对话。他们采取的方式是操纵与模型的交互,让受保护的推理内容以请求者可见的形式再现。这种有组织、大规模的行为违反了我们的服务条款。这种操纵手法所利用的漏洞并非 OpenAI 模型独有。我们已通过前沿模型论坛向行业合作伙伴分享相关信息,以加强共同抵御对抗性蒸馏的能力。
在发布本文之前,我们调查了此事的范围和潜在影响,部署了自身的缓解措施,并向研究人员和行业合作伙伴分享信息、听取反馈,以确保针对这类攻击的防护措施已落实到位。进一步的缓解和调查工作仍在进行中。我们相信,现在分享已掌握的信息,将有助于整个生态系统加强防御。
我们发现,操作者尝试用新手法提取受保护的推理内容,包括从一段对话中复制加密的推理内容,再在另一段对话中要求模型解密并转录这些隐藏的内容。
独立安全研究人员(在新窗口中打开)也通过负责任的漏洞披露流程,向我们报告了相关的跨模型漏洞和对话压缩漏洞。我们调查了他们的发现,并确认他们识别出的攻击路径确实存在。他们的工作帮助我们更全面地了解了这类攻击,并加快了缓解措施的实施。
相关活动始于 7 月 1 日,最初规模较小。到 7 月 24 日和 25 日,我们观察到活动量骤增:超过 4,000 名用户采用相关提取模式,发出了 16,000 次请求1。进一步调查发现,一个涉及超过 15,000 名用户的群体开展了使用相关提示词模式的活动。截至 7 月 28 日,我们已全面阻断这些活动。
这些活动的手法不断演变,进一步表明,对抗性蒸馏是一项更广泛的安全挑战,需要多层次、可动态调整的防御措施。
目前尚不清楚,我们在相关时段观察到的所有操作者是否都来自同一行动主体。不过,我们判断,其中一组核心活动由与 Kimi 开发商月之暗面有关联的人员实施。
对抗性蒸馏会带来安全及国家安全风险。提取出的推理内容可能被用于训练另一个模型,而原模型针对面向用户的输出所施加的安全防护措施却未必会得到保留。大规模蒸馏还可能加速先进能力的转移,而接收方无需为安全投入同等资源。随着模型在双重用途领域的能力不断增强,这些担忧也会加剧。
这一风险并非 OpenAI 独有。如上所述,类似手法也可能影响其他先进 AI 系统,因此,这是一项共同的安全挑战,需要全行业协同应对。
针对近期这起蒸馏行动,我们结合账号处置、技术管控以及合作伙伴协作,降低了其影响。我们封禁或限制了欺诈账号,加强了注册和基础设施管控,并扩大了对相关网络的监测范围。
我们还加强了用户、工作区、组织和模型系列之间对隐藏推理内容的隔离保护。我们封堵了一条攻击路径:此前,已持有其他用户加密推理内容的人,可以通过重放来还原其中的内容。我们还增设了检查机制,用于检测并暂缓发送可能泄露推理内容的流式输出。当相关活动转而通过第三方服务开展时,我们与这些服务提供商合作,识别并处置了涉事账号。
最后,我们通过前沿模型论坛及适当的政府信息共享渠道分享了相关发现,以便其他前沿模型开发者和公共部门合作伙伴排查类似活动,并加强自身防御。支持推理记录迁移或重放的系统,可能面临类似风险。
随着前沿模型不断进步,以及相关行为者寻求成本更低的方式来模仿这些模型的能力,我们预计,对抗性蒸馏的手法将变得更加复杂。防御此类活动,需要多层次的管控措施和持续调整。
这项工作尚未完成。由合作伙伴托管的部署需要与第一方服务同等的防护;对于利用工具输出发起的攻击,防护措施则不能仅检查常规可见文本。我们正持续改进工具防御、扩大分类器覆盖范围、增强模型拒绝不当请求的能力,并推动各云服务合作伙伴落实相关管控措施。
我们的应对工作将继续聚焦三个方面:加强防范提取的技术保护措施,提升对有组织行动的检测和处置能力,以及深化行业与政府之间的威胁信息共享。

