为 AI 下一阶段制定标准
我们的使命是确保通用人工智能造福全人类。正如 Sam Altman 近期所阐述的以及 Jakub Pachocki 所指出的,我们围绕三大目标优先推进工作,以实现这一使命:
通过打造自动化 AI 研究员、与其共同迭代解决对齐问题,并探索让人类继续参与自我改进循环的方法,引导 AI 迈入下一阶段的发展。
让高度智能的机器所推动的科学进步与经济增长惠及大众。
让每个人都能拥有个人 AGI,获得自主发展的力量。
AI 正在加速我们自身的研究与工程工作,由 AI 赋能的研究也推动了数学领域的进展,其中包括纳维-斯托克斯千禧年难题。这些进展也为我们的另外两项目标带来巨大希望,有望促成重要的医学发现,推动医疗服务广泛普及,并为世界各地的小型企业和个体创业者赋能。
许多公司和国家都在推动 AI 发展,而整个领域的进步正在改变每个人面临的机遇与挑战。除其他益处外,能力强且已对齐的 AI 将成为我们应对这一转型的重要助力——它可以加强防御、推进对齐研究,并帮助人们理解和引导 AI 的后续发展。
要安全度过这一转型期,对齐研究必须跟上这些能力的发展,确保我们和其他各方构建的系统始终符合人类价值观并受人类控制。随着 AI 系统的能力和自主性不断增强,包括承担越来越多的 AI 研发工作,这一点将愈发重要。要确保 AI 持续安全发展并造福社会,既需要推进对齐研究,也需要制定共享标准,为各实验室和各国的开发工作提供指引。
自动化 AI 研究可以在不同程度上接受人类监督。随着 AI 系统承担越来越多的下一代 AI 开发工作,即使人类仍参与其中,它们也能日益推动递归式自我改进(RSI)进程。随着这一过程更加自动化,AI 的发展速度可能会迅速加快。
我们相信,自动化 AI 研究将催生能够直接改善人们生活的模型。它可以降低先进智能的成本,让世界各地的人们都能从中受益。自动化研究还可以帮助我们大幅改进对齐,并构建抵御能力日益增强的 AI 的防御机制——自动化 AI 研究员也可以成为自动化 AI 安全研究员。能力更强且已对齐的系统可以帮助保护关键基础设施、防御危险的 AI 智能体,并开发新的保护措施。
完全自主的 RSI 目前尚未发生;除非并且直到能够确保安全,否则我们不应追求它。是否推进以及如何推进,必须取决于我们能否维持人类控制,也取决于针对其收益与风险所作的知情民主选择(在新窗口中打开)。如果缺乏适当的审慎,RSI 可能导致人类实际上失去对 AI 开发的控制,无法再监督自己已经无法理解的研究过程。在此之后,AI 可能变得更危险、更不符合对齐要求,并总体上对人类构成威胁。我们披露的 Hugging Face 事件虽非 RSI 直接导致,却预示了在缺乏健全保障措施和对齐机制的情况下,相关风险可能变得何等严重。
针对前沿 AI 开发制定国际安全与安保实践标准,可能与对齐研究本身一样,对把握前沿发展节奏至关重要。标准可以为高质量证据确立共同定义,并就技术保障措施的严谨程度形成公认基线。简而言之,它们有助于我们回答这个问题:“怎样才算妥善降低灾难性 AI 风险?”
AI 标准与创新中心(CAISI)等现有民主机构、各州法律、联邦 AI 框架以及新型公私合作模式(在新窗口中打开),都可以为此提供助力。然而,AI 的开发与部署正在多个国家展开,应用也遍及全球;其影响很可能会在不同时间以某种方式波及每个人。
因此,需要通过国际标准制定工作解决以下几项关键挑战:
碎片化——各国的评估、报告要求和事件定义可能相互冲突,导致证据难以比较、新兴能力难以理解,也更难应对跨境风险。
集体行动——各国各自行动,可能产生所有国家都不愿看到的结果。RSI 能够加速 AI 研究本身,其速度可能超出我们集体理解进展、评估风险和维持有效人类监督的能力。
能力不均——前沿开发活动及相关专业知识在全球分布并不均衡。这会进一步加剧上述两个问题。
这些挑战同时适用于开放模型和闭源模型。
需要明确的是,任何开展自动化 AI 研究或开发其他先进能力的 AI 实验室,都必须遵循自我负责的基本原则和现行法律,为安全开展这些工作承担责任。我们倡导制定标准,是为了避免权力集中,并取得更好的实际成效。标准可以让实验室之外更多的利益相关方参与决定这项技术的发展方向,并提供一套清晰可见、可供信赖的原则,不受任何特定实验室具体做法的影响。而且,各方若能协作应对上述挑战,很可能取得更好的结果。
因此,我们认为美国应牵头推动与世界各国合作,为前沿 AI(包括 RSI)制定全球技术标准。
尽管我们预计这一构想会随时间推移发生显著演变,但其中有两个方面必不可少。
一种实现方式是利用正在形成的 AI 安全研究所网络——例如已在澳大利亚、加拿大、德国、法国、肯尼亚、日本、韩国、新加坡、印度和英国设立的机构——通过 CAISI 和各国行业组织推动标准制定,重点关注:(1) 依据能力基准衡量的前沿 AI 模型和开发者;以及 (2) 自动化 AI 研究(包括 RSI)的收益与风险管理。美国可以在 CAISI 于 2024 年创建先进 AI 测量、评估与科学国际网络(在新窗口中打开)的基础上继续推进,汇聚公共机构,在 AI 测量、评估和科学领域开展合作。
通过这项工作制定的标准,将为能力测量与评估、风险评估及保障措施充分性提供共同的技术基础。这些技术标准不会成为 AI 模型的许可证、强制发布前审查或批准要求。各国政府将自行决定是否以及如何将这些标准纳入本国法律体系。
这项工作还应征询开放模型和闭源模型开发者、独立技术专家及学术界的意见,从而支持具有竞争力的 AI 生态系统。共同标准应以透明方式制定,并确保不会让特定公司、国家或商业模式获得优势,包括避免提高新进入者或开放权重模型开发者的竞争门槛。
正如我们建议的那样(在新窗口中打开),这一方法可以借鉴航空和金融稳定等领域的经验。在这些领域,各国既制定了共同技术标准和可信的合作渠道,又保留了国家自主权。该机制还应与现有及新兴标准机构密切合作,例如 ISO(在新窗口中打开)、前沿模型论坛(在新窗口中打开)、智能体 AI 基金会(在新窗口中打开)和开放安全 AI 联盟(在新窗口中打开);同时也要与注重实施的组织合作,例如正在制定实用规范、将国际标准与现实 AI 评估衔接起来的 Appia 基金会。
随着 AI 研究的自主性和递归式自我改进程度不断提高,国际 AI 标准对管理相关风险尤为关键。具体而言,这些标准可包括:
除制定这些标准外,我们认为,世界各地的关键基础设施运营方和政府还需建立安全通信渠道,以共享国家安全关切、新出现的漏洞与威胁,以及前沿 AI 安全这一快速演进领域的最佳实践。中美两国就这些领域展开对话将是积极的一步,而即将举行的会谈正逢其时。
把握 AI 发展节奏,并不意味着维持预先设定的速度。从技术层面看,这意味着确保对齐研究及其成果的部署始终领先于能力发展。从社会层面看,这意味着运用标准、制度与协作,增强产业网络、社会关系网络和市场力量,从而实现正和结果。近期提出的网络防御集体行动倡议就是后一种做法的例子。
美国完全有能力发挥领导作用,因为其 AI 产业处于技术前沿,并且在金融、贸易、国防、技术和信息系统等关键领域的全球网络中仍占据优势地位。现在能否发挥领导作用,将决定美国是塑造全球 AI 框架,还是坐视一个碎片化、发展不均且冲突不断的体系在其周围形成。这也将决定先进 AI 能否强化美国及其盟友已有的网络;若不能发挥领导作用,这些网络可能会被削弱。
地缘政治竞争不仅关乎谁在技术上领先,也将围绕 AI 的采用与普及展开。后者将日益取决于谁能推动切实可行的合作,并制定合理的通行规则——如果世界各地的企业和社会要把未来寄托在这项技术上,这正是它们所需要的。
以务实的国际合作相互衔接的有力国家治理,为加强保障措施、持续创新以及广泛共享 AI 红利提供了一条路径。


