2023 年年中,在“RLSlow”研究项目中,我们首次看到了一些结果,让我们确信推理模型训练能够实现扩展,从而释放预训练模型形成自身思维链的能力。那一晚,Szymon 和我留在办公室里。我们想的不是这项技术将带来的惊人基准数据、产品或科研成果,而是努力消化一个令人清醒的事实:有生之年,我们真的会看到明显比自己更聪明的机器,而这些系统的轮廓已经显现;我们还在思考,如何让人们意识到这件事的重大意义。
三年后,推理语言模型已成为经济中迅速增长的一部分,并开始拓展科学的边界。它们能够操作计算机和图形界面,与人类及其他 AI 协作,并开展研究项目。它们也在改变计算机安全格局,并由此带来明确的新危险。
这段时间出现了许多新研究,我们对这些系统的理解也再次与 2023 年略有不同。根据内部结果,我强烈预计,这一进步速度可能延续到递归自我改进阶段。如果 AI 开发沿当前道路继续推进,未来几年出现的系统很可能再次实现幅度相当或更大的能力跃升,并日益推动自身发展。
此时必须极其谨慎。我担心,没有人准备好面对机器智能持续迅速提升所带来的后果。OpenAI 将继续寻求对齐与监控的技术解决方案、建立防御系统,并在必要时单方面暂缓进一步扩展;但我认为还需要更广泛的干预。
从宏观上看,机器智能的进步由计算能力的提升驱动。大约在 2017 年,看到多个研究项目持续从扩展中获益后,OpenAI 的我们深刻认识到了这一点1。因此,我们开始寻求获取远超原先计划的算力,并逐渐将研究集中于少数具有高度可扩展性的方向。我们相信,这是跻身 AI 研究前沿并塑造 AGI 所带来的影响的唯一途径。
一路走来,我们开发出了新算法,团队和研究人员个人也展现了新的巧思与创举。在我看来,它们大多是扩展道路上的发现;深度学习科学仍处于起步阶段,而有意义的算法进步往往与可用算力相关。如果把视野拉长到数年,AI 正随着扩展到更大型的计算机上而不断变得更智能。
正如 Ray Kurzweil 在 20 世纪末所预测的那样(在新窗口中打开),我们如今正处于计算史上的一个时刻:机器智能开始以具有变革意义的方式超越人类智能。
与其说 AI 是被设计出来的,不如说它是被培育出来的 — 大体而言,它是在难以想象的庞大算力上,多次重复一个简单优化步骤的产物。由此产生的系统复杂得惊人,能够处理抽象概念,并模拟人类行为的某些方面。我们可以像研究神经科学一样,探索这个系统内部涌现的各种微小机制;也同神经科学一样,其整体运作仍无法用我们能够完全理解的方式描述。
研究基于深度学习的 AI,在很大程度上是一门实验科学。我们投入了大量精力来构建原理清晰的算法并提出可检验的预测,但从根本上说,我们的大规模训练仍是实验,其结果有时会令我们意外。而且,随着系统能力增强,结果也越来越难以解读。
当前算法通常提升易于衡量的能力,比提升难以客观量化的能力更快,这让问题更加复杂。我们投入大量时间,试图理解能力如何泛化,以及应优先发展哪些在未来几年最为重要的技能。例如,我们认为,如果额外投入精力,可以专门增强模型开展数学研究的能力;但我们没有优先选择这一方向,因为正如后文将讨论的,我们认为 RSI 和自动化对齐研究更为紧迫。
通过扩展深度学习产生的智能,无法与人类智能直接比较。要在现实世界产生重大影响 — 无论极其有用还是极其危险 — AI 无需比肩或超越人类的全部能力;只需在足够多的能力上超过人类即可。随着它在越来越多的维度上超越人类,我们也越来越难准确理解它究竟有多强。
机器智能的产生过程与人类智能有根本差异,因此我们不能想当然地认为它默认遵循人类原则,或会以类似人类的方式从这些原则中泛化。AI 研究的核心问题是对齐,即让 AI 按照人类标准“努力做正确的事”。
为了梳理切实可行的研究方向,我认为区分目标对齐与价值对齐很有帮助。
概括来说,目标对齐关注的是:“AI 是否会努力完成交给它的目标?”这可以包括遵守指令层级,或与人类沟通协作并尝试理解其目标的能力。这一系列方向具有极强的实际意义。
价值对齐则是模型更内在的属性。它指的是秉持一套高层原则并从中泛化的能力;即使目标不明确或相互冲突,或身处陌生、对抗性的情境,也能采取“合理”的行动。已对齐的 AI 应当诚实正直,并热爱人类。
当然,价值对齐与目标对齐之间的界限可能很模糊;真正重视目标,需要尝试推断其背后的意图(在新窗口中打开)与价值观。不过,一般而言,当我谈到对齐研究的长期重要性时,指的是价值对齐。
AI 对齐的根本挑战在于泛化。随着机器变得更聪明,它们会处理更高层次的概念,并进入与训练时所遇情境越来越不同的环境。它们可能无法将训练中教授和强化的价值观泛化到这些新情境;我们也很难确定它们会如何行动。AI 所处的整体生态系统也在迅速变化,这让问题更加棘手;例如,如今训练的 AI 必须能够稳健地与各种其他 AI 互动。至关重要的是,无论未来的 AI 是否认为自己受到人类监督,都必须始终秉持人类价值观。
目前实际采用的对齐训练方法主要分为两类。
第一类是在目标导向的强化学习中鼓励对齐行为。模型的行动会被评估(通常由 AI 评估)是否符合给定的偏好模型、“规范”或“宪法”,并获得相应奖励。这种方法在一般情况下非常有效,也是现代 AI 助手构建方式的核心组成部分。遗憾的是,它也可能很脆弱,并且高度依赖训练监督的覆盖范围,以及模型从训练中遇到的情境进行泛化的能力。例如,在 OpenAI-Hugging Face 事件中,智能体守住了不对人类实施社会工程攻击的底线。但显然,它们未能克制其他超出范围、且违背在其他情境中所学价值观精神的行为。
第二类方法试图利用模型从预训练数据中泛化的能力。这可以包括构建促成对齐的训练数据集,或让模型聚焦于预训练分布中“已对齐”的部分,例如人格选择模型(在新窗口中打开)。这种方法的弱点在于,它无法稳健抵御进一步的优化压力。如果一个模型通常会产生“已对齐”的想法,但随后经历大量训练,被教导完成极其困难的目标,它就可能学会进行动机驱动的推理:根据实现目标的需要,扭曲那些看似“已对齐”的想法。近期涉及某个非 OpenAI 模型的网络安全事件,很可能就是此类行为的例子。
我们正对这些方向所涵盖的一系列方法进行大量投入。我们也看到了实质性进展 — GPT‑6 Astra 是首个受益于我们长期研究的一些重要进展的模型,其对齐程度显著优于 GPT‑5.6 Sol。尽管如此,必须承认并理解,随着模型能力增强,我们仍需取得更多进展;而可泛化对齐的进步,未必能以足够大的幅度领先于模型整体智能的进步。
我们尚未建立令人满意的泛化理论,而且至少在没有更强大 AI 帮助的情况下,短期内似乎也不太可能建立起来。因此,就目前而言,我们通过实证验证对齐技术的能力,实际上甚至可以说比这些技术本身更重要。
OpenAI 在这方面主要押注于思维链监控(在新窗口中打开)。它基于一个颇具吸引力且可扩展的理念:模型的许多能力来自以语言表达的推理过程(思维链)。如果我们扩大对该过程结果的优化,却不监督过程本身,那么训练就不会直接激励思维链隐藏任何未对齐的想法或目标。这并不意味着模型会学会把不依赖思维链的未对齐倾向外显出来;但它能让我们准确监控推理带来的能力提升。
在开发推理模型的同时,我们也认识到了思维链监控的潜在重要性。发布 o1‑preview 时,我们特意将产品设计为隐藏思维链,以使思维链长期免受训练监督所带来的压力2。此后的开发中,我们一直努力遵守不监督推理过程这一原则。在研究模型如何从训练分布中泛化时,CoT 监控成为我们极为重要的工具,让我们不仅能观察和分析模型的行动,还能了解其内部过程。
在研究 Astra 类模型时,这项工具仍然至关重要。但遗憾的是,我们的评估表明,我们能够依赖 CoT 监控的程度正在逐步下降。这是多种因素共同作用的结果。
- 现代推理模型所处的环境比 o1‑preview 更复杂;它们的推理过程日益与人类、其他 AI 的交流以及工具使用交织在一起。其中许多交互必须受到监督,因而模糊了我们希望保留的边界。
- AI 越来越擅长思考并操控自己的推理过程。
- 随着预训练性能提高,我们还发现,即使完全不使用语言化推理,模型也变得聪明了许多。
这些挑战未必无法克服。我希望我们能制定干预措施,提高模型思维链的可监控性,例如更深入地理解不同优化目标与模型所用测试时计算形式之间的相互作用。我也相信,将 CoT 与激活监控的思路结合起来会很有价值 — 让监控器直接访问网络内部并扩大其训练,例如坦白机制(在新窗口中打开)。我们正在积极探索这些思路。尽管如此,我预计 AI 的整体进展将日益受制于我们对监控的信心。
在我看来,支持继续快速训练更聪明模型的最有力理由,是我们需要建立防御系统,以应对其他 AI 带来的危险。
今年反复讨论的一项明确风险是网络安全:模型侵入计算机系统并突破其限制逃逸的能力正变得超越人类。这极大扩展了 AI 相关风险的范围:智能体将能访问除最安全设施之外的几乎所有基础设施,即使没有实体躯体,也能直接影响世界的许多方面。目前,我们正处于一个短暂窗口期,可以利用现有最佳模型显著加强关键系统的安全性。
遗憾的是,AI 相关风险今后还会继续增长。一个被专门训练并指示实施恶行的高能力智能体会带来全新的危险;它很可能超出其操作者的意图范围,并可能泛化出更为极端的恶意行为。随着 AI 自主性增强,滥用与自主的未对齐行动之间的界限将逐渐模糊。我们或许习惯于把 AI 视为工具,但有些智能体会追求自身目标。它们会通过讨价还价、欺骗或勒索,与人类展开合作。
此外,AI 可能催生的新技术也会带来风险,例如工程化病原体。
我们将需要强大且已对齐的 AI 来进行防御:保护基础设施、实时抵御失控智能体,并发明全新的防护措施。这将成为 OpenAI 部署工作的重点。
与此同时,即使考虑到 AI 全面进步预期带来的不确定性以及建立防御系统的需要,我们也绝不能以此为鲁莽行事的借口。一旦真正认识到事关重大,不惜一切代价向前竞速的想法就显得荒谬。
Machine intelligence playing a larger and larger role in its own development process is a natural conclusion of sustained technological progress. If AI progress continues, machine recursive self-improvement (RSI) will be at the very core of future scientific discovery.
Automated AI research is a more dramatic form of scaling intelligence with compute; and of course as a part of it, AI will improve the computational substrate itself. And similarly to scaling, we focus OpenAI research towards RSI as we believe it is the only way to remain at the frontier of AI research moving forward.
I want to stress that the above words don’t imply I think greatly accelerating deep learning research, especially in the short term, is the right collective action we should take as the research community. However, I do think this is where the current path leads, and we all need to make a conscious choice on how to proceed. The main levers we have are either steering the process to strengthen alignment and monitoring alongside the AI and find ways to keep people in the loop; or coordinating to slow down future development as needed to build confidence in these measures.
The best way forward I see currently is a combination of both.
The concrete bits of progress we’ve made on alignment and monitoring have generally been very intertwined with general AI progress. Great examples are RL from human feedback(在新窗口中打开), which was key to training early AI assistants, and the aforementioned chain-of-thought monitoring(在新窗口中打开), which was enabled by advances on reasoning models. We must focus the increasingly automated research process on developing new such insights, algorithms and theories, and iteratively build up safety cases for more capable AIs.
Scaling AI systems has to be constrained by our confidence in safety. We need to evolve commitments like the Preparedness Framework or Responsible Scaling Policy(在新窗口中打开) into widely mandated safety bars for continued development. These can be enforced by a network of third-party auditors, by government agencies or by international bodies.
The core challenge of automating AI research is not “getting there” - it is getting there in a way that keeps people a part of the continued improvement process, and leaves the future in humanity’s hands.
As we outlined recently with Sam, OpenAI prioritizes work in service of three north stars:
- Navigating the next period of AI progress, by building an automated AI researcher, iterating with it on the alignment problem and finding ways for people to remain part of the self-improvement loop.
- Delivering the benefits of scientific progress and economic growth that very intelligent machines enable.
- Empowering everyone individually with a personal AGI.
I have focused in this essay only on the first point, as I believe it is by far the most urgent. However, I hold a deep hope and appreciation for the benefits that further technological progress will bring. Future aligned AI could advance science, develop new therapies, and bring about broad material abundance. Friendly and honest AI can help people navigate difficulties they face in their life and meaningfully improve their happiness and sense of fulfillment. OpenAI puts a tremendous amount of effort into bringing these benefits about. One current example I am proud of - and my loved ones have found helpful - is the deep investment into ChatGPT’s ability to provide health information.
As great as the long-term promise of AI may be, the majority of our focus should be on the next few years. We are facing a transition to a world with incredibly intelligent machines, and we need to ensure that transition works out well for humanity. We need to find ways to preserve human agency and enshrine an intrinsic value to being human, in a world where most tasks could be performed by AI. To prevent extreme concentration of power in a world where undertakings that would have taken thousands of experts now will be achievable by a few people operating a large computer. And to ensure that humans remain in control of the future and are not left behind by unchecked progress, brought about by an alien intellect exceeding our own.
Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer. I expect and hope for voluntary slowdowns to become commonplace until shared safety bars are established. And I believe that international coordination on future AI development needs to become a top priority for governments around the world.
Author
脚注
- 1
其中包括扩展自我博弈(在新窗口中打开)、机器人技术(在新窗口中打开),以及事后看来最值得一提的扩展循环神经网络以进行语言建模(在新窗口中打开);后者是 GPT 系列研究的先驱。
- 2


