为了让通用人工智能 (AGI) 惠及全人类,我们认为必须对其进行民主治理。只有围绕强大 AI 系统的能力、风险与防护措施开展知情的公共讨论,才有可能实现这一目标。世界各地的人们都需要了解前沿 AI 未来可能的发展轨迹,从而切实参与决定其发展方向。
对特定风险、事件与防护措施保持透明固然必要,但这还不够。我们认为,公众还需要了解能力最强的系统在前沿实验室内如何发展,以及它们如何推动研究进展。
我们的目标是安全地打造在人类监督下工作的自动化 AI 研究员,以进一步推动深度学习与对齐方面的进展,实现迭代优化。根据我们的评估,我们现已实现去年秋季宣布(在新窗口中打开)的目标,即在今年 9 月前打造出自动化研究实习生。我们所说的“研究实习生”(research intern),是指一个能够在人类指导下执行明确研究任务的系统,这其中也包括一些熟练研究人员通常需要耗费数天才能完成的任务。我们在自动化 AI 研究员的研发上取得了显著进展,目标是在 2028 年 3 月前将其打造出来。
今年以来,OpenAI 研究人员的日常工作发生了实质性的变化。研究人员全天都在使用编程智能体(通常会并发运行多个会话),总体使用量正在快速增长,增速超过 OpenAI 的其他团队。研究人员提交代码的速度更快,开展的实验也更多。研究人员使用智能体的方式也在发生变化:智能体正在处理越来越复杂的任务,且成功率也在不断提升。AI 研究是一个包含许多潜在瓶颈的复杂过程,因此整体的研究进展速度可能无法完全与这些特定的指标同步。但总体而言,这些数据印证了我们内部许多人的普遍印象:基于智能体的工具正在切实加速研究的进展。人类依然负责设定研究优先级、判断应推进哪些想法和成果,并决定是否扩大、暂停或部署系统。
我们相信,若能以负责任的方式开展自动化 AI 研究,其所产出的模型将直接提升人类福祉,并推进 OpenAI 的使命。它可以降低高级智能的成本,让全球民众从中受益。我们推进这项工作,部分原因在于自动化研究能够协助我们解决对齐问题,并针对日益强大的 AI 建立防御机制。自动化 AI 研究员同样也可以充当自动化安全或对齐研究员的角色。能力更强且符合对齐标准的系统,有助于保障关键基础设施的安全、防范危险的 AI 智能体,并开发出新的保护措施。
这些都是我们开发实用型自动化研究能力的原因,但并不意味着快速的递归自我优化 (RSI) 必然是我们应该追求的结果。是否推进以及如何推进,必须取决于我们能否维持人类控制,并取决于人们在充分了解利益与风险后作出的民主选择。
我们尚不清楚如何安全地一路实现对齐的完整 RSI。我们正努力在提升能力的同时,扩展对齐与安全措施。但我们不能理所当然地认为对齐与安全方面的进展能一直保持同步,毕竟能力更强的系统往往更难被监控。严谨的对齐与安全工作是这项任务的核心,它的起点便是衡量并缓解我们如今在智能体编程系统中发现的安全问题。一旦我们发现继续推进会带来无法承受的安全风险,我们将采取适当的应对措施,包括放缓甚至停止开发或部署那些我们认为无法提供充分安全保障的系统。
在近期的 Hugging Face 事件之后,我们将这一承诺付诸实践,暂停了针对待发布最新模型的强化学习 (RL) 训练,转而进一步加固我们的研究环境并进行红队测试,同时扩大了监控系统的覆盖范围。这并非意味着停止所有研究:一些工作负载在更严格的控制下恢复了运行,而另一些则继续保持暂停。我们提高了安全与对齐标准,并将安全工作进一步深入到模型生命周期的各个环节中,要求在整个训练过程中提供更具说服力的对齐行为证据。
今天,我们将详细呈现近几个月来智能体系统如何推动我们在 RSI 方面的进展。智能体系统仍处于早期阶段,并且发展迅速;我们的衡量工作也仍处于初步阶段。通过分享这些初步结果及其背后的方法,我们希望加深公众对此的了解,推动行业形成公开披露的惯例,并促进该领域逐步确立共同的衡量标准。
最终,正如我们在前沿政策蓝图中所写,我们认为应当要求我们及其他公司公开跟踪我们在 RSI 方面的进展。即使没有这样的规定,我们也计划继续对我们在 RSI 方面的进展保持透明。随着衡量技术不断发展、我们的认识不断深入,我们将持续完善透明度做法,同时兼顾维护安全和保护专有信息的需要。
今年年初,OpenAI 研究人员按智能体使用量排名的中位水平仍然不高。到 8 月中旬,智能体使用量处于中位水平的研究人员已经开始每天在工作流中使用智能体;其每日推理用量按 API 价格折算已超过 600 美元。如今,在我们的研究组织中,智能体使用量位居前 10% 的研究人员,每天使用的 Token 按 API 价格折算已超过 7000 美元。
2026 年 6 月之前,整个研究组织中智能体的总运行时长仍少于人类的总工作时长。如今,这一情况已经逆转。按标准的 8 小时工作日折算,截至 8 月中旬,研究组织内智能体的总运行时间已相当于人类总工作时间的 3.1 倍。
另一项观察指标是使用高并发工作流的研究人员人数,例如同时运行 4 个或更多智能体的研究人员人数。如下图所示,这一人数正在持续增加。该数据按每日峰值计算,既包括用户直接启动的智能体,也包括这些智能体进一步创建的子智能体。
AI 研究很大程度上可以被视为一个劳动密集型过程,其目标是将模型智能或性能上的新突破融入我们的某一个核心模型中。这个过程包含多个环节,只有各环节顺利协同,模型能力才能得到提升:研究人员必须设计新的改进方案、编写评估来判断模型性能、构建基础设施以大规模测试这些改进、在训练期间发现错误以及不安全或未对齐的行为,并将成功的想法整合到核心训练运行中。研究过程中任何环节的失败,都可能制约整个闭环。
编写代码与开展实验是研究人员日常工作中的两项核心活动,我们有证据表明这些进程正在加速。
这些数据点相对容易衡量,但解读起来却颇具挑战。随着自动化进程的推进,那些最难以自动化的任务将占据研究人员更多的时间与精力,并成为未来进展的重要瓶颈。算力是制约进展的另一个关键因素,随着其他瓶颈的缓解,它的重要性可能会随着时间推移而增加。
2026 年以来,每位活跃实验者开展的实验数量持续增加,并于 2026 年 8 月创下自 2025 年 1 月开始追踪以来的历史新高。这与 Codex 使用量的增长相关,同时我们也注意到,自 2025 年以来,我们的可用算力也大幅增加。
定性观察与内部数据均表明,研究人员委派给编程智能体的任务类型正在发生变化:越来越多层级更高、时间跨度更长的任务被交给智能体处理。
为了更清晰地把握这一趋势,我们使用了 Epoch AI 近期发布的一种分类法(在新窗口中打开),对研究组织内部最近的使用情况进行了分析,该分类法对 AI 研发周期中的各类工作进行了划分。这套分类法借鉴了历史悠久的 O*NET 工作分类系统,专为前沿 AI 研发量身定制,将整个流程细分为六个主要阶段:
决策:决定研发方向、继续哪些项目、资源分配等
设计:构思研究方案及制定工程规范
构建:编写代码与整理数据集
运行:执行训练/评估、硬件调配、模型服务
分析:评估实验结果、模型表现、部署情况及外部工作
沟通:传达发现成果、反馈意见、项目状态与决策
下图根据这套分类法对编程智能体使用的 Token 进行了分类。
我们看到,从 2026 年 1 月至 8 月,所有类别的研究活动均有所增加。1 月份时,占据主导地位的类别是研究与基础设施代码。这一类别有所增长,其他类别也出现了显著增长,尤其是技术支持与运行监控方面的任务。高层级规划在智能体输出 Token 中依然只占极小的比例。
据同事反馈,编程智能体在排查内部研究基础设施故障方面表现出色,这切实解决了一个阻碍研究进展的重要瓶颈。多个此前设置“答疑时间 (office hours)”以协助研究人员排查实验故障的团队表示,2026 年的参与人数有所下降。其中一个团队甚至彻底取消了此类活动,转而专注于开展其他系统改进工作。
下图绘制了在一个供研究人员向其他团队寻求技术支持的主要内部沟通频道中,每日发布的主帖数量。据我们了解,该频道活跃度下降,并未被转移至其他人工运营的技术支持频道的问询所抵消。这种流量的下滑与这一更广泛的转变趋势是一致的。
我们还可以研究编程智能体是否成功完成了研究人员所提出的任务要求。我们使用智能体分类器进行分析后发现,在能够确定真实结果的任务中,从 1 月到 7 月,多个难度区间(以预估的人类完成任务耗时为代理指标)的成功率普遍上升。然而,智能体仍需要大量的人类引导才能顺利完成任务,尤其是随着任务复杂度的增加。在过去 6 个月里,成功完成的 4–8 小时任务中,超过一半经历过至少 1 次人工干预。
研究人员任务的成功率随时间的推移有所上升。图表中已排除了结果不确定的分类,以及会话少于 50 次或独立用户少于 50 人的数据点。
1 月至 7 月期间按时间跨度划分的任务成功率与干预率。结果不确定的分类已被排除。
为实现安全且有益的 AGI,推进能力更强的系统开发,同样离不开此类工作所需的防护措施。随着我们对风险认识的加深,我们对所需防护措施的评估也可能随之改变。
如我们所述,我们近期更新了针对监控、对齐与安全的标准。下面,我们将展示近期的限制措施如何影响研究活动的一个方面。
*图表中 7 月 20 日至 8 月 6 日期间显示的大部分 Astra 算力,是用于测试各项安全改进措施的实施效果。
7 月 20 日,在发现智能体攻破了我们的研究基础设施后,我们暂时关闭了用于训练的容器服务,并在实施多项严格的额外限制措施后恢复了该服务。
这导致强化学习 (RL) 训练算力急剧下降,与此同时,各团队不得不重新配置工作流,以适应经过强化的研究环境。上图数据涵盖了我们针对拟部署的最新模型暂停两周强化学习训练的时期。在 7 月 20 日至 8 月 6 日期间,Astra 级别的强化学习实验中(按 GPU 分配量计算),大部分运行旨在测试安全改进措施的实施效果。
8 月 7 日,初步证据表明,根据我们的准备框架 (Preparedness Framework)(在新窗口中打开),Astra 可能已具备极高 (critical) 级别的网络安全能力。因此,我们针对该模型实施了额外的安全限制,要求 Astra 必须在安全级别更高的研究环境中运行。在随后的一周里,Astra 级别的 GPU 分配量进一步下降了 59.2%,而其他模型级别的分配量则上升了 17.2%。这一增长抵消了 Astra 级别算力下降的约 85%,使得所分析的强化学习工作负载的总分配量基本保持不变。这一模式与以下情况相符:在涉及 Astra 的工作受到限制期间,部分训练与实验转向了非 Astra 模型。这也与研究人员的反馈一致:他们将那些因新限制而无法继续用于相关工作负载的算力转用于其他任务。
这一数据为当前有关训练与安全的讨论提供了一个重要信号:引入新的控制措施后,算力依然具有价值且可以灵活调配,并会自然流向研究机构内部的其他用途。长远来看,在讨论 AI 的发展速度时,也应考虑如何充分利用受到新限制或拟议限制的算力。
在实现对齐 RSI 的道路上不断取得进展并深化理解,对我们的使命而言至关重要。我们将持续完善方法、公开分享不断深化的认识,并推动围绕前沿系统开展知情的公共讨论和有意义的民主治理。
由智能体驱动的 AI 研究依然是个新事物,我们仍处于学习如何衡量它的阶段。一些指标,例如我们研究团队生成的代码量,相对容易收集,但却难以解读,因为它们与研究进展之间的关系仍不明朗。像“智能体在处理研究人员交办的任务时的成功率”这类更直接反映研究进展的指标可能更有价值,但开发与验证却非常复杂。更具挑战性的是,研究人员依赖的工具和系统正在快速迭代。深化我们对“研究加速”的理解,是整个 OpenAI 的一个重要关注点。
在贯穿全文的这些分析中,除非另有说明:
“研究人员”(researcher) 是一个宽泛的统称,指我们研究组织的所有成员,包括搭建研究基础设施、管理研究项目或以其他方式为整个组织提供支持的员工。
鉴于研究人员所依赖的工具与系统快速更迭,编程智能体的使用量指标虽涵盖了绝大部分,但并未包含所有的使用情况。


