跳至主要内容
OpenAI

2026年10月6日

刊发

携手 Ironclad,提升计算机使用能力

合同管理领域的研究合作,如何帮助我们围绕复杂的专业工作训练和评估 AI 智能体。

正在加载…

发布 GPT‑6 Astra 时,我们展示了模型在使用计算机完成专业工作方面取得的长足进步,从准备文档到测试网站,均有体现。我们的下一个目标,是提升智能体使用专业软件解决复杂业务问题的能力和效率。我们正在探索如何训练模型,使其理解公司的业务规则、执行多步骤工作流程,并核实自己的工作是否符合最初的要求。

为加快这项研究,我们正与少数最了解这些工作流程的软件公司直接合作。我们共同找出具有挑战性且价值较高的任务,将其转化为训练和评估模型的研究问题,最终让模型在实际业务应用中更有能力、更有用。

我们的首家合作伙伴是 AI 合同管理领域的领先企业 Ironclad。通过与 Ironclad 团队密切合作,我们设计了一系列要求智能体配置协议、审批和可复用法律条款的任务,并展示了模型在这些复杂工作流程中取得的进步。Ironclad 的专业知识发挥了关键作用,帮助我们明确成功标准,并将真实客户需求直接融入前沿模型的开发。我们感谢 Ironclad 的合作,也很高兴分享双方共同取得的成果。

GPT‑6 Astra 是我们首个使用 Ironclad 任务训练的前沿模型。在我们的研究评估中,其平均得分比 GPT‑5.6 Sol 高出 32%,而每次尝试的估算用时减少了 48%。1

将合同管理流程转化为训练任务

设想一个法务运营团队正在搭建软件采购流程。财务部门可能需要审批超过特定金额的采购,安全部门可能需要审核某些申请,法务部门则可能需要审核非标准条款。负责搭建流程的人必须将这份简短的要求清单转化为申请表单、文档模板、审批规则以及最终协议的记录。

AI 智能体在完成同样的工作时,必须在操作软件的整个过程中始终兼顾这些要求。例如,它必须配置规则,让超出支出阈值的申请需要财务审批,并检查高于和低于该阈值的申请是否都遵循正确的流转路径。仅仅做对各个步骤还不够:搭建完成的流程必须能应对其设计范围内的各种情况。

Ironclad 员工以及 OpenAI 内部使用 Ironclad 的人员,帮助我们的研究人员确定了涵盖法务、商务和采购工作的 11 项任务。这些任务包括设置保密协议、创建采购审批流程,以及更新可复用的法律条款,使其与申请人选择的司法管辖区相符。据我们估计,有经验的用户完成这类工作,平均每项任务需要约 30 至 40 分钟。

根据任务的复杂程度,我们为每项任务设定了 8 至 50 项标准进行评估。这样,我们就能看出模型在哪些部分做对了,在哪些方面还有不足。Ironclad 还提供了其产品的托管软件环境,让模型能够在其中练习这些任务。我们的研究人员围绕典型工作流程开发了合成训练任务2,并运用强化学习,帮助模型通过练习和反馈不断改进。与熟悉业务的人共同选择任务、制定详细标准,并为模型提供练习环境——这三者相结合,确保我们在对客户最重要的实际任务上持续取得进步。

Astra 的表现

我们对比了 Astra 和 GPT‑5.6 Sol:Astra 采用 Max 推理设置,Sol 采用高推理设置,二者在各自对应的设置下得分最高。在这 11 项研究任务中,Astra 的平均得分为 55.0%,GPT‑5.6 Sol 为 41.6%;每次尝试的估算平均用时则从 Sol 的 37.0 分钟缩短到 Astra 的 19.2 分钟。3 Astra 开发过程中使用的一个内部模型,在这些任务上取得了更高的 63.7% 得分,我们希望将这些进一步的提升带到未来的模型中。

指标

GPT‑5.6 Sol
高推理设置

GPT‑6 Astra
Max 推理设置

评分标准平均得分

41.6%

55.0%

每次尝试的估算平均用时

37.0 分钟

19.2 分钟

Astra 在每次尝试的模拟用时更短的情况下,满足了更多任务要求。下方的两段视频展示了两个模型处理同一项研究任务的过程。Astra(第一段)在估算的 20 分钟内达到了约 94% 的任务标准;GPT‑5.6 Sol(第二段)在估算的 32 分钟内达到了约 85% 的任务标准。

GPT‑6 Astra 在估算的 20 分钟内达到了约 94% 的任务标准。

GPT‑5.6 Sol 在估算的 32 分钟内达到了约 85% 的任务标准。

这项合作对 Ironclad 意味着什么

Ironclad 在这项工作中的角色,体现了其客户熟知的一项挑战:合同管理流程既要处理例外情况,也要遵守企业赖以运作的规则。如果智能体在执行任务的过程中遗漏了其中某条规则,软件公司能够放心交给它的工作就会受到限制。这也说明,即使智能体越来越擅长处理复杂的合同管理任务,人工监督依然重要,完整的合同管理平台仍然不可或缺。与我们的研究人员合作,让 Ironclad 能够将这些问题带入底层模型的开发过程,由双方共同研究。

随着模型能力不断增强,Ironclad 有机会将其应用于更多自有产品。对法务和业务团队而言,这可能意味着 AI 可以承担更多复杂合同管理工作,同时保留这些团队所依赖的管控机制。

“AI 要在复杂的合同管理领域真正发挥作用,就不能只完成单项操作。智能体需要理解合同管理的整个生命周期,包括各业务流程如何衔接,同时保留团队所依赖的管控机制。我们与 OpenAI 的合作将这些现实挑战带入研究过程,助力技术不断进步。”
—Sunita Verma,Ironclad 首席技术官

与我们合作,推动 AI 应用于复杂的专业工作

我们正邀请少数软件公司,与我们的研究和工程团队直接合作,聚焦当前智能体尚无法可靠完成的重要专业任务。如果你的团队有这样的任务,我们希望看到一个具体示例:你要求智能体做什么,有哪些证据表明它在哪些环节未能完成要求,以及你会如何判断结果是否成功。合作伙伴还应能够安排深谙相关工作的人员参与,提供安全的测试环境,以及可安全用于研究的数据。这些条件将为我们调查失败原因、衡量模型是否有所改进提供起点。

如果你的团队符合这些条件,欢迎 申请探索研究合作机会。

作者

OpenAI

脚注

  1. 1

    这些结果涵盖的是 11 项研究任务,而非 Ironclad 的所有工作流程。所列时间是根据假定的模型处理和生成速度进行模拟估算得出的,并非实测的客户节省时间。

  2. 2

    我们对美国证券交易委员会(SEC)EDGAR 数据库中公开的合同进行了旨在去除个人信息的过滤处理,然后基于这些合同创建了模拟任务。我们未使用 OpenAI 客户数据、OpenAI 内部合同,或未公开的 Ironclad 客户数据或合同进行训练或评估。

  3. 3

    请参阅上方关于研究评估的脚注。