AI 时代的记分卡
我从各地 CFO 那里听到的问题很简单:我们如何从 AI 投入中获得更多价值?
多年来,市场一直通过采用情况来衡量软件的成功:购买了多少席位、活跃用户有多少、续订了多少许可证。理解 AI 的价值,需要一个更有力的衡量标准:完成的工作。
CFO 和其他企业领导者面临的基本经济问题是:AI 完成的工作所创造的价值,是否比产出这些工作的成本增长得更快。
回答这个问题,需要比“每个 Token 成本”这类指标看得更深。成本较低的模型或许 Token 更便宜,但要获得出色结果,可能需要更多尝试、更多时间或更多人工审核。能力更强的模型或许 Token 更贵,但可以一次完成同一项任务。真正重要的是产出成功结果的全部成本,以及这个结果所创造的价值。
AI 时代的终极记分卡可以被理解为“每美元有用智能”。这个指标回答四个关键问题:
- AI 是否在完成重要的工作?
- 每项成功任务的成本是多少?
- 人们能否信赖结果?
- 随着使用量增长,每一美元 AI 投入是否创造更多价值?
从工作本身开始。
AI 帮助解决了多少客户问题?它帮助发布了多少代码变更?它审核了多少份合同?它为人们节省了多少时间?有多少决策因为在正确时刻获得了正确上下文而得到改善?
当 Token 转化为人们可用的工作时,才会创造价值。随着模型能力增强,它们可以承担更长、更复杂的任务:保持上下文、进行多步推理、跨工具工作,并在过程中持续适应。
最好的起点是一个工作流。定义“完成”意味着什么,并在工作发生的系统中衡量这个结果。
对支持团队来说,“完成”可能意味着一个客户问题得到解决。对工程团队来说,可能意味着一次代码变更通过了测试。对法务团队来说,可能意味着一份合同被准确且按时审核完毕。
以一个准备开展预测评审的财务团队为例。很多工作发生在最终决策之前:找到最新预测,把数据移入 Excel 或 Sheets,识别变化,核对各个标签页,重做幻灯片,并检查所有数字是否完全吻合。
ChatGPT 工作可以承担其中大部分流程,让团队有更多时间专注于真正重要的问题:发生了什么变化?为什么?接下来我们该怎么做?
这就是“每美元有用智能”的实际体现。更多工作以更快速度完成,同时人们把更多时间用于判断、创造力和专业能力。
下一个问题是,高质量完成这项工作的成本是多少。
AI 任务差异很大。快速回答可能只需要很少计算。编码、研究或财务工作流可能涉及更深入的推理、工具使用和许多操作。这些更复杂的任务可能需要更多计算,但也能创造大得多的价值。
在模型层面,每项成功任务的成本取决于价格、使用的计算量,以及达到正确结果的可能性。对企业来说,完整成本还包括员工时间、人工审核、重试和返工。
计算方法很直接:
- 加总完成工作的全部成本。
- 统计达到所需质量标准的任务数量。
- 用全部成本除以成功任务数。
这就是为什么最低的每 Token 价格并不总能带来最低的每结果成本。即使是常规请求,前沿模型也可能带来最佳价值:如果它能一次给出正确答案,就能减少重试、延迟、审核和总计算量。
分层模型系列让客户有更多方式优化这个等式。我们上周发布的 GPT‑5.6 有三个层级:Sol 是我们的旗舰;Terra 在性能与成本之间取得平衡;Luna 是我们速度最快、价格最亲民的模型。
这些层级提供了有用的起点。最终,应由完整任务的经济性来决定合适的模型。客户可以将 Luna 用于快速、高容量的工作流,将 Terra 用于需要更大深度的工作,或在更强推理能以更少尝试带来最佳结果时使用 Sol。
我们训练 GPT‑5.6,是为了让每个 Token 产出更多有用工作。在 Artificial Analysis 编码智能体指数上,GPT‑5.6 Sol 在最大推理设置下创下新的最先进水平,同时输出 Token 比另一款领先模型少 54%。下方图表展示了这一对比。
DeepSWE v1.1:长周期工程任务;GPT‑5.6 Sol 达到 72.7% 的新高,高于 Claude Fable 5 的 69.9%,且预估 API 成本低 36.2%。
在整个 GPT‑5.6 系列中,目标始终一致:每一美元完成更多成功的工作。更高效率让现有任务更可负担。更强能力让全新的工作类型成为可能。
每一代新模型都应改善这个等式的两端。客户应能完成更有价值的工作,同时每项任务的完成成本持续下降。
第三项衡量标准是可靠性。
AI 的采用往往会分阶段加深。首先,AI 帮助起草。然后,它寻找上下文,并跨工具和数据进行推理。随着时间推移,它开始采取行动、处理例外情况并完成工作流,而人在需要时提供判断和控制。
每一步都会创造更多价值,也对系统提出更高要求。
可靠性具有直接的经济价值。当结果准确、来源清晰、一致,并能适当地升级处理时,人们用于审核、纠正和重复工作的时间就会减少。成功任务的成本会降低,组织也会更有信心在更重要的工作流中使用 AI。
团队可以通过跟踪三个结果来具体衡量:
- 可直接使用:交付结果已达到质量标准。
- 需要修正:结果需要再次尝试或人工编辑。
- 需要升级处理:需要有人介入并完成工作。
这些指标比单纯的模型准确率讲述了更丰富的故事。它们显示 AI 是否真正减少了完成项目所需的工作量。
可靠性还需要清晰的边界。在 AI 从起草转向采取行动之前,组织应明确:
- 系统可以访问哪些数据。
- 它可以使用或更改哪些系统。
- 何时应由人来审核或批准某项行动。
安全、安保、隐私和控制构成更深入使用的基础。人们需要了解系统如何运行、他们的数据如何被处理,以及系统的行动如何受到治理。
ChatGPT 工作建立在 ChatGPT Enterprise 的安全、隐私、合规和工作空间管理基础之上。这使组织能够为 AI 提供更多上下文,并让它接入更有价值的工作流,同时保持适当监督。
能力赢得首次使用。可靠性让 AI 成为完成工作的方式之一。
最后一个问题是,规模扩大时经济性是否改善。
公司可以通过长期跟踪同一个工作流来衡量这一点。跟踪达到质量标准的任务数量、完成这些任务的总成本,以及每项成功任务的成本。如果已完成工作增长快于总成本,而质量保持不变或有所提升,那么每一美元 AI 投入都在创造更多价值。
算力处在这个等式的核心。
算力驱动研究,也驱动 AI 完成的每一项任务。它塑造产品质量、速度、可靠性、可用性和成本。训练算力构建未来能力。推理算力交付今天的有用工作。两者都应转化为客户更好的结果。
更好的模型、更高效的推理、专用硬件、更高利用率、更智能的路由和更强的产品设计,都会提高算力回报。每一代基础设施都有助于训练能力更强的模型。更好的算法、硬件和软件随后帮助更高效地服务这些模型。
客户以人的方式感受到这些改进:更好的答案、更快的结果、更少的修正、更可靠的产品,以及更低的所需工作成本。
这些收益会复合增长。更好的基础设施加速研究。研究产出能力更强、效率更高的模型。更好的模型改进产品。更好的产品推动采用、学习和收入增长。这种增长支持对下一代研究、算力、部署和安全的持续投资。
OpenAI 通过一个共享智能平台把这些要素整合在一起。人们通过 ChatGPT 和 ChatGPT 工作使用它。开发者通过 Codex 和 API 基于它进行构建。企业将它部署到工作发生的系统中。
当其中一层得到改进,每个产品和每位客户都能受益。
综合来看,这四项衡量标准告诉我们,每美元有用智能是否在提升。
有用工作告诉我们 AI 产出了什么。每项成功任务的成本告诉我们,达成结果需要付出什么。可靠性告诉我们,人们能有信心使用多少工作成果。规模化价值告诉我们,随着时间推移,每一美元和每一单位算力是否完成了更多。
目标是让 AI 帮助人们做更多有意义的工作、做出更好的决策,并把更多时间用于工作中需要鲜明的人类判断和创造力的部分。
我们的工作是让这个等式在每一代中变得更好:能力更强的模型,更快速、更可靠的结果,以及客户所需工作更低的成本。
这就是 AI 如何随着时间推移,对更多人和组织变得更加有用。


