AI 時代的評分卡
我從各地財務總監聽到的問題很簡單:我們如何從 AI 支出中獲得更多價值?
多年來,市場一直以採用情況衡量軟件成功:購買了多少席位、有多少活躍用戶、續訂了多少授權。要理解 AI 的價值,需要更有力的衡量標準:完成了多少工作。
財務總監和其他企業領袖面對的基本經濟問題,是 AI 完成工作的價值增長,是否快過完成這些工作的成本。
要回答這個問題,必須比每 Token 成本等指標看得更深入。成本較低的模型或許有較便宜的 Token,但要取得出色結果,可能需要更多嘗試、更多時間或更多人工審核。能力更強的模型或許 Token 較昂貴,卻能一次完成同一項任務。關鍵在於計算產生成功成果的總成本,並把這項成本與成果所創造的價值比較。
AI 時代的終極評分卡,可以視為「每美元實用智能」。這項指標回答四個關鍵問題:
- AI 是否正在完成重要的工作?
- 每項成功任務的成本是多少?
- 人們能否信賴結果?
- 隨着使用量增長,每一美元 AI 支出是否帶來更多價值?
先從工作本身開始。
AI 協助解決了多少客戶問題?它協助發佈了多少項程式碼變更?它審閱了多少份合約?它為人們節省了多少時間?有多少決策因在適當時刻取得適當背景資料而得到改善?
當 Token 轉化為人們可用的工作時,便會創造價值。隨着模型能力提升,它們可以承擔更長、更複雜的任務:保持背景資料、進行多步推理、跨工具工作,並在過程中調整。
最佳起點是一個工作流程。界定「完成」的意思,並在實際進行工作的系統中衡量該成果。
對支援團隊而言,「完成」可能是解決一宗客戶問題。對工程團隊而言,可能是通過測試的程式碼變更。對法律團隊而言,可能是準確並準時審閱一份合約。
以財務團隊準備預測檢討會議為例。許多工作都在作出最終決策之前發生:尋找最新預測、把數據匯入 Excel 或 Google 試算表、找出變化、核對各工作表、重製簡報,以及檢查所有數字是否完全吻合。
ChatGPT Work 可以承擔這個流程的大部分,讓團隊有更多時間專注於真正重要的問題:發生了甚麼變化?為甚麼?接下來我們應該怎樣做?
這就是每美元實用智能的實際體現。更多工作能更快完成,而人們可以把更多時間用於運用判斷力、創意和專業知識。
下一個問題是,要把這項工作做好需要多少成本。
AI 任務差異很大。快速回答可能只需少量運算資源。程式編寫、研究或財務工作流程,可能涉及更深入的推理、工具使用和多項操作。這些較複雜的任務可能需要更多運算資源,但也可以創造更多價值。
在模型層面,每項成功任務的成本取決於價格、使用的運算量,以及達到正確結果的可能性。對企業而言,總成本還包括員工時間、人工審核、重試和重做。
計算方法很直接:
- 把完成工作的全部成本加起來。
- 計算達到所需質素門檻的任務數量。
- 用全部成本除以成功任務數量。
這正是最低每 Token 價格不一定帶來每項成果最低成本的原因。即使是例行要求,前沿模型若能一次產生正確答案,減少重試、延遲、審核和總運算量,也可能帶來最佳價值。
分層模型系列讓客戶有更多方式優化這條方程式。我們上星期發佈的 GPT‑5.6 分為三個層級:Sol 是我們的旗艦;Terra 平衡效能與成本;Luna 則是我們最快且最實惠的模型。
這些層級提供了有用的起點。最終應由整項任務的經濟效益決定合適的模型。客戶可以把 Luna 用於快速、高用量工作流程;把 Terra 用於需要更深入處理的工作;或在更強推理能以更少嘗試交付最佳結果時使用 Sol。
我們訓練 GPT‑5.6,目標是從每個 Token 取得更多實用工作成果。在 Artificial Analysis Coding Agent Index 上,以 max 推理強度運行的 GPT‑5.6 Sol 達到新的最先進水平,同時比另一個領先模型少用 54% 輸出 Token。下圖展示了相關比較。
DeepSWE v1.1:長跨度工程任務;GPT‑5.6 Sol 達到 72.7% 的新高,高於 Claude Fable 5 的 69.9%,而估算 API 成本則低 36.2%。
在整個 GPT‑5.6 系列中,目標一致:每美元可成功完成更多工作。效率更高,令現有任務成本更低。能力更強,令全新類型的工作成為可能。
每一代新模型都應同時改善這條方程式的兩邊。客戶應能完成更有價值的工作,同時每項任務的完成成本持續下降。
第三項衡量標準是可靠性。
企業對 AI 的應用通常會分階段逐步深入。首先,AI 協助起草。然後,它尋找背景資料,並在工具和數據之間進行推理。隨着時間推移,它開始採取行動、處理例外情況並完成工作流程,而人在需要時提供判斷和控制。
每一步都創造更多價值,也對系統提出更高要求。
可靠性具有直接經濟價值。當結果準確、資料來源可靠、一致,並能在適當情況下交由人員處理時,人們用於審核、修正和重做工作的時間就會減少。成功任務的成本降低,組織也更有信心在更重要的工作流程中使用 AI。
團隊可追蹤以下三種結果,具體衡量可靠性:
- 可直接使用:交付的結果已達到質素門檻。
- 需要修正:需要重試或由人手修改。
- 需要升級處理:需要人手介入並完成工作。
這些衡量標準比單看模型準確度更能呈現完整情況。它們顯示 AI 是否真正減少了完成項目所涉及的工作。
可靠性也需要清晰界線。在 AI 從起草轉向採取行動之前,組織應界定:
- 系統可以存取哪些數據。
- 它可以使用或更改哪些系統。
- 應在甚麼情況下由人員審核或批准某項行動。
安全、保安、私隱和控制,構成更深入使用的基礎。人們需要了解系統如何運作、他們的數據如何處理,以及其行動如何受到管治。
ChatGPT Work 建基於 ChatGPT Enterprise 的安全、私隱、合規和工作區管理基礎。這讓組織能在保持適當監督的同時,讓 AI 取得更多背景資料,並應用於更多高價值工作流程。
能力促使用戶首次採用;可靠性則令 AI 融入日常工作方式。
最後一個問題是,成本效益是否隨規模擴大而提升。
公司可以透過長期追蹤同一個工作流程來衡量這一點。追蹤有多少任務達到質素門檻、完成這些任務的總成本,以及每項成功任務的成本。如果完成的工作量增長快過總成本,而質素保持不變或有所提升,每一美元 AI 支出就正在產生更多價值。
運算資源處於這條方程式的核心。
運算資源支撐研究,以及 AI 完成的每項任務。它影響產品質素、速度、可靠性、可用性和成本。用於訓練的運算資源建立未來的模型能力;推理所用的運算資源則產出當下的實用工作成果。兩者都應轉化為客戶更佳的成果。
更佳模型、更高效推理、專用硬件、更高使用率、更智能的路由,以及更強的產品設計,都能提升運算資源回報。每一代基礎設施都有助訓練能力更強的模型。更佳算法、硬件和軟件,進而協助更有效率地提供模型服務。
客戶可從實際體驗中感受到這些改善:更好的答案、更快的結果、更少修正、更可靠的產品,並以更低成本完成所需工作。
這些效益會層層累積。更佳基礎設施加速研究。研究產生能力更強、效率更高的模型。更佳模型改善產品。更佳產品推動採用、學習和收入。這種增長支持持續投資於下一代研究、運算、部署和安全。
OpenAI 透過一個共享智能平台,把這些部分整合起來。人們透過 ChatGPT 和 ChatGPT Work 使用它。開發人員透過 Codex 和 API,運用這個平台進行開發。企業則把它部署至實際進行工作的系統。
當其中一層有所改善,每款產品和每位客戶都能受惠。
整體而言,這四項衡量標準告訴我們,每美元實用智能是否正在提升。
實用工作成果告訴我們 AI 產出了甚麼。每項成功任務的成本告訴我們達到成果需要付出甚麼。可靠性告訴我們,人們可以有信心使用多少工作成果。規模擴大時的價值則可顯示,每一美元和每一單位運算資源能否隨時間創造更多工作成果。
目標是讓 AI 幫助人們做更有意義的工作、作出更佳決策,並把更多時間用於工作中需要人類特有的判斷力和創意。
我們的任務,是在每一代都改善這條方程式:能力更強的模型、更快且更可靠的結果,並以更低成本完成客戶所需的工作。
這樣,AI 才能隨時間推移,為更多人和組織帶來更大作用。


