AI 時代的評分表
我從各地 CFO 聽到的問題很簡單:我們要如何從 AI 支出中獲得更多價值?
多年來,市場以採用情況衡量軟體的成功:購買的席位、活躍使用者、續約的授權。理解 AI 的價值,需要一項更有力的衡量標準:完成的工作。
CFO 和其他企業領導者面臨的基本經濟問題是:AI 完成工作的價值,是否比產出這些工作的成本成長得更快。
要回答這個問題,必須比每 Token 成本這類指標看得更深入。成本較低的模型也許 Token 較便宜,但要得到出色結果,可能需要更多嘗試、更多時間,或更多人工審查。能力更強的模型也許 Token 較昂貴,卻能一次完成同一項任務。真正重要的是產出成功成果的總成本,並以該成果所創造的價值衡量這筆成本。
AI 時代最終的評分表,可以視為「每美元有用智慧」。這項指標回答四個關鍵問題:
- AI 是否完成了重要的工作?
- 每項成功任務的成本是多少?
- 人們能否信賴結果?
- 隨著使用量成長,每一美元 AI 支出是否產生更多價值?
從工作本身開始。
AI 協助解決了多少客戶問題?它協助交付了多少程式碼變更?它審閱了多少份合約?它替人們省下了多少時間?因為在正確時刻取得正確脈絡,而改善了多少決策?
當 Token 轉化為人們可使用的工作時,才會創造價值。隨著模型能力提升,它們能承擔更長、更複雜的任務:維持脈絡、進行多步驟推理、跨工具工作,並在過程中調整。
最佳起點是選定一個工作流程。定義「完成」的意義,並在實際執行工作的系統中衡量該成果。
對支援團隊而言,「完成」可能代表客戶問題已解決。對工程團隊而言,可能代表程式碼變更通過測試。對法務團隊而言,可能代表合約已準確且準時完成審閱。
以準備預測審查的財務團隊為例。許多工作都發生在做出最終決策之前:找出最新預測、將資料移至 Excel 或 Sheets、識別變化、核對分頁、重建投影片,並檢查所有數字是否完全相符。
ChatGPT Work 可以承擔這個流程的大部分,讓團隊有更多時間專注於真正重要的問題:發生了什麼變化?為什麼?接下來該怎麼做?
這就是每美元有用智慧的實際運作。更多工作能以更快速度完成,而人們能把更多時間用於判斷、創意和專業能力。
下一個問題是,要把這項工作做好需要多少成本。
AI 任務差異很大。快速回答可能只需要少量運算。編碼、研究或財務工作流程,可能涉及更深入的推理、工具使用和許多動作。這些更複雜的任務可能需要更多運算,但也能創造更大價值。
在模型層級,每項成功任務的成本取決於價格、使用的運算量,以及達成正確結果的可能性。對企業而言,總成本也包括員工投入的時間、人工審查、重試與重做。
計算方式很直接:
- 加總完成工作的完整成本。
- 計算達到所需品質門檻的任務數。
- 用完整成本除以成功任務數。
這就是為什麼最低的每 Token 價格,未必總能帶來最低的每成果成本。即使是例行請求,前沿模型若能一次產出正確答案,減少重試、延遲、審查和總運算量,也可能提供最佳價值。
分層的模型系列,讓客戶有更多方式最佳化這個方程式。我們上週發布的 GPT‑5.6 有三個層級:Sol 是我們的旗艦;Terra 在效能與成本之間取得平衡;Luna 則是我們最快、最實惠的模型。
這些層級提供了有用的起點。最終應由完整任務的經濟效益來決定合適的模型。客戶可能會將 Luna 用於快速且大量的工作流程,將 Terra 用於需要更深度的工作,或在更強推理能以更少嘗試帶來最佳結果時使用 Sol。
我們訓練 GPT‑5.6,讓每個 Token 都能產生更多有用工作。在 Artificial Analysis Coding Agent Index 上,GPT‑5.6 Sol 在最高推理設定下創下新的最佳水準,同時輸出 Token 比另一個領先模型少 54%。下方圖表說明了這項比較。
DeepSWE v1.1:長時程工程任務。GPT‑5.6 Sol 以 72.7% 創下新高,高於 Claude Fable 5 的 69.9%,預估 API 成本則低 36.2%。
在 GPT‑5.6 系列中,目標相同:每一美元完成更多成功工作。效率越高,既有任務越負擔得起。能力越強,越能實現全新的工作類型。
每一代新模型都應改善這個方程式的兩端。客戶應該能完成更有價值的工作,同時讓完成每項任務的成本持續下降。
第三項衡量標準是可靠性。
AI 採用通常會分階段深化。一開始,AI 協助起草。接著,它找出脈絡,並跨工具與資料進行推理。隨著時間推移,它開始採取行動、處理例外狀況並完成工作流程,而人在需要時提供判斷與控制。
每一步都創造更多價值,也對系統提出更高要求。
可靠性具有直接的經濟價值。當結果準確、來源充分、一致,且能適當升級處理時,人們就能少花時間審查、修正和重做。成功任務的成本會降低,組織也更有信心在更重要的工作流程中使用 AI。
團隊可以追蹤三項成果,讓這件事具體化:
- 可直接使用:交付的結果已達品質門檻。
- 需要修正:結果需要再次嘗試或人工編輯。
- 需要升級處理:需要有人介入並完成工作。
這些衡量指標講述的故事,比單看模型準確率更完整。它們顯示 AI 是否真正減少了完成專案所需投入的工作。
可靠性也需要清楚的界線。在 AI 從起草轉向採取行動之前,組織應定義:
- 系統可以存取哪些資料。
- 它可以使用或變更哪些系統。
- 何時應由人員審查或核准某項行動。
安全、資安、隱私和控制,構成更深入使用的基礎。人們需要了解系統如何運作、資料如何被處理,以及其行動如何受到治理。
ChatGPT Work 建立在 ChatGPT Enterprise 的安全性、隱私、合規和工作區管理基礎之上。這讓組織能在維持適當監督的同時,給予 AI 更多脈絡,並讓它存取更有價值的工作流程。
強大的能力讓人願意開始使用,可靠性則讓 AI 融入日常工作。
最後一個問題是,規模擴大時經濟效益是否改善。
公司可以透過長期追蹤同一個工作流程來衡量這一點。追蹤有多少任務達到品質門檻、完成這些任務的總成本,以及每項成功任務的成本。如果完成的工作成長速度快於總成本,而品質維持不變或有所提升,代表每一美元 AI 支出都在創造更多價值。
運算位於這個方程式的核心。
運算驅動研究,也支撐 AI 完成的每一項任務。它影響產品品質、速度、可靠性、可用性和成本。訓練運算打造未來能力。推論運算交付今天的有用工作。兩者都應轉化為客戶更好的成果。
更好的模型、更高效的推論、專用硬體、更高使用率、更聰明的路由,以及更強的產品設計,都會提升運算回報。每一代基礎設施都有助於訓練能力更強的模型。更好的演算法、硬體和軟體,接著有助於更有效率地執行這些模型。
客戶會以人的感受體驗這些改善:更好的答案、更快的結果、更少修正、更可靠的產品,以及更低的所需工作成本。
這些效益會複合成長。更好的基礎設施加速研究。研究產出能力更強、效率更高的模型。更好的模型改善產品。更好的產品推動採用、學習和營收。這樣的成長支持對下一代研究、運算、部署和安全的持續投資。
OpenAI 透過單一共用智慧平台整合這些要素。使用者可透過 ChatGPT 和 ChatGPT Work 使用平台,開發者可透過 Codex 和 API 進行開發,企業則可將平台部署至實際執行工作的系統中。
當其中一層有所改善,每項產品和每位客戶都能受益。
綜合來看,這四項衡量標準能告訴我們,每美元有用智慧是否正在提升。
有用工作告訴我們 AI 產出了什麼。每項成功任務的成本告訴我們,要達成成果需要付出什麼。可靠性告訴我們,人們能放心使用多少工作成果。規模化價值告訴我們,隨著時間推移,每一美元和每一單位運算是否能完成更多事。
目標是讓 AI 協助人們從事更有意義的工作、做出更好的決策,並把更多時間投入工作中需要獨特人類判斷與創意的部分。
我們的任務,是讓這個方程式隨每一代持續改善:能力更強的模型、更快且更可靠的結果,以及客戶所需工作更低的成本。
這就是 AI 如何隨時間對更多人和組織變得更有用。


