跳至主要內容
OpenAI

2026年7月17日

公司

AI 時代的評分表

載入中…

我從各地 CFO 聽到的問題很簡單:我們要如何從 AI 支出中獲得更多價值?

多年來,市場以採用情況衡量軟體的成功:購買的席位、活躍使用者、續約的授權。理解 AI 的價值,需要一項更有力的衡量標準:完成的工作。

CFO 和其他企業領導者面臨的基本經濟問題是:AI 完成工作的價值,是否比產出這些工作的成本成長得更快。

要回答這個問題,必須比每 Token 成本這類指標看得更深入。成本較低的模型也許 Token 較便宜,但要得到出色結果,可能需要更多嘗試、更多時間,或更多人工審查。能力更強的模型也許 Token 較昂貴,卻能一次完成同一項任務。真正重要的是產出成功成果的總成本,並以該成果所創造的價值衡量這筆成本。

AI 時代最終的評分表,可以視為「每美元有用智慧」。這項指標回答四個關鍵問題:

  1. AI 是否完成了重要的工作?
  2. 每項成功任務的成本是多少?
  3. 人們能否信賴結果?
  4. 隨著使用量成長,每一美元 AI 支出是否產生更多價值?

1. 完成了多少有用的工作?

從工作本身開始。

AI 協助解決了多少客戶問題?它協助交付了多少程式碼變更?它審閱了多少份合約?它替人們省下了多少時間?因為在正確時刻取得正確脈絡,而改善了多少決策?

當 Token 轉化為人們可使用的工作時,才會創造價值。隨著模型能力提升,它們能承擔更長、更複雜的任務:維持脈絡、進行多步驟推理、跨工具工作,並在過程中調整。

最佳起點是選定一個工作流程。定義「完成」的意義,並在實際執行工作的系統中衡量該成果。

對支援團隊而言,「完成」可能代表客戶問題已解決。對工程團隊而言,可能代表程式碼變更通過測試。對法務團隊而言,可能代表合約已準確且準時完成審閱。

以準備預測審查的財務團隊為例。許多工作都發生在做出最終決策之前:找出最新預測、將資料移至 Excel 或 Sheets、識別變化、核對分頁、重建投影片,並檢查所有數字是否完全相符。

ChatGPT Work 可以承擔這個流程的大部分,讓團隊有更多時間專注於真正重要的問題:發生了什麼變化?為什麼?接下來該怎麼做?

這就是每美元有用智慧的實際運作。更多工作能以更快速度完成,而人們能把更多時間用於判斷、創意和專業能力。

2. 一項成功任務的實際成本是多少?

下一個問題是,要把這項工作做好需要多少成本。

AI 任務差異很大。快速回答可能只需要少量運算。編碼、研究或財務工作流程,可能涉及更深入的推理、工具使用和許多動作。這些更複雜的任務可能需要更多運算,但也能創造更大價值。

在模型層級,每項成功任務的成本取決於價格、使用的運算量,以及達成正確結果的可能性。對企業而言,總成本也包括員工投入的時間、人工審查、重試與重做。

計算方式很直接:

  • 加總完成工作的完整成本。
  • 計算達到所需品質門檻的任務數。
  • 用完整成本除以成功任務數。

這就是為什麼最低的每 Token 價格,未必總能帶來最低的每成果成本。即使是例行請求,前沿模型若能一次產出正確答案,減少重試、延遲、審查和總運算量,也可能提供最佳價值。

分層的模型系列,讓客戶有更多方式最佳化這個方程式。我們上週發布的 GPT‑5.6 有三個層級:Sol 是我們的旗艦;Terra 在效能與成本之間取得平衡;Luna 則是我們最快、最實惠的模型。

這些層級提供了有用的起點。最終應由完整任務的經濟效益來決定合適的模型。客戶可能會將 Luna 用於快速且大量的工作流程,將 Terra 用於需要更深度的工作,或在更強推理能以更少嘗試帶來最佳結果時使用 Sol。

我們訓練 GPT‑5.6,讓每個 Token 都能產生更多有用工作。在 Artificial Analysis Coding Agent Index 上,GPT‑5.6 Sol 在最高推理設定下創下新的最佳水準,同時輸出 Token 比另一個領先模型少 54%。下方圖表說明了這項比較。

DeepSWE v1.1:長時程工程任務。GPT‑5.6 Sol 以 72.7% 創下新高,高於 Claude Fable 5 的 69.9%,預估 API 成本則低 36.2%。

在 GPT‑5.6 系列中,目標相同:每一美元完成更多成功工作。效率越高,既有任務越負擔得起。能力越強,越能實現全新的工作類型。

每一代新模型都應改善這個方程式的兩端。客戶應該能完成更有價值的工作,同時讓完成每項任務的成本持續下降。

3. AI 多常把工作做對?

第三項衡量標準是可靠性。

AI 採用通常會分階段深化。一開始,AI 協助起草。接著,它找出脈絡,並跨工具與資料進行推理。隨著時間推移,它開始採取行動、處理例外狀況並完成工作流程,而人在需要時提供判斷與控制。

每一步都創造更多價值,也對系統提出更高要求。

可靠性具有直接的經濟價值。當結果準確、來源充分、一致,且能適當升級處理時,人們就能少花時間審查、修正和重做。成功任務的成本會降低,組織也更有信心在更重要的工作流程中使用 AI。

團隊可以追蹤三項成果,讓這件事具體化:

  • 可直接使用:交付的結果已達品質門檻。
  • 需要修正:結果需要再次嘗試或人工編輯。
  • 需要升級處理:需要有人介入並完成工作。

這些衡量指標講述的故事,比單看模型準確率更完整。它們顯示 AI 是否真正減少了完成專案所需投入的工作。

可靠性也需要清楚的界線。在 AI 從起草轉向採取行動之前,組織應定義:

  • 系統可以存取哪些資料。
  • 它可以使用或變更哪些系統。
  • 何時應由人員審查或核准某項行動。

安全、資安、隱私和控制,構成更深入使用的基礎。人們需要了解系統如何運作、資料如何被處理,以及其行動如何受到治理。

ChatGPT Work 建立在 ChatGPT Enterprise 的安全性、隱私、合規和工作區管理基礎之上。這讓組織能在維持適當監督的同時,給予 AI 更多脈絡,並讓它存取更有價值的工作流程。

強大的能力讓人願意開始使用,可靠性則讓 AI 融入日常工作。

4. 隨著使用量成長,每一美元 AI 支出能買到更多工作嗎?

最後一個問題是,規模擴大時經濟效益是否改善。

公司可以透過長期追蹤同一個工作流程來衡量這一點。追蹤有多少任務達到品質門檻、完成這些任務的總成本,以及每項成功任務的成本。如果完成的工作成長速度快於總成本,而品質維持不變或有所提升,代表每一美元 AI 支出都在創造更多價值。

運算位於這個方程式的核心。

運算驅動研究,也支撐 AI 完成的每一項任務。它影響產品品質、速度、可靠性、可用性和成本。訓練運算打造未來能力。推論運算交付今天的有用工作。兩者都應轉化為客戶更好的成果。

更好的模型、更高效的推論、專用硬體、更高使用率、更聰明的路由,以及更強的產品設計,都會提升運算回報。每一代基礎設施都有助於訓練能力更強的模型。更好的演算法、硬體和軟體,接著有助於更有效率地執行這些模型。

客戶會以人的感受體驗這些改善:更好的答案、更快的結果、更少修正、更可靠的產品,以及更低的所需工作成本。

這些效益會複合成長。更好的基礎設施加速研究。研究產出能力更強、效率更高的模型。更好的模型改善產品。更好的產品推動採用、學習和營收。這樣的成長支持對下一代研究、運算、部署和安全的持續投資。

OpenAI 透過單一共用智慧平台整合這些要素。使用者可透過 ChatGPT 和 ChatGPT Work 使用平台,開發者可透過 Codex 和 API 進行開發,企業則可將平台部署至實際執行工作的系統中。

當其中一層有所改善,每項產品和每位客戶都能受益。

AI 時代的評分表

綜合來看,這四項衡量標準能告訴我們,每美元有用智慧是否正在提升。

有用工作告訴我們 AI 產出了什麼。每項成功任務的成本告訴我們,要達成成果需要付出什麼。可靠性告訴我們,人們能放心使用多少工作成果。規模化價值告訴我們,隨著時間推移,每一美元和每一單位運算是否能完成更多事。

目標是讓 AI 協助人們從事更有意義的工作、做出更好的決策,並把更多時間投入工作中需要獨特人類判斷與創意的部分。

我們的任務,是讓這個方程式隨每一代持續改善:能力更強的模型、更快且更可靠的結果,以及客戶所需工作更低的成本。

這就是 AI 如何隨時間對更多人和組織變得更有用。

作者

Sarah Friar