OpenAI 近日發表〈A scorecard for the AI age〉,為企業財務長與產品負責人提出一套衡量 AI 投資回報的框架。核心論點是:傳統軟體以「採用率」——例如購買席位、活躍用戶、授權續約——來衡量成功,但 AI 時代需要更精準的指標,即「完成的工作量」。以下整理四個關鍵衡量維度,並補充產品團隊可以如何落地。
這是 OpenAI 從供應商角度提出的管理框架,不是獨立的 ROI 標準。文中的模型效率和 Benchmark 數字仍應與團隊自己的任務、品質門檻和成本資料交叉驗證。
為什麼「每 token 成本」不夠用?
OpenAI 指出,許多企業仍以「每 token 成本」作為選模型的依據,但這可能誤導決策。一個較便宜的模型,token 單價雖低,卻可能需要更多次嘗試、更多時間或更多人工審查才能產出可接受的結果;反之,一個能力更強的模型 token 較貴,卻可能一次就完成任務。真正該計算的是「產出一個成功結果的總成本」,並與該結果創造的價值相比。
OpenAI 將這個終極衡量標準稱為「每美元有用智慧」(Useful Intelligence per Dollar),它回答四個問題:
- AI 是否完成了有意義的工作?
- 每個成功任務的成本是多少?
- 結果是否可靠?
- 隨著使用量成長,每一塊錢是否買到更多工作?
1. 衡量有用的工作產出
OpenAI 建議從一個具體的工作流程開始。先定義「完成」的標準,然後在該工作發生的系統中追蹤結果。例如:
- 客服團隊:「完成」可能代表一個客戶問題獲得解決。
- 工程團隊:「完成」可能代表一次通過測試的程式碼變更。
- 法務團隊:「完成」可能代表一份合約被準確且按時審閱完畢。
以財務團隊準備預測審查為例,大量工作發生在最終決策之前:尋找最新預測、將資料匯入試算表、識別變動、核對分頁、重建投影片、檢查數字是否吻合。OpenAI 的 ChatGPT Work 可以接手這類流程,讓團隊專注於「什麼變了?為什麼?接下來該怎麼做?」這類需要判斷力的問題。
2. 計算每個成功任務的真實成本
OpenAI 提出一個簡單的計算公式:
- 加總完成工作的全部成本(包括員工時間、人工審查、重試與返工)。
- 計算達到品質標準的任務數量。
- 將總成本除以成功任務數。
這就是為什麼最低的每 token 價格不一定帶來最低的每任務成本。一個前沿模型可能對例行請求也提供最佳價值,因為它一次就給出正確答案,減少了重試、延遲、審查與總計算量。
OpenAI 以自家剛發表的 GPT‑5.6 系列為例,說明分層模型如何幫助客戶優化這個等式。GPT‑5.6 有三個層級:Sol(旗艦)、Terra(平衡效能與成本)、Luna(最快、最實惠)。這些層級是起點,最終應根據任務的整體經濟效益來選擇模型。例如,Luna 適合高速、高吞吐量的工作;Terra 適合需要更深度的任務;Sol 則在需要更強推理能力、且能以更少嘗試次數達成最佳結果時勝出。
OpenAI 宣稱,在 Artificial Analysis Coding Agent Index 上,GPT‑5.6 Sol 以最大推理模式創下新紀錄,同時比另一領先模型減少 54% 的輸出 token。在 DeepSWE v1.1 長期工程任務基準中,Sol 達到 72.7% 的新高,高於 Claude Fable 5 的 69.9%,且估計 API 成本低 36.2%。
3. 評估可靠性與依賴度
OpenAI 觀察到,AI 採用通常會經歷幾個階段:先協助草稿,然後尋找脈絡並跨工具推理,最後開始採取行動、處理例外、完成工作流程,人類則在關鍵節點提供判斷與控制。每個階段創造更多價值,也對系統提出更高要求。
可靠性有直接的經濟價值。當結果準確、來源清楚、一致且能適當升級處理時,人們花在審查、修正與重做上的時間就會減少。成功任務的成本降低,組織也更有信心將 AI 用於更關鍵的工作流程。
OpenAI 建議團隊追蹤三種結果:
- 可直接使用:結果送達時即符合品質標準。
- 需要修正:結果需要另一次嘗試或人工編輯。
- 需要升級:必須由人介入並完成工作。
這些指標比單純的模型準確率更能反映 AI 是否真正減少了完成專案所需的工作量。
在 AI 從草稿階段進入行動階段之前,組織應明確定義:系統可以存取哪些資料、可以使用或修改哪些系統、以及何時需要人類審查或核准。安全、隱私、合規與控管是更深層使用的基礎。
4. 追蹤規模化後的經濟效益
最後一個問題是:隨著使用量成長,經濟效益是否改善?OpenAI 建議企業長期追蹤同一個工作流程,記錄:達到品質標準的任務數量、完成這些任務的總成本、以及每成功任務的成本。如果完成的工作成長速度快於總成本,且品質維持或提升,就代表每一塊錢正在產生更多價值。
運算資源(compute)是這個方程式的核心。訓練運算打造未來能力,推論運算交付當前的有用工作。更好的模型、更有效率的推論、專用硬體、更高的利用率、更聰明的路由、更強的產品設計,都能改善運算的回報。每一代基礎設施都有助於訓練更強大的模型,而更好的演算法、硬體與軟體則能更有效率地服務這些模型。
OpenAI 將這些環節整合在一個共享的智慧平台中:使用者透過 ChatGPT 與 ChatGPT Work 使用;開發者透過 Codex 與 API 建構;企業則部署到實際工作發生的系統中。當其中一層改善時,所有產品與客戶都能受益。
給產品建構者的實務建議
綜合 OpenAI 這套框架,產品團隊可以立即採取以下行動:
- 定義一個核心工作流程:選擇一個對業務有明確價值的重複性任務,例如客服回覆、程式碼審查或報告產出。
- 建立「成功」的定義:與利害關係人共同決定什麼樣的輸出才算「完成且可用」。
- 計算總成本:不僅包括 API 費用,還要納入員工操作時間、審查時間、重試次數與返工成本。
- 追蹤可靠性分佈:記錄「可直接使用」「需要修正」「需要升級」的比例,並設法降低後兩者。
- 定期檢視規模化趨勢:每月或每季比較同一流程的每成功任務成本,確認是否隨使用量增加而下降。
結論
OpenAI 提出的「每美元有用智慧」框架,將 AI 投資的衡量從模糊的採用率轉向具體的工作產出與成本效益。對於產品建構者而言,這不僅是一個評估工具,更是一個設計指南:當你選擇模型、設計流程、設定品質標準時,都應該以「能否以更低成本產出更多可靠工作」為核心。AI 的真正價值不在於它用了多少 token,而在於它幫人類完成了多少有意義的事。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
