大語言模型的Token成本正在下降,但整體AI工作負載的費用卻在上漲。
Gartner研究預測,儘管Token成本到2030年將下降95%,但智能體工作流的推理成本在未來兩年內將增長逾五倍。原因在於,隨著大語言模型日趨複雜,AI應用開發者正在使用更多、且往往更昂貴的Token。Gartner將這一現象稱為"推理悖論
"。
Gartner分析師Will Sommer與Sabine Zimmerhansl在報告中指出,"創新速度正在超越成本下降曲線","市場正被Token價格下降的幻覺所迷惑"。買家危險地假設,隨著AI服務商改善Token經濟性,這些節省將體現在其產品路線圖中,但事實並非如此。
分析師指出,AI無疑能創造巨大價值,在許多常規任務上往往比人類更出色、更高效。智能體也能更快速地識別跨孤立系統的規律。例如,Gartner觀察到客戶成功智能體將響應時間縮短了99%。
然而,隨著AI的演進,Token用量不斷增加,且Token的價值並不固定。具備推理能力的高級AI智能體
,在單項任務上的成本已比基礎AI聊天機器人高出多達150倍。
簡單的聊天機器人只需讀取並理解請求,快速給出"概率上合理"的答案;而智能體隨著能力的提升,必須思考、質疑,並在出現問題時靈活應對,且越來越多地在後台持續、無感知地運行。
分析師寫道:"它們需要在沒有人工介入的情況下驗證結果的準確性,還需要與其他智能體進行通信。"
這一切都需要消耗更多資源。隨著日益自主的智能體"集群"相互觸發和調用,Token消耗量呈指數級增長。分析師指出,在用戶獲得最終結果之前,這已產生了"巨額推理稅
"。
報告顯示,訓練具備高級推理能力的中等規模智能體模型,其硬體成本是訓練同等規模簡單聊天機器人的2.5倍;智能體的推理成本是後者的5倍;處理同等任務時,智能體所需的Token量是聊天機器人的5至30倍。
分析師表示:"試想一下,當數百個智能體每小時各自執行數十乃至數百項任務時,成本將如何急劇膨脹。"隨著智能體將複雜問題拆解為多個子任務、調用高階模型並處理多模態數據,成本持續飆升。
分析師指出:"這些能力所需的計算量令人嘆為觀止。"
為分析智能體系統的影響,Gartner基於多種訓練與推理場景構建了一個Token經濟學模型,涵蓋不同架構設計(層數、大語言模型作為評判者或混合專家模式)、技術改進、硬體規格及數據、基礎設施、能源、人力等多項成本因素。
該機構對12種不同能力的AI模型進行了測算,發現基礎工作流的成本約為每推理Token 0.05美元;摘要與知識檢索約為0.10美元;較複雜的工作流約為0.30美元;規劃與學習約為0.40美元。這意味著,規劃與學習任務的服務商Token成本是基礎工作流的8至10倍。
Sommer與Zimmerhansl認為:"成本的上升不可避免,而隨著成本上升,價值能否同步增長並無保證。每一代新技術的投資回報率都將來之不易。"
Gartner建議,企業可以通過開發和維護複雜的多模態系統來嚴格管控Token成本,同時需要建立衡量已完成工作流的投資回報率與改進效果的方法。
編排能力將成為差異化競爭的關鍵,"推理分層
"將提升成本效益與性能。Gartner建議企業構建能將查詢路由至最具成本效益模型的系統,並默認阻止智能體在簡單任務中調用前沿模型。採用基於用量的定價模式也是重要一步,即從固定計算費用轉向按需擴展的分層計劃。
Sommer與Zimmerhansl補充道,企業可以考慮強制推行持續更新周期。他們建議"將每次模型發布視為一輛'新車',從第一天起就開始貶值",並內置數據微調與自學習反饋循環。
開發者還應為AI執行設定最低標準:預先定義成功閾值、風險緩解措施及合規開銷。分析師強調:"在針對Token價格波動和合規費用進行壓力測試之前,拒絕批准任何部署方案。"
此外,Gartner還建議將"每結果價值"嵌入產品規劃。這意味著要求每項AI功能都能預測並追蹤其支出與"明確結果指標"(如自動化任務數量或成功解決的案例數)的對應關係,從而識別需要改進或下線的低效工作流。
分析師指出,投資回報率"完全可以實現",但需要在複雜工作流中付出大量努力,企業不能簡單依賴傳統系統和工作流。他們強調:"默認使用通用自主智能將導致成本無限制地攀升,其量級遠超優化後的產品生態系統。"
Q&A
Q1:什麼是"推理悖論"?為什麼Token便宜了,AI成本反而更高?
A:Gartner提出的"推理悖論"是指:雖然單個Token的價格在持續下降,但由於AI智能體工作流需要消耗大量Token,整體推理成本反而大幅上升。智能體需要思考、驗證、與其他智能體通信,並處理多模態數據,這些操作都會消耗遠超普通聊天機器人的Token量,導致總成本不降反升。
Q2:AI智能體的成本比普通聊天機器人高多少?
A:差距相當顯著。具備推理能力的高級AI智能體,單項任務成本可比基礎聊天機器人高出多達150倍。在硬體訓練成本上,智能體模型是聊天機器人的2.5倍;推理成本是5倍;完成同等任務所需的Token量是聊天機器人的5至30倍。當數百個智能體同時運行時,成本將進一步呈指數級膨脹。
Q3:企業應該如何控制AI智能體帶來的高額成本?
A:Gartner給出了幾項建議:一是建立"推理分層"機制,將簡單任務路由至低成本模型,避免默認調用高端前沿模型;二是從固定計算費用轉向按用量計費的定價模式;三是為每項AI功能設定明確的結果指標,追蹤投資回報率;四是在部署前對Token價格波動和合規成本進行壓力測試;五是建立持續的模型更新與自學習反饋機制。






