企業AI買家從未擁有過如此多能力強大的選擇。各大實驗室早期的前沿模型依然表現出色,成本卻僅為最初的零頭。此外還有可在自有環境中運行的開放權重模型
,以及針對特定任務微調、能超越通用工具表現的小型模型。
我的第一次生成式AI
部署是基於GPT-3
運行的。即便技術進步止步於此,大多數機構也還有數年有價值的工作可做。
人們的本能反應仍然是確保擁有"最好"的模型,將其部署在API網關之後,把它定為官方選項,然後告訴業務部門放手去做。這種做法直覺上很合理,畢竟沒有人會因為採購了最先進的技術而被追責。
在談到跨行業的企業AI戰略時,同樣的問題總會出現:我們應該選擇哪個模型?很多人可能會對答案感到失望。模型選擇確實會影響延遲、安全性、成本支出以及使用權限。
但模型選擇只是簡單的部分。真正的工作在於圍繞模型的一切,比如乾淨的數據、能發現故障的測試以及訓練有素的人員。選定一個模型,然後把精力放在真正重要的事情上。
大多數企業工作並不需要前沿模型
企業AI工作負載的分布並不均衡,大致可以按90-10來劃分。約90%的工作是有邊界、可重複的。比如客服助手根據政策庫回答問題,合同工具按照既定條款集檢查協議。這些工作量大,可接受答案的範圍較窄,也正是大多數公司真正想要解決的問題。
剩下的10%才是真正棘手的部分:需要對模糊輸入進行多步驟推理,一些細微的錯誤可能數月內都不被發現的分析工作,以及在沒有人工介入的情況下採取具有重大後果行動的智能體。正是這一部分工作,才配得上前沿模型的高昂價格。
常見的錯誤是不論什麼場景都動用前沿模型,僅僅因為它是公司的標準配置,結果為那些根本不需要如此高規格的工作支付了溢價。在試點階段,你可能感覺不到這個問題——賬單金額不大,也沒人關注單位經濟效益。但隨著採用規模擴大,我已經看到一些公司的Token成本
壓力劇增,而這些公司去年還認為這筆支出微不足道。
基礎設施準備不足與規模化的謬誤
成本還只是較小的問題。更大的問題在於,幾乎沒有人真正建立起能讓任何模型在規模化場景下良好運行的體系,因此他們花錢購買的能力大部分處於閒置狀態,即便是在那關鍵的10%場景中也是如此。要從先進模型中獲得真正的價值,需要有明確流程和真實關鍵績效指標
、乾淨的數據、一套值得信賴的評估框架,以及懂得如何把輸出從平庸提升到精準的人才。大多數企業都不具備這些條件。
單一步驟可能有95%的概率正常運行。但如果把多個步驟串聯起來,出錯概率會迅速累積。五個步驟各有95%的成功率,整體端到端順利運行的概率也只有約75%,二十個步驟下來這個概率會降到36%。你可以通過重試機制、驗證環節和關鍵節點的人工核查來挽回這種可靠性,但每一項核查都需要你自己去搭建,沒有哪個更強的模型能免費附贈這些能力。
真正的制約因素在於架構
看看實際出問題的地方就知道了。客服助手自信滿滿地給出錯誤答案,是因為背後的政策文檔已經過時,而且沒人負責維護它。合同工具漏掉了關鍵條款,是因為檢索環節抓取到了錯誤的頁面。分類器的準確率卡在80%上不去,是因為從來沒人明確定義過什麼是正確的路由方式。這分別是所有權問題、檢索問題和定義問題。用購買更大模型的方式來解決數據問題,只不過是花大價錢依然沒解決數據問題罷了。
因此,要從看似枯燥、但有邊界、有用且可衡量的工作開始。搞清楚你手上有哪些數據,誰擁有這些數據,數據是否是最新的,以及數據可以流向何處。根據人們實際會提出的問題來構建測試,而不是那些只在演示中顯得亮眼的問題。把每一次修復都記錄下來,對照一個明確的"正確"標準。沒有這樣的標準,判斷結果是否足夠好就成了一場誰都贏不了的爭論。
架構與數據同樣重要。將你與文檔儲存系統、CRM系統
的連接,按照像模型上下文協議
這樣的開放標準來搭建,而不是綁定在單一供應商上。當更換成本很低時,模型選擇就不再是一個戰略性決策了。
投資員工能力與真正的戰略
最後,要為人才投入資金。幾乎所有這些工作都要經由員工完成——他們編寫提示詞、閱讀輸出結果,並判斷哪些答案需要進一步覆核。這種判斷力會在成千上萬次日常決策中不斷積累,而這是競爭對手無法直接買到的東西。他們可以簽下和你一樣的模型合同,但無法繞過底層的運營經驗積累過程。
模型會持續變得更便宜、更強大。但你的競爭對手也能享受到同樣的折扣,這對你而言並沒有帶來任何優勢。真正持久的競爭優勢,在於你所整理並能夠信賴的數據、你實際運行的測試,以及能夠識別出"看似自信、實則錯誤"答案的人才。
Q&A
Q1:企業選擇AI模型時最應該關注什麼?
A:模型選擇確實會影響延遲、安全性、成本和使用權限,但真正的重點在於模型之外的工作,比如乾淨的數據、有效的測試機制和訓練有素的人員,這些才是決定AI應用成敗的關鍵。
Q2:為什麼說大多數企業工作不需要前沿模型?
A:企業AI工作負載中約90%是有邊界、可重複的任務,比如客服問答或合同條款檢查,這類工作用普通模型就能勝任。只有約10%涉及複雜推理或高風險決策的場景才真正需要前沿模型的能力。
Q3:多步驟AI流程為什麼容易出問題?
A:因為錯誤概率會累積。假設單步成功率為95%,五個步驟串聯後端到端成功率約為75%,二十個步驟則降至36%。可以通過重試、驗證和人工核查來提升可靠性,但這些都需要額外搭建,不會隨更強模型自動獲得。






