宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

智能體AI崛起,CPU成為新性能瓶頸

2026年08月17日 首頁 » 熱門科技

今年早些時候,亞馬遜雲服務(AWS)的高層向工程師下達了一項新指令:必須不惜一切代價節省CPU算力。據報道,隨著AI工作負載對AWS雲基礎設施造成壓力,CPU伺服器容量的等待時間出現了爆炸式增長。

這一問題似乎讓AWS措手不及,但背後有其原因。AI熱潮帶動了GPU需求的急劇攀升,隨後又波及內存領域,而CPU在很大程度上被排除在外。由於CPU在並行計算能力上相對不足,它並不適合承擔AI模型推理任務,也就是向用戶運行和提供大語言模型服務的過程。

然而,允許AI模型自主運行並調用子智能體的智能體AI智能體AI崛起CPU成為新性能瓶頸系統的興起,正在改變這一敘事。

摩爾洞察與戰略公司副總裁兼首席數據中心分析師麥特·金博爾表示,2026年CPU需求出現了大幅增長,其中很大一部分源於智能體AI。"假設一個智能體工作負載可以生成100個智能體,當我將其部署到企業級規模時,這100個就會變成數萬、數十萬乃至數百萬個智能體,"金博爾說,"智能體不斷派生出子智能體,發起API調用,通過Anthropic的模型上下文協議與更多智能體交互。"

金博爾的話部分指向了"工具調用智能體AI崛起CPU成為新性能瓶頸"這一概念,它是大語言模型訪問網際網路、打開桌面文件以及調用各類軟體來完成任務的能力的簡稱。

經過工具調用訓練的大語言模型學會了如何調用其他軟體。雖然大語言模型的推理過程仍主要在GPU或類似AI加速器上執行,但模型發起的工具調用通常會被推送到CPU上處理。

英特爾高級研究科學家蘇維克·昆杜解釋道:"智能體AI任務中有許多環節本質上是CPU的工作。CPU負責解析輸出、判斷調用哪個工具、發起API調用或運行代碼、收集結果並將其反饋回去。"AMD計算與企業AI副總裁馬杜·蘭加拉詹也有類似的說法:"在我們的測試中,真實智能體AI流水線的八個階段中,有七個完全運行在CPU上。"

以編寫軟體為例,被賦予編程任務的大語言模型很可能會調用工具,將代碼寫入文件、移動或替換文件、下載所需依賴包,並在認為任務完成後構建軟體。

昆杜與喬治亞理工學院的研究人員共同撰寫了一篇關於智能體AI優化的論文。他們發現,在GPU執行大語言模型推理時,CPU往往處於空閒狀態;反之,當CPU執行工具調用時,GPU也常常處於空閒狀態。為此,昆杜及其同事提出了調度優化方案,在持續負載下可將端到端延遲(智能體工作負載從開始到結束的時間)最多降低1.8倍。

這是一個好的開始,但優化的成果始終在追趕一個移動的靶子。智能體系統以機器速度生成任務,並在運行中不斷疊加。OpenAI模型曾無意間"入侵"Hugging Face,每小時觸發多達300個操作,而單個智能體還能派生出各自發起工具調用的子智能體。

隨著模型越來越複雜,還有一個重要因素可能進一步加重CPU的工作負擔:安全防護機制。

昆杜指出,對智能體行為的安全與策略檢查通常是檢查語法和日誌文件的具體規則,防護欄還可能使用參數量不足十億的小模型來分析任務複雜度或意圖。儘管這些工作可以在GPU上執行,但通常並不會這樣做,因為模型體量小且需要將延遲壓縮到最低,所以這些工作往往留在CPU上處理。

喬治亞理工學院的博士生鄭義俊(音譯)近期與他人共同發表了另一篇論文,其研究結論與昆杜的工作相互印證。鄭義俊和合著者發現,當伺服器CPU核心數量不足時,向GPU分發任務的速度就會跟不上,導致GPU因等待指令而陷入停滯。

此外,該論文還涉及大語言模型工作負載的另一個關鍵要素:Token化智能體AI崛起CPU成為新性能瓶頸

Token化是大語言模型推理的關鍵第一步,它將文本轉換為模型可處理的整數Token ID。與大語言模型推理中大量用到的矩陣運算不同,Token化是一種分支多、依賴數據的順序字符串操作。雖然可以通過分塊方式實現一定程度的並行化,但其並行程度遠不如大語言模型推理的主體部分。

對短提示詞的Token化而言,這是一項相對簡單的任務,即便是入門級CPU也能輕鬆應對。然而,進行工具調用的智能體模型必須對調用結果進行解析和Token化處理。

"如果當前序列有10萬個Token,而工具返回了1000個Token,Token化器就必須對整個序列重新進行Token化。而且每次智能體工具調用都要執行一次Token化,"鄭義俊說道。這既增加了Token化的頻率,也增加了涉及的Token數量。鄭義俊表示,未來的Token化器或許能找到緩解這一問題的方法,但對於當前的大語言模型推理而言,這依然是個棘手問題。

該論文發現,隨著序列長度的增加,首Token延遲(模型生成回復第一個詞所需的時間)可能急劇上升,而擁有更多核心的CPU可以改善這一問題。在較長序列長度的測試中,增加CPU核心數量可將首Token延遲降低約1.5倍至7倍。

由於測試硬體的限制,鄭義俊及其同事只能對阿里巴巴Qwen 3-30B和Meta的Llama 3.1-70B等較小的模型進行測試。他推測,更大的模型由於對GPU的整體需求更高,所受的瓶頸影響會相對較小,但他同樣預計智能體AI將把Token序列長度推向遠超當前測試範圍的水平。

"以Anthropic的Claude為例,Token數量輕鬆就能達到50萬甚至100萬,"鄭義俊說,"在智能體AI的世界裡,平均序列長度會不斷增長,我預計這個問題在未來的工作負載中將愈發突出。"

亞馬遜對CPU資源使用的收緊,是昆杜和鄭義俊所發現的這些問題具有現實意義的諸多佐證之一。

英特爾伺服器CPU的訂單已經排到至少今年年底。AMD將伺服器CPU的出貨預期上調了一倍。Arm和高通均已發布專為加速智能體AI而設計的新款CPU。就連英偉達智能體AI崛起CPU成為新性能瓶頸也將其基於Arm架構的智能體AI專用CPU——Vera列為優先項,該產品是英偉達Vera Rubin平台的重要組成部分。

金博爾表示,這些進展清楚表明,AI行業正在對CPU性能給予更多重視。他認為,這股需求浪潮是一個"絕對明確的信號",說明CPU已被視為智能體AI系統的核心組成部分。

然而遺憾的是,這可能意味著更大範圍的CPU短缺和價格上漲,正如此前在GPU和內存領域發生的情況一樣。

"某種程度上,CPU荒已經初現苗頭。市場上的供應緊張甚至開始蔓延到消費級市場,"金博爾說。他還補充道,英特爾已縮減消費級CPU的產能,轉而優先保障伺服器CPU的供應,儘管其全新的18A製程工藝已經帶動了客戶端業務的銷售增長。金博爾認為,這一跡象表明CPU廠商將跟隨資金流向作出決策。

Q&A

Q1:為什麼智能體AI會導致CPU需求激增?

A:智能體AI系統允許模型自主運行並調用子智能體。當一個智能體工作負載派生出大量子智能體時,每個智能體都需要進行API調用、解析輸出、調用工具等操作,這些任務都運行在CPU上,而非GPU。AMD的測試顯示,真實智能體AI流水線的八個階段中,有七個完全在CPU上運行,由此導致CPU需求大幅上升。

Q2:Token化為什麼會成為大語言模型推理中的CPU瓶頸?

A:Token化是大語言模型推理的第一步,負責將文本轉換為模型可處理的Token ID,這是一種分支多、依賴數據的順序字符串操作,並行化程度遠低於矩陣運算。在智能體AI場景下,每次工具調用都需要對整個上下文序列重新進行Token化,隨著序列長度不斷增長(如Claude可達100萬Token),CPU的處理壓力會顯著增加,直接拉長首Token延遲。

Q3:目前各大晶片廠商如何應對CPU需求暴增的問題?

A:英特爾伺服器CPU訂單已排至年底,同時縮減消費級CPU產能以優先供應伺服器市場;AMD將伺服器CPU出貨預期上調一倍;Arm和高通發布了針對智能體AI優化的新款CPU;英偉達也將基於Arm架構的智能體AI專用CPU——Vera列為優先研發方向,作為其Vera Rubin平台的重要組成部分。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新