AI基礎設施領域的討論幾乎總是圍繞GPU和TPU展開。The New Stack近日與Arm公司的Bhumik Patel以及谷歌的Mo Farhat進行了深度交流,探討一個鮮少登上頭條的晶片——CPU,以及隨著AI從聊天機器人轉向智能體
,CPU的重要性為何正在不斷提升。
Farhat是谷歌計算引擎Axion
及基於Arm架構虛擬機的產品管理負責人,他告訴The New Stack:"CPU扮演的角色,大體上相當於一名空中交通管制員。"
本期內容聚焦於:從對話式聊天機器人到自主智能體的轉變,正在悄然演變為一個CPU的故事。
"當今六到八十億參數的模型表現比過去好得多,"Farhat說。他表示,在某些專項任務中,CPU每秒可處理約25個Token,這對於智能體工作負載而言已經足夠。
CPU的角色:從輔助到核心
早期的聊天機器人只是返回一個回答,而智能體則能夠基於回答採取行動——調用工具完成任務,必要時還能創建運行環境來執行自己生成的代碼。
"智能體工作負載的編排框架,本質上是一種始終在線的分支控制流邏輯,這正是CPU的強項,"Farhat說。
他指出,大語言模型通常在加速晶片上運行,但CPU同樣承擔著編排調度、數據預處理、語義檢索以及向量資料庫等工作。
Patel負責Arm在雲計算與AI領域的軟體生態建設,他表示公司正專注於大規模運行這些工作負載所需的軟體與基礎設施層。他指出,不同類型的智能體在執行"不同類型的代碼、API調用以及典型CPU任務"。
在實際模型運行方面,CPU也有用武之地,但規模較小,主要包括摘要生成、內容推薦和效果評估等模型。"今天的六到八十億參數模型表現比以往好得多,"Farhat說,"對於某些專項工作負載,CPU可以提供每秒約25個Token的處理速度,足以滿足智能體場景的需求。"
安全沙箱:讓智能體安全執行代碼
智能體要運行代碼,就需要一個既安全又不危及生產系統的執行環境。
"智能體在執行代碼,你需要確保大語言模型生成的代碼是可信的,"Patel說,"如果不可信,就需要對運行環境進行沙箱隔離。"
谷歌為此提供的方案是gVisor
——一個開源項目,充當應用程式與宿主作業系統之間的隔離層。Farhat表示:"我們在零信任環境中運行,這正是智能體所需要的隔離技術存在的原因。"
谷歌還表示,GKE Agent Sandbox同樣能夠應對智能體時代所需的規模化需求。"GKE Agent Sandbox可以支持客戶每秒每集群啟動300個沙箱,"Farhat說。Patel表示,該平台通過Pod快照和預熱的掛起環境池,幫助客戶更快地完成擴展,而無需始終保持所有環境完全就緒。
Axion的效能優勢:性能與能效兼顧
谷歌表示,Axion處理器在成本和能效方面均具備優勢。
"Axion目前相比同代可比虛擬機,可提供高達2倍的性價比,"Farhat說,"同時還能實現超過60%的能效提升。"
谷歌為不同場景提供了差異化的Axion機型:C4A機型面向持續高性能需求,N4A機型則在性能與成本之間取得平衡。對於計算密集型、完成時間至關重要的長時間工程任務,Farhat推薦選用C4A;對於密度和成本更為關鍵的小型代碼執行任務,則推薦N4A。
"N4A非常適合大規模部署大量智能體的場景,不同類型的智能體執行著不同類型的代碼、API調用和常規CPU任務,"Patel說。
Farhat還強調,隨著智能體規模的擴大,CPU、GPU與TPU資源將持續協同運作。"我們處於一個計算資源靈活調配的時代,"他說,"我們建議客戶綜合考量CPU、TPU和GPU各類方案,確保應用具備面向未來的擴展能力。"
Q&A
Q1:CPU在智能體工作負載中具體承擔哪些任務?
A:在智能體場景中,CPU主要負責編排調度、數據預處理、語義檢索和向量資料庫等工作,同時承擔分支控制流邏輯,相當於整個系統的"空中交通管制員"。此外,對於六到八十億參數的小型模型(如摘要、推薦、評估類模型),CPU也可直接運行推理,提供約每秒25個Token的處理速度,滿足部分智能體任務需求。
Q2:谷歌GKE Agent Sandbox是怎麼保障代碼執行安全的?
A:GKE Agent Sandbox基於gVisor開源項目,在應用程式與宿主作業系統之間建立隔離層,實現零信任環境下的沙箱隔離。它支持每秒每集群啟動300個沙箱,並通過Pod快照和預熱的掛起環境池實現快速擴展,確保大語言模型生成的代碼在受控環境中安全運行,不影響生產系統。
Q3:谷歌Axion處理器C4A和N4A機型有什麼區別?該如何選擇?
A:C4A機型面向持續高性能需求,適合計算密集型、完成時間要求嚴格的長時間工程任務;N4A機型則在性能與成本之間取得平衡,更適合需要大規模部署智能體、對密度和成本敏感的場景。總體上,Axion相比同代可比虛擬機可提供高達2倍的性價比,並實現超過60%的能效提升。






