每當談到AI基礎設施,話題幾乎總是落在GPU和TPU上。The New Stack近日與Arm公司的Bhumik Patel以及谷歌的Mo Farhat展開對話,聚焦那塊鮮少登上頭條的晶片——CPU,以及隨著AI從聊天機器人向智能體
演進,CPU為何正變得越來越重要。
Farhat在谷歌計算引擎負責Axion
和基於Arm的虛擬機產品管理,他告訴The New Stack:"CPU扮演的角色,或多或少就像一個空中交通管制員。"
在本期對話中,雙方探討了從對話式聊天機器人向自主智能體轉變的過程中,CPU如何悄然成為這場變革的核心敘事。
Farhat表示:"如今60億到80億參數的模型,表現比過去好得多。"他指出,對於部分專項工作負載,CPU可以達到約每秒25個Token的處理速度,這對於智能體工作負載而言已經足夠。
早期的聊天機器人只是返回一個回復,而智能體則能夠付諸行動——它們通過調用工具來執行任務,必要時還會創建環境來運行自己生成的代碼。
Farhat說:"智能體工作負載的編排框架本身,是一種始終在線的分支控制流邏輯,而這正是CPU所擅長的。"
他還指出,大語言模型通常運行在加速器上,但CPU同樣承擔著編排、數據預處理、語義搜索和向量資料庫等任務。
Patel在Arm主導雲與AI方向的軟體生態工作,他表示公司正專注於在規模化場景下運行這些工作負載所需的軟體與基礎設施層。他指出,不同類型的智能體在執行"不同類型的代碼執行、API調用以及典型CPU任務"。
當然,CPU也有直接運行模型的場景,但這裡指的是體量非常小的模型,包括摘要生成器、推薦器和評估器。
"如今60億到80億參數的模型表現比過去好得多,"Farhat說,"對於某些專項工作負載,CPU可以達到約每秒25個Token的速度,這對於智能體工作負載已經足夠。"
代碼執行環境的安全隔離
要讓智能體執行代碼,就必須提供一個安全隔離的環境,確保不會危及生產系統。
"智能體在執行代碼,你需要確保大語言模型生成的代碼是可信的,"Patel說,"如果不可信,就需要對運行環境進行沙箱隔離。"
谷歌為此推出的方案是gVisor
——一個開源項目,在應用程式與宿主作業系統之間充當隔離層。Farhat表示:"我們運行在零信任環境中,這正是智能體運行所需要的隔離技術存在的原因。"
谷歌還表示,GKE Agent Sandbox能夠支撐智能體時代所需的規模。"GKE Agent Sandbox將允許客戶以每秒每集群300個沙箱的速度啟動環境,"Farhat說。Patel則表示,該平台利用Pod快照和預熱的掛起環境池,幫助客戶快速擴展,而無需將所有環境始終保持完全就緒狀態。
Axion的性價比優勢
谷歌表示,Axion處理器在成本和能效方面均具備優勢。
"Axion目前可以為你提供與同類現行代際虛擬機相比高達兩倍的性價比,"Farhat說,"同時能效還能提升60%以上。"
谷歌提供兩種Axion機型:面向持續高性能需求的C4A
,以及在性能與成本之間尋求平衡的N4A
。對於計算密集、運行時間長且完成時間至關重要的工程任務,Farhat推薦C4A;而對於注重密度和成本的小型代碼執行任務,則推薦N4A。
"谷歌雲的好處在於,正如Mo之前提到的,你有C4A用於高性能工作負載,也有N4A,"Patel說,"當你需要擴展大量智能體,而不同類型的智能體在執行不同類型的代碼執行、API調用和典型CPU工作時,N4A非常契合。"
Farhat還從更宏觀的視角指出,隨著智能體規模持續擴大,CPU、GPU和TPU資源將繼續協同運作。
"我們處於一個流動計算的世界,"他說,"我們確實建議客戶綜合考量所有選項——基於CPU、TPU還是GPU——確保應用程式具備面向未來的擴展能力。"
Q&A
Q1:在智能體工作負載中,CPU具體承擔哪些任務?
A:在智能體場景中,CPU主要負責編排控制流邏輯、數據預處理、語義搜索和向量資料庫等任務。由於智能體需要持續運行、處理分支判斷和工具調用,這類控制流邏輯正是CPU的強項。此外,CPU還可以運行60億到80億參數的小型模型,如摘要生成器、推薦器和評估器,在某些專項工作負載下可達每秒約25個Token的處理速度,滿足智能體任務需求。
Q2:谷歌的GKE Agent Sandbox是什麼,有什麼作用?
A:GKE Agent Sandbox是谷歌提供的智能體代碼執行隔離環境,基於開源項目gVisor構建,在應用程式與宿主作業系統之間設置隔離層,確保大語言模型生成的代碼在零信任環境中安全運行,不會危及生產系統。它支持每秒每集群啟動300個沙箱,並通過Pod快照和預熱掛起環境池實現快速擴展,無需所有環境始終完全就緒。
Q3:谷歌Axion處理器的C4A和N4A機型有什麼區別?
A:C4A和N4A是谷歌基於Axion處理器推出的兩種虛擬機機型。C4A面向需要持續高性能的計算密集型任務,例如運行時間長且對完成速度要求高的工程作業;N4A則在性能與成本之間取得平衡,更適合需要大規模部署智能體、注重密度和成本效益的代碼執行任務。整體而言,Axion可提供同類現行代際虛擬機最高兩倍的性價比,並具備60%以上的能效提升。






