宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

桌面電腦拉起128個AI智能體!他把「數據中心」搬到了桌上

2026年08月04日 首頁 » 熱門科技

一年前還要塞進數據中心的大模型,現在被搬到了辦公桌上。

沒有雲端API,沒有外部計算集群,也沒有幾十台伺服器協同工作。Alex Ziskind只用一台華碩ExpertCenter Pro ET900N G3,希望能同時啟動128個本地AI智能體。

桌面電腦拉起128個AI智能體他把數據中心搬到了桌上

編程、研究、分析、寫作、測試、規劃……不同智能體在同一時間持續讀取資料、調用模型並生成內容。

當AI應用逐漸由單輪對話進入多智能體協作,一台放在辦公室里的本地設備,究竟能不能承擔過去只有數據中心才能完成的推理任務?

先把465GB大模型塞進桌面主機

這台搭載NVIDIA GB300超級晶片的華碩ExpertCenter Pro ET900N G3,擁有約748GB一致性內存,其中包括256GB HBM高頻寬顯存,以及500GB以上的Grace系統內存。前者頻寬達到每秒7至8TB,負責模型推理中最密集的計算;後者頻寬約為每秒500GB,用於容納超出HBM容量的模型權重。

Alex首先測試了Nemotron、Qwen 3 235B、DeepSeek桌面電腦拉起128個AI智能體他把數據中心搬到了桌上以及GLM等大模型。為了讓這些數百億、數千億參數模型能夠放進單機內存,他採用了Blackwell架構桌面電腦拉起128個AI智能體他把數據中心搬到了桌上原生支持的NVFP4四位量化格式。

桌面電腦拉起128個AI智能體他把數據中心搬到了桌上

以GLM模型為例,NVFP4版本在磁盤中仍然達到465GB。按照16位精度計算,這類模型原始體積可能接近2TB,經過四位量化後,體積能夠縮小至原來的四分之一左右,同時獲得更高的推理速度。

465GB依然遠遠超過256GB HBM的容量。運行時,一部分模型權重會被放在高速HBM中,剩餘部分進入Grace系統內存。兩塊內存可以統一尋址,模型無需被拆分到多台設備上,但讀取系統內存中的數據時,速度會明顯下降。

測試結果也驗證了這一點。能夠完整放入HBM的Nemotron,單路生成速度達到每秒約184個Token;GLM由於大量權重溢出到系統內存,單路速度下降至每秒約24個Token。

模型可以運行,只是模型放在哪裡,直接決定了它跑得有多快。

從一個人聊天,到128個請求同時湧入

完成單模型測試後,Alex沒有繼續追逐單路生成速度,而是逐步增加並發請求。

單個用戶使用模型時,Nemotron每秒可以生成約180個Token。並發增加到2路、4路、8路和16路後,單個請求的等待時間有所增加,整台機器的總吞吐量卻持續上升。

32路並發時,總生成速度突破每秒1000個Token;64路並發時,上升至每秒1500至1800個Token;並發達到128路後,部分模型的總吞吐量接近約每秒2700個Token。

桌面電腦拉起128個AI智能體他把數據中心搬到了桌上

背後的關鍵機制是連續批處理。

GPU會把多個用戶在相近時間發出的請求組合起來,一次性送入模型計算。請求數量增加後,GPU可以保持更高利用率,同一輪計算也能服務更多任務。

Alex還專門測試了Prefill,也就是模型讀取提示詞和上下文的速度。對於普通聊天,用戶輸入可能只有幾十個字;對於代碼智能體,一次請求中往往包含項目文件、歷史對話、工具說明和代碼上下文,輸入長度可能達到數萬甚至數十萬個Token。

在單路測試中,Nemotron的Prefill速度約為每秒2200個Token,Qwen約為2500個Token,DeepSeek約為1800個Token。並發增加後,Qwen的總提示詞處理速度最高達到每秒約4.1萬個Token。

這些數字意味著,大模型讀取一個代碼倉庫、理解多個文件並準備調用工具的時間,已經可以被壓縮到幾秒之內。

128個智能體一起工作,功耗衝到1000W

模型吞吐量只是基礎測試,Alex隨後把本地模型接入Visual Studio Code和OpenAI Codex CLI。

他先啟動一個代碼智能體,讓模型讀取整個項目,判斷代碼用途,並調用工具分析文件。單個智能體運行十分順暢,但這種任務對普通筆記本和Mac mini也不算困難。

接下來,他設計了一套智能體並發界面,將編程、研究、分析、寫作、規劃、測試和架構等不同角色同時啟動。16個智能體運行時,整機GPU利用率達到100%,總輸出速度約為每秒1400個Token,功耗升至750W左右。

桌面電腦拉起128個AI智能體他把數據中心搬到了桌上

智能體數量增加到64個後,輸出速度提升至每秒約3500個Token,整機功耗接近900W。最終,Alex啟動了128個智能體,所有智能體都在本地調用同一個大模型,同時生成各自的任務結果。

測試過程中,整機功耗一度接近1000W,溫度維持在55攝氏度左右,短時間內生成了接近15萬個Token。

根據他的測試,32至64路並發是這款模型較為理想的工作區間。此時GPU能夠保持接近滿載,每個智能體仍能獲得相對穩定的響應速度。繼續增加並發,可以獲得更高的總吞吐量,但單個任務的完成時間也會變長。

至頂AI實驗室洞見

在最後,Alex給出了明確判斷:普通電腦同樣可以運行本地模型,也可以搭建AI智能體。

的確,Mac mini、筆記本電腦或者普通工作站,都能夠承擔單個代碼助手、寫作工具和個人知識庫等任務。它們的限制主要出現在模型體積、上下文長度和並發數量上。

但是GB300桌面設備提供的,是更大的模型容量和更高的並發上限。

它可以把數百GB模型完整留在本地,讓幾十名員工共享同一套模型服務,也可以同時運行數十個甚至上百個智能體。代碼、文件和業務數據無需發送到外部API,運行過程中也不會產生按Token計費的調用成本。

代價同樣明顯。機器本身價格高昂,對供電和散熱都有更高要求,滿載功耗可以接近甚至超過一台大功率家電。只有當企業長期運行大型模型、擁有大量並發任務,或者每月API費用已經達到數千美元時,本地部署的經濟價值才會逐漸顯現。

桌面AI計算的衡量標準,已經不再局限於「一秒能生成多少字」。當一台設備能夠同時承載代碼、研究、測試和分析任務時,它更接近一套可以放在辦公室里的私有AI基礎設施。

過去,用戶購買一台電腦,是為了讓一個人完成更多工作。

現在,一台電腦里,可能同時坐著128個「人」。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新