兩台巴掌大小的AMD主機,接上一台10GbE交換機,能不能跑起接近4000億參數的大模型?
YouTuber Alex Ziskind真動手試了。他拿出兩台AMD Ryzen AI Halo小主機,每台配備128GB統一內存,按照AMD官方Playbook搭建雙機集群,先後運行GLM-4.7 358B和Qwen 3.5 397B。

整個過程沒有昂貴的InfiniBand,也沒有伺服器機櫃。兩台小盒子、一台交換機和幾根網線,就在桌面上拼出了一套迷你分布式推理系統。
兩塊128GB內存,不能直接相加
Ryzen AI Halo搭載AMD Strix Halo晶片,CPU和GPU可以共享128GB內存。按照AMD的說法,單台設備有機會運行約2000億參數的量化模型,兩台機器組成集群後,理論上可以把模型規模推到4000億參數左右。
問題在於,兩台電腦不會因為插上網線,就自動變成一台擁有256GB顯存的電腦。
模型需要被拆分到兩台機器上。生成每一個Token時,兩側GPU都要交換中間結果,網路延遲和頻寬會直接影響推理速度。Ryzen AI Halo只有一個10GbE接口,這條萬兆鏈路也成了整個測試里最值得關注的變量。
Alex最初想直接用網線連接兩台主機,但AMD的兩套集群方案都要求使用10GbE交換機。最後,他選用了一台UniFi Flex XG。這台交換機擁有四個10GbE接口和一個千兆接口,最多可以連接四台計算節點,千兆口則用於接入日常管理網路。

通過iPerf3測試,兩台機器之間的實際頻寬達到9.41至9.44Gbps,基本跑滿萬兆網路。硬體鏈路準備完成後,真正麻煩的部分才剛剛開始。
為了多拿幾十GB內存,他重裝了兩台機器
AMD目前提供的初級和中級AI應用Playbook可以在Windows或Linux上運行,雙機集群Playbook只支持Linux。
Alex手裡的兩台機器系統並不一致,一台裝有Windows,另一台運行Linux。為了避免重複配置驅動、ROCm環境和各種依賴,他先在Linux機器上下載好模型,再把整塊系統盤克隆到另一台主機。

克隆系統也會複製主機身份,兩台機器接入同一個網路前,他又分別修改主機名,將它們設置為Halo 1和Halo 2。這樣一來,兩台設備擁有相同的軟體環境、驅動版本和模型文件,也減少了分布式部署中常見的版本衝突。
內存分配帶來了更隱蔽的麻煩。
雖然每台機器標稱128GB統一內存,作業系統會占用一部分容量。Linux環境下,AMD允許將GPU可用共享內存提高到120GB,兩台合計約240GB。Windows最多只能分配96GB,部分機器默認甚至只有64GB。
其中一台主機原本安裝Windows,後來換成Linux後,GPU內存仍然被鎖在64GB。BIOS里找不到相關設置,AMD提供的命令也沒有生效。Alex排查許久後發現,必須進入AMD Ryzen AI Developer Center,手動修改GPU內存分配。
經過這一步,兩台設備才真正獲得每台約120GB的模型裝載空間。
RPC跑358B,搭建簡單但並發有限
AMD給出的第一種方案,是使用llama.cpp的RPC功能。
在這套架構里,Halo 1作為主節點,負責啟動模型服務;Halo 2將GPU和內存暴露為遠程RPC工作節點。主節點可以借用第二台機器的內存,把單機裝不下的模型分散到兩台設備上。

Alex選擇了GLM-4.7 358B,並使用Unsloth提供的UD-Q4_K_XL量化版本。這個模型僅靠一台128GB主機無法完整裝入,雙機集群讓他有機會保留質量更高的4bit量化,避免使用壓縮程度更高的IQ2或IQ1版本。
模型成功啟動後,單並發對話速度大約為每秒7.6至8.2個Token。對於一個3580億參數的模型,這個速度已經能夠支撐正常聊天。

當並發提高到4時,短輸入場景下的總吞吐達到每秒13至13.5個Token。不過,當提示詞長度增加到2048 Token,吞吐會下降到約每秒5.5個Token。

由此可以看出,llama.cpp RPC更適合個人使用、單輪聊天和低並發任務。它的配置過程相對直接,第二台機器更像主節點的遠程顯存擴展。輸入變長、請求數量增加後,通信和調度開銷會迅速暴露出來。
397B跑到18 Token,桌面上搭出迷你數據中心
為了測試更複雜的分布式推理,Alex 又嘗試了AMD的第二套方案:RCCL、vLLM和Ray。
這套方案使用張量並行,將同一層模型計算拆到兩塊GPU上。Ray負責兩台節點之間的任務組織,RCCL承擔GPU通信,vLLM負責模型服務和並發調度。整體技術棧已經接近數據中心常見的多節點推理架構。
代價也很明顯。整個環境通過Podman容器運行,大模型啟動一次大約需要15分鐘。任何啟動參數寫錯,都可能意味著重新執行整套加載流程。Alex因此建議先用架構相同的小模型驗證環境,再加載數百GB的大模型。
正式測試中,他運行了Qwen 3.5 397B。模型在兩台機器上各占用約110GB,總占用約220GB,張量並行度設置為2。

運行期間,兩側GPU利用率達到100%,單機功耗約60W,溫度約52℃。通過10GbE傳輸數據時,單並發生成速度約為每秒7.81個Token,四並發總吞吐接近每秒18個Token。
至頂AI實驗室洞見
10GbE雖然談不上理想的高速互聯,但依然能夠支撐兩台Ryzen AI Halo協同運行近4000億參數的量化模型。RPC方案容易搭建,適合少量交互;RCCL配合vLLM的部署門檻更高,在多用戶、智能體和並發API場景中更有優勢。
兩台小主機沒有獲得一塊真正統一的256GB顯存,網路通信也會留下性能損耗。它們卻把原本屬於伺服器集群的模型拆分、張量並行和多節點調度帶到了桌面上。
對需要本地運行超大模型的人來說,這次測試真正展示的價值,或許不只是「能不能裝下3970億參數」,還包括一條更加現實的路徑:用多台統一內存主機逐步擴展容量,在辦公室里搭出一座低功耗的小型AI集群。






