同樣準備八九千美元,一台M5 Max和兩台DGX Spark,該怎麼選?
按美國目前的零售價,一台16英寸M5 Max MacBook Pro,128GB內存、4TB硬碟,售價7999美元。DGX Spark單台4699美元,兩台合計9398美元。
兩套設備相差1399美元,已經進入同一個預算區間。
M5 Max是一台主力電腦,可以剪片、寫代碼,也能運行本地模型。兩台DGX Spark共有兩組128GB統一內存和8TB硬碟,通過高速網路連接,主要任務就是跑AI。
只看配置,雙Spark占了不少優勢:內存更多,支持CUDA,還能把模型拆到兩台機器上運行。但這些配置值不值錢,最後還得看Agent能不能把任務做完。
最近我在LocalLLaMA看到一組很有針對性的測試。用戶anvarazizov同時擁有一台128GB M5 Max和4台DGX Spark/GX10,他從中拿出兩台Spark,在兩邊運行DeepSeek-V4-Flash,再交給同一個Agent完成Terminal-Bench 2.1的89項終端任務。

M5 Max:47項,54%雙DGX Spark:45項,52.3%
這裡的「打成平手」只指任務完成率。生成速度、並發和上下文容量,雙Spark依然占優。
89項任務,Mac多做對了兩項
Terminal-Bench不會用選擇題考模型,而是直接給Agent一個Linux終端。
Agent需要自己讀文件、執行命令、修改代碼,最後由程序檢查任務有沒有完成。測試內容包括修復代碼倉庫、恢復資料庫、編譯擴展、處理數據、訓練小模型和破解哈希。
模型寫了多少分析不計分,程序修好、測試通過,才算完成。
受到運行錯誤影響,M5 Max有87項獲得有效成績,完成47項;雙Spark有86項獲得有效成績,完成45項。
在兩邊都得到結果的86項任務中,66項結果相同:36項兩邊都完成,30項兩邊都失敗。
另外20項出現分歧,M5 Max單獨完成11項,雙Spark單獨完成9項。兩項任務的差距不足以分出勝負,原帖作者給出的結論也是:這一輪沒有檢測到明顯的任務完成能力差異。
80.8GB版本為什麼沒有掉隊
兩邊運行的都是DeepSeek-V4-Flash,但模型文件和推理軟體並不相同。
DeepSeek-V4-Flash共有2840億參數,採用MoE架構。模型每次生成內容,只會調用其中約130億參數。M
ac上運行的是一份80.8GiB的GGUF量化版本,平均每個參數約2.45bit。體積最大的專家權重被大幅壓縮,注意力、路由和輸出層等容易影響結果的部分保留較高精度。
它沒有把所有部分壓到同一精度。占空間最多的專家權重負責減小體積,容易影響能力的關鍵部分則儘量保留。
負責運行模型的是DwarfStar 4,也就是ds4。這個項目由Redis創始人Salvatore Sanfilippo主導開發,專門優化DeepSeek-V4、GLM-5.2等少數大模型。
測試中的Mac還把部分KV緩存放到了SSD上。KV緩存相當於模型執行長任務時需要保存的臨時記憶,放到硬碟後,可以把更多內存留給模型權重。
依靠量化和磁盤緩存,這份80.8GiB的模型可以在128GB統一內存中運行,並向Agent提供100K上下文。這裡的100K代表模型一次可以保留的代碼和文檔量。
雙Spark的優勢沒有寫進得分里
雙DGX Spark運行的是約167GB的FP8和FP4混合精度權重,壓縮程度比Mac上的版本低得多。
每台DGX Spark配備128GB統一內存和4TB硬碟。兩台機器通過ConnectX-7的200Gbps鏈路連接,再用張量並行把模型分到兩個節點上運行。
兩組128GB內存不會自動變成一塊256GB內存,推理軟體需要負責拆分模型,並協調兩台機器共同計算。
雙Spark使用針對GB10修改過的vLLM,並啟用了DSpark推測解碼。原帖記錄的單路生成速度為54至58 token/s。token是模型生成內容時的計量單位,這裡可以直接看成輸出速度。
同時運行8路任務時,雙Spark的總生成速度達到253 token/s,平均每路約31.6 token/s。它還能提供262K服務端上下文,本次測試向Agent開放了200K,是Mac端的兩倍。
Terminal-Bench只檢查任務成功或者失敗,不會因為提前完成而多給分,多Agent並發也不會反映在最終成績中。
雙Spark的價值會在長任務和多人使用時體現出來。一個Agent運行和八個Agent同時運行,對個人用戶區別不大,對團隊卻是兩種體驗。
這筆錢怎麼花
只給一個人使用,我會買M5 Max。
獨立開發者、內容創作者和需要移動辦公的人,可以把它作為主力電腦。白天寫代碼、剪影片,空閒時運行本地模型。128GB+4TB版本還能比雙Spark節省1399美元,也不用維護兩台Linux主機。
它的限制也很明確:沒有完整的CUDA生態,多Agent並發和長上下文不如雙Spark。
機器固定放在辦公室,同時供多人調用,雙DGX Spark更合適。
兩台設備一共有256GB物理內存和8TB硬碟,支持CUDA、vLLM和200K上下文,可以同時運行多個Agent。像實驗室、小型開發團隊和本地AI伺服器,更容易用到這些能力。
只做本地聊天、文檔問答和普通編程,兩套都沒有必要買。
其實32GB到64GB內存配合更小的模型,已經能覆蓋大部分輕量需求。
80.8GiB的量化版本,在這輪測試中的任務完成率並沒有明顯落後於167GB版本。對個人用戶來說,量化方法和推理引擎可以彌補不少硬體差距;到了多人並發和長任務,雙Spark多出來的配置才會轉化成時間優勢。
M5 Max適合一個人的完整工作流,雙DGX Spark適合多個Agent持續運行。預算接近,用途完全不同。






