M5 Ultra
是蘋果不久前推出的晶片,對於這款晶片,蘋果的官網給出一個相當醒目的數字:本地AI性能最高提升4.3倍。
這個數字到底能在真實使用里兌現多少?最近,Alex Ziskind
把M5 Ultra和M3 Ultra
兩台Mac Studio直接擺到了一張桌子上。
同樣版本的llama.cpp
,同樣的MLX
,同樣的模型文件。從編譯代碼、SSD讀寫,到DeepSeek V4 Flash
、GPT-OSS 120B
、Qwen 3.8 27B
,他把兩代Ultra晶片從常規開發一路測到了本地大模型。尤其是在長上下文測試里,兩台機器逐漸拉開了一個相當誇張的差距。
先別急著跑大模型,硬碟已經快得有點離譜
測試先從開發場景開始。M5 Ultra擁有36核CPU,其中包括24個性能核心和12個Super Core。為了把這些核心全部壓起來,他跑了一次包含10萬個命名空間和類的大型.NET編譯。
M3 Ultra需要71.7秒,M5 Ultra縮短到52.4秒。接著換成Python執行Mandelbrot算法。M3 Ultra跑了10.25秒,M5 Ultra只用了5.8秒,接近兩倍的差距。更誇張的是SSD。M3 Ultra順序讀取大約6.5GB/s,寫入約2.7GB/s;M5 Ultra讀取直接跑到接近14.9GB/s,寫入接近20GB/s。

這個數字對於日常辦公可能有些性能過剩,一旦進入本地AI場景,意義馬上就不一樣了。一個100GB甚至140GB的大模型啟動時,需要先從SSD讀取大量權重。硬碟越快,模型進入記憶體的等待時間越短。對於經常切換模型、同時運行多個Agent的用戶,這部分時間會不斷累積。真正的重頭戲隨後才開始。
1.2TB/s頻寬,最終變成了多少Token?
測試本地大模型時,他重點盯住兩個數字。一個是Prompt Processing
,也就是模型讀取和處理輸入內容的速度;另一個是Token Generation,也就是模型生成答案的速度。前者更依賴GPU計算能力,後者則高度依賴記憶體頻寬。
M5 Ultra這一代的變化恰好同時落在這兩處。它的GPU核心中加入了Neural Accelerator,專門承擔矩陣計算。更關鍵的是,llama.cpp已經能夠識別這些硬體。
同一版本的llama.cpp運行在M3 Ultra上時,顯示has tensor = false;到了M5 Ultra上,則變成了has tensor = true。這意味著軟體已經能夠調用針對M5系列設計的AI計算路徑。
然後他開始測蘋果宣傳得很猛的1.2TB/s記憶體頻寬。CPU側的STREAM測試參考意義有限,於是他又專門跑了GPU記憶體頻寬測試。
結果,M3 Ultra測到724GB/s,M5 Ultra達到1039GB/s。也就是說,蘋果標稱1.2TB/s的M5 Ultra,實際GPU側可以跑到1TB/s以上,相比M3 Ultra提升大約1.4倍。
接下來,大模型上場。284B參數的DeepSeek V4 Flash,在M3 Ultra上生成速度約37 token/s,到了M5 Ultra上升到53 token/s,基本正好對應1.4倍左右的記憶體頻寬提升。
GPT-OSS 120B也呈現了類似趨勢。M3 Ultra大約90 token/s,M5 Ultra達到130 token/s。換成Dense架構的Qwen 3.8 27B,結果仍然高度一致:37 token/s對54 token/s,提升約1.47倍。三種結構和規模不同的模型,最終都指向同一個數字:M5 Ultra在Token生成上的提升,大致就是1.5倍。
真正拉開差距的測試,還在後面。
14K代碼塞進去,33秒變8秒
DeepSeek V4 Flash的Prompt Processing,在M3 Ultra上是483 token/s。到了M5 Ultra,直接衝到了1485 token/s。接近3倍。GPT-OSS 120B同樣明顯,從約1300 token/s提高到3200 token/s。

為了看看這種提升到底是不是跑分特例,他又換成了Dense模型Qwen 3.8 27B。
這一次差距更大。M3 Ultra大約430 token/s,M5 Ultra達到1800 token/s,超過4倍。隨後他準備了一個大約14000 Token的Prompt,可以理解成一次性給AI塞進去數個源代碼文件。M3 Ultra處理這些內容需要33秒。
M5 Ultra只用了8秒,實測提升4.2倍。不過,「4倍」這個數字也有明顯的使用條件。Prompt越短,差距越小。大約350 Token的短Prompt,M5 Ultra只有約1.6倍提升;到了1700 Token左右,差距擴大到3.4倍;大約4500 Token以後,才逐漸進入4倍這個區間。
如果只是打開本地模型聊幾句話,這台機器很難持續跑出宣傳數字對應的體驗。但如果使用Coding Agent,讓AI一次讀取幾十個文件、幾萬Token代碼,再持續調用工具、修改項目,Prompt Processing就會反覆發生。8秒和33秒的差距,也會一次次被放大。而且並發還有進一步提升。影片最後,他簡單預覽了8路請求同時運行的表現:M3 Ultra總吞吐約75 token/s,M5 Ultra達到134 token/s。
至於代價,模型生成階段,M5 Ultra晶片功耗約45W,M3 Ultra約36W,單位功耗下的Token提升只有約12%。到了GPU重載狀態,M3 Ultra接近200W,M5 Ultra則超過400W,風扇開始明顯加速,溫度也明顯更高。這輪測試最後留下了一個很有意思的變化。
過去Mac Studio跑本地大模型時,最顯眼的優勢一直是統一記憶體容量和超高記憶體頻寬,它能把很多消費級顯示卡裝不下的大模型直接塞進記憶體里。M5 Ultra繼續把這部分能力往上推,又通過Neural Accelerator明顯加快了長Prompt和代碼上下文處理。
於是,一個新的使用場景開始變得更具體:256GB甚至未來512GB統一記憶體里,可以放下超大模型、代碼、文檔和長上下文,再讓多個Agent一起工作。這時候,衡量一台本地AI機器的體驗,一秒能吐出多少Token,已經只是其中一個數字。
END本文來自至頂AI實驗室,一個專注於對AI電腦、工作站及各類AI相關硬體設備,開展基於真實使用場景評測的研究機構。






