宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

蘋果的M5 Ultra本地AI真能跑出「4倍提升」?

2026年10月08日 首頁 » 熱門科技

M5 Ultra蘋果的M5Ultra本地AI真能跑出4倍提升是蘋果不久前推出的晶片,對於這款晶片,蘋果的官網給出一個相當醒目的數字:本地AI性能最高提升4.3倍。

這個數字到底能在真實使用里兌現多少?最近,Alex Ziskind蘋果的M5Ultra本地AI真能跑出4倍提升把M5 Ultra和M3 Ultra蘋果的M5Ultra本地AI真能跑出4倍提升兩台Mac Studio直接擺到了一張桌子上。

同樣版本的llama.cpp蘋果的M5Ultra本地AI真能跑出4倍提升,同樣的MLX蘋果的M5Ultra本地AI真能跑出4倍提升,同樣的模型文件。從編譯代碼、SSD讀寫,到DeepSeek V4 Flash蘋果的M5Ultra本地AI真能跑出4倍提升、GPT-OSS 120B蘋果的M5Ultra本地AI真能跑出4倍提升、Qwen 3.8 27B蘋果的M5Ultra本地AI真能跑出4倍提升,他把兩代Ultra晶片從常規開發一路測到了本地大模型。尤其是在長上下文測試里,兩台機器逐漸拉開了一個相當誇張的差距。

先別急著跑大模型,硬碟已經快得有點離譜

測試先從開發場景開始。M5 Ultra擁有36核CPU,其中包括24個性能核心和12個Super Core。為了把這些核心全部壓起來,他跑了一次包含10萬個命名空間和類的大型.NET編譯。

M3 Ultra需要71.7秒,M5 Ultra縮短到52.4秒。接著換成Python執行Mandelbrot算法。M3 Ultra跑了10.25秒,M5 Ultra只用了5.8秒,接近兩倍的差距。更誇張的是SSD。M3 Ultra順序讀取大約6.5GB/s,寫入約2.7GB/s;M5 Ultra讀取直接跑到接近14.9GB/s,寫入接近20GB/s。

蘋果的M5Ultra本地AI真能跑出4倍提升

這個數字對於日常辦公可能有些性能過剩,一旦進入本地AI場景,意義馬上就不一樣了。一個100GB甚至140GB的大模型啟動時,需要先從SSD讀取大量權重。硬碟越快,模型進入記憶體的等待時間越短。對於經常切換模型、同時運行多個Agent的用戶,這部分時間會不斷累積。真正的重頭戲隨後才開始。

1.2TB/s頻寬,最終變成了多少Token?

測試本地大模型時,他重點盯住兩個數字。一個是Prompt Processing蘋果的M5Ultra本地AI真能跑出4倍提升,也就是模型讀取和處理輸入內容的速度;另一個是Token Generation,也就是模型生成答案的速度。前者更依賴GPU計算能力,後者則高度依賴記憶體頻寬。

M5 Ultra這一代的變化恰好同時落在這兩處。它的GPU核心中加入了Neural Accelerator,專門承擔矩陣計算。更關鍵的是,llama.cpp已經能夠識別這些硬體。

同一版本的llama.cpp運行在M3 Ultra上時,顯示has tensor = false;到了M5 Ultra上,則變成了has tensor = true。這意味著軟體已經能夠調用針對M5系列設計的AI計算路徑。

然後他開始測蘋果宣傳得很猛的1.2TB/s記憶體頻寬。CPU側的STREAM測試參考意義有限,於是他又專門跑了GPU記憶體頻寬測試。

結果,M3 Ultra測到724GB/s,M5 Ultra達到1039GB/s。也就是說,蘋果標稱1.2TB/s的M5 Ultra,實際GPU側可以跑到1TB/s以上,相比M3 Ultra提升大約1.4倍。

接下來,大模型上場。284B參數的DeepSeek V4 Flash,在M3 Ultra上生成速度約37 token/s,到了M5 Ultra上升到53 token/s,基本正好對應1.4倍左右的記憶體頻寬提升。

GPT-OSS 120B也呈現了類似趨勢。M3 Ultra大約90 token/s,M5 Ultra達到130 token/s。換成Dense架構的Qwen 3.8 27B,結果仍然高度一致:37 token/s對54 token/s,提升約1.47倍。三種結構和規模不同的模型,最終都指向同一個數字:M5 Ultra在Token生成上的提升,大致就是1.5倍。

真正拉開差距的測試,還在後面。

14K代碼塞進去,33秒變8秒

DeepSeek V4 Flash的Prompt Processing,在M3 Ultra上是483 token/s。到了M5 Ultra,直接衝到了1485 token/s。接近3倍。GPT-OSS 120B同樣明顯,從約1300 token/s提高到3200 token/s。

蘋果的M5Ultra本地AI真能跑出4倍提升

為了看看這種提升到底是不是跑分特例,他又換成了Dense模型Qwen 3.8 27B。

這一次差距更大。M3 Ultra大約430 token/s,M5 Ultra達到1800 token/s,超過4倍。隨後他準備了一個大約14000 Token的Prompt,可以理解成一次性給AI塞進去數個源代碼文件。M3 Ultra處理這些內容需要33秒。

M5 Ultra只用了8秒,實測提升4.2倍。不過,「4倍」這個數字也有明顯的使用條件。Prompt越短,差距越小。大約350 Token的短Prompt,M5 Ultra只有約1.6倍提升;到了1700 Token左右,差距擴大到3.4倍;大約4500 Token以後,才逐漸進入4倍這個區間。

如果只是打開本地模型聊幾句話,這台機器很難持續跑出宣傳數字對應的體驗。但如果使用Coding Agent,讓AI一次讀取幾十個文件、幾萬Token代碼,再持續調用工具、修改項目,Prompt Processing就會反覆發生。8秒和33秒的差距,也會一次次被放大。而且並發還有進一步提升。影片最後,他簡單預覽了8路請求同時運行的表現:M3 Ultra總吞吐約75 token/s,M5 Ultra達到134 token/s。

至於代價,模型生成階段,M5 Ultra晶片功耗約45W,M3 Ultra約36W,單位功耗下的Token提升只有約12%。到了GPU重載狀態,M3 Ultra接近200W,M5 Ultra則超過400W,風扇開始明顯加速,溫度也明顯更高。這輪測試最後留下了一個很有意思的變化。

過去Mac Studio跑本地大模型時,最顯眼的優勢一直是統一記憶體容量和超高記憶體頻寬,它能把很多消費級顯示卡裝不下的大模型直接塞進記憶體里。M5 Ultra繼續把這部分能力往上推,又通過Neural Accelerator明顯加快了長Prompt和代碼上下文處理。

於是,一個新的使用場景開始變得更具體:256GB甚至未來512GB統一記憶體里,可以放下超大模型、代碼、文檔和長上下文,再讓多個Agent一起工作。這時候,衡量一台本地AI機器的體驗,一秒能吐出多少Token,已經只是其中一個數字。

END本文來自至頂AI實驗室,一個專注於對AI電腦、工作站及各類AI相關硬體設備,開展基於真實使用場景評測的研究機構。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新