在開發者與企業進行AI部署時,不難發現:算力早已不是唯一的瓶頸,內存容量與數據搬運開銷正在成為新的性能「枷鎖」。
在本地模型推理中,KV-Cache會隨上下文長度持續增長。上下文越長,占用內存越高,很容易觸發OOM內存溢出。在多模型並發運行時,內存壓力會進一步加劇,系統卡頓、首字延遲(TTFT)升高等問題會集中顯現。
這一痛點,倒逼本地AI硬體架構思路發生轉變。傳統方案把計算、模型數據分散在獨立儲存與異構計算單元里,CPU、GPU 之間需要反覆拷貝數據,帶來巨大延遲,甚至無法順利加載。
業界新的思路,是讓CPU、GPU等計算單元共享同一塊大容量內存:模型權重、KV 緩存儘可能常駐在這片統一內存中,減少跨單元的數據來回搬移。
這種統一內存架構帶來了兩點核心收益:
一方面,充足的共享內存空間,可承載長上下文推理、多智能體並發任務;
另一方面,可以消除大量的跨晶片數據拷貝,降低數據搬運帶來的性能損耗。
統一內存架構,可以有效解決本地AI部署的內存與數據搬運難題。
AMD的Halo系列正是這一思路下的代表性產品。
就在最近,AMD全新升級的銳龍AI Max PRO 400 系列處理器在中國首秀,並聯合眾多合作夥伴,帶來基於該系列旗艦型號銳龍 AI Max+ PRO 495(代號 Gorgon Halo)打造的多款本地AI主機方案。
01 從128GB到192GB ,撕裂統一內存「天花板」
AMD銳龍AI Max+ PRO 495延續了上代銳龍AI Max+ 395(Strix Halo)成熟的計算基座,依舊是「Zen 5 CPU + RDNA 3.5 GPU + XDNA 2 NPU」 這套黃金異構架構。
核心硬體依舊強悍。處理器是16核32 線程的Zen 5 架構CPU,搭配40 個計算單元的 Radeon 8065S iGPU ,頻率達到了 3.0 GHz,同時擁有最高55 TOPS算力的NPU 。默認熱設計功耗55W,並支持在 45–120W 區間內靈活調節。
除了計算核心本身,內存是這一代最大的變化。
AMD銳龍AI Max+ PRO 495平台的統一內存上限提升至192GB,相比上代銳龍AI Max+ 395增幅達50%,規格為LPDDR5X-8533。容量提升直接帶來了可用顯存的躍升,AMD銳龍AI Max+ PRO 495最高可劃撥160GB作為GPU顯存。與此同時,內存頻寬也小幅提升至約273 GB/s。兩者疊加,AMD銳龍AI Max+ PRO 495可本地運行的模型權重拓展到了300B級別。

從本次升級的思路其實不難發現,AMD銳龍AI Max+ PRO 495並沒有把重點放在堆算力、拼速度上,而是先解決大模型「是否能放下」的問題。
對本地AI部署來說,顯存容量往往是第一道門檻:模型裝不進去,算力再強也無從談起。160GB的可分配顯存,讓過去只能依託雲端集群部署的大模型,如今能裝進一台僅2L大小的迷你主機中。
02 海量KV-Cache駐留、多Agent並發、多線程狂飆,495展現超強「統治力」
AMD銳龍AI Max+ PRO 495的性能優勢要放在具體場景下才能體會到。
具體來說,其一是在長文檔處理場景下KV-Cache不會再撐爆顯存。
打個比方,讓大模型讀幾十頁的商業標書,或者分析龐大的代碼庫,是本地AI最常見的需求之一。文檔越長,模型要緩存的歷史上下文就越多,注意力鍵值緩存(KV-Cache)也會隨之呈指數級膨脹。
而採用常規的獨顯只有16GB 或 24GB 顯存,很快就會被占滿,這會導致,系統報錯OOM,任務直接中斷。但如果把數據卸載到慢速硬碟(比如HDD),任務雖能繼續,但AI生成速度卻會斷崖式下跌。
而AMD銳龍AI Max+ PRO 495憑藉最高160GB的可分配顯存,能夠將數百萬 Token 的 KV-Cache完整駐留在高頻寬內存中,數據無需再卸載到硬碟。無論是做長文本 RAG(檢索增強生成),還是做深度多輪對話,生成速度都能始終保持平穩。
其二是在多Agent協作場景中,可以讓模型常駐內存,無需切換等待。
以FlowyAIPC這類本地AI Agent 應用為例,跑一個任務通常需要多個智能體協同完成,比如負責拆解任務的規劃者、負責編寫代碼的代碼生成模型、負責執行操作的工具調用模型。
但如果顯存不夠,這些模型無法同時駐留本地,系統只能在調用時反覆加載、換出模型權重(Swapping)。每調用一個未駐留的模型,都要重新讀取並加載權重。這就導致,Agent之間交接越頻繁,累積的等待就越長。
而AMD 銳龍 AI Max+ PRO 495擁有192GB 統一內存,最高可劃撥160GB給 GPU,足以讓數十個小型模型同時常駐本地。調用哪個模型,直接在內存中啟用即可,無需重新加載權重,也省去了耗時的PCIe 數據搬運。效果上,TTFT(首字延遲)會明顯降低,Agent之間的數據交互也會更加順暢。
其三是多任務並行場景。在這一場景中,AMD 銳龍 AI Max+ PRO 495的CPU、GPU、NPU分工協作,多個應用同時運行也能保持流暢。
我們知道,本地 AI 應用的負載並不只有模型推理。預處理、資料庫檢索這類非張量計算同樣會大量消耗CPU資源,幾類任務疊在一起,最先受影響的往往是前台操作。
AMD 銳龍 AI Max+ PRO 495的做法是按任務類型分配硬體:NPU 以 55 TOPS 算力和極低功耗,負責常駐後台的助手。GPU承擔 FP16/INT8密集型大模型推理;Zen 5 CPU專注於高壓調度和非向量邏輯代碼。每類任務都在最合適的晶片上運行,即使本地PC滿載跑大模型,前台界面也不會卡頓。
03 Gorgon Halo與 RTX Spark 「殊途同歸」的架構邏輯
把模型全部留在本地,讓計算單元共享同一塊內存,這是當下 AI PC 的一個重要方向。這條路上,AMD 並不孤單。今年,NVIDIA公開的RTX Spark晶片平台,以及此前的DGX Spark晶片平台,瞄準的是同樣是統一內存的方向,但給出的卻是另一套答案。
兩者談不上誰優誰劣,但確實是兩種不同的架構邏輯。
分歧首先出現在計算單元的組織方式上。
RTX Spark 走的是CPU-GPU Superchip路線,以20核 Grace Arm CPU 搭配 Blackwell RTX GPU,通過NVLink-C2C 把兩者連成一體。沒有單獨設置 NPU,AI 任務主要依託Tensor 核心和CUDA 執行,重點發揮 FP4精度推理的能力。這種設計把AI算力集中在GPU上,路徑統一,調度也簡潔。
AMD銳龍AI Max+ PRO 495同樣把各個計算單元集成在一起、共享統一內存,但選擇了另一種分配方式:通用計算交給CPU,並行計算交給 GPU,低功耗AI加速交給 NPU,三類引擎按負載特性分工。這一設計,能讓不同類型的任務各自落在合適的硬體上。
簡單來說,一個以GPU為AI計算的核心,一個是「三芯分工「的思路。底層邏輯從一開始就不相同。
硬體上的差異,也會延伸到生態層面。RTX Spark 運行的是Arm版 Windows 11,AI側直接對接 CUDA 生態,AMD銳龍AI Max+ PRO 495是原生 x86 架構,兼容 Windows 11、RHEL、Ubuntu,AI側依託AMD ROCm、ONNX Runtime等開源軟體棧。
兩條路線,各有各的考量。
先說RTX Spark,CUDA 是當下AI開發中積累最深的軟體生態之一。對於工程體系早已建立在CUDA之上的團隊,選擇 Spark,現有的模型、工具鏈和開發經驗都能較為順暢地延續下來。與此同時,因為運行在Arm版Windows 上,部分x86 應用需要通過轉譯運行,驅動和專業軟體的適配目前也仍在推進之中。
Gorgon Halo的情況恰好相反。原生x86 架構讓企業現有的 ERP 系統、本地資料庫和各類專業軟體可以直接運行,適合需要讓傳統應用與Agent部署在同一台機器上的場景。而在AI側,ROCm 等開源軟體棧仍在持續推進。
半個月前,AMD也發布了ROCm 10,同時推出了ROCm.AI正式版,新增 Hyperloom、AMD Skills 和新的ROCm CLI。Windows 端也取消了單獨的HIP SDK,改用 ROCm Core SDK,與Linux 採用相同的SDK定義。
歸根結底,兩條路線並無高下之分。比起參數上的差異,企業現有的代碼和工具建立在哪套生態之上,往往才是真正左右選擇的因素。
04 擴展生態版圖: 9 款「王炸」AI主機亮相
架構與性能之外,技術能否走進場景,還要看硬體、軟體與行業應用能否環環相扣。
最近,AMD與多家合作夥伴集中展示了AMD銳龍AI Max+ PRO 495平台的商業落地進展。從整機形態、開發工具到行業方案,一條相對完整的生態鏈已初具雛形。
AI主機方面,聯想、超聚變、銘凡、極摩客、Emdoor、七彩虹、阿邁奇、六聯等合作夥伴,一次拿出9款基於銳龍AI Max+ PRO 495的首發新品,包括聯想 ThinkCentre X Ultra、超聚變 FusionXpark M 系列、銘凡 MS-S1 MAX-P495、極摩客 EVO X5 Pro、Emdoor AGH27、七彩虹靈創 Mini Pro、阿邁奇 F9A,以及六聯 AXB35-03-H13-YC 和 AXB88P-02-H07-SZ。
聯想ThinkCentre X Ultra
超聚變 FusionXpark M系列桌面AI超算
六聯智能 六聯AXB88P-02-H07-SZ
六聯智能 六聯 AXB35-03-H13-YC
阿邁奇 acemagic F9A
銘凡 MS-S1 MAX-P495
極摩客 EVO X5 Pro
七彩虹靈創 Mini Pro
億道 AS113-SM-ACH27
從現場陳列來看,這批產品清一色是迷你主機和小型工作站,沒有一台是傳統意義上的塔式機殼。
機器能做到這么小,前提之一是功耗彈性。銳龍AI Max+ PRO 495的可配置功耗(cTDP)覆蓋45至120 瓦,廠商如果想做極致緊湊的桌面盒子,可以把功耗壓在低位,換取更小的散熱模組。如果面向移動或桌面工作站,廠商則可以把功耗放開,換取更持久的滿載性能,同一顆晶片由此能落到體積差異很大的機器里。
對於企業IT部門而言,機器買回來之後還要管得住。銳龍AI Max+ PRO 495屬於PRO 系列,AMD PRO技術提供的企業級安全架構和可選管理功能,對應的是批量部署、設備管理和長期運維這些日常工作,這也是商用機型與消費級迷你主機不一樣的地方。
目前首次展示的9款AI主機,只是第一批。據介紹,近期預計還將有超過20 款基於銳龍 AI Max+ PRO 495的新品陸續上市。當可選機型從個位數增加到數十款,企業挑選時就有了更多餘地。
05 寫在最後
回頭看銳龍 AI Max+ PRO 495 這一代的升級,AMD 把主要精力放在了內存上。這個選擇背後,是端側 AI 競爭焦點的變化:模型能不能在本地跑起來、跑得穩,越來越多地取決於內存容量和數據通路,而不只是晶片本身的計算能力。
不過,硬體只是第一步。
端側 AI 最終能走多遠,還要看軟體棧是否成熟、整機是否豐富,以及行業應用能否真正落進業務流程。從這個角度看,AMD 銳龍 AI Max+ PRO 495 已經交出了一份硬核答卷。






