從功能手機到智慧型手機,再到智能體手機,手機的角色一直在變。驍龍新一代旗艦移動平台正是為這個轉變而來,CPU、GPU、NPU三大模組協同發力,支撐起智能體AI的完整體驗。
相比CPU、GPU這兩個更基礎、更成熟的SoC組成單元,NPU的發展從源頭上就與AI強相關——Neural Processing Unit,神經網路處理單元。也正因如此,在智能體時代,NPU幾乎成為智能終端在算力層的「標配」。驍龍新一代旗艦平台搭載的全新Hexagon NPU,給出的答案可以簡單歸納成兩句話:算得更快,算得更多。

算得更快:讓智能體「想」得乾脆利落
智能體和傳統AI應用最大的區別,在於它不是「問一句答一句」,而是一連串任務的協同——理解意圖、拆解步驟、調用工具、跨應用操作。這套流程要跑得順暢,NPU必須同時做好兩件事:把大模型最核心的運算加速,把智能體的決策邏輯處理好。
高通在Hexagon NPU中引入了全新的Element Accelerator,專為生成式AI和智能體AI的Transformer工作負載打造。它結合了向量計算單元和標量計算單元——向量單元負責高吞吐量的AI數學運算,加速大模型推理中的關鍵計算;標量單元則處理智能體的決策邏輯、路由和編排。這套設計的含義是:NPU不僅能「算」,還能「想」。智能體在推理過程中需要選擇走哪條路、調用哪個工具、下一步做什麼,這些控制邏輯的複雜度遠超傳統AI任務,Element Accelerator讓NPU第一次同時具備了「重計算」和「輕調度」兩類能力。
快,是能感知到的。對於INT4精度的模型,預填充性能提升最高可達50%,40億參數模型首個詞元生成時間低於1.5秒——用戶與智能體對話時,幾乎感覺不到等待。

算得更多:讓大模型真正「住」進手機
端側大模型部署有一個容易被忽視的瓶頸:數據搬運比計算本身更耗資源。模型每生成一個詞元,都需要讀取用於保存對話上下文的KV緩存。如果NPU片上空間不足,這些數據就必須在NPU和設備主內存之間頻繁搬移,推高時延和功耗。用戶感受到的「智能體反應遲鈍」「答到一半忘了上下文」,根源往往在這裡。
Hexagon NPU的做法是把共享內存容量較前代增加50%,讓模型狀態、上下文資訊和KV-cache數據儲存在更靠近加速器的位置,大幅減少對外部內存的訪問頻次。簡單說,數據留在NPU內部,智能體就不用每次都「跑一趟內存」。
更大的突破在模型層面。驍龍新一代旗艦平台支持在終端側運行300億參數的混合專家(MoE)模型,每次生成一個詞元僅激活約30億個被路由選中的參數。當前的DDR內存無法承載300億參數規模的模型,高通的解法是一套從快閃記憶體到內存的智能加載機制——模型本體儲存在快閃記憶體中,用到哪個「專家」再臨時調入。配合INT2、INT4、INT8、FP8和FP16五種精度策略,開發者可以根據任務複雜度靈活平衡性能、內存、模型質量和功耗。

從能跑到一直跑:NPU正在重新定義手機的AI角色
驍龍新一代旗艦平台的Hexagon NPU,思路很明確:讓AI不只是能在手機上跑,而是能一直跑、快速跑、更智能地跑。
「算得更快」解決的是響應問題——Element Accelerator和更大共享內存的協同,讓智能體的每一步推理都乾脆利落,用戶不用等。「算得更多」解決的是能力問題——MoE和多精度策略的合力,讓手機第一次有了承載百億級參數模型的能力,智能體能做的事從「查天氣、設鬧鐘」擴展到真正的複雜任務。
當手機從等你操作變成主動幫你做事,晶片的評價標準也隨之改變。過去看的是峰值算力,未來看的是能不能在功耗紅線之內,持續、穩定地輸出智能體驗。Hexagon NPU正在為這個標準建立新的基線——它不是一顆更快的NPU,而是一顆為智能體運行模式重新設計的計算核心。這或許才是智能體手機時代,NPU真正的價值所在。






