9 月 23 日,在 GMIF 2026 全球儲存器行業創新峰會上,Arm 全球儲存業務負責人 John Xavier Lionel 發表了題為《從數據到 Token:重塑邊緣 AI 的計算與儲存架構》的主題演講,圍繞生成式人工智慧(AI)時代計算與儲存的演進趨勢分享了最新洞察。

AI 正在重塑儲存需求
隨著 AI 模型規模不斷擴大、上下文長度持續增長以及並發用戶數量快速增加,儲存正成為影響 AI 系統能力的關鍵因素。在推理過程中,解碼(Decode)階段需要持續訪問 KV Cache,使記憶體容量、頻寬和數據傳輸效率直接影響系統性能與吞吐量。因此,對於生成式 AI 而言,系統性能不再僅由計算資源決定,也越來越取決於記憶體、儲存和數據傳輸系統能否持續、高效地向計算資源提供所需數據。
與此同時,隨著生成式 AI 規模化落地,Token(詞元)正成為衡量 AI 運營成本的重要單位。例如,100 萬台設備每天進行 20 次 AI 交互、每次生成 500 個 Token,就意味著每天將產生約 100 億個 Token。每一次交互所產生的 Token 都會對應計算、記憶體、儲存、網路和能耗等成本。可見,推理正在從一次性的技術投入,轉變為持續性的運營支出。對於產業而言,未來真正重要的問題不再是「能夠生成多少 Token」,而是「能夠以多高的效率和多低的成本生成有價值的智能」。
AI 時代的競爭,也正在從單純追求更高 TOPS,轉向如何在計算、記憶體、儲存和數據移動之間建立更高效的系統平衡。
分布式 AI 讓智能運行在最合適的位置
隨著 AI 不斷從雲端向邊緣延伸,產業關注點正在從「雲還是邊緣」的選擇題,轉向「如何讓合適的 AI 工作負載運行在最合適的位置」。
不同 AI 工作負載對性能、時延、隱私、功耗和成本的要求各不相同,因此需要運行在最合適的計算層級。始終在線感知、喚醒詞檢測和異常檢測等輕量級任務適合在低功耗終端設備本地運行;AI 助手、多模態交互等對時延和隱私敏感的應用更適合在手機、PC、XR 設備和機器人等高性能邊緣設備上執行;行業模型和本地化 AI 服務可依託邊緣基礎設施運行;而超大模型、複雜推理、模型訓練以及全球化服務等工作負載,則更適合部署在雲端。
通過在雲端、邊緣基礎設施和終端設備之間合理分配 AI 工作負載,企業能夠在能力、時延、隱私、成本和能效之間實現更優平衡;而對於用戶而言,這意味著更快的響應速度、更好的隱私保護、更可靠的使用體驗,以及更加個性化的智能服務。
儲存已成為邊緣 AI 系統競爭力的關鍵一環
得益於小語言模型(SLM)、量化技術、異構計算架構以及軟體生態的持續進步,邊緣 AI 進入快速發展階段。原本只能運行在雲端的 AI 能力正被部署到終端設備,在提升響應速度、保護數據隱私的同時,也讓本地智能應用成為可能。與此同時,隨著模型規模、本地知識庫和用戶上下文的持續擴張,邊緣 AI 系統對儲存容量、記憶體頻寬、模型加載速度、安全性以及功耗管理等的要求也不斷提高,並帶來了新的系統設計挑戰。
例如,生成式 AI 推理需要持續訪問模型權重、上下文和鍵值緩存(KV Cache)。即使擁有強大的 AI 加速器,如果數據無法高效地在儲存、記憶體和計算單元之間流動,系統性能仍然會受到限制。
在這一過程中,儲存系統的角色也在發生深刻變化。過去,儲存主要用於保存作業系統、應用程式和用戶數據;而隨著越來越多 AI 能力向設備側遷移,模型、向量數據、本地知識庫以及 Agent 記憶等 AI 資產也開始長期駐留在設備側。儲存承載的不再只是數據,而是模型、知識和智能能力本身。
Armv9 計算平台擴展邊緣 AI 能力邊界
隨著邊緣 AI 從始終在線感知、關鍵詞檢測和異常檢測等輕量級應用,逐步擴展到 AI PC、多模態 AI、機器人和本地生成式 AI 應用,模型和上下文從 MB 級增長到 GB 級,系統對於計算、記憶體和儲存能力提出了更高要求。
對於低功耗邊緣設備而言,Arm Cortex-M CPU 能夠在有限功耗預算下提供高效 AI 能力,其核心設計原則是:最大限度減少外部數據移動,讓活躍數據儘量靠近計算單元,高效地將模型保存在 Flash 中,按需配置 AI 加速能力。
隨著模型規模、上下文長度以及本地知識庫持續增長,邊緣 AI 開始邁向大模型時代。此時,系統挑戰已不僅僅來自計算能力本身,而是來自容量、頻寬和數據移動效率。基於同樣的設計理念,Arm 推出基於 Cortex-A320 CPU 與 Ethos-U85 NPU 的 Armv9 邊緣 AI 計算平台,通過增強的記憶體架構、更高效的數據訪問能力以及 CPU 與 NPU 協同計算設計,支持運行超過 10 億參數的大語言模型,為生成式 AI、多模態 AI 和智能體應用提供更強大的邊緣側計算能力。
AI 時代的下一場競爭,不再只是 TOPS 競賽,而是在計算、記憶體、儲存和數據移動之間實現最佳協同的系統設計競爭。Arm 正在通過覆蓋從低功耗終端到高性能邊緣設備的計算平台,以及持續優化的異構計算架構,幫助生態夥伴更高效地釋放 AI 能力,推動邊緣 AI 邁向十億參數時代。






