宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

Synaptics Torq NPU攜手谷歌Gemma 3,突破邊緣端大語言模型推理瓶頸

2026年08月10日 首頁 » 熱門科技

當前,開發者和系統架構師面臨越來越大的壓力,需要在資源受限的設備上支持基於Transformer的大語言模型。這不僅是為了保障數據隱私、消除雲端API費用、實現離線可靠性,也是為了滿足歐洲《網路彈性法案》等嚴格安全法規的要求,同時提供智能AI助手所需的極低延遲響應。

然而,大多數邊緣端硬體並非專為大語言模型的動態執行模式、激活函數瓶頸和內存訪問需求而設計。在Arm、RISC-V或x86等通用CPU上運行數億參數級的Transformer模型,效率遠低於在專用硬體上本地運行。此外,AI工作負載占用主機核心算力,會影響整個應用棧的正常運轉,迫使開發者在系統功能上做出妥協,這使得將模型卸載至高效、可擴展的NPU實現顯得尤為必要。

傳統NPU在處理此類工作負載時往往力不從心,原因主要有三:一是Gemma 3 270MSynapticsTorqNPU攜手谷歌Gemma3突破邊緣端大語言模型推理瓶頸等Transformer模型具有動態特性,對話過程中序列長度和注意力掩碼持續增長,而多數邊緣NPU只支持靜態運行時,無法有效應對張量維度的動態變化;二是大語言模型依賴GELU、Softmax等計算密集型激活函數,在通用加速器上會引發明顯的延遲和功耗瓶頸;三是內存頻寬而非算力往往才是真正的瓶頸,大型權重矩陣在從內存加載過程中會導致NPU大量空閒。

為突破上述硬體與軟體層面的挑戰,Synaptics與谷歌研究院攜手合作,推出了一套面向邊緣智能的先進可擴展解決方案,並以三大支柱為基礎構建這一方案。

Synaptics Astra SL2610產品線

Synaptics Astra SL2610是業界首款集成了谷歌研究院Coral NPU的IoT邊緣AI處理器產品線。其Torq NPUSynapticsTorqNPU攜手谷歌Gemma3突破邊緣端大語言模型推理瓶頸充分體現了異構設計理念,將Synaptics自研的支持Transformer的T1核心與谷歌開發的Coral NPU標量RISC-V核心相結合,協同實現高效的設備端多模態AI處理。

谷歌Gemma 3 270M模型

Gemma 3 270M是谷歌推出的一款緊湊型指令微調語言模型,內部結構包含18個Transformer層,使用GELU激活函數、Softmax機制和大量矩陣乘法運算,這些層會帶來顯著的內存和算力瓶頸,需要針對性優化。

藉助Torq NPU的卸載能力,系統可以承擔完整的Transformer推理任務,確保絕對的數據隱私和離線可靠性。該平台支持從自然語言觸發工具調用,可將模型作為智能接口,理解用戶意圖並激活特定設備端功能,同時支持離線語言翻譯、消息摘要和文檔處理,無需依賴雲端API,從而降低成本和延遲。

為在受限邊緣硬體上高效實現以上能力,Torq NPU工具鏈通過三項關鍵優化加以應對。

動態圖靜態化SynapticsTorqNPU攜手谷歌Gemma3突破邊緣端大語言模型推理瓶頸

邊緣加速器要求靜態運行時和固定張量維度,Torq NPU工具鏈的編譯器可將動態圖轉換為靜態圖,用預分配的靜態張量替換不斷增長的KV緩存,並實現靜態注意力掩碼和位置編碼,從而保障最大化的硬體利用率和可預測的執行時序。

激活函數近似加速

GELU和Softmax等激活函數的疊代計算會在通用硬體上消耗大量能量。Torq NPU通過將輸入域分區,結合硬體優化的查找表和線性插值來近似複雜激活函數,避免了反覆執行指數、除法等高開銷運算。實驗數據顯示,GELU推理速度提升10倍,Softmax推理速度提升12.5倍。

敏感度感知權重壓縮

內存頻寬是Astra平台上大語言模型推理的首要瓶頸。Torq NPU工具鏈採用敏感度引導的壓縮策略,對84%的層進行4-bit量化,對語言模型頭等敏感層保留8-bit精度。平均位寬從16-bit降至4.3-bit,通過動態反量化恢復為bf16精度,有效吞吐量提升2.7倍,並配合詞彙表裁剪和DMA效率優化進一步加速推理。

綜合以上三項優化,Torq NPU將推理速度提升3.5倍,同時消除動態分配開銷,實現10倍激活函數加速,並大幅提升內存頻寬利用率,真正實現了本地執行所帶來的數據隱私保障、離線可靠性、極低延遲和雲端成本節省等全方位邊緣優勢。

開發者可訪問Torq示例/演示GitHub倉庫查閱實現細節和文檔,也可購買Synaptics Astra SL2610(Machina)開發套件進行硬體評估。Synaptics Coralboard的正式發布及上市安排也將結合谷歌I/O 2026的最新動態同步公布。

Q&A

Q1:Torq NPU是如何解決大語言模型在邊緣端推理時的內存頻寬瓶頸的?

A:Torq NPU採用敏感度引導的壓縮策略,將84%的層量化為4-bit精度,僅對語言模型頭等敏感層保留8-bit精度,平均位寬從16-bit降至4.3-bit。權重以壓縮格式儲存,在流入計算單元時動態反量化為bf16精度,有效吞吐量提升2.7倍。結合詞彙表裁剪和DMA效率優化,整體推理速度得到顯著提升。

Q2:Synaptics Astra SL2610與普通邊緣NPU有什麼區別?

A:Synaptics Astra SL2610是業界首款集成谷歌研究院Coral NPU的IoT邊緣AI處理器。其Torq NPU採用異構架構,將Synaptics自研的Transformer專用T1核心與谷歌Coral NPU的RISC-V標量核心相結合,可協同處理動態Transformer模型,解決了普通邊緣NPU無法應對動態張量維度、激活函數瓶頸和內存頻寬限制等核心問題。

Q3:Gemma 3 270M在邊緣設備上能實現哪些具體應用?

A:在Torq NPU的支持下,Gemma 3 270M可在邊緣設備上實現多種實用場景,包括:從自然語言指令觸發設備端工具調用、完全離線的語言翻譯、消息摘要以及文檔處理。由於所有推理均在本地完成,無需連接雲端API,因此可保障數據隱私,同時提供更低延遲和更少成本開銷。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新