宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

ETH蘇黎世揭秘:當AI的「記憶」變得更聰明——線性注意力架構的全面較量與跨層資訊傳遞新方案

2026年07月21日 首頁 » 熱門科技

這項由ETH蘇黎世電腦科學系與ETH AI中心聯合開展的研究,於2026年7月發表,論文編號為arXiv:2607.07953。有興趣深入了解的讀者可以通過該編號在arXiv平台上查閱完整論文。

**每一次閱讀,都是一場記憶的挑戰**

每當你打開一本厚厚的書,試圖記住前面章節的細節,同時還要理解當前頁的內容,你的大腦就在同時處理"記憶"與"理解"兩件事。現代AI語言模型——那些能寫文章、回答問題、輔助編程的智能助手——面臨的正是同樣的挑戰,只不過規模要大得多,而且它們的"記憶方式"直接決定了速度與質量之間的權衡。

這篇研究的核心問題,用最簡單的話來說就是:AI應該怎樣"記東西",才能既快又准?研究團隊從ETH蘇黎世出發,對目前幾種主流的AI記憶機製做了一次全面的橫向比較,並提出了一種讓不同層次的記憶之間"互通消息"的新思路。

---

一、AI的記憶困境:為什麼"看全文"會把電腦累垮

要理解這項研究,先得明白AI是怎麼"讀"文章的。

當前最主流的AI語言模型依賴一種叫做"自注意力機制"的技術。用一個生活化的比喻來理解:你正在讀一篇關於廚師張三的長篇小說。讀到第200頁時,你需要回憶第5頁張三用的是什麼鍋。為了找到這個資訊,你必須把書翻回去,逐字逐句對比——不是只查一個地方,而是把第200頁的每一個字都和前面199頁的每一個字做一次對比,才能判斷哪句話最相關。

這就是"自注意力機制"的工作方式:它讓文章中的每一個詞都和其他所有詞做配對比較,從而找出最關聯的資訊。這個機制極其強大,也極其消耗資源。文章越長,比較的次數就以"平方"的速度暴增——文章長度翻倍,計算量變成四倍;文章長度翻四倍,計算量變成十六倍。對於需要處理超長文檔或超長對話的場景,這種"二次方代價"很快就會把電腦的時間和內存耗盡。

正是為了解決這個問題,一批研究者開始探索"線性注意力"機制。線性注意力的核心思路是:與其每次都把當前詞和所有歷史詞做比較,不如維護一個固定大小的"記憶矩陣",把歷史資訊壓縮進去,每次只需要查這個矩陣就夠了。這樣一來,無論文章有多長,查詢的代價始終是固定的,整體計算量只和文章長度成正比——也就是"線性"代價。

這個矩陣就像一個筆記本,你邊讀書邊往裡面寫關鍵資訊,每次需要回憶時,只需要翻這本筆記,而不是把整本小說從頭翻一遍。效率大幅提升,代價是筆記本的大小是固定的,寫滿了就需要決定哪些內容要保留、哪些要覆蓋。

---

二、從"粗心的筆記員"到"精細的記憶管理者":四種架構的演進

ETH團隊這次重點比較了四種線性注意力架構,它們都圍繞同一個核心思路展開,但在"如何管理筆記本"這件事上,一代比一代精細。

**DeltaNet:只記"補丁"的聰明筆記員**

最早的線性注意力有一個嚴重問題:每次讀到新資訊就直接往筆記本里疊加,久而久之,新舊內容混在一起,互相干擾,想查某條資訊時總會帶出一堆無關內容。

DeltaNet提出了一個聰明的解法,研究者們稱之為"Delta規則"。它的做法是:在往筆記本寫新內容之前,先查一下筆記本對這條資訊已經知道多少。如果筆記本已經記了"張三用鐵鍋",而新讀到的資訊是"張三用鐵鍋(確認)",那就不需要重複寫一遍,只記錄一個零差值就好;如果新讀到"張三其實用銅鍋",那就只寫下"把鐵鍋改成銅鍋"這個修正量。

這種"只寫修正量"的方式,讓記憶更新變得精準,大大減少了資訊疊加造成的混亂。DeltaNet的局限在於,它沒有辦法主動"清空"筆記本上已經過時的內容。一旦某條資訊在很久之前寫入,即便它已經不再重要,也還是會一直待在那裡影響後續的查詢。

**Gated DeltaNet:加了"橡皮擦"的改進版**

Gated DeltaNet在DeltaNet的基礎上加入了一個"遺忘旋鈕"。每次寫入新資訊之前,先把整個筆記本的內容按照一個可學習的比例"淡化"——就像把鉛筆字用橡皮輕輕擦淡,再在上面覆蓋新內容。這個比例由當前讀到的詞動態決定,讀到一段全新的話題時,遺忘率自動調高;讀到與之前高度相關的內容時,遺忘率自動調低。

這樣一來,筆記本就有了"主動遺忘"的能力,不再是無限堆積。代價是,這種遺忘是對整個筆記本"一刀切"的——無論哪部分內容,都按同一個比例淡化,精細控制能力還不夠強。

**Kimi Delta Attention:用"分區橡皮擦"精細管理**

Kimi Delta Attention把這個"淡化比例"從一個數字升級成了一個向量——也就是說,筆記本的不同區域可以按不同的速率淡化。某些記錄"地點資訊"的區域可以保留得久一些,而記錄"臨時狀態"的區域則可以很快被清空。這種分區域、分速率的遺忘機制,讓記憶管理變得更加靈活精細。

研究團隊在實驗中發現,在350億參數、150億詞訓練量的標準測試下,使用Muon優化器的Kimi Delta Attention混合架構達到了本次實驗中最低的最終驗證損失2.273,是所有架構中表現最好的。當然,精細的管理也帶來了更高的計算開銷,它在所有架構中訓練速度相對較慢,相對速度約為70.9%。

**Gated DeltaNet-2:把"寫入"和"擦除"徹底分開**

Gated DeltaNet-2是這個系列目前最精細的版本。它的核心創新是把"擦除舊內容"和"寫入新內容"這兩件事徹底解耦,分別由兩個獨立的門控機制來控制。一個"擦除門"專門決定從筆記本的哪些區域移除舊內容,另一個"寫入門"專門決定把新內容寫進哪些區域。這兩個門各自根據當前讀到的詞獨立計算,互不干擾。

如果把Gated DeltaNet比作"用一把刀又切又抹",那Gated DeltaNet-2就是"用兩把專業工具,一把專門刮舊內容,一把專門塗新內容"。當這兩個門的參數設置成相同值時,整個機制就退化回Kimi Delta Attention,再進一步退化就成了Gated DeltaNet,體現了清晰的包含關係。

---

三、大型實驗場:在同一個擂台上,誰贏了?

為了做公平比較,ETH團隊搭建了一個統一的實驗平台。所有模型都採用3.5億參數規模,在同一個高質量網頁文本數據集上訓練150億個詞,使用相同的序列長度、批大小、精度和硬體配置。這就像讓不同品牌的汽車在同一條賽道上跑同樣的圈數,只比較最終成績。

實驗區分了兩種架構模式。"混合棧"是指把線性注意力層和傳統的軟最大值注意力層交替排列,每三層里有一層是傳統注意力;"純棧"則是全部使用線性注意力層,不混入傳統注意力。這兩種模式代表了兩種不同的設計哲學:混合棧試圖兼顧質量和效率,純棧則追求最極致的速度優勢。

從驗證損失這個衡量模型質量的核心指標來看,Kimi Delta Attention配合Muon優化器的混合架構以2.273的最終損失拔得頭籌。DeltaNet配合Muon的混合架構緊隨其後,達到2.299。即便是傳統的軟最大值注意力,在換用Muon優化器後也達到了2.349,優於多個線性注意力的AdamW版本。

從訓練速度來看,純棧Gated DeltaNet配合AdamW優化器以100%的相對速度排名第一,是整個實驗中最快的設置,但其最終損失為2.433,比最佳質量的結果差了不少。Kimi Delta Attention由於電腦制更複雜,速度只有68.5%到70.9%左右。

這兩項結果合在一起,清晰地揭示了一個根本性的權衡:你想要最好的質量,就要付出速度的代價;你想要最快的速度,就要接受質量上的妥協。沒有哪個單一設置能同時在兩個維度上稱王。

---

四、優化器的選擇比你想像的重要得多

這項研究揭示了一個很多人可能忽視的細節:選擇哪種優化器,對最終結果的影響巨大,而且必須和學習率一起考慮。

優化器可以理解為AI學習時的"調參策略"——它決定了每次根據錯誤信號調整模型參數的方式。實驗比較了兩種主流優化器:AdamW和Muon。表面上看,從AdamW換成Muon只是換了一個工具,但實驗數據顯示,在所有測試的架構和棧結構組合中,Muon都穩定地帶來了更低的最終驗證損失。

更有趣的是,不同的架構對"學習率"這個參數的最優值需求截然不同。學習率就像調味料的用量——太少了菜沒味道,太多了則會咸苦難以入口。研究團隊在2000步的短期訓練實驗中發現,使用Muon的模型普遍偏愛較低的學習率,約在3×10??附近;而使用AdamW的線性注意力模型則偏愛較高的學習率,約在10??附近。唯一的例外是傳統軟最大值注意力,它在兩種優化器下的最優學習率都落在3×10??附近。

這個發現有重要的實踐意義:如果你想比較兩種架構的好壞,必須分別為它們各自調到最優的學習率,否則得出的結論很可能是因為調參失誤導致的,而不是架構本身的差異。用一個烹飪類比來說:同樣是比較鐵鍋和不粘鍋哪個煎蛋更好,如果鐵鍋用了適合不粘鍋的火候,最後鐵鍋煎出焦糊的蛋,你不能就此得出鐵鍋更差的結論。

---

五、長文本的速度測試:線性優勢在這裡最明顯

研究團隊還專門測試了當文本序列變長時,不同架構的表現如何變化,這是線性注意力架構存在意義最直接的體現。

測試在4096個詞、16384個詞和32768個詞三種長度下分別測量了每次訓練疊代需要的時間。結果非常直觀:在32768個詞的長度下,傳統軟最大值注意力每次疊代需要3.37秒;Gated DeltaNet的混合棧需要1.56秒;而純棧Gated DeltaNet只需要0.96秒。

更能說明問題的是增長幅度:從4096詞增長到32768詞,傳統注意力的時間增加了約192%,接近三倍;混合棧Gated DeltaNet增加了約65%;純棧Gated DeltaNet僅增加了約8%,幾乎沒有變化。這正是"線性"與"二次方"在實際中的差距——序列越長,線性架構的優勢越明顯,到了足夠長的序列,差距可以是數倍乃至數十倍。

混合棧的增長幅度(65%)非常接近純軟最大值注意力(192%)的三分之一,這個比例並非巧合——混合棧中恰好有三分之一的層是傳統注意力層,它們貢獻了幾乎全部的序列長度相關開銷。這個細節說明,混合架構的速度特性幾乎可以線性地由"有多少比例的層是傳統注意力"來預測。

---

六、規模擴展的驗證:更大的模型說了什麼

研究團隊還把DeltaNet擴展到了更大的規模,以驗證在3.5億參數之外的表現是否一致。

在13億參數、訓練400億詞的規模上,實驗發現學習率的選擇對結果依然至關重要。使用3.6×10??學習率的混合架構DeltaNet最終損失為2.066,對應的純棧版本為2.085;但同樣是純棧版本,把學習率降到1.5×10??後,最終損失反而更低,達到2.063——差距雖然不大,但方向相反,說明最優學習率因棧結構不同而不同。

在30億參數、訓練600億詞的更大規模上,同樣的規律再次出現:學習率為5×10??的混合架構DeltaNet最終損失高達2.332,而把學習率降到3×10??或1.5×10??,損失都降到了1.955,差距顯著。這再次證明,在任何規模的實驗中,學習率調參都不能省略。

研究團隊還在多個下游任務上做了評測,包括HellaSwag(常識推理)、PIQA(物理常識問答)和WinoGrande(指代消解)。這些任務的結果顯示,各架構之間的差異不大,沒有任何一個架構在所有任務上明顯占優,也沒有明顯的退化。這意味著驗證損失所反映的質量差異,並沒有在這幾個基準任務上造成明顯的功能差距,至少在這個規模和任務集合上如此。

---

七、跨層"傳話":讓深層網路不再遺忘淺層的發現

解決了"如何管理單個層的記憶"之後,研究團隊把目光轉向了一個更深層的問題:當模型有很多層堆疊在一起時,淺層提取的有用資訊,會不會被深層網路"淡忘"或"覆蓋"?

這個問題的背景是:深度神經網路由許多層組成,每一層都對輸入做一定的變換,輸出傳給下一層。理論上,淺層發現的某個關鍵模式,應該能通過層層傳遞影響到最終輸出。但實踐中,隨著層數增加,早期資訊確實可能被稀釋。一些研究者(包括Kimi團隊)提出了用"注意力殘差"或"深度混合注意力"等方案,專門在層與層之間建立額外的資訊通道。

ETH團隊的思路是:既然DeltaNet風格的架構在每一層都會產生一個"寫入殘差"(也就是前面說的"修正量"),這個資訊不用了就被丟掉了。那能不能把它傳遞給更深的層,讓更深的層也能利用這個資訊?而且,這種傳遞方式必須不破壞線性注意力的速度優勢。

**第一次嘗試:傳遞"寫錯了多少"(CLER)**

最直覺的想法是把淺層的"修正量"直接傳遞給下一個線性注意力層,讓接收層把它加入自己的寫入目標中——相當於告訴下一層"上一層覺得自己對這條資訊的記錄還差這麼多,你幫忙補上"。這個方案被命名為"跨層錯誤殘差"(CLER)。

然而實驗結果令人失望。使用Muon優化器時,CLER版本的Gated DeltaNet比原始版本損失反而略高了0.0013;CLER版本的DeltaNet雖然有-0.0004的微弱改善,但這個差距小到可以忽略不計,不具統計意義。使用AdamW優化器時,CLER對兩個架構都沒有改善,DeltaNet版本甚至損失大幅上升了0.019。

研究團隊並沒有因此放棄,而是仔細分析了原因。他們認為問題在於"空間錯位":淺層的修正量是在淺層自己的"值空間"中定義的,這個空間和深層的值空間之間沒有天然的對齊關係——就像一個廚師用法語寫的菜譜,傳給一個只懂中文的廚師,對方根本無法直接利用。

**第二次嘗試:傳入"公共頻道"(CLER-H)**

意識到問題所在後,團隊做了第一個改進:不把資訊傳入接收層的"私有值空間",而是傳入所有層共享的"殘差流"——也就是整個網路中各層之間傳遞資訊的公共通道。這個方案叫做CLER-H,傳遞的信號仍然是寫入錯誤量。

結果有了明顯改善。在350億參數、10億詞訓練的實驗中,CLER-H使Gated DeltaNet的損失降低了0.0073,使DeltaNet降低了0.0047。在更長的150億詞訓練中,改善依然存在但幅度縮小,分別為-0.0042和-0.0002。

**第三次嘗試:傳遞"寫了什麼"而不是"差了多少"(CLVR)**

團隊進一步思考:既然"寫入錯誤量"能有所幫助,那"寫入量本身"會不會更有用?畢竟,寫入錯誤量只是"寫入值減去已有記憶對該位置的預測",而完整的寫入值包含了更多資訊。這個方案被命名為"跨層值路由"(CLVR)。

結果證實了這個判斷。在350億參數、10億詞的實驗中,CLVR使Gated DeltaNet損失降低了0.0103,使DeltaNet降低了0.0119,均優於CLER-H。在150億詞的訓練中,改善持續存在,分別為-0.0059和-0.0016。在13億參數、400億詞的更大規模實驗中,僅有Gated DeltaNet的數據,CLVR使損失降低了0.0019。

關鍵的一點是:CLVR使用了零初始化的投影矩陣——一開始,這個跨層傳遞通道完全不起作用,模型和沒有CLVR時完全一樣。隨著訓練進行,模型自己"學會"了是否以及如何利用這個通道。訓練結束後檢查這個投影矩陣,發現它在所有路由層上都有了非零但可控的參數值,說明模型確實主動使用了這個通道,而不是把它置之不理。

研究團隊還做了幾個控制實驗來確認改善來自路由本身而非額外參數。把路由的信號從"寫入值"換成"該層的隱藏狀態",效果幾乎持平(改善僅-0.0014);把Gated DeltaNet的參數量直接增加到和CLVR版本相同,不引入路由機制,損失反而上升了+0.0021。兩個控制實驗都說明,改善來自"傳遞了什麼資訊",而不是"增加了多少參數"。

---

八、研究的邊界:什麼結論是穩健的,什麼還是初步的

ETH團隊在論文中對研究局限性的描述相當坦誠,這也是值得稱道的學術態度。

整個實驗中,每種配置只跑了一次,沒有多次隨機種子的重複實驗,因此所有結果都不附帶誤差範圍。對於損失差距小於約0.001到0.01的比較,研究者明確表示不做強結論——這個量級的差異可能只是隨機波動,在單次實驗中無法區分。

下游任務評測的覆蓋面也相對有限,僅測試了HellaSwag、PIQA和WinoGrande三個標準基準,而且這三個任務對於長上下文記憶能力的要求不高。研究者明確指出,這些評測的主要用途是"檢查有無明顯退化",而不是作為改善的獨立證據。

CLVR目前只在DeltaNet和Gated DeltaNet兩種宿主架構上做了驗證,Kimi Delta Attention和Gated DeltaNet-2上還沒有對應的實驗數據。Gated DeltaNet-2特別值得關注——它把寫入值和擦除操作分開了,"路由寫入值"這個邏輯在這種架構上意味著什麼,還是一個開放的問題。

此外,隨著模型規模增大或訓練時間增長,CLVR的改善幅度有所收窄。在13億參數級別,改善已經縮小到0.0019,這是否意味著在更大規模或更充分訓練的情況下收益會消失,目前還不清楚。研究者猜測這可能是因為更大、訓練更充分的模型自己已經能夠學會淺層的有用資訊,不再那麼需要顯式的跨層傳遞。

---

九、對工程實踐者的啟示:速度還是質量,你只能先選一個

從這項研究的全部實驗結果中,可以提煉出幾個對實際應用直接有用的認識。

關於架構選擇,沒有一個在所有維度都最優的選項。如果部署場景對推理延遲極其敏感、需要處理很長的上下文,純線性注意力棧在序列長度增加時幾乎不增加時間成本,是值得認真考慮的方向。如果對質量的要求高於速度,混合架構通常能在不大幅犧牲速度的前提下,讓驗證損失接近更大計算量的純軟最大值注意力。

關於優化器,不能只試AdamW就做定論。研究顯示Muon在所有測試架構上都能改善質量,而且它們偏愛的學習率範圍不同——用AdamW的最優學習率來跑Muon,或者反過來,都會得到遠未達到潛力的結果。

關於跨層路由,CLVR在小規模和中等規模上有一定的改善,而且不增加推理成本,工程代價很低,可以作為一個值得嘗試的技巧。但目前的實驗僅限於兩種宿主架構和有限的規模,不宜過度推廣。

---

說到底,這項研究做的事情,就是把幾個"AI記憶筆記本"的不同管理方式放在同一張桌子上,認真地量了量各自的重量和容量。結論不是"這個筆記本最好,其他都可以扔掉",而是"每本筆記本適合不同的場合,而且你選的筆還會影響寫出來的字好不好看"——這裡的筆就是優化器。

研究團隊還發現,讓不同層的筆記本"互相傳閱"是有價值的,但傳閱方式很關鍵。把"我哪裡記錯了"傳給別人,沒有把"我原本打算寫什麼"傳給別人更有用。這個發現打破了最初的直覺——畢竟,"記錄我的錯誤"才是DeltaNet這個系列的核心設計哲學。

這項工作的價值,一方面在於對已有架構的系統梳理,讓不同機制的異同在數學上變得透明;另一方面在於CLVR這個輕量級的新機制,它在保留線性注意力全部速度優勢的前提下,提供了一個讓深層網路不遺忘淺層智慧的方式。它的改善目前還比較小,在更大規模上是否依然有效還是未解之謎,但作為一個幾乎沒有工程成本的改進,已經值得關注。

有興趣深入了解全部細節的讀者,可以通過arXiv編號2607.07953找到這篇論文,同時研究團隊也在GitHub上開放了完整的實現代碼,可以直接復現實驗。

---

**Q&A**

Q1:線性注意力和傳統軟最大值注意力相比,質量真的能差不多嗎?

A:根據ETH蘇黎世的實驗,在3.5億參數、150億詞訓練的標準設置下,Kimi Delta Attention配合Muon優化器的混合架構最終驗證損失為2.273,而傳統軟最大值注意力配合Muon達到2.349,線性注意力反而更優。但這個結論的前提是架構、優化器和學習率都經過合理匹配,不是隨便換一個就能得到這個結果。

Q2:CLVR跨層值路由對推理速度有沒有影響?

A:CLVR通過一個零初始化的投影矩陣把淺層的寫入值加入殘差流,這個操作在推理時也同樣存在,理論上會增加一點點計算量,但由於投影矩陣的維度相對較小,且不改變任何一層的主體計算邏輯,研究團隊描述其為"保留宿主架構線性時間結構"的輕量方案。論文中沒有單獨列出CLVR對推理速度的具體影響數字。

Q3:混合棧和純棧Gated DeltaNet的訓練速度差距有多大?

A:根據論文中的實驗數據,在32768詞的長序列下,純棧Gated DeltaNet每次訓練疊代約需0.96秒,混合棧需要1.56秒,傳統軟最大值注意力需要3.37秒。從4096詞增長到32768詞,純棧時間只增加了約8%,混合棧增加了約65%,而傳統注意力增加了約192%。在相對吞吐量上,純棧AdamW版本被定為100%基準,混合棧AdamW版本約為90.5%。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新