宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

把一部手機壓縮到能塞進硬幣縫裡,還要照片拍得跟原來一樣清楚

2026年09月30日 首頁 » 熱門科技

你有沒有想過,一個訓練好的神經網路,裡面到底裝了多少"沒用的東西"?

這個問題在2025年之前有一個還算清楚的答案:剪枝把一部手機壓縮到能塞進硬幣縫裡還要照片拍得跟原來一樣清楚和量化把一部手機壓縮到能塞進硬幣縫裡還要照片拍得跟原來一樣清楚,各干各的活,誰也不管誰。剪枝負責把不重要的權重直接歸零,量化負責把留下來的權重從32位浮點數壓成8位甚至更低。兩條流水線,兩套團隊,兩次優化,最後拼在一起交貨。

這篇來自普渡大學和德州大學埃爾帕索分校的論文,提出了一個讓人有點意外的觀點:分開做這兩件事,本身就是一種浪費。

**核心問題:兩條腿走路,為什麼反而摔跤**

想像你要給一個大家庭搬家,要求是既要扔掉不需要的東西(剪枝),又要把留下的東西打包得儘量小(量化)。如果你先花一整天決定扔什麼,第二天再決定怎麼打包,你大概率會發現:昨天覺得"必須留下"的一個大衣櫃,今天打包的時候才意識到根本塞不進搬家車,應該換成別的方式處理。

先剪枝後量化,或者先量化後剪枝,都會遇到類似的問題。剪枝階段以為某個權重很重要所以保留了它,但等到量化階段,發現這個權重在低精度表示下反而變得沒那麼關鍵,這時候已經晚了,決策已經做完了。

論文管這個現象叫"redundancies in each step",也就是每一步單獨優化時都會漏掉的冗餘。數據說話最直接:在ResNet把一部手機壓縮到能塞進硬幣縫裡還要照片拍得跟原來一樣清楚-32上,分開做的DGMS把一部手機壓縮到能塞進硬幣縫裡還要照片拍得跟原來一樣清楚方法能達到27倍壓縮,而論文提出的SQS把一部手機壓縮到能塞進硬幣縫裡還要照片拍得跟原來一樣清楚聯合優化方法能做到32倍壓縮,準確率下降還從1.30%降到了1.29%。壓縮率提升了18%,精度損失反而更小。這不是玄學,這是把兩個決策放在同一個優化過程里同時權衡的結果。

那麼問題來了,聯合優化聽起來是個正確的方向,但具體怎麼在數學上把"該不該留下這個權重"和"留下的權重該量化成什麼值"這兩件事捏合到一起?這篇論文給出的答案,是一套叫SQS的貝葉斯框架。

**貝葉斯變分學習把一部手機壓縮到能塞進硬幣縫裡還要照片拍得跟原來一樣清楚:用概率分布描述"權重的命運"**

先說說這套方法的骨架。SQS,全稱Sparse Quantized Sub-distribution,直譯是"稀疏量化子分布",這個名字聽起來抽象,拆開看其實很直觀。

變分學習*:一種用簡單分布去近似複雜後驗分布的貝葉斯推斷方法。真實的後驗分布往往算不出來,所以退而求其次,在一族"好算"的分布里找一個最接近真實分布的,這個過程就叫變分學習。

論文的做法是,不再把每個權重看成一個固定的數字,而是看成一個概率分布,這個分布同時描述了"這個權重有多大概率被剪掉"和"如果不被剪掉,它更可能落在哪幾個量化值附近"。

這個分布由兩部分拼成。第一部分叫spike,也就是"釘子",在數學上是一個點質量,概率全部集中在0這一個點上,代表"這個權重被剪掉了"。第二部分叫slab,也就是"板子",是一個連續分布,代表"這個權重被保留時的取值範圍"。

spike-and-slab先驗把一部手機壓縮到能塞進硬幣縫裡還要照片拍得跟原來一樣清楚*:貝葉斯統計里用來誘導稀疏性的經典先驗分布,由一個在零點的尖峰(spike)和一個平緩的連續分布(slab)混合而成,常用於變量選擇問題。

這個概念本身在統計學裡已經有幾十年歷史,不是這篇論文的原創。論文的創新點在於slab那部分怎麼設計。傳統做法里slab往往是一個簡單的高斯分布,但SQS把slab換成了一個高斯混合模型把一部手機壓縮到能塞進硬幣縫裡還要照片拍得跟原來一樣清楚。

高斯混合模型(GMM)*:由多個高斯分布加權疊加而成的概率分布,常用於聚類和密度估計。每個高斯分量有自己的均值、方差和權重。

為什麼要用GMM而不是單個高斯?因為量化的本質就是把連續的權重值映射到幾個離散的代表值上,比如4bit量化只允許16個可能的取值。GMM里的每個高斯分量的均值,天然就可以當作量化後的候選數值。當每個高斯分量的方差被壓得足夠小的時候,GMM這個連續分布就退化成了一個離散的多項分布,這個"退化"的過程,恰好就是量化想要模擬的效果。

這裡可以打一個比方。假設你要給一批學生的成績打包成等級(A、B、C、D),但評分老師內心的判斷本來是連續的,比如85.3分、85.7分、86.1分都傾向於打A,但具體給哪個數字有點模糊。GMM式的思路是:先假設有幾個"標準分數中心"(比如90分代表A的中心,80分代表B的中心),每個學生的真實分數以一定概率歸屬到最近的中心。方差越小,這個歸屬就越果斷,最後幾乎就是非黑即白的等級劃分了。如果不用這種帶概率的軟劃分,而是一上來就硬性規定"85分以上是A,以下是B",會發生什麼?85.01分和84.99分這種邊界情況會被粗暴地分到兩個完全不同的等級,損失大量原本連續變化的資訊。GMM的軟劃分保留了這種漸變的可能性,直到訓練收斂前它都還有調整空間。

論文的完整變分分布,就是spike(要不要留)乘以GMM(留下來量化成什麼),這兩層決策被寫進同一個概率分布里,同一次梯度下降就能同時調整兩者。這就是"聯合"的數學含義,不是先後串行,而是在同一個目標函數裡同時求解。

**目標函數算不出來怎麼辦:一個巧妙的近似**

理論聽起來很美,但這裡有一個卡殼的地方。

標準的貝葉斯做法要求你去最小化一個叫ELBO把一部手機壓縮到能塞進硬幣縫裡還要照片拍得跟原來一樣清楚的東西。

證據下界(ELBO)*:變分學習中用來替代直接優化難以計算的後驗分布的目標函數,由兩部分組成:衡量擬合數據程度的似然項,和衡量與先驗分布接近程度的KL散度把一部手機壓縮到能塞進硬幣縫裡還要照片拍得跟原來一樣清楚項。

ELBO里有一項是變分分布和先驗分布之間的KL散度。

KL散度*:衡量兩個概率分布之間差異程度的一種度量,數值越小說明兩個分布越接近。

問題是,spike-and-slab分布和GMM分布之間的KL散度,根本沒有解析解,算不出來。這不是工程實現的困難,是數學上就沒有閉式解。

論文的解決辦法分成兩步走。第一步,面對似然項里那個"在整個分布上求期望"的操作,論文沒有真的去採樣很多次權重再平均,而是直接用分布的均值代入網路做一次前向傳播,相當於用一個"平均權重"網路去近似整個分布的期望效果。第二步,面對算不出來的KL散度,論文用一個數學引理把它的上界推導出來,上界裡出現的是"最大概率的那個高斯分量"和"零均值高斯先驗"之間的KL散度,這個是有閉式解的高斯對高斯的KL散度。

用上界代替真值來優化,是變分推斷里的常規操作,但這裡巧妙的地方在於,論文沒有簡單粗暴地用一個大雜燴上界,而是精確定位到"貢獻最大的那個分量"上做近似,這樣既控制了近似誤差,又讓計算量保持可控。

打個比方,如果你要評估一個班級今天的整體出勤狀態,嚴格來說應該統計每個學生具體在哪、幹了什麼,但這個資訊量太大算不過來。一個務實的近似是:只看每個學生最可能去的那個地方(教室、操場、圖書館),按照這個"最大概率地點"來估算全班狀態。這樣雖然損失了一些細節,但抓住了主要矛盾,而且計算量從"追蹤每個人的完整概率分布"降到了"記錄每個人最可能在哪"這麼簡單。

**推理階段:貝葉斯平均比"選最可能的那個"更穩**

訓練結束之後,怎麼用這個學出來的分布去做預測?論文在這裡比較了兩種做法。

第一種叫貪心法(greedy),對每個權重直接選概率最高的那個量化值,一錘定音。第二種叫貝葉斯平均(Bayesian averaging),從整個分布里採樣出好幾組完整的權重(論文默認采4次),分別跑一遍網路,再把結果平均。

實驗結果很直接:在ResNet-18和ResNet-50上,用相同數量的高斯分量,貝葉斯平均始終比貪心法準確率更高。這個差距在分量數少的時候(比如K=8)更明顯。

論文還專門測了平均次數M對結果的影響。M=1時準確率掉了3.76個百分點,M=5時降到2.86,M=50時降到2.63。有意思的是,從M=5到M=50,準確率只提升了0.23個百分點,大部分收益在前5次採樣就吃到了。

這背後的道理其實很樸素。你去問5個不同的醫生同一個診斷問題,取多數意見,通常比只問1個醫生可靠,但問50個醫生和問5個醫生的效果差不了太多,因為多數意見早就趨於穩定了。貝葉斯平均本質上就是"問多個版本的自己",用採樣出的多組權重分別預測再取平均,抵消掉量化引入的隨機噪聲。如果只相信貪心法選出的那"一個標準答案",一旦這個最大概率分量的選擇本身就帶著量化誤差,預測結果就完全暴露在這個誤差之下,沒有任何緩衝。

**長尾分布與離群值:大語言模型權重里的隱藏麻煩**

如果說前面講的是SQS的通用骨架,那這一部分講的是論文針對大語言模型專門做的一個補丁,而且這個補丁的效果相當顯著。

論文觀察到一個現象:大語言模型的權重分布,尤其是自注意力層的權重,往往不是規規矩矩的高斯鐘形曲線,而是長尾分布,也就是絕大多數權重擠在中間一小段區間裡,但有極少數權重的數值特別大,拖出一條長長的尾巴。

長尾分布*:一種概率分布形態,大部分數據集中在某個區間,但存在少量遠離主體、數值極端的樣本,這些極端樣本被稱為離群值(outlier)。

這個現象不是這篇論文首次發現的,此前已有研究指出大語言模型權重里存在顯著的離群值。但SQS的應對方式值得細說。

論文原本的量化方案是把一層的權重按照數值範圍切成4個等寬窗口,每個窗口內部單獨擬合一個K分量的GMM。這個思路在權重分布均勻的情況下沒問題,但碰到長尾分布就會出問題:因為窗口是等寬切分的,那些占少數但數值極端的離群權重,會和大量普通權重擠在同一個寬窗口裡,量化精度被主體權重"平均"掉了,離群值的資訊被嚴重稀釋。

論文的解決方案叫outlier-aware windowing,離群值感知的窗口劃分。

IQR(四分位距)*:統計學中衡量數據離散程度的指標,等於第三四分位數減去第一四分位數,常用於識別異常值。

具體做法是,先算出這層權重的四分位距IQR,然後用5倍IQR作為界限,把權重切成4個窗口,其中專門留出兩個窗口去捕捉最低和最高的尾部區域,剩下的窗口處理中間的主體部分。這樣,原本被稀釋掉的離群權重,現在有了自己專屬的量化空間,不用再跟主體權重搶資源。

實驗數據很能說明問題。在Qwen2.5-0.5B模型上,相同6bit精度、相同50%非零率的條件下,用等寬窗口的準確率掉了5.40個百分點,用離群值感知窗口只掉了2.46個百分點,差距接近3個百分點。論文配的圖裡,可以直觀看到用離群值感知窗口量化出來的權重分布,在尾部區域和原始全精度權重的形狀吻合得多,而等寬窗口在尾部區域基本是空的,那部分資訊被丟光了。

這裡可以類比一下城市規劃。如果一個城市裡絕大多數房子都是普通住宅,只有少數幾棟是摩天大樓,你如果按照"每個區域面積相等"的原則來劃分行政區,摩天大樓所在的那個區域可能因為面積配額有限,反而沒法給這棟樓配套足夠的基礎設施,因為設計者默認這個區域應該跟其他區域承載差不多規模的建築。而如果你事先知道這些摩天大樓扎堆在哪,單獨給它們劃出一個特殊管理區,反而能針對性地投入資源。等寬窗口就是前者的思路,離群值感知窗口就是後者。為什麼不能一開始就把所有窗口都設計成動態自適應大小?因為對於絕大多數沒有長尾的普通層,這樣反而增加了不必要的計算複雜度,論文選擇了一個折中方案,用IQR這個統計量來判斷該不該做特殊處理。

**理論保證:這套方法不是拍腦袋,是有數學支撐的**

如果一篇論文只講實驗效果,讀者難免會懷疑這是不是運氣好湊出來的結果。這篇論文專門用了一整節做理論分析,證明在一定條件下,這套spike-and-GMM變分方法學出來的稀疏量化網路,會隨著數據量增大而收斂到真實的目標函數。

論文考慮的是一個標準的非參數回歸問題,真實函數記為f0,數據裡帶著高斯噪聲。論文證明了一個叫Hellinger距離的量,會被一個由三部分組成的誤差上界給控制住。

Hellinger距離*:一種衡量兩個概率分布相似程度的度量,數值越接近0說明兩個分布越相似,常用於統計推斷中的收斂性分析。

這三部分誤差分別是統計估計誤差、變分誤差和逼近誤差。前兩者會隨著樣本量n趨向無窮而消失,逼近誤差則和網路的容量有關,網路越大,能表達的函數越豐富,逼近誤差反而越小。這和統計學習理論里的經典權衡完全一致:模型容量增大,能降低逼近誤差,但會增加統計估計和變分近似的負擔,好在這篇論文證明了在合理的稀疏度和先驗設置下,三者可以同時被控制住。

證明過程藉助了一個叫Lemma 3的引理,這個引理本身來自更早的一篇論文(Chérief-Abdellatif和Alquier,2018),給出了兩個混合分布之間KL散度的上界,前面講的那個"近似目標函數"的推導,數學基礎就來自這裡。

理論分析當然有局限,論文自己也承認,這套證明目前只覆蓋了全連接網路的回歸任務,沒有直接覆蓋Transformer架構或分類任務。但至少證明了這套框架不是一個純粹靠調參湊出來的經驗方法,背後有可以立得住的數學邏輯。

**實驗戰場:從ResNet到Llama,壓縮率全面領先**

理論說完了,該看實際戰績了。

在ResNet-56上,SQS用2bit精度、50%非零率,達到了32倍壓縮,準確率只掉了0.84個百分點,而同為聯合壓縮方法的DGMS只能做到31倍壓縮,準確率掉0.89個百分點。差距雖然不算懸殊,但SQS在所有對比方法裡都拿到了更優的壓縮率和更小的精度損失,這個"雙贏"的組合在壓縮領域並不常見,通常壓縮率和精度是要互相妥協的。

BERT-base在SQuAD v1.1數據集上的結果更能說明差距。傳統的純剪枝方法比如L-OBS只能做到2倍壓縮,F1分數掉了10.86分;PLATON能做到5倍壓縮,F1掉2.20分;而SQS用4bit量化配合25%非零率,做到了32倍壓縮,F1隻掉1.66分。壓縮率是PLATON的6倍多,精度損失反而更小。

真正讓人印象深刻的是大語言模型上的對比。在Llama3.2-1B上,DGMS這個原本表現不錯的基線方法,壓縮率只有7倍,但準確率暴跌了46.67個百分點,幾乎等於模型失效了。原因論文分析得很清楚:DGMS假設權重服從高斯分布,但自注意力層的權重是前面提到的長尾分布,DGMS的量化方案完全沒有為離群值留出空間,而且這個方法本身不支持自定義稀疏度,只能被動接受一個不合理的壓縮配置。相比之下,SQS用同樣6bit精度,把非零率控制在25%,做到了21倍壓縮,準確率只掉1.48個百分點。這不是漸進式的改進,這是量級上的差異。

論文還專門跟一個叫Bayesian Bits的方法做了對比。這個方法同樣是貝葉斯框架下統一剪枝和量化,但它的做法是給一串"翻倍位寬"的殘差項加門控,本質上是在一個均勻網格上做選擇。在ResNet-56上,Bayesian Bits做到約13.5倍壓縮,準確率掉6.79個百分點;SQS做到17倍壓縮,準確率只掉0.84個百分點。差距的核心在於,SQS學的是GMM均值這種非均勻的碼本,而不是被限定在均勻網格里,這給了模型更大的自由度去逼近真實權重分布的形狀。

下面這張表格匯總了幾個關鍵場景下SQS和最強基線的對比:

| 模型 | 基線方法 | 基線壓縮率 | 基線精度損失 | SQS壓縮率 | SQS精度損失 |

|---|---|---|---|---|---|

| ResNet-56 | DGMS | 31倍 | 0.89% | **32倍** | **0.84%** |

| BERT-base | PLATON | 5倍 | 2.20 F1 | **32倍** | **1.66 F1** |

| Llama3.2-1B | DGMS | 7倍 | 46.67% | **21倍** | **1.48%** |

| Qwen2.5-0.5B | DGMS | 16倍 | 50.80% | **11倍** | **2.46%** |

**關於壓縮率計算方式,一個誠實的說明**

這篇論文有一個值得稱道的細節,它專門用一段篇幅解釋了自己壓縮率的計算口徑,而不是迴避這個問題。

論文的壓縮率公式沒有單獨給"哪些權重被剪掉了"這個二進制掩碼計入儲存成本,這是沿用了它對比的一系列剪枝基線方法(比如L-OBS、PLATON、ExactOBS)一貫的統計口徑。論文解釋,如果按照更嚴格的部署導向標準,比如像位圖或壓縮稀疏行索引那樣顯式為稀疏結構計費,那麼所有基於剪枝的方法(包括SQS自己)算出來的絕對壓縮率都會偏低,但方法之間的相對排名不會變。

這種坦率地把統計口徑的局限性擺在明面上,而不是藏在腳註里含糊帶過,是這篇論文讓人信任的一個細節。

**寫在後面**

讀這篇論文的時候,有一個地方讓我反覆琢磨:為什麼"先剪枝後量化"這種看似合理的流水線思路,在實踐中會漏掉這麼多冗餘?

後來想明白了,問題出在資訊的單向流動上。剪枝階段做決策的時候,它並不知道量化階段會怎麼處理留下來的權重,它只能基於"這個權重現在的重要性"來判斷該不該留。但一個權重在32位浮點精度下看起來很重要,不代表它在4bit精度下依然重要,精度損失本身會重新洗牌哪些權重才是真正關鍵的。反過來,量化階段拿到的輸入已經是剪枝之後的結果,它沒有回頭修改剪枝決策的餘地。這是一個典型的"局部最優不等於全局最優"的例子,而且這個例子藏在一個我們平時不太會去質疑的工程習慣里,分階段處理複雜問題。

另一個值得單獨說的細節是論文對DGMS失效原因的分析。DGMS在ResNet上表現不錯,但在Llama和Qwen上直接崩掉,原因不是算法本身有bug,而是它對權重分布形態的假設(高斯)在小模型上大致成立,但在大語言模型的自注意力層上完全不成立。這提醒我一件事:很多壓縮方法的"通用性"其實是有隱藏前提的,這個前提往往是關於權重分布形態的一個隱含假設,論文如果不做長尾分布的可視化分析,這個失效原因可能永遠被歸因成"大語言模型更難壓縮"這種籠統的說法,而不會被追溯到具體的分布假設失配。

這篇論文目前的理論分析還停留在全連接網路的回歸問題上,沒有覆蓋Transformer架構。但反過來想,理論落後於實踐,在深度學習領域幾乎是常態,而不是例外。

Q&A

Q1:SQS壓縮方法是什麼?

A:SQS是普渡大學團隊提出的一種貝葉斯變分學習框架,通過spike-and-slab先驗和高斯混合模型聯合完成神經網路的剪枝和低比特量化,在ResNet、BERT、Llama3.2等模型上都取得了比傳統分步壓縮方法更高的壓縮率。

Q2:SQS和DGMS這類方法有什麼區別?

A:DGMS只用高斯混合做量化聚類,不支持自定義稀疏度,遇到長尾權重分布時會大幅掉精度。SQS把剪枝和量化寫進同一個spike-and-GMM變分分布里聯合優化,還加入了離群值感知的窗口策略,在Llama3.2-1B上準確率損失從46.67%降到1.48%。

Q3:為什麼大語言模型的權重更難量化?

A:因為大語言模型自注意力層的權重往往呈長尾分布,少數權重數值極端大,如果用均勻窗口做量化,這些關鍵的離群權重會被主體權重稀釋掉,導致模型性能大幅下降,這也是SQS專門設計離群值感知窗口的原因。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新