這項由字節跳動、中國科學院軟體研究所中文資訊處理實驗室及中國科學院大學聯合開展的研究,以arXiv預印本形式於2026年7月14日公開發布,論文編號為arXiv:2607.13124。有興趣深入了解技術細節的讀者可通過該編號查詢完整論文。
一、故事從一次"外科手術"開始
現代AI大語言模型,就像一座精密運轉的大型工廠,擁有數十億甚至數百億個零部件協同工作。然而,運營這座工廠的成本極其高昂——每次生成一段文字,都需要消耗大量的計算資源和電力。為了降低成本,工程師們會對這座工廠進行"瘦身手術",把一些看似不那麼重要的生產車間整個拆掉,讓工廠用更少的零部件繼續運轉。這個過程在技術上叫做"結構化剪枝"。
這種瘦身方法有個天然的好處:拆掉整個車間之後,工廠的結構依然是標準的、通用的,不需要任何特殊設備就能繼續運轉,這一點比其他一些只是把零件打個洞或者壓縮零件體積的方法要方便得多。
然而,手術之後出現了一個令人頭疼的問題:工廠在做選擇題方面表現依然不錯(比如判斷"這句話是正面的還是負面的"),但一旦要自己從頭寫一篇文章,質量就急劇下滑,甚至完全崩潰。這就好比一個人做了大腦手術後,還能回答"蘋果是紅色的嗎"這種判斷題,卻已經沒辦法自己寫一首詩或者講一個故事了。
研究團隊拿Qwen3-4B-Instruct這個模型做了實驗。這個模型原本有36個"生產車間"(即Transformer層),研究人員將其中9個最不關鍵的車間拆掉,參數量減少了約25%。結果,這個經過手術的模型在解數學題上的準確率從88%暴跌到了1%,寫代碼的能力幾乎歸零,在各種開放式問答任務上也全面潰敗。
這就是這篇論文想要解決的核心問題:如何在做完"縮減手術"之後,幫助這個受損的模型重新找回自由寫作的能力?
二、一個關鍵發現:能力沒有消失,只是被"壓制"了
在尋找解決方案之前,研究團隊先做了一件偵探式的工作——他們想搞清楚,手術之後,模型的寫作能力到底是永遠消失了,還是只是暫時被壓制住了?
他們的測試方法很有趣:讓這個受損的模型不只生成一次答案,而是生成很多次(比如64次),然後看這64次里有沒有至少一次是正確的。結果非常出人意料:在解數學題方面,當允許嘗試64次時,這個受損模型居然有91%的概率能給出正確答案,甚至略高於原始未受損模型直接給出的88%!
這說明什麼?這說明正確的答案其實還藏在模型腦子裡,只是模型每次開口"說話"時,不夠自信,總是選擇了錯誤的方向。就像一個真正懂得某道數學題的學生,因為過於緊張,每次考試時都寫錯了——但並不是因為他真的不會,而是因為某種"心理障礙"在作怪。
這個發現給了研究人員重要的方向:恢復這個模型的寫作能力,本質上不是"重新教會它知識",而是"幫它找到表達知識的正確路徑"。
三、另一個關鍵發現:模型在寫著寫著就開始"復讀"
研究團隊還發現了受損模型在生成文字時的另一個典型症狀:它特別喜歡在生成一段內容之後,陷入無休止的重複循環。就像一個正在講故事的人,講到一半突然卡殼,然後開始反覆說"然後……然後……然後……",永遠跳不出這個循環。
在參數減少25%這個"臨界點"上,模型生成的內容中有高達84%會在結尾部分陷入這種重複循環。更有意思的是,研究團隊用數據證明了這些重複的"尾巴"幾乎不攜帶任何有用的學習資訊——重複部分的資訊量(用一種叫做JSD散度的指標來衡量)只有正常部分的約1/35。換句話說,那些陷入循環的文字內容,就像一盤磁帶卡碟之後反覆播放的雜音,既沒有新資訊,也沒有糾錯的價值。
這個發現變成了後來設計解決方案時的核心出發點。
四、為什麼常規"補課"方法效果不好
面對受損的模型,最直覺的修複方式是給它做"補課"——收集大量高質量的問答數據,讓模型重新學習如何正確回答問題。研究團隊系統地測試了幾種常見的補課方法。
第一種是最簡單的方式:直接拿人工整理好的標準答案,讓模型對照著重新學習,類似於給學生發一本答案冊讓他抄。這種方法確實有一定效果,模型的綜合評分從5.7分(滿分假設為100分,原始模型約75分)提升到了21分左右,但依然遠遠不夠。
第二種方式稍微聰明一些:讓原始的、未受損的"老師模型"先把答案寫出來,再讓受損的"學生模型"去學習這些答案。這種方式效果略好,綜合評分提升到約28分。
第三種方式更進一步:不僅讓學生模型學習老師寫的答案,還在每個詞的層面上讓學生參考老師的"詞彙偏好"(即老師對每個可能的下一個詞賦予的概率分布)。這種方式綜合評分約30分。
但這三種方式都有一個共同的根本缺陷:它們都是讓受損的模型去學習別人寫的答案,而不是讓模型在自己真實的"思考狀態下"得到糾正。這就好比一個學生手抖寫字總是抖,你給他看再多別人寫的漂亮字帖都沒用——你真正需要的,是在他自己拿筆寫字、手剛開始抖的那一刻,立即告訴他"這裡抖了,應該這樣調整"。
五、正確的修復思路:在"自己的錯誤"上實時糾正
研究團隊採用的核心方法叫做"在線策略蒸餾"(On-Policy Distillation,簡稱OPD)。這個名字聽起來很學術,但背後的思路其實非常直觀。
具體操作是這樣的:讓受損的學生模型自己生成文字,同時讓原始的老師模型(也就是手術之前的完整版模型)站在旁邊實時觀看。學生每寫一個字,老師就在心裡給出一個參考答案——"這個位置我會選這些詞,概率分別是這樣的"。然後,通過一種數學上的"拉近"操作,讓學生模型下次在同樣位置時做出更接近老師的選擇。
這個過程有幾個重要特點。老師是完全"自給自足"的,不需要從外部找任何人標註數據或者設計獎勵機制——老師就是模型自己在手術之前的狀態,天然地知道"正確的分布"應該是什麼樣的。每一個生成的詞都會得到老師的實時反饋,而不是只在整篇文章寫完之後才得到一個"對"或"錯"的裁決。最關鍵的是,學生是在自己實際生成的文字上被糾正,而不是在別人寫的文字上。
從實驗數據來看,這種方法的效果遠超之前所有的補課方式,綜合評分直接跳升到約48至50分,是受損未修復狀態的將近9倍,也比最好的傳統方法高出了將近18分。
六、但這裡有個棘手的問題:老師在給無用內容評分
然而,直接套用這個在線實時糾正的方法,在實際操作中會遇到一個嚴重的效率問題:受損模型在訓練初期生成的內容,有高達55%至75%都是那種陷入循環重複的"廢話尾巴"。
當受損學生模型生成了一段循環廢話,老師模型也跟著把這段廢話讀了一遍。問題在於,老師模型發現,這段廢話其實挺"合理"的——在循環開始之後,繼續循環確實是概率最高的選項!所以老師給出的反饋是"繼續循環吧,這挺對的",而學生的分布也已經在循環這件事上與老師基本一致,雙方都覺得循環是對的,從數學上看幾乎沒有任何可以改進的信號。
結果就是:在訓練的最初階段,大量的時間和計算資源都被浪費在處理那些無用的重複尾巴上,真正有價值的學習信號(也就是那些正常生成的、資訊量豐富的前半段文字)卻被稀釋了。研究團隊在實驗中發現,用固定長度預算訓練時,大約需要到第80步才能真正進入有效學習階段,前80步幾乎都是在原地踏步。
七、ShortOPD:從短到長,智能分配"學習時間"
為了解決這個問題,研究團隊提出了他們的核心創新:ShortOPD,即"從短到長的在線策略蒸餾"。
核心思路可以這樣理解:既然訓練早期模型總是寫著寫著就開始循環廢話,那就不要讓它寫那麼長。把每次生成的最大長度限制到一個較短的範圍內,讓模型只寫它目前還能寫好的那部分。隨著訓練的進行,模型的能力逐漸恢復,循環廢話越來越少,再逐步放開長度限制,允許模型挑戰更長的生成任務。
但具體怎麼判斷"現在應該寫多長"呢?研究團隊設計了一套自動化的檢測和控制系統,完全不需要人工介入。
這套系統會持續監測三個信號。第一個信號是"循環重複率":每批次生成的內容里,有多少比例陷入了終止性的循環重複?第二個信號是"截斷率":那些沒有陷入循環的生成內容里,有多少在達到當前最大長度限制時還沒寫完?第三個信號是"有效長度":每次生成的內容里,真正有用的部分(不含循環廢話尾巴)平均有多長?
控制邏輯遵循兩個規則:當循環率高時,把最大生成長度縮短,縮短到大約"當前有效長度的1.15倍"這個範圍;當循環率低、且同時有大量內容在達到長度上限時還沒寫完(說明模型已經準備好挑戰更長的內容了),就把最大生成長度提高25%。為了避免每批次的隨機波動導致系統反覆橫跳,所有統計數據都經過指數移動平均來平滑處理,長度變化本身也經過平滑處理,避免突然劇烈變化。
這套系統的妙處在於:它不需要任何額外的計算——所有用於判斷的數據,都是在正常訓練過程中已經產生的,不需要額外跑一遍模型。
八、實驗結果:數字說話
實驗在數學、代碼和開放式問答三個完全不同的領域同時進行,使用了超過45000個訓練樣本。受損模型在25%參數被剪掉後的綜合評分約為5.7分。經過一輪ShortOPD訓練後,綜合評分達到約48.5分,恢復到了原始完整模型75.2分的64.5%。
在計算效率上,對比最直接的傳統固定長度訓練方式,ShortOPD節省了約71%的詞元生成量,訓練時間從35.9小時縮短到8.5小時,卻只損失了不到2分的最終效果(48.5分對比50.2分,或49.6分)。換句話說,用約四分之一的訓練時間,達到了接近完整訓練的效果。
研究團隊還測試了擴展訓練輪次的效果:訓練一輪綜合評分為48.5分,兩輪為53.5分,三輪達到55.4分,已經恢復到原始模型的73.7%。這說明隨著更多訓練,效果還能繼續提升。
關於"稀疏獎勵"方法(即只在整篇答案對了之後才給獎勵的強化學習方式)的對比也很有說服力:同樣只用數學題訓練,使用強化學習的兩種變體(PPO和GRPO)幾乎沒能改善受損模型(準確率分別提升0.23和1.59個百分點),而ShortOPD在同樣的數學題上訓練後準確率提升了約37個百分點。背後的原因很直接:受損模型很少能自己寫出正確答案,所以幾乎沒有"正確答案"可以被獎勵——獎勵信號太稀疏,根本沒有足夠的資訊來引導學習。
九、訓練數據的覆蓋範圍也至關重要
研究團隊還做了一組非常有啟發性的消融實驗:如果訓練數據只覆蓋部分領域,會怎樣?
當訓練數據去掉所有數學題時,模型在數學上的恢復幾乎為零(GSM8K準確率只有8%,而完整數據集訓練能達到62.7%)。當訓練數據去掉所有代碼題時,代碼執行成功率暴跌到接近0(HumanEval只有0.61%,MBPP只有2.33%)。這說明,模型的寫作能力必須在特定類型的任務上練習,才能在那類任務上得到恢復——沒有數學題,就不會恢復數學寫作能力;沒有代碼題,代碼生成能力就無從修復。
這意味著訓練數據的覆蓋範圍不是一個技術細節,而是整個恢復方案中的一個核心設計決策。如果你希望恢復某個領域的能力,就必須確保訓練數據覆蓋了那個領域的提示詞。
十、一個有趣的發現:選擇題和作文題的恢復互不相保
研究團隊還附帶測試了恢復後的模型在多項選擇題上的表現。結果揭示了一個值得深思的現象:ShortOPD主要提升了生成寫作能力,但在多項選擇題上的準確率(67.6分)低於那些專門針對選擇題優化的傳統方法(SFT約74.9分,KD約74.4分)。
這並不令人意外——選擇題考查的是在給定選項中評分排序的能力,而這恰好是傳統方法(讓模型學習外部寫好的固定文本序列)擅長的事情。ShortOPD讓模型在自己寫作時更像原始模型,但這不等於讓模型在看別人寫的文字時也更像原始模型。
研究人員隨後嘗試了一種"組合拳":先用傳統SFT方法做一輪基礎訓練,再用ShortOPD做第二輪訓練。結果顯示,這種組合方式在選擇題(76.8分)和寫作生成兩個方向上都達到了接近原始完整模型的水平,說明兩種方法是互補而非對立的。
說到底,這項研究解決的是一個長期被忽視的實用問題:AI模型壓縮後的"寫作能力崩潰"。過去大家只看選擇題成績,覺得壓縮沒問題,但真正部署時才發現模型已經不會好好寫文章了。這項工作清晰地指出了問題所在,並提供了一套實驗驗證有效的解決方案——在模型自己的寫作過程中實時糾正,並智能地管理訓練初期的無效循環內容。
當然,研究團隊也坦率地指出了工作的局限性:目前的實驗主要集中在一種特定的剪枝方法和一個特定的模型系列上,25%的參數減少量是這個方案有效的"臨界點",壓縮超過這個比例,模型會進入更混亂的"胡言亂語"狀態,這套方法是否依然有效還需要進一步驗證。更大的模型、更多的剪枝方式,以及"到底壓縮到什麼程度就徹底沒救了"這個邊界問題,都留給了未來的研究。
對於普通人而言,這項研究意味著:未來你在手機、電腦或各類AI助手上用到的大語言模型,可能是經過了更充分剪枝壓縮、運行更省電更快速的版本,但你與它對話時感受到的寫作質量,並不會因此大打折扣。有興趣深入了解技術細節的讀者,可通過arXiv編號2607.13124查閱完整論文。
Q&A
Q1:結構化剪枝為什麼會導致大語言模型寫作能力崩潰?
A:結構化剪枝是將模型中整個"車間"(Transformer層)拆掉的操作。寫作需要模型在生成每一個詞時做出正確的概率選擇,並沿著自己的選擇繼續生成,這是一個鏈式過程,任何一步出錯都會累積放大。剪枝後,模型在這種鏈式生成時頻繁選錯方向,最終陷入循環重複,而選擇題只需在給定選項里評分,受影響小得多。
Q2:ShortOPD訓練時為什麼要動態調整生成長度?
A:因為訓練初期受損模型生成的內容大部分是無意義的循環廢話,而處理這些廢話既耗費計算資源,又幾乎不能提供有效的學習信號(老師和學生在"循環是對的"這件事上高度一致,沒有糾正空間)。動態縮短生成長度,讓模型只寫它目前能寫好的部分,然後隨著能力恢復再逐步放開長度,能把有限的訓練資源集中在真正有價值的內容上。
Q3:為什麼強化學習方法對受損模型幾乎沒有效果?
A:強化學習依賴"正確答案"才能給出獎勵信號。但受損模型本身很少能自己寫出正確答案,正確答案出現的概率極低,可供獎勵的機會極少,學習信號極度稀疏,模型幾乎得不到任何有意義的反饋。相比之下,ShortOPD在每一個詞上都給出老師的參考分布,無論答案最終是否正確,每個詞都有學習信號。






