這項由南開大學、北京理工大學、浙江大學、中國科學院自動化研究所、哈里工業大學及中關村學院等多家機構聯合開展的研究,以預印本形式發表於2026年7月,論文編號為arXiv:2607.17247,有興趣深入了解的讀者可通過該編號查詢完整論文。
你有沒有想過,那些能夠幫你寫代碼、解數學題、回答各種刁鑽問題的AI助手,究竟是怎麼變得越來越聰明的?說穿了,它們的"進化"過程其實和人類學習沒什麼本質區別——要麼自己反覆練習、在錯誤中成長,要麼找個更厲害的老師,跟著老師學新東西。然而,這兩條路各有各的麻煩,就像一個學生,光靠自己刷題會遇到瓶頸,而一味照抄高手答案又學不到真本事。這篇論文提出的"蒸餾強化學習
"(Distilled RL),正是為了解決這個兩難困境而生的。
一、兩條路,各有各的坑
要理解這項研究解決的問題,先得搞清楚AI模型目前主要用哪兩種方式來"變聰明"。
第一種叫做強化學習(RL)。打個比方,這就像一個學生靠自己做題、對答案來提高成績。AI每次給出一個答案,系統會告訴它"對了"或者"錯了",然後AI根據這個反饋調整自己的思路。這種方法的好處是AI完全依靠自己的力量成長,不會被外界帶偏;但壞處也很明顯——它只知道最終結果對不對,卻不知道中間哪一步出了問題。就好比你做了一道數學大題,老師只告訴你"算錯了",但不指出是哪個步驟出了差錯,你下次還是可能在同一個地方翻車。更關鍵的是,強化學習只能強化AI"本來就會的東西",對於那些AI從來沒見過、完全不會的知識,單純靠自我練習幾乎沒有用。
第二種叫做在線蒸餾(OPD)。這就像是讓一個學生跟著大師學藝——不是照著大師留下的筆記背,而是實時觀察大師如何解題,然後努力模仿大師的每一步思路。具體來說,AI學生自己先寫一個答案,然後逐字逐句地和AI老師(通常是一個更大、更強的模型)做對比,拼命讓自己的每個詞都和老師選的詞"口味相似"。這種方法的好處是反饋非常細緻,每個詞都有指導;壞處同樣顯而易見。當老師和學生本來就差不多時,學來學去也沒多少新東西;而當老師和學生差異很大時,強行模仿反而適得其反——就像讓一個剛學英語的人直接模仿莎士比亞的寫法,只會越學越亂。
研究團隊通過大量實驗,清晰地觀察到了這兩個問題的具體表現。在訓練曲線圖上,在線蒸餾在訓練開始階段進步飛快,但很快就撞上了天花板,成績開始停滯甚至下滑,尤其是在老師和學生來自不同"家族"(也就是結構和訓練背景差異很大)的情況下,這種崩塌更加明顯。強化學習則進步緩慢,但能持續爬升。把兩者直接混合使用的方案,在訓練後期同樣出現了性能下滑,說明單純疊加並不能解決根本問題。研究團隊還特別驗證了一件事:增加在線蒸餾時AI自己採樣的次數,並不能改善瓶頸——把採樣組數從1增加到4再增加到8,效果幾乎沒有變化。這說明問題的根源不在於"練得不夠多",而在於這種無條件模仿大師的學習方式本身有缺陷。
二、新方法的核心思路:讓老師成為"選擇性顧問",而不是"必須照搬的權威"
既然兩條路各有短板,研究團隊的思路是:把老師的指導融入進強化學習的過程里,但不是讓學生無條件地模仿老師,而是讓老師在關鍵時刻提供精準的、有選擇性的指導。這就是"蒸餾強化學習"(Distilled RL)的核心理念。
可以用一個學棋的比喻來理解整個框架。假設你在學圍棋,你的師傅(老師模型)是個高段位選手。傳統的在線蒸餾,就是讓你每走一步棋,都要努力模仿師傅在同樣情況下最可能走的那步,不管你走的這步棋最終是贏棋還是輸棋。而傳統的強化學習,只告訴你這盤棋最後贏了還是輸了,至於哪步棋下對了哪步棋下錯了,全靠自己猜。蒸餾強化學習則採用了一種更聰明的方式:它先讓你按照自己的想法下棋,然後看這盤棋最終的走向;只有當這盤棋整體來看是"值得學習的好局"時,才參考師傅在每一步棋上的偏好,讓你從師傅那裡汲取更多智慧;而當這盤棋本來就是一場失敗的爛棋時,就直接沿用原來強化學習的懲罰機制,不讓師傅的偏好來干擾"這步棋要受到懲罰"的判斷。
三、三個精妙的技術設計
這個框架的具體實現由三個環節組成,每個環節解決一個具體問題,三者合在一起才構成完整的蒸餾強化學習。
第一個環節叫"反向重要性採樣"。在強化學習中,有一個常用的技巧叫重要性採樣,它的作用是把"舊版AI選擇的方案"的權重,調整成適合"當前版AI"的權重。蒸餾強化學習把這個方向反過來了:它計算的是老師模型和舊版學生模型對每一個詞的"偏好差異比值"。具體來說,如果老師非常喜歡某個詞(老師選這個詞的概率遠高於學生舊版本),這個詞就會得到一個大於1的權重;反之,如果老師對某個詞不太感冒,這個詞就會得到一個小於1的權重。這個權重衡量的是"老師比學生舊版本更偏好這個詞的程度"。為了防止這個比值出現極端情況(比如某個詞老師極度偏愛但學生完全不用,導致比值爆炸性增大),設計中對這個比值做了截斷處理,把它限制在一個合理的區間內,確保訓練過程不會失控。
第二個環節叫"負樣本重置
"。這是整個方法中最精妙、也最關鍵的設計。回想一下前面下圍棋的比喻:當學生自己走的棋整體上是"好棋"(也就是這次回答得比較好、整體評分為正)時,引入師傅的偏好來調整每一步棋的權重是有意義的——師傅偏愛的步驟得到強化,師傅不喜歡的步驟被相對削弱,從而在"好的大方向"下實現更精細的優化。但當學生走的棋整體上是"爛棋"(這次回答整體評分為負)時,情況就不同了。在強化學習中,"爛棋"中的每一步都應該受到懲罰,讓AI知道"這麼走是不對的"。如果這時候還引入師傅的偏好,就會出現一個荒謬的結果:師傅偏愛的步驟,在"爛棋"里反而會因為權重變大而受到更嚴重的懲罰,等於在逼著AI故意避開師傅的思路。這顯然是錯誤的。負樣本重置的解決方案非常直接:當一個回答整體評分為負時,直接把所有詞的老師權重重置為1,也就是完全恢復到普通強化學習的狀態,讓原始的懲罰信號正常發揮作用,不讓師傅的偏好在錯誤方向上"幫倒忙"。
第三個環節叫"序列級幾何歸一化
"。這個設計解決的是一個更隱蔽的技術問題。AI生成一段文字時,是一個詞一個詞地往後寫的,而整段文字的總概率,是每個詞的概率相乘得到的。老師模型和學生模型畢竟是兩個不同的模型,它們對整段文字的"總體喜好程度"在數量級上就可能有很大差異。如果把所有詞的老師偏好比值直接相乘,結果可能非常小(遠小於1),這樣就相當於把好的回答整體"壓縮"了,讓訓練信號整體變弱,學不到什麼東西。幾何歸一化的做法是,對一個回答里所有詞的老師偏好比值做一次"整體校正"——把每個詞的比值除以這個回答里所有詞比值的幾何平均數,讓整體相乘結果等於1。這樣一來,老師的指導就不是在整體上放大或縮小這個回答的重要性,而是在回答內部重新分配學習的側重點:老師更偏愛的詞得到更多關注,老師不太偏愛的詞得到相對少一些的關注,而整體的學習力度保持不變。
四、一個優雅的"驗證實驗":用溫度來測試知識傳遞
光靠最終的評分表來說明效果還不夠直觀,研究團隊設計了一個非常巧妙的案例研究來直接展示蒸餾強化學習是否真的能傳遞知識。
這個實驗用了一個叫"熵"的概念來做測試。在AI語言模型的語境裡,熵可以理解為"AI在選詞時的不確定性"或者"AI選詞的隨機程度"——熵高說明AI給很多候選詞都分配了差不多的概率,不太確定選哪個;熵低則說明AI非常篤定地認為某個詞最合適。通過控制溫度參數(一個影響AI選詞隨機性的數值),可以人為地讓一個模型變得"更猶豫"(高溫度、高熵)或者"更果斷"(低溫度、低熵)。
實驗的巧妙之處在於,研究團隊不用一個更大的外部模型當老師,而是用學生模型自身當老師——但給了它一個會隨時切換的溫度控制規則:當學生當前的熵超過0.5時,老師就切換到低溫度(0.8),告訴學生"你現在太猶豫了,要果斷一點";當學生的熵低於0.5時,老師就切換到高溫度(1.2),告訴學生"你現在太死板了,要靈活一點"。
如果蒸餾強化學習真的能傳遞老師的分布特徵,學生的熵就應該在0.5附近來回振盪,跟著老師的溫度信號走。實驗結果清晰地顯示,學生的熵確實迅速向0.5靠攏,然後在這個目標區域附近持續振盪——老師降溫時學生熵下降,老師升溫時學生熵上升,整個系統像一個精準的恆溫器。這個實驗直接證明了蒸餾強化學習能夠把老師分布的特徵性質傳遞給學生,而這種傳遞是原始強化學習完全做不到的,因為原始強化學習的信號只有最終答案對不對,完全不包含任何關於分布特徵的資訊。
當去掉"負樣本重置"這個環節再做一遍同樣的實驗時,學生的熵就完全無法跟隨老師的溫度信號,始終維持在一個遠低於目標的水平。這個對比實驗非常直觀地說明了負樣本重置對於知識傳遞的關鍵作用——沒有它,在負樣本上反方向施加的老師偏好權重會抵消乃至壓制正樣本上的正確引導。
五、實驗結果:在各種難度的考場上都更勝一籌
研究團隊在多個評測維度上驗證了蒸餾強化學習的效果,對比對象包括三個基準:單獨使用在線蒸餾(OPD)、單獨使用強化學習(RL,具體採用GRPO算法)、以及兩者直接相加混合使用(OPD+RL)。測試的學生模型包括規模為15億參數的DeepSeek-R1-Distill-Qwen-1.5B(簡稱DSQW-1.5B)、規模為17億參數的Qwen3-1.7B以及規模為40億參數的Qwen3-4B,老師模型統一使用規模為80億參數的Qwen3-8B-GRPO。訓練數據集使用DAPO-17K,共訓練160步。
在最難的測試場景中,表現的差距最為顯著。DSQW-1.5B和Qwen3-8B-GRPO之間不僅參數規模差距懸殊,而且兩者來自完全不同的模型"家族"(一個是DeepSeek系列,一個是Qwen系列),推理風格和內部結構都有很大差異,這被稱為"跨家族蒸餾
"場景。在這個場景下,在線蒸餾雖然比不訓練要好,但比單純用強化學習還差,說明硬性模仿在家族差異很大時根本行不通。把兩者混合使用也沒有幫助,後期同樣出現性能下滑。蒸餾強化學習則實現了最大幅度的提升,把DSQW-1.5B的綜合成績從31.70分提升到了40.00分,比在線蒸餾高出4.73分,比純強化學習高出3.14分。
在Qwen3-4B這個"同家族"場景下,整體成績從46.33分提升到了58.96分,比在線蒸餾高出2.99分,比純強化學習高出1.56分。Qwen3-1.7B同樣實現了穩定的全面領先。訓練過程中的動態曲線也清楚地顯示,蒸餾強化學習的獎勵值始終保持在最高水平,策略的隨機性(熵)保持在一個適中且穩定的區間,既不會因為過於隨機而難以收斂,也不會因為過於保守而失去探索能力,回答長度也保持穩定,沒有出現"越回答越短"或者"越回答越囉嗦"的異常現象。
在知識類評測(MMLU-Pro和SuperGPQA)上,蒸餾強化學習同樣保持了競爭力,說明這種訓練方法沒有讓AI"只會解數學題",而是在提升推理能力的同時保留了廣博的通識知識。在Pass@16評測(也就是同一道題讓AI回答16次,看能不能至少有一次答對)上,蒸餾強化學習同樣表現最佳,說明它不僅提高了AI最常給出的那個答案的質量,還拓寬了AI整體的答題能力分布。
六、去掉某個環節會發生什麼
研究團隊還做了消融實驗,分別去掉負樣本重置和序列級幾何歸一化,來驗證每個設計的必要性。
去掉負樣本重置的後果是最嚴重的。在Qwen3-4B上,綜合成績平均下降了8.81分;在DSQW-1.5B上,平均下降了6.39分。這個下降幅度甚至比完全不用老師指導還要差,直接說明了在錯誤回答上盲目引入老師偏好,不僅沒有幫助,反而是有害的。前面提到的熵控制實驗裡,去掉這個環節後學生完全無法跟隨老師的溫度指令,也從另一個角度印證了這一點。
去掉序列級幾何歸一化的後果相對溫和一些,但同樣穩定地導致性能下降,在兩個學生模型上分別下降了1.24分和1.47分。這說明即使方向對了(只在正樣本上引入老師權重),如果不做整體校正,老師和學生之間的概率尺度差異還是會系統性地壓制學習信號,讓訓練效果打折扣。
七、這個方法還有什麼局限性
研究團隊在論文中也坦誠地指出了這個方法目前的不足之處。最核心的限制在於,整個訓練過程中老師只被用來評估學生自己寫出來的答案,而不是被要求自己先寫出正確答案來。這意味著訓練過程無法直接判斷老師對某道題是否真的會做。雖然負樣本重置機制在一定程度上緩解了這個問題(因為在學生自己也答錯的題目上,老師權重會被歸零),但仍然存在一個隱患:在那些學生答對了、但老師其實並不比學生強的題目上,老師的詞偏好權重可能反而是一種干擾,把學生往錯誤的方向引導。隨著訓練推進,學生的能力在某些領域可能超過了固定不動的老師,這時候老師的"意見"就會變得不那麼可靠。未來的改進方向可以考慮給老師設置一個"能力評估"機制,比如偶爾讓老師也完整地回答一道題來檢驗它是否真的會做,或者根據老師給出建議的一致性和置信度,動態調整對老師建議的參考程度。
說到底,這項研究解決的問題可以用最簡單的話來描述:以前的AI訓練方法,要麼讓AI只靠自己摸索(進步慢、遇到瓶頸),要麼讓AI無條件模仿老師(容易過擬合、跨家族時適得其反),而蒸餾強化學習找到了一條中間道路——讓老師在合適的時機、以合適的方式、選擇性地給出精細指導,而不是當一個學生必須全盤照搬的權威。實驗結果表明這條路走對了,尤其是在老師和學生差異最大的情況下,優勢最為明顯。對於普通用戶而言,這意味著未來的AI助手有望在更少的計算資源消耗下達到更高的推理能力,特別是那些規模較小、可以在普通設備上運行的AI模型,也能藉助更大模型的知識來彌補自身能力的不足,這對於AI技術的普惠化有著直接的推動意義。有興趣深入了解技術細節的讀者,可以通過arXiv編號2607.17247查閱完整論文。
Q&A
Q1:蒸餾強化學習和傳統知識蒸餾有什麼本質區別?
A:傳統知識蒸餾讓學生模型無條件地在每一步都模仿老師的詞概率分布,不管學生自己的回答好不好。蒸餾強化學習只在學生回答整體較好的情況下才參考老師的逐詞偏好,在學生回答較差的情況下會恢復為普通強化學習的懲罰機制,本質上是把老師的指導變成了"有條件的精細輔助"而不是"無條件的全面模仿"。
Q2:蒸餾強化學習為什麼在跨家族蒸餾里效果特別明顯?
A:跨家族指的是老師模型和學生模型來自完全不同的訓練背景和架構系列,二者的用詞偏好和推理風格差異很大。傳統在線蒸餾在這種情況下因為強行模仿而導致性能下降,而蒸餾強化學習通過負樣本重置和幾何歸一化,避免了對差異化分布的盲目跟隨,只保留了相對有用的老師偏好信號,因此在差異最大的場景下反而收益最顯著。
Q3:負樣本重置去掉之後為什麼成績會比不用老師還差?
A:當一個回答整體是錯誤的,強化學習本應對其中每個詞施加懲罰。但如果此時加入老師偏好權重,老師比較喜歡的詞反而會因為權重變大而受到更重的懲罰,等於在錯誤軌跡上把老師偏好當成了"需要避免"的行為來訓練,方向完全反了。這不僅浪費了老師的參考價值,還會主動把學生推向與老師相反的方向,造成比不引入老師還要差的結果。






