2024年8月的一天,如果你去問任何一個正在做大模型後訓練的工程師"蒸餾可靠嗎",他大概率會告訴你:可靠,效果穩定,業界都在用。
但如果你追問一句"你確定學生學到的是老師的能力,而不只是記住了那幾道訓練題的答案",很多人會愣住。
這正是這篇論文想要戳穿的一個盲區。過去幾年,"在線策略蒸餾"這項技術已經悄悄成為大語言模型訓練的標配武器,從Kimi到DeepSeek,幾乎所有頭部模型的技術報告裡都能看到它的身影。可是幾乎所有的評測方式都有一個共同的毛病:只在訓練用的那個領域、那個語言、那種題目難度上評分。這就好比你教一個學生做數學題,只在他刷過的那套卷子裡出題考他,然後驕傲地宣布"教學效果顯著"。他到底是學會了解題的思路,還是僅僅背下了這幾道題的答案,你根本無從分辨。
這篇來自中科大、北大、浙大等機構聯合團隊的論文,就是要把這層遮羞布掀開,看看蒸餾出來的能力,到底能走多遠。
一件反直覺的事:老師做不出來的題,照樣有用
在講清楚這篇論文的方法之前,得先說說"在線策略蒸餾"到底是什麼,為什麼它會成為主流。
在線策略蒸餾
在線策略蒸餾(On-Policy Distillation,簡稱OPD):讓學生模型自己生成答案,然後老師模型對學生生成的這些內容逐字逐句評分指導,而不是讓學生去背老師寫好的標準答案。
這個設計思路其實解決了傳統蒸餾的一個老毛病。以前教小模型的常見做法是,讓大模型(老師)寫一堆解題過程,然後把這些過程餵給小模型(學生)去模仿。問題是,學生自己實際做題時說的話,和老師寫的範文往往不是一個路數,等真正上考場,學生按自己的方式往下寫,寫著寫著就發現自己從沒被這樣訓練過,越寫越亂。這在學術上叫"曝光偏差"(exposure bias)。
在線策略蒸餾的解法很直接:既然學生遲早要用自己的話答題,那就乾脆讓學生現場答題,老師在旁邊實時點評每一個字寫得好不好。這就像請了一位家教,不是甩給你一本參考答案讓你自己背,而是坐在你身邊,看著你寫作業,你寫一步他就在旁邊說"這步不對,應該往這個方向想"。
這裡研究者們發現了一件很反直覺的事情。他們做了個實驗:把訓練題目按照老師能不能做對分成三類,一類是老師穩贏的簡單題(連續四次採樣全部答對),一類是老師根本做不出來的難題(四次採樣全部答錯),還有一類是隨機混合的題。
按照常識,你會覺得肯定得挑老師會做的題來教學生,老師自己都不會的題,怎麼可能教得好學生?
可實驗數據顯示,這三類題目訓練出來的學生,最後成績幾乎一模一樣。
論文原圖(圖1)里畫得很清楚,Qwen3-32B教Qwen3-8B、Polaris-7B教兩個不同大小的學生模型,簡單題、難題、混合題這三條曲線在訓練兩百步之後收斂到了幾乎重合的水平線上。他們還專門找了極端案例來驗證,用小學生水平的GSM8K題目(簡單到不能再簡單),和DeepMath-103K里最難的那批題(老師大概率也做不出來),結果依然是差不多的效果,還能恢復默認混合訓練效果的80%以上。
這說明了什麼?
在線策略蒸餾教給學生的其實不是"這道題的正確答案",而是老師面對問題時的思考方式和推理習慣。
就像一個老棋手指導你下棋,即使他自己沒能算清楚這盤殘局的勝負,他每一步落子時展現出的判斷邏輯,依然能讓你學到東西。他"輸了"這盤棋這個事實並不重要,重要的是他每一步棋背後的算路和權衡,這才是真正可以傳授的東西。
不過研究者們也發現了一個更聰明的調整方式:不是看老師能不能做對,而是動態盯著學生自己的做題情況。一旦學生已經能穩定做對某道題了,就該把這道題從訓練集裡拿掉,因為再讓老師在這道題上反覆"糾正"學生,已經沒有意義了,反而是浪費訓練資源。這就好比一個孩子已經能熟練地繫鞋帶了,家長還非要天天盯著他繫鞋帶糾正姿勢,孩子既煩,進步也慢,不如把這份精力挪到孩子還沒掌握的技能上。這個小調整帶來的提升雖然只有零點幾個百分點,但邏輯是站得住的。
最要命的分水嶺:老師和學生是不是"一個師門"出來的
如果說前面這個發現只是讓人意外,那接下來這個發現才是這篇論文真正的重頭戲,也是理解全文邏輯的一把鑰匙。
同源模型 / 異源模型
同源(Same-Origin):老師模型和學生模型是從同一個基礎模型出發訓練來的,好比學生是從某個基座模型直接微調(SFT)而來,老師則是在同一個基座模型上做了強化學習訓練。
異源(Cross-Origin):老師和學生壓根不是從同一個基礎模型出發的,是兩條完全不同的血統。
研究者做了一系列對照實驗,讓同一個學生模型分別接受一個同源老師和一個異源老師的指導,然後在英語數學、中文數學、長鏈條推理題(需要串聯多個子問題才能解出的複雜題)這幾個完全不同的場景下考核。
結果非常打臉常識:更強的老師並不一定教出更強的學生。
比如論文裡有一組對照,DS-distill-7B這個學生模型,同源老師是Polaris-7B,異源老師是Light-R1-14B。單看這兩位老師自己的能力,Light-R1-14B明明分數更高,是個更厲害的選手。可讓它去教學生之後,學生的表現反而不如那個"弱一點"的同源老師教出來的效果。尤其是在長鏈條推理這類需要跨領域遷移能力的題目上,異源老師教出的學生幾乎沒有明顯進步,跟沒訓練之前差不多。
而同源師徒對之間發生的事情,堪稱神奇:學生會被穩穩地拉到接近老師的水平線上,不管是在訓練用的英語數學題上,還是壓根沒訓練過的中文數學題、長推理鏈題目上,都是如此。
論文給出的解釋是,模型的"出身"決定了兩者之間的策略分布有多接近。
在線策略蒸餾本質上是在用KL散度(一種衡量兩個概率分布差距的數學指標)把學生的輸出概率拉向老師的輸出概率。
如果學生和老師本來就是同一個祖先訓練出來的,兩者輸出概率的"底子"本身就很接近,訓練過程能做到的是把兩者在整體策略層面對齊,這種對齊一旦發生,就會自動擴散到各種沒見過的場景里去,因為學生學到的不是某個領域的具體技巧,而是老師整套思考問題的方式。
但如果老師和學生根本不是一路人,兩者概率分布之間的鴻溝太大,訓練頂多能做到讓學生在訓練數據覆蓋的那個特定分布上表現得更像老師,一旦離開這個分布,學生立刻打回原形。
這裡有個特別直觀的類比:想像你要模仿一個人的說話口音。如果你倆本來就是老鄉,從小聽著同樣的方言長大,只是後來一個走南闖北多學了幾個新詞,那你稍微跟他聊聊天,很快就能把新詞的發音習慣學到手,甚至連他沒教你的其他場合說話你都能自然帶上那個味兒。可如果對方是外國人,說的是完全不同語系的語言,你死記硬背下來的那幾句話,頂多是鸚鵡學舌,換個場景立刻露餡,因為你壓根沒學到那套發音的底層邏輯,只是背下了幾個固定搭配。
如果不做這個區分會怎樣?
那就是很多團隊會犯的錯誤:只看老師模型的絕對分數高不高,卻完全沒考慮師生之間的血緣關係,結果精心挑選了一個"最強"的老師,訓練出來的效果反而不如隨手找個同源的"弱"老師。這不是理論上的空談,論文裡的實驗數據白紙黑字地證明了這一點。
論文還專門去量化驗證了這個"血緣假說"。他們測量了訓練過程中,學生和老師在每一步預測下一個詞時,兩者給出的候選詞集合(取概率最高的16個詞)有多大重疊。結果發現,同源師生對的重疊率隨著訓練推進是穩步上升的,而異源師生對的重疊率要麼原地踏步,要麼反而下降。
這說明同源蒸餾是在把學生的整套策略往老師那邊挪,而異源蒸餾只是在訓練數據那一小片區域裡把兩者的差距壓低了而已,壓根沒有實現更廣泛的對齊。
老師教的東西,會不會"越界"跑到別的學科去?
搞清楚了同源異源這個變量之後,研究者接著拋出了第二個重磅問題:如果只用數學題訓練學生,學生會不會順帶在代碼、科學這些完全不相干的領域也變強?
答案是:會,前提還是那個老規矩,得看師生是不是同源。
論文裡做了個很乾淨的實驗設計。用數學題目訓練學生,然後拿代碼能力測試基準LiveCodeBench和科學問答基準GPQA-Diamond去考它。同源情況下,無論是用數學題訓練還是直接用代碼題訓練,最後學生在代碼測試上的表現幾乎一樣好,都能接近老師的代碼水平。反過來也成立,用代碼題、科學題甚至是"遵循指令"這類跟數學八竿子打不著的任務去訓練學生,學生的數學能力照樣會顯著提升,甚至連中文數學、長鏈條推理這些更細分的場景都能受益。
這背後的邏輯跟前面提到的是同一件事:同源老師和學生因為出身相近,蒸餾訓練做的是整體策略層面的對齊,這種對齊一旦形成,會自然輻射到老師所有的能力維度上,而不管訓練時用的是哪個學科的題目。
而異源師生對呢?直接用代碼數據訓練出來的效果,明顯好於用數學數據訓練但拿代碼來考的效果,兩者之間有一道清晰的鴻溝。這說明異源蒸餾頂多是在訓練用的那批題目分布附近做局部微調,壓根沒有實現能力的跨界流動。
這裡可以打個比方:你請了一位私教幫你練體能,如果這位私教本來就深諳你的身體狀況和運動習慣(同源),那他哪怕只帶你練了幾周跑步,你會發現自己游泳、打球的耐力也跟著變好了,因為他鍛煉的是你整體的心肺功能這個底層能力。可如果這位私教對你完全陌生,只是照本宣科地按一套通用教案帶練(異源),那他教你跑步能讓你跑步進步,但游泳該多差還是多差,因為壓根沒有觸及底層能力,只是在表面動作上做了些調整。
如果不管這個跨領域效應會怎樣?下一節會告訴你答案,這才是這篇論文真正讓人後背發涼的地方。
當你想同時請多位老師,會發生什麼
前面所有的鋪墊,都是為了引出這篇論文最實用也最critical的發現:多教師蒸餾(Multi-Teacher OPD,簡稱MOPD)里潛藏的一個巨大的隱患。
多教師在線策略蒸餾
MOPD:現在業界流行的做法是,找好幾位專精不同領域的老師模型(比如一位數學專家、一位科學專家),把不同領域的題目分別路由給對應的專家老師去指導,理論上這樣能"拼裝"出一個全能型學生。
這個設計思路聽上去無懈可擊:數學題交給數學老師批改,科學題交給科學老師批改,各管一段,互不干擾,最後學生應該能把各位老師的看家本領都學個遍。
但前面已經證明了,老師的影響力壓根不會乖乖待在自己被分配的那個學科里,它會"越界"滲透到別的領域。這就意味著,當你把好幾位老師湊在一起同時訓練一個學生時,各位老師看似分工明確,實際上卻在暗中"搶地盤",爭奪學生在各個能力維度上的話語權。
研究者用兩個數學能力強但科學能力弱的模型JustRL-1.5B,和一個科學、指令遵循能力強但數學偏弱的模型Nemotron-1.5B,做了一組極具戲劇性的實驗。
設定一:JustRL當數學老師,Nemotron當科學/指令遵循老師,把兩者分配給學生的題目比例不斷調整。結果發現,隨著分配給JustRL(數學老師)的題目比例逐漸增加,學生在科學測試GPQA-Diamond、代碼測試LiveCodeBench、指令遵循測試IF-Eval上的分數居然全都跟著往下掉,而這幾門科目本該是Nemotron負責教的。更誇張的是,在科學測試上,因為JustRL自己的科學水平比學生原本的水平還差,這種"越界"的拖累甚至讓學生的科學分數一度跌破了訓練前的起點。
設定二:把兩位老師的角色對調,讓Nemotron當數學老師,JustRL當科學/指令遵循老師。這時候原本會下跌的那三門科目反而隨著Nemotron份額的增加而上升,方向完全反了過來。
這說明什麼?學生某個領域的最終表現,壓根不是由"名義上"負責這個領域的老師決定的,而是由整個混合體系里,哪位老師分到的題目份額更大來決定的。份額大的老師,會把自己的整體水平"拽"過來,無論這位老師負責的名義領域是什麼。
論文管這個現象叫蹺蹺板效應(seesaw effect)。這個詞選得很妙,因為它精準描述了這種此消彼長、互相拉扯的動態平衡:你多給一個老師加點份量,蹺蹺板這頭就往下沉,另一頭(另一位老師主導的能力)就翹起來。
研究者甚至還觀察到了訓練過程中一場真實的"拉鋸戰"。在長鏈條推理測試AIME24-Horizon-2上,訓練初期學生的表現會先跟著數學能力更強的那位老師走,訓練到後期又慢慢被拉回到另一位老師的水平線上,就像拔河比賽里繩子的中心點先往這邊挪、又往那邊挪,最終停在哪裡,取決於兩邊選手(老師)各自的"力氣"(能力水平和分配比例)。
為了把這個現象看得更清楚,研究者還做了一個"級聯蒸餾"實驗:先用科學能力強的Nemotron和科學題目訓練一段時間,學生的科學分數應聲上漲,緊接著切換成用JustRL和數學題目繼續訓練,學生的科學分數居然又原路掉了回去。這就像一個人先跟著一位教練苦練三個月游泳,成績眼看著提升,結果換了個只練田徑的教練之後,游泳成績又慢慢退步回去了,因為身體資源和訓練重心被重新分配了。
這裡最值得琢磨的一個類比是:想像你同時請了兩位家教輔導孩子,一位專攻數學,一位專攻英語,你覺得這樣安排孩子就能數學英語兩不誤。可如果這兩位家教實際上都在無意中影響孩子的整體學習習慣和思維方式(比如做題的嚴謹程度、時間分配的偏好),那麼哪怕英語老師從來不教數學,只要他每周來的次數比數學老師多,孩子做數學題的風格也會不知不覺往這位英語老師的整體風格上靠。如果不去正視這種"越界影響",家長可能會一直以為"孩子數學不好,肯定是數學老師教得不到位",卻完全想不到問題出在英語老師占用的比重太大,把孩子的整體狀態往另一個方向帶偏了。
這也是這篇論文提出的一個很有價值的診斷思路:當你發現一個多教師訓練出來的模型在某個領域表現不佳時,別急著怪罪那個"名義上"該負責這個領域的老師,很可能真正的元兇是另一位老師的"跨界拉扯"在起作用。
同源師生之間到底發生了什麼
論文的最後一部分,試圖回答一個更本質的問題:為什麼同源蒸餾能實現整體對齊,而異源蒸餾做不到?
研究者用了一個叫"Top-K重疊率"的指標去量化觀察。簡單說,就是每次學生預測下一個詞時,看它給出的最可靠的16個候選詞,跟老師給出的最可靠的16個候選詞,重合了多少個。
這個指標隨著訓練推進的走勢,在同源和異源兩種情況下呈現出完全不同的圖景。同源師生對的重疊率一路走高,從訓練開始時就已經比異源師生對高出一截,然後隨著訓練步數增加持續攀升。而異源師生對的重疊率則原地不動,甚至有下降的趨勢。
這個結果很關鍵,因為兩種情況用的是完全同一套訓練目標(同一個KL散度損失函數),卻訓練出了截然不同的效果。這說明同源蒸餾做到的是把學生整套輸出概率分布,往老師那個方向整體挪動,而異源蒸餾充其量是在訓練數據覆蓋的那一小塊區域上,把兩者的差距降下來了而已,壓根沒觸及到策略層面的深層對齊。
研究者進一步把這個發現套回到多教師蒸餾的場景里驗證,結果證實同源老師在蹺蹺板效應里的"拉力"明顯更強。他們用DS-distill-7B作學生,同源的Light-R1-7B當數學老師,異源的Light-R1-14B當科學/指令遵循老師,結果發現哪怕在兩位老師份額對半分的情況下,學生的科學能力依然被那位"份量並不占優"的同源數學老師拽著走。
這說明"血緣"這個因素帶來的影響力,甚至比訓練數據的份額比例還要更強勢。
論文中一個值得單獨拎出來說的細節是,在其中一組同源實驗裡(Light-R1-14B教DS-distill-14B),蒸餾出來的學生模型在長鏈條推理測試上,最終成績居然超過了老師自己的獨立表現。這說明同源蒸餾訓練出的學生,並不一定被老師的水平天花板鎖死,這個結論多少有點反常識,值得後續研究再深挖一下這個"青出於藍"的機制到底是怎麼發生的。
寫在後面
讀完這篇論文,最讓我意外的一點,是那個"教師從不解題的題目照樣有用"的實驗結果。這個結論其實間接回應了一個我一直沒想清楚的問題:為什麼大家在做強化學習和蒸餾的數據篩選時,總喜歡用難度過濾這種簡單粗暴的手段,卻很少有人真正驗證過這個篩選到底有沒有必要。這篇論文用紮實的對照實驗說明,至少在在線策略蒸餾這個場景下,難度篩選可能是個偽命題,真正重要的變量藏在別處,也就是師生的血緣關係上。
另一個讓我反覆咂摸的點是蹺蹺板效應這個發現。它其實揭示了一個更普遍的道理:任何試圖用"路由分工"來實現模組化組合的系統,都可能面臨類似的隱患,如果各個模組之間的影響力壓根沒有被真正隔離開的話。這讓我聯想到多智能體系統里的類似問題,幾個分工明確的智能體協作時,會不會也存在這種誰的話語權大誰就主導全局風格的暗流?這篇論文沒有回答這個問題,但它提供了一個很好的診斷框架,遇到類似的"分工卻互相干擾"的現象時,不妨先去檢查各個組件之間是不是存在這種隱性的"血緣"或"權重"因素在起作用。
Q&A
Q1:在線策略蒸餾和傳統的知識蒸餾有什麼區別?
A:傳統蒸餾讓學生模仿老師寫好的答案,容易出現訓練內容和學生實際生成方式不匹配的問題。在線策略蒸餾則是讓學生自己生成答案,老師對學生生成的內容逐字評分指導,這樣能減少訓練和實際使用之間的偏差。
Q2:為什麼同源的老師模型比更強的異源老師模型效果更好?
A:因為同源模型(從同一個基礎模型訓練而來)的輸出概率分布本身就更接近,蒸餾訓練能實現整體策略對齊,這種對齊能擴散到各種沒訓練過的場景。異源模型分布差距太大,訓練只能在訓練數據覆蓋的範圍內起效,泛化能力弱。
Q3:多教師蒸餾中的蹺蹺板效應具體是什麼意思?
A:指在同時用多位專精不同領域的老師訓練一個學生時,某位老師的份額增加,會把學生在各個能力維度上的表現都往這位老師的整體水平拉,而不只是拉動這位老師名義負責的那個領域,導致各領域能力此消彼長。






