宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

{給一個學生請四個家教,結果三個提前放假一個還在補課:D3-MOPD如何讓AI蒸餾不再「一刀切」}

2026年09月04日 首頁 » 熱門科技

你有沒有想過這樣一個場景:給一個孩子同時請了數學、編程、寫作三個家教,每周固定分配兩小時給每門課,雷打不動。

三個月後會發生什麼?

數學家教教的內容孩子早就會了,兩小時基本在浪費時間。編程剛學出點門道,正是突破瓶頸的關鍵期,可惜時間到了就得下課。寫作才剛起步,連基礎語法都沒搞明白,同樣只有兩小時。

這不是一個假設,這正是當下大語言模型訓練領域裡,一個真實存在卻長期被忽視的問題。

**核心問題:固定課表,浪費了誰的時間**

先說清楚背景。現在做AI大模型,一個越來越流行的做法叫"多教師蒸餾給一個學生請四個家教結果三個提前放假一個還在補課D3MOPD如何讓AI蒸餾不再一刀切"。

**蒸餾*:這裡不是化學實驗室里的蒸餾,而是指讓一個小模型(學生)去學習模仿一個或多個大模型(教師)的行為方式,目標是讓學生模型學到教師模型的能力,同時體積更小、跑得更快。

想像你要培養一個全能型選手,但沒有哪個教練是全能的。於是你找了四位專項教練:一位專教數學解題,一位專教寫代碼,一位專教怎麼聽懂並執行複雜指令,還有一位專教怎麼熟練使用各種工具。你希望這個學生把四位教練的本事都學到手,最後靠一個人就能頂四個專家用。

這個思路本身沒問題,業內已經有不少團隊在這麼幹,論文裡提到的MiMo-V2-Flash給一個學生請四個家教結果三個提前放假一個還在補課D3MOPD如何讓AI蒸餾不再一刀切、DeepSeek-V4給一個學生請四個家教結果三個提前放假一個還在補課D3MOPD如何讓AI蒸餾不再一刀切、GLM-5給一個學生請四個家教結果三個提前放假一個還在補課D3MOPD如何讓AI蒸餾不再一刀切等都用了類似的技術路線。問題出在"怎麼分配學習時間"這件事上。

目前行業里的標準做法是:訓練開始之前,先定好每個領域該分多少比例的練習題,比如數學25%、代碼25%、指令遵循25%、工具使用25%,然後從頭到尾,雷打不動地按這個比例訓練,直到訓練結束。

論文的研究者做了一個很直接的實驗來驗證這套固定課表到底有多浪費。他們把數學、代碼、指令遵循這三個領域拆開單獨訓練學生模型,然後觀察一個叫"反向KL散度給一個學生請四個家教結果三個提前放假一個還在補課D3MOPD如何讓AI蒸餾不再一刀切"的指標怎麼隨時間變化。

**反向KL散度(reverse-KL)*:可以理解成"學生和老師之間還差多遠"的一個數字。這個數字越小,說明學生的回答方式越接近老師;數字趨近於零,基本就是學到位了。之所以叫"反向",是因為它是拿學生自己生成的內容去對照老師的判斷,而不是反過來,這樣能更真實地反映學生在實際做題時的表現,而不是死記硬背老師的答案。

結果很直觀。數學領域的學習曲線,前四分之一的訓練時間裡斷崖式下降,之後基本走平,說明學生很快就學會了,後面基本在原地踏步。代碼領域下降得比較慢但一直在降,訓練結束時都沒看到明顯收斂的跡象。指令遵循這個領域最特殊,它的絕對數值比另外兩個領域高出一到兩個數量級,而且到訓練結束都還在持續下降,完全沒有觸底的意思。

三個領域,三種完全不同的節奏。

接著研究者把這三個領域放到一起,用固定的三分之一比例聯合訓練,再看結果。代碼領域大概在第48步就進入了低KL的平穩期,數學在第96步左右達到平穩,指令遵循要等到第144步才趨於平穩。

可訓練總共設計跑了256步,固定比例意味著從第48步之後,超過200步的時間裡,代碼領域依然拿著三分之一的訓練資源,卻幾乎學不到新東西了。

這就是問題所在。

**固定的資源分配方式,沒有考慮到每個學習任務的收斂速度天差地別這個事實。**

回到開頭請家教的例子。如果數學家教發現孩子早就會了,卻因為課表寫死了必須上滿兩小時,這兩小時對孩子的成長貢獻幾乎為零,而編程課本可以多上一小時,正好能抓住那個"剛好卡在瓶頸上"的關鍵突破期,結果因為課表限制,只能幹巴巴地看著孩子在瓶頸期原地打轉。

時間是有限的,課表定死了,浪費掉的每一分鐘都回不來了。

**D3-MOPD給一個學生請四個家教結果三個提前放假一個還在補課D3MOPD如何讓AI蒸餾不再一刀切的設計思路:把課表變成動態的**

面對這個問題,論文提出的解決方案叫D3-MOPD,全稱是"面向多教師在線策略蒸餾的動態領域調度"。

這個名字聽起來複雜,核心邏輯其實很簡單:既然反向KL散度這個信號已經在訓練過程中被計算出來了,為什麼不拿它來實時調整每個領域該分配多少訓練資源?

論文裡有一句話我覺得說得挺到位,大意是"這個信號本來就有,只是被浪費了"。這種"廢物利用"式的設計思路,某種程度上比重新發明一個全新指標更聰明,因為它不需要額外的計算成本,不需要改動核心訓練邏輯,只是把已經算出來但沒被充分利用的數據,重新利用了一遍。

具體怎麼做的?系統里加了兩個新組件。

第一個叫"離進程觀察器給一個學生請四個家教結果三個提前放假一個還在補課D3MOPD如何讓AI蒸餾不再一刀切"(off-process watcher)。

**離進程*:意思是這個監控程序是單獨跑在訓練主流程之外的,不會占用訓練本身的計算資源,也不會拖慢訓練速度,相當於一個悄悄在旁邊記筆記、時不時給出建議的助教,不干擾主課老師上課。

這個觀察器每隔10步就檢查一次各個領域最近的反向KL走勢,算出一個新的資源分配比例,寫進一個狀態文件里。

第二個叫"分層數據源給一個學生請四個家教結果三個提前放假一個還在補課D3MOPD如何讓AI蒸餾不再一刀切"(stratified data source)。它負責讀取觀察器給出的最新比例,然後按照這個比例去組裝每一批訓練數據。

整個流程里,負責生成回答、負責教師評分、負責學生更新參數這幾個核心步驟,統統沒有被改動。改動的只有"餵給學生多少哪個領域的題"這一環。

這一點很重要。論文特意強調了這套方案"零訓練開銷",意思是它不會拖慢訓練速度,也不會破壞現有訓練流程里其他已經調好的部分,比如損失函數的具體形式、教師模型怎麼訓練出來的等等。你可以把它理解成給現有的生產線加了一個智能調度模組,而不是把整條生產線推倒重建。

**怎麼判斷一個領域"該不該多分資源"**

這是整篇論文最核心的技術設計。研究者提出,判斷一個領域值不值得多投入資源,要同時看兩個指標。

第一個指標叫"剩餘差距給一個學生請四個家教結果三個提前放假一個還在補課D3MOPD如何讓AI蒸餾不再一刀切"(remaining gap)。

簡單說,就是當前的KL值相對於訓練剛開始時的KL值,還剩下百分之多少沒追上。如果一個領域當前的KL已經降到初始值的十分之一,說明大部分差距已經補上了,剩餘差距就小;如果還有八成沒追上,剩餘差距就大。

第二個指標叫"下降速度給一個學生請四個家教結果三個提前放假一個還在補課D3MOPD如何讓AI蒸餾不再一刀切"(descent velocity)。

意思是這個領域最近一段時間的KL值,到底是在穩定下降,還是已經趴窩不動了。這個指標專門用來區分"看起來差距很大但已經躺平不學了"和"差距大但正在快速追趕"這兩種完全不同的狀態。

兩個指標為什麼必須一起用,不能只用一個?論文給出的理由是這樣的:一個領域可能剩餘差距很大,但已經進入了瓶頸期,不管再餵多少題都學不動了,這時候光看"差距大"就去分配更多資源,純屬浪費。反過來,一個領域可能眼下下降速度很快,但它已經快學到頭了,剩餘空間本來就不多,哪怕下降速度快,能擠出來的提升空間也有限。

只有把這兩個指標乘起來,才能篩選出那種"確實還有很大提升空間,而且正在積極進步"的領域,這才是真正值得多投入資源的對象。

打個比方。假設你在帶一個團隊沖銷售業績,有兩個銷售員。一個銷售員的業績離目標還差得遠,但最近三個月的成交數字一直在往上爬,這種人值得給更多客戶資源,因為他正在快速成長,給他更多機會能加速衝刺。另一個銷售員業績同樣離目標很遠,但已經連續三個月毫無起色,業績死水一片,這時候再給他更多客戶,大概率也是白白浪費掉這些商機。

如果只看"業績差距",兩個人看起來一樣需要資源。只有把"業績差距"和"最近的成長趨勢"放在一起看,才能分辨出誰是真正的潛力股,誰只是暫時卡在瓶頸里出不來。

論文裡對這套方法還做了一個理論證明,附在文章的附錄E里。研究者假設每個領域的KL值是按指數規律衰減的(這是訓練里比較常見的一種簡化假設),然後推導出這個"差距乘以速度"的組合信號,近似等於"歸一化之後的邊際KL下降量"。

**邊際下降量*:可以理解成"再多訓練一點,還能擠出多少額外的進步"。這個信號越大,說明這個領域再投入訓練資源,收益越明顯。

這個證明的意義在於,它說明"差距乘速度"這個設計不是拍腦袋想出來的湊數公式,而是有數學依據支撐的一種近似最優分配策略。不過論文也很坦誠地指出,這個指數衰減假設不一定完全符合實際情況,好在這套方法有個"自我糾正"的機制:如果某個領域偏離了指數衰減的規律,突然進入了意外的瓶頸期,它的下降速度指標會自動趨近於零,資源分配也會隨之自動減少,不需要額外的規則去兜底。

**從信號到實際比例:一套"留有餘地"的轉換公式**

算出了每個領域的綜合信號之後,還有一步要做:把這個信號轉換成一個真正能用來分配訓練批次的比例數字。

論文用了一個帶溫度參數的softmax函數,外加一個"保底比例"設計。

**softmax*:一種常見的數學函數,作用是把一組任意大小的數字,轉換成一組加起來正好等於1的比例數字,數值越大的輸入,轉換後占的比例也越大。

保底比例這個設計我覺得挺值得說一下。系統設定了每個領域至少能拿到10%的訓練資源,哪怕這個領域的綜合信號已經掉到零,系統判斷它已經完全學不動了,它依然能保底拿到10%的資源份額,不會被徹底打入冷宮。

為什麼要留這個保底?論文的解釋是防止"災難性遺忘"。

想像一個已經通過考試的學生,如果徹底不再接觸這門課的內容,過一段時間知識會慢慢生鏽,遺忘掉一部分。同理,一個已經學得差不多的領域,如果徹底斷絕訓練資源,之前學到的能力也可能因為長期不"複習"而慢慢退化。保留10%的最低配額,相當於讓這個領域偶爾還能"複習一下",防止已經學到的本事悄悄流失。

如果沒有這個保底機制會怎樣?論文的實驗數據顯示了一個很有意思的現象:指令遵循這個領域,在訓練中期一度因為下降速度放緩被大幅降低了資源分配,一路降到接近保底線附近,結果它的歸一化KL值反而在這段時間從0.29爬升到了0.65,差距不但沒縮小反而擴大了。好在保底機制保住了它的一線生機,後期又重新獲得了資源分配,最終追了回來。

如果連這10%的保底都沒有,這個領域可能就真的一去不回頭了。

**批次抖動:故意加一點隨機性**

論文裡還提到一個細節設計,叫"批次級抖動"(batch-level jitter)。

**批次抖動*:觀察器每隔10步才更新一次資源分配比例,如果這10步之間每一批訓練數據的領域比例都完全一致,系統就會給這個比例加上一點隨機波動,讓每一批的實際比例圍繞著目標比例上下輕微浮動,但長期平均下來還是等於目標比例。

這個設計初聽起來有點反直覺,好不容易算出了一個精確的比例,為什麼還要故意往裡面摻點隨機噪音?

論文的消融實驗(也就是把這個設計單獨去掉,看看效果會不會變差)給出了答案。去掉抖動之後,整體平均得分從62.34掉到了61.63,差了0.71分,其中掉分最明顯的是兩個代碼類的評測,OJBench掉了2.6分,LiveCodeBench掉了1.6分。

研究者給出的解釋是,對於那些已經快接近學習瓶頸的領域(比如代碼),固定不變的採樣比例只能帶來微弱且重複的梯度信號,而隨機的批次波動反而能帶來一些意外的、更強的更新信號,類似給已經趴窩的引擎偶爾猛踩一腳油門,反而能把它重新推動起來。

這讓我想到健身圈子裡常說的"打破平台期"的做法。如果每次訓練動作、重量、組數都完全一樣,身體很快會適應這個固定刺激,進步速度會明顯放緩。教練通常會建議偶爾換個訓練方式,或者故意加大重量波動,給身體一點意料之外的刺激,反而更容易突破瓶頸。這裡的批次抖動,本質上做的是同樣的事情。

**實驗結果:數字說話**

理論講了不少,接下來看實際效果。

研究團隊用Qwen3.6-35B-A3B作為學生模型,四個專項教師模型分別專攻數學、代碼、指令遵循和工具使用,在七個評測基準上做了對比測試。

結果顯示,採用固定比例的傳統方法(論文裡叫vanilla MOPD),最終能彌補學生和教師之間63%的能力差距。而用了D3-MOPD這套動態調度方案後,這個數字提升到了97%。

|方法|與教師差距彌補比例|達到峰值所需步數|

|---|---|---|

|傳統固定比例方法|63%|143步|

|**D3-MOPD**|**97%**|**47步**|

這個97%意味著什麼?意味著學生模型幾乎已經把四位教師的水平都學了個七七八八,差距已經小到幾乎可以忽略。而且更關鍵的是,D3-MOPD只用了47步就達到了傳統方法需要143步才能達到的效果,速度快了大約三倍。

如果把訓練步數理解成上課時間,這相當於原本要上143節課才能學到的水平,現在47節課就學到了,省下來的將近100節課的時間,完全可以拿去繼續深挖那些還沒學透的領域。

更讓人意外的是,在七個評測基準里,D3-MOPD在三個基準上(HMMT數學競賽、IFEval指令遵循評測、OJBench代碼評測)的表現超越了對應的專項教師模型本身。而傳統固定比例方法,在所有七個基準上都沒能超過任何一個專項教師。

這裡要澄清一下,超過教師不代表學生憑空學出了教師不具備的新本事。論文裡引用了之前的研究結論,指出蒸餾這個過程本質上是在彌補已有的能力差距,而不是無中生有創造新能力。之所以能在個別指標上超過教師,是因為這幾個指標本身學生和教師之間的原始差距就不算太大(比如IFEval原始差距只有5.1個百分點),稍微多學一點,歸一化之後的分數就能突破1.0這個"追平教師"的分界線。

**觀察四個領域資源分配的真實走勢**

論文裡還畫了一張圖,展示訓練過程中四個領域實際拿到的資源比例是怎麼隨時間波動的,這張圖很直觀地印證了前面講的所有邏輯。

代碼領域的資源比例從起始的25%,一路穩步下降到大約15%,因為它是四個領域裡收斂最快的,系統很早就判斷它"學得差不多了",持續把資源往外挪。

省下來的資源最先流向了數學領域,數學在訓練進行到60到127步這段時間裡,資源比例一度衝到接近50%,因為這段時間的綜合信號顯示,數學是當時剩餘差距最大、同時下降速度也最快的領域。

等數學在127步左右也進入平穩期之後,資源又開始轉向指令遵循和工具使用這兩個領域,它們的比例在150步之後分別衝到55%和50%左右,因為這兩個領域本身收斂得最慢,後期依然有很大的提升空間。

這整個過程,論文裡用了一個詞來形容,叫"隱性課程"(implicit curriculum)。

**隱性課程*:意思是這套調度系統並沒有被明確編程告訴"先學什麼再學什麼",但通過實時追蹤每個領域的學習狀態,自動形成了一套類似人類教學中常見的、循序漸進的課程安排,先集中攻克進步空間大的領域,等這個領域學到位了再轉向下一個。

這一點其實挺有啟發性的。人類老師帶學生時,會憑經驗判斷"這個知識點孩子已經掌握了,該往下一個進度走了",這種判斷力本身是一種隱性的教學智慧,很難寫成一條條明確的規則。而D3-MOPD做的事情,某種程度上是把這種"憑經驗判斷學習進度"的直覺,轉化成了一套可以自動運行、可以量化的機制。

**它在更大模型和更小模型上都成立嗎**

論文做了一個額外的驗證,把學生模型換成參數量小得多的Qwen3.5-4B,重新跑了一遍完整實驗。

結果顯示,在4B這個更小的模型規模上,D3-MOPD依然全面超過傳統固定比例方法,七個基準全部勝出,漲幅從0.9分到4.1分不等。歸一化得分方面,D3-MOPD達到了1.01,略微超過了教師團隊的綜合水平,傳統方法只有0.86。

在收斂速度上,D3-MOPD比傳統方法提前40步達到最佳平均表現,相當於節省了25%的訓練步數。

這個結果說明,這套動態調度思路不是只在某個特定模型規模上湊巧管用的偏方,它背後的邏輯,不同領域收斂速度天然存在差異這件事,在大模型和小模型上都同樣存在,所以這套方法在不同規模上都能起作用。

**消融實驗:拆開看每個部件到底有沒有用**

論文還做了詳細的拆解實驗,把"差距信號""速度信號""批次抖動""平滑窗口"這幾個設計元素分別單獨去掉,看看效果分別會掉多少。

|變體|說明|最佳平均分|

|---|---|---|

|傳統固定比例|作為基準對照|61.36|

|去掉速度信號|只用剩餘差距判斷|61.41|

|去掉差距信號|只用下降速度判斷|61.46|

|去掉批次抖動|η設為0|61.63|

|去掉平滑窗口|R設為1(單窗口)|62.17|

|**完整版D3-MOPD**|所有設計都保留|**62.34**|

有幾個細節值得多說兩句。

只用剩餘差距這一個信號的變體,在訓練早期第127步就達到了峰值,之後就開始走下坡路。原因是這個變體只能看到"當前差距還剩多少",看不出這個差距是不是還在持續縮小,所以一旦某個領域的KL數值降到一定程度,系統就誤判它"夠了",過早地減少了資源投入。

只用下降速度這一個信號的變體則完全相反,它要一直跑到第255步(也就是訓練結束的最後一步)才達到峰值,而且過程中出現了明顯的資源分配大幅震盪。因為訓練剛開始的時候,所有領域下降速度都很快,單看速度根本分不出高低,系統只能靠後期速度出現明顯分化之後才勉強分辨,這也導致了它整體收斂得特別慢。

這兩個對照實驗其實印證了前面反覆強調的一個觀點:單獨一個指標各有各的盲區,只有兩個信號結合起來,才能又快又准地找到真正值得投入資源的領域。

**寫在後面**

讀完這篇論文,最觸動我的其實不是D3-MOPD本身的技術細節,而是它切入問題的角度。

很多AI訓練領域的改進思路,傾向於往模型架構里加更複雜的組件,或者設計更精巧的損失函數。而這篇論文選擇的路徑完全不同,它沒有碰任何核心訓練邏輯,只是盯著一個訓練過程中本來就存在、卻被大家習慣性忽略的信號,反向KL散度,重新利用了一遍。

這讓我想到一個更普遍的現象:很多低墊腳的改進機會,往往不在於發明新工具,而在於把手頭已經有的工具用對地方。反向KL散度這個數字,業內所有做蒸餾的團隊都在算,只是大家把它當成了單純的損失函數輸入,沒人想到把它拿出來當調度信號用。

另一個值得琢磨的地方是那個"保底比例"的設計。10%聽起來是個很隨意的數字,但它背後其實包含了一種謹慎:不完全相信自己的判斷系統百分百正確,給已經"判了死刑"的領域留一條活路。這種對自身系統局限性的清醒認知,某種程度上比精巧的算法設計更難得。

論文裡也留了一個沒細說的問題:如果領域數量從4個擴展到幾十個甚至上百個會怎樣?論文裡提到"預期收益會隨著領域數量增加而增長",但沒有給出實際驗證。這個假設聽起來合理,但真到了幾十個領域同時競爭有限訓練資源的時候,會不會出現某種意想不到的資源搶奪或震盪現象,這大概是留給後續研究者的一個有意思的坑。

Q&A

Q1:D3-MOPD是什麼?

A:D3-MOPD是一種給多教師蒸餾訓練用的動態資源調度方法,它利用訓練過程中本來就會算出來的反向KL散度信號,實時判斷每個學習領域的剩餘差距和進步速度,動態調整各領域該分配多少訓練資源,而不是像傳統方法那樣從頭到尾固定一個比例不變。

Q2:D3-MOPD相比傳統固定比例的方法效果好在哪?

A:在論文的實驗裡,傳統固定比例方法只能彌補學生模型和教師模型之間63%的能力差距,而D3-MOPD能彌補97%,並且達到同樣效果只需要傳統方法大約三分之一的訓練步數,同時在部分評測基準上還超過了專項教師模型本身。

Q3:D3-MOPD需要改動模型的訓練代碼嗎?

A:不需要。這套方法只改動了數據加載這一個環節,增加了一個獨立運行的監控程序去調整訓練數據的領域配比,模型生成回答、教師評分、參數更新這些核心訓練流程完全沒有被改動,也不會拖慢訓練速度。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新