宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

教AI「取其精華」:NAVER AI Lab發現讓小模型跟大模型學習時,只學「進化的部分」效果更好

2026年07月29日 首頁 » 熱門科技

這項研究由韓國網際網路公司NAVER旗下的AI研究機構NAVER AI Lab發布,論文於2026年7月16日以預印本形式公開,編號為arXiv:2607.15161,有興趣深入了解技術細節的讀者可通過該編號查詢完整論文。

**一個你可能從沒想過的問題**

每當你和手機上的AI助手對話時,背後運行的往往是一個經過精心"培訓"的語言模型。但這個模型究竟是怎麼變聰明的?它又是如何在有限的計算資源下,儘量接近那些龐大、昂貴的頂級AI模型的水平?

NAVER AI Lab的研究團隊提出了一種全新的訓練思路,把整個問題描述得非常直觀:與其讓學生照抄老師的一切,不如讓學生只學老師"後天努力學來的部分"——也就是老師通過專門訓練才獲得的推理能力,而非老師天生自帶的語言習慣和風格偏好。這個思路看似簡單,但背後蘊含了對AI學習本質的深刻理解,並且在大量實驗中取得了顯著優於現有方法的成績。

這套方法被命名為"在線策略差值蒸餾"(On-Policy Delta Distillation,簡稱OPD?)。別被這個名字嚇到,我們接下來會用一個貫穿全文的比喻把它講得清清楚楚:把AI訓練過程類比成一場武俠小說里的武功傳授。

**一、AI的"武功傳授":從大師到弟子**

在武俠世界裡,一位大師想把畢生武功傳給弟子,有幾種方式。最粗暴的一種是讓弟子每天觀看大師的招式錄像,然後照貓畫虎地模仿——這叫"監督微調"(SFT),弟子學的是大師的動作,但動作是大師自己打出來的,弟子只是跟著練。

還有一種方式是讓弟子實戰出招,大師在旁邊評分:這一招出得好,加分;那一招出得差,扣分。這叫"強化學習"(RL),弟子在自己的實戰中慢慢摸索什麼是對的。這種方式更貼近弟子自己的實際水平,但需要大師不斷評分,耗時費力,而且評分本身也可能打偏。

現在有了第三種方式,叫"在線策略蒸餾"(OPD):弟子自己出招,大師看著這套招數,對每一個動作給出反饋——哪個動作我會這樣打,哪個動作我不會這樣打。這樣一來,弟子既在練自己的招數,又得到了大師對每個細節的實時指導,兼顧了實戰性和精細度。

NAVER的研究團隊發現,OPD這種方式雖然已經很不錯,但還有一個根本性的問題沒有解決:大師給弟子的反饋,夾雜了太多"大師天生的習慣和風格",而不是純粹的"武功精髓"。

**二、大師的"天生習慣"是什麼?**

任何一位頂級AI模型,都經歷了兩個階段的訓練。第一階段是"預訓練":在海量的網際網路文本上學習語言本身,學會怎麼組詞造句、理解上下文,這就像一個人從小學語文、讀書看報,培養出了基本的語言直覺。第二階段是"推理調優":專門針對數學題、科學問題、編程任務進行強化訓練,讓模型學會一步一步推導答案,這就像一個語文基礎紮實的學生,開始專門學習邏輯推理和解題技巧。

問題在於,當大師(頂級大模型)經歷了第一階段之後,它已經形成了很多根深蒂固的"語言偏好"——比如它特別喜歡用"perhaps(也許)"這個詞來表達不確定,喜歡用"verify(驗證一下)"、"see(看看)"這樣的詞來表達探索過程。這些習慣是大師在漫長的語言學習階段自然形成的,並不是推理能力的體現。

當傳統OPD訓練弟子時,大師給出的反饋不加區分地包含了這兩類資訊:哪些推理步驟是對的,以及哪些詞彙符合大師的語言風格。弟子照單全收,既學了推理方法,也學了很多和推理無關的語言癖好。這就相當於你去學廚師,師傅教你的不只是炒菜技術,還包括他吃飯時習慣先喝一口湯、筷子要斜著拿的個人習慣——這些習慣跟炒出好菜沒什麽關係。

**三、"差值信號":只學大師努力得來的部分**

NAVER團隊的核心突破就在這裡:與其讓弟子學大師的全部輸出,不如讓弟子學大師"通過推理訓練額外獲得的部分"。

具體來說,他們引入了"大師的初始版本"——也就是大師在經過推理訓練之前的樣子,稱為"基礎模型"(base model)。然後,他們計算這樣一個差值:大師(訓練後)對某個詞語的判斷,減去大師基礎版(訓練前)對同一詞語的判斷,這個差值就叫做"差值信號"(delta signal)。

用武俠比喻來說:大師在學武之前,已經是個普通的江湖人,有自己的行走坐臥習慣。學武之後,大師在原有基礎上新增了獨門功夫。弟子真正需要學的,是那套"獨門功夫",而不是大師的整個人生閱歷。差值信號就是這套獨門功夫的提煉。

從數學角度看,傳統OPD的反饋信號是"大師的概率減去弟子的概率",而差值信號是"大師的概率減去大師基礎版的概率"。兩者的區別在於:傳統OPD的參照系是弟子自己,而差值信號的參照系是大師尚未專門訓練時的狀態。

**四、詞雲實驗:差值信號到底強調什麼?**

為了直觀展示差值信號和傳統信號的區別,研究團隊做了一個非常有意思的可視化實驗。他們用小模型(Qwen3-1.7B)在一萬道數學題上生成回答,然後分別計算傳統OPD信號和差值信號,把信號最強的詞語以詞雲形式呈現出來,詞語越大代表該信號越傾向於強化這個詞。

結果非常說明問題。傳統OPD信號強化的詞語裡,出現了大量"verify(驗證)"、"see(看看)"、"try(試試)"、"confirm(確認一下)"這樣的探索性、猶豫性詞彙。而差值信號強化的詞語則明顯不同:出現的是"hence(因此)"、"however(然而)"、"note(注意)"、"instead(而是)"這樣邏輯連接性強的詞彙。

這個區別反映了兩種完全不同的推理風格。探索性詞彙代表的是"東摸摸西試試"的漫無目的思考,而邏輯連接詞代表的是"由此得出、進一步推斷"的有序推理鏈。差值信號通過對比推理前後的變化,精準抓住了"推理訓練到底教了模型什麼"這個本質問題。

**五、用錯誤答案檢驗信號質量**

研究團隊還設計了一個更直觀的測試:他們故意構造了三道包含錯誤推理過程的簡單題目,分別來自數學、科學和編程領域,然後把這些錯誤的推理過程輸入系統,觀察傳統OPD信號和差值信號各自如何反應。

以一道數學題為例,題目是"一個箱子裡有3個紅球和2個藍球,共有多少個球?"正確答案顯然是5個,但構造的錯誤推理聲稱"把兩個數字相乘,3×2=6,所以有6個球"。

面對這個錯誤推理,理想中的信號應該在"相乘"和"×2=6"這些地方給出強烈的負面反饋,告訴訓練系統"這裡錯了,要壓制這種表達"。實驗結果顯示,差值信號確實在這些關鍵錯誤節點給出了更一致的負面反饋,而傳統OPD信號在這些地方的表現則搖擺不定,有時甚至給出了正面反饋。

原因是這樣的:在傳統OPD中,大師和弟子都對"乘法"這個概念有很強的語言偏好(畢竟乘法在數學文本中很常見),兩者的差值可能因此偏小甚至為正;而差值信號對比的是大師推理後和推理前的差異,推理訓練讓大師在遇到這道題時專門學會了"3+2才是正確操作",因此大師基礎版對"乘法"並無特別偏好,差值信號能更清晰地展現推理訓練帶來的方向性改變。

**六、統計分析:三個領域的全面驗證**

除了可視化實驗,研究團隊還做了大規模統計分析,使用了更大的模型(Qwen3-8B作為弟子,Qwen3-30B-A3B-Thinking-2507作為大師),分別在數學、編程和科學三個領域各隨機抽取一萬道題目,生成推理回答後分析兩種信號的差異。

分析結果在三個領域呈現出高度一致的規律。被差值信號強化的詞語,跨領域都包括"hence(因此)"、"thus(所以)"、"however(然而)"和"regardless(不管怎樣)"這類明確的邏輯連接詞,這些詞代表推理過程中的邏輯跳轉和轉折判斷。被差值信號壓制的詞語則包括"perhaps(也許)"、"tackle(著手處理)"、"look(看看)"、"consider(考慮一下)"、"analyze(分析一下)"等,這些詞往往出現在漫無目的的思考描述中,而非真正的推理跳轉。

在數學領域,差值信號還特別強化了"note(注意)"、"why(為什麼)"和"depending(取決於)",這些詞在數學推理中代表對關鍵前提的觀察和條件判斷。在編程領域,"imagine(假設)"、"oh(哦)"、"hmm(嗯)"這類反思性表達也得到了強化,說明推理訓練讓大模型在編程問題上發展出了更強的反思和自我糾錯能力。

**七、OPD?的完整設計:兩個關鍵機制**

確定差值信號是個好信號之後,研究團隊還需要解決一個工程問題:直接用差值信號來訓練,可能會導致訓練不穩定。具體來說,傳統OPD信號中包含了弟子自己的概率,這意味著當弟子的輸出越來越接近大師時,信號會自然減弱,訓練會趨向穩定收斂。但差值信號里沒有弟子的成分,理論上即使弟子已經和大師一樣好了,信號仍然存在,可能導致弟子被過度訓練。

為此,團隊設計了兩個配套機制,就像給差值信號配備了兩個"安全閥"。

第一個機制叫"中心化":把信號減去它的期望值,讓信號圍繞零點波動。這樣做的好處是讓信號的方向更清晰,哪些詞要強化(正信號),哪些詞要壓制(負信號),一目了然。傳統OPD信號有一個天然的優勢:當弟子的概率等於大師的概率時,信號恰好為零,不產生任何梯度。差值信號沒有這個性質,中心化處理部分彌補了這個缺陷。

第二個機制叫"聯合條件":在使用差值信號更新弟子參數時,只有當差值信號和傳統OPD信號方向一致時,才執行更新;如果兩者方向相反,就跳過這次更新,不做任何修改。這個機制的意義是:差值信號告訴弟子"大師學到了什麼",傳統OPD信號告訴弟子"你距離大師還差什麼",只有當這兩個方向對齊時,才說明這次更新既符合學習目標又符合追趕目標。當弟子的輸出已經完全等同於大師時,兩個信號方向自然一致且都為零,訓練自動停止,實現了穩定收斂。

這兩個機制組合起來,就構成了OPD?的完整損失函數:以差值信號為主要驅動力,以中心化和聯合條件為約束,確保訓練既有方向性又有穩定性。

**八、實驗驗證:覆蓋三大領域、多個模型規模**

理論設計之後,研究團隊構建了一個相當全面的實驗驗證體系。他們選擇了當時最前沿的開源推理模型作為實驗對象:阿里雲的Qwen3系列(1.7B、4B、8B三個規模)和谷歌的Gemma4系列(E4B規模),涵蓋了從十億量級到百億量級的多種規模。

訓練數據來自三個領域的公開問題集:數學推理用OpenMathReasoning,科學推理用OpenScienceReasoning-2,編程推理用OpenCodeReasoning。三個領域各抽取均等數量的問題,混合成一個多領域訓練集,共十萬道題目,每道題目在整個訓練過程中最多使用一次,相當於不足一個訓練輪次。

評估則更為全面,覆蓋14個基準測試:數學方面包括AIME24、AIME25、AMC23、HMMT25、MATH500、OlympiadBench和ReasoningGym Math七個;編程方面包括CodeContests、CodeForces、LiveCodeBench和ReasoningGym Algorithm四個;科學方面包括GPQA、SuperGPQA和SciBench三個。

同時,研究團隊還特別考察了Qwen3模型的兩種工作模式:非思考模式(直接給出答案,不展示推理過程)和思考模式(逐步推導,類似於讓模型"把草稿寫出來")。這是因為Qwen3在非思考模式下推理能力相對薄弱,而在思考模式下已經處於頂尖水平,兩種模式代表了截然不同的挑戰。

**九、非思考模式:大幅超越現有方法**

在非思考模式下,結果非常令人振奮。以Qwen3-1.7B(最小的那個模型)為例,原始模型在數學平均分只有34.8分,經過傳統OPD訓練後提升到51.0分,經過ExOPD(現有最先進方法)訓練後是51.4分,而經過OPD?訓練後達到了54.6分。

這種差距在更大規模的模型上依然持續。Qwen3-4B經過OPD?訓練後數學平均分達到70.3,而ExOPD只有66.4,傳統OPD只有64.0。有一個特別值得注意的現象:4B模型經過OPD?訓練後,成績超過了8B模型經過OPD和ExOPD訓練後的成績(分別是65.9和67.8)。換句話說,更好的訓練方法可以讓小模型超越用一般方法訓練的更大模型,這在實際應用中具有重要的成本意義。

編程和科學領域的結果同樣一致。在編程上,Qwen3-1.7B經過OPD?訓練後平均分從10.5提升到29.4,比ExOPD高出4.8分。在科學上,三個規模的模型經過OPD?訓練後均達到各自規模的最高分,分別是38.8、50.5和51.6。

**十、思考模式:在頂尖水平上繼續提升**

思考模式的挑戰要難得多:這些模型原本已經是世界上推理能力最強的開源模型之一,想在此基礎上進一步提升,就像讓奧運冠軍繼續提高成績一樣困難。而且實驗表明,傳統OPD在這個模式下經常適得其反,平均分反而低於原始模型。

OPD?在這個高難度任務上表現出了獨特的穩定性。以Qwen3-8B為例,原始模型數學平均分73.7,傳統OPD訓練後降至72.2,ExOPD訓練後勉強維持在73.6,而OPD?訓練後提升到75.9。在最難的幾個競賽級別測試上提升尤為顯著:HMMT25(一個面向高中生的國際數學競賽)從44.3分提升到52.3分,而傳統OPD和ExOPD分別只能達到43.3和46.3分。

在編程領域,Qwen3-8B的思考模式經過OPD?訓練後,四個編程基準測試全部得到提升,平均分從50.8提高到57.8。科學領域同樣呈現類似規律,OPD?在所有規模的模型上都取得了最佳成績,而傳統OPD和ExOPD則經常讓科學成績低於原始水平。

**十一、跨越模型家族:在Gemma4上的驗證**

為了確認OPD?不只是針對Qwen3定製的技巧,研究團隊還在完全不同的模型家族Gemma4上進行了驗證。

結果非常能說明問題:傳統OPD在Gemma4-E4B上幾乎讓所有指標大幅下降,數學平均分從60.6跌至58.9,編程平均分從55.2暴跌至36.9,這說明直接把傳統OPD應用到一個新的模型家族可能相當危險。ExOPD在數學上有所改善,但在編程上依然嚴重下降(45.1,仍遠低於原始55.2)。

OPD?則展現出更強的魯棒性。數學平均分從60.6提升到67.8,其中AIME24(美國數學邀請賽2024)從51.7大幅提升到69.2,而ExOPD只能達到59.6。在編程上,雖然所有方法都未能超過原始模型的55.2,但OPD?保住了49.5分,遠好於傳統OPD的36.9和ExOPD的45.1,說明OPD?至少在保持現有能力方面更加穩健。

**十二、訓練過程的動態變化**

除了最終成績,研究團隊還觀察了整個訓練過程中性能的變化曲線,揭示了三種方法在訓練機制上的根本差異。

所有方法在訓練的前二三十步都會經歷快速提升,說明在線策略蒸餾的收益主要集中在訓練早期。但之後的走勢出現了分化:傳統OPD和ExOPD往往在某個中間步驟達到峰值,然後隨著訓練繼續反而開始下滑,最終成績低於中途峰值。OPD?雖然也有波動,但整體保持在更高的水平上,最終成績依然穩定領先。

這個發現有一個重要的實踐意義:論文中所有的成績都是在訓練第100步(最後一步)時記錄的,而不是選最佳檢查點。這意味著OPD?的優勢是系統性的,而不是某個偶然的好時機。

**十三、消融實驗:哪個改動最重要?**

研究團隊還系統分析了OPD?中每個設計選擇的貢獻,通過逐一"拆掉"某個部件來觀察成績的變化。

結果非常清晰:三個改動中,差值信號是最核心的。把差值信號換回傳統OPD信號,非思考模式數學成績從54.6下降到50.5,思考模式從62.7下降到57.4,降幅最大。聯合條件(方向一致才更新)和中心化操作各自貢獻了相對較小但仍然正向的提升。這個結果告訴我們:OPD?的關鍵創新是"學什麼"(差值信號),而不是"怎麼學"(聯合條件和中心化),儘管後兩者也起到了輔助穩定的作用。

**十四、計算成本:額外開銷值不值?**

OPD?需要額外運行一遍"大師基礎版"來計算差值信號,這意味著它比傳統OPD需要更多計算資源。實驗數據顯示,Qwen3系列模型的訓練時間增加了24%到28%,Gemma4增加了8%。與現有最先進的ExOPD相比,OPD?的額外開銷非常接近,幾乎可以忽略不計(OPD?增加27%,ExOPD增加24%,對於Qwen3-8B)。

考慮到OPD?換來的是顯著更好的效果,這個額外開銷是完全合理的投入。而且團隊指出,他們當前的實現方式並沒有針對差值信號計算做專門優化,實際上還有進一步降低開銷的空間。

**十五、與相關工作的關係**

在這個領域,最相近的前人工作是ExOPD(Learning Beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation),這個方法同樣引入了大師基礎版模型,但用法完全不同。ExOPD計算的是"大師比大師基礎版好多少",然後把這個差距乘以一個大於1的係數(論文中λ=1.25),目的是讓弟子學到比大師更厲害的能力——相當於老師已經學會了1.0版本的武功,但要求弟子練出1.25版本的水平。

OPD?的目標則不是"超越大師",而是"更精準地學到大師推理訓練的成果"。差值信號代表的是大師在推理訓練中獲得的知識增量,弟子通過學習這個增量來提升自己的推理能力,而不是盲目追趕大師的全部輸出。

事實上,實驗結果顯示,OPD?的這種"精準蒸餾"策略在實際效果上全面優於ExOPD的"外推超越"策略,尤其是在模型已經很強的思考模式下,以及跨越模型家族的Gemma4實驗中。

---

說到底,NAVER AI Lab這項研究的價值在於重新定義了"好的老師"應該傳授什麼。不是照搬老師的一切,而是精準提取老師"經過努力學到的部分"——這個道理不只適用於AI,在人類教育中同樣成立。一個好的桌球教練不會讓學生模仿自己的每個動作,而是著重教導那些經過多年摸索才掌握的發球技巧和步法節奏。

從實際意義上來看,這項研究意味著同等規模的小模型可以通過更好的訓練方法獲得更強的推理能力,這在計算資源有限的應用場景下(比如手機端AI、邊緣設備推理)具有切實的工程價值。同時,OPD?的訓練只需要100步左右就能收斂,遠比完整的強化學習訓練廉價,這讓頻繁更新AI能力的應用場景變得更加可行。

值得進一步思考的是:差值信號的概念是否可以推廣到更多訓練場景?比如,當模型需要學習多種不同技能時,是否可以分別計算每種技能對應的差值信號並加以組合?此外,如果一個模型經歷了多輪推理訓練,如何定義"基礎版"這個參照系?這些都是未來值得探索的方向。有興趣深入了解技術細節的讀者,可以通過arXiv編號2607.15161查閱完整論文,代碼也將在github.com/naver-ai/opd2上公開。

---

Q&A

Q1:OPD?和普通AI蒸餾訓練有什麼區別?

A:普通蒸餾訓練(OPD)讓小模型直接模仿大模型的全部輸出,包括大模型天生的語言習慣和後天學到的推理能力。OPD?則計算大模型推理訓練前後的"差值",只讓小模型學習大模型通過推理專項訓練額外獲得的能力,避免了無關語言習慣的干擾,因此在推理任務上效果更好。

Q2:OPD?訓練需要哪些額外資源?

A:OPD?需要同時加載三個模型:學生模型(被訓練的小模型)、教師模型(大模型)和教師基礎版(大模型在推理訓練之前的版本)。相比普通OPD,計算時間增加約24%到28%,與現有最先進方法ExOPD的開銷基本持平,但換來了更好的訓練效果。

Q3:差值信號為什麼能更準確地識別錯誤推理?

A:傳統信號比較的是大模型和小模型對同一詞語的偏好,兩者都對常見詞語有偏好,導致即使推理出錯,信號也可能是正的。差值信號比較的是大模型推理訓練前後的變化,推理訓練專門強化了邏輯正確的表達模式,因此差值信號能更敏銳地識別哪些推理步驟是錯誤的,給出更準確的負反饋。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新