宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

浙江大學與阿里巴巴聯手:讓AI小學生也能在答錯時「懸崖勒馬」,不再一條路走到黑

2026年08月06日 首頁 » 熱門科技

這項由浙江大學與阿里巴巴集團優音團隊聯合開展的研究,以預印本形式於2026年7月28日發布在arXiv平台,論文編號為arXiv:2607.26057。研究團隊提出了一種名為"接力式在線蒸餾"(Relay On-Policy Distillation,簡稱Relay-OPD)的全新訓練方法,專門用於解決人工智慧語言模型在學習過程中"一錯到底"的頑固問題。

教AI模型解題,本質上和輔導孩子做數學沒多大區別。如果孩子在第三步就算錯了,卻沒人告訴他,他後面寫的所有步驟都是在錯誤的基礎上疊加更多錯誤。等到最後,整張卷子都是歪的,批改起來連紅筆都不知道從哪裡標起。研究團隊發現,當前主流的AI訓練方法正在面對完全一樣的困境——而他們找到了一種近似於"實時家教"的解決方案:讓更強的老師模型在學生模型剛要走錯路的那一刻接手幾步,撥正方向後再把筆交還給學生。

一、AI是怎麼"上課"的,又怎麼會"越學越歪"

要理解這項研究解決的問題,得先聊聊AI語言模型是怎麼練成的。訓練一個能推理、能解題的大模型,有點像培養一個從零開始的學徒。最常見的做法是給學徒看大量由優秀師傅(即更強大的"教師模型")寫好的範文,讓學徒模仿著寫。但模仿有一個根本弱點:學徒練的是別人走過的路,等到真正自己上場,一旦遇到沒見過的岔路,就會發蒙。

更進階的做法叫做"在線蒸餾"(On-Policy Distillation,簡稱OPD),可以理解為"邊實戰邊點評"的訓練模式。在這種模式下,學生模型不看範文,而是自己真實地去解題,把完整的解題過程寫出來。然後教師模型站在旁邊,對照學生寫下的每一個字,逐字逐句地給出評分和指導。因為點評的是學生自己真實寫出的內容,而不是假設學生會怎麼寫,所以指導更貼合實際,學生進步更快。這種方法近年來已經成為大模型訓練的主流手段之一。

然而,"在線蒸餾"有一個被研究團隊稱為"前綴失敗"(prefix failure)的致命弱點。所謂前綴,就是解題過程中已經寫下的部分。如果學生在第三行就走偏了方向,後面寫的所有內容都建立在這個錯誤的前提之上。這就好比一個廚師在放鹽這步加錯了調料,後面不管怎麼翻炒、怎麼調味,整鍋菜的底味都是歪的。更糟糕的是,教師在評點這些後續步驟時,面對的是一個越來越離譜的上下文,它給出的指導也會變得越來越不可靠、甚至有害。與此同時,這些方向已經錯了的推理過程往往還很冗長,白白占用了大量的計算資源。

二、教師和學生在錯誤路口的關鍵分歧

研究團隊在深入分析這個問題時,注意到了一個頗為微妙的現象:當學生模型已經走上錯誤方向、即將繼續深陷其中的那一刻,教師模型和學生模型對"下一步該怎麼走"其實有著截然不同的判斷。

打個比方,兩個人在一道數學題里得出了一個實際上行不通的中間結論,接下來:學生模型傾向於說"所以……"然後繼續沿著這個錯誤結論往下推;而教師模型則更傾向於說"但是……"或者"等等……"——用這些反思性的詞語停下來,重新審視這一步到底對不對。

這種差異在論文舉的一個例題里體現得相當清晰。題目是:蘋果3令吉一個、芒果4令吉、木瓜5令吉,花剛好50令吉,每種至少買一個,最多能買多少個水果?學生模型推算出買15個蘋果剩下5令吉,然後得出"還可以再買1個芒果和1個木瓜"的結論,並繼續往下算出答案是17個。事實上,1個芒果加1個木瓜要9令吉,剩餘的5令吉根本不夠。學生已經在錯誤前提下繼續往下走了,而在這個分叉口,教師模型下一個詞選擇"But(但是)"的概率高達74.4%,而學生模型下一個詞選擇"So(所以)"的概率則高達50.6%——兩者的判斷截然相反。

這個"教師想轉彎、學生想直走"的分歧,就是研究團隊找到的關鍵信號。更重要的是,識別這個信號不需要任何外部裁判——不需要先知道答案對不對,不需要專門的評分模型,只需要對比教師和學生在那一刻各自傾向於說什麼詞。

三、提前介入有多重要:從實驗結果說話

在正式提出方法之前,研究團隊做了一組很有說服力的預備實驗,目的是搞清楚"在什麼時候、用多大力度介入"最有效。

他們拿Qwen3-4B-Instruct-2507作為教師模型、Qwen3-1.7B-Non-Thinking作為學生模型,在128道數學題上進行測試。實驗的基準是:學生自己解題的正確率約為27.73%,教師自己解題的正確率約為60.55%。然後他們模擬"教師在檢測到分歧信號時接管一段時間"的效果,改變兩個變量:接管時長(用生成的段落數L衡量)和接管時機(是否跳過前幾個觸發點,等到後面的觸發點再介入)。

結果發現了兩個規律,一個關於"力度",一個關於"時機"。

關於力度:哪怕教師只替換了整個推理過程中0.35%的詞——僅僅是在每個觸發點替換一個反思詞——正確率就從27.73%跳升到了34.96%,提升了7.23個百分點。隨著接管時長從0段落增加到3段落,正確率穩步上升到41.99%。繼續增加到6段落,正確率雖然小幅增長到43.55%,但教師詞的占比已經從17.52%飆升到28.52%,收益明顯趨於平緩。這說明"少量但精準的介入"就能產生顯著效果,過度介入則性價比大幅下降。

關於時機:研究團隊還測試了"故意跳過前幾個觸發點、等到後面的觸發點再介入"的策略。結果令人印象深刻:同樣是接管3段落,在最早的觸發點介入時正確率為41.99%;跳過1個觸發點後介入,正確率跌到33.98%;跳過3個觸發點後介入,只剩29.49%。越晚介入,效果越差。

為什麼時機如此關鍵?研究團隊給出了解釋:隨著推理過程的推進,教師模型也會被學生模型已經寫下的那些錯誤內容"帶跑"——共同的錯誤上下文讓教師自己也越來越難以扭轉方向。早介入,教師還能拉得住;晚介入,教師自己也被錯誤的慣性拖著走了。

四、接力訓練法的完整設計

正是基於以上發現,研究團隊設計了Relay-OPD的核心機制。整個設計可以用一場接力賽來理解:學生拿著接力棒跑,跑著跑著出現了偏道的跡象,教師接過棒子短暫糾正路線後,再把棒子交回給學生繼續跑。

具體來說,這套機制分三個核心部分。

第一部分是"換手觸發器"(handoff trigger)。研究團隊預先定義了一組"反思詞",包括"Wait(等等)"、"But(但是)"、"Hmm(嗯)"、"Actually(實際上)"、"Hold(等一下)"、"However(然而)"、"Yet(然而)"、"Oh(哦)"、"Alternatively(另外)"、"No(不對)"、"Ah(啊)"、"Oops(哎呀)"、"Well(好吧)"等詞語及其大小寫和前置空格變體。這些詞都是推理過程中"停下來重新審視"的信號詞。觸發條件是:教師模型在當前前綴下最傾向於說的下一個詞屬於這組反思詞,而學生模型的前K個候選詞裡沒有任何一個屬於這組詞。K取5,意思是學生最有可能說的5個候選詞裡都不包含任何反思詞,說明學生根本沒有"要回頭看看"的意識,只想直走。

第二部分是"接力軌跡構建"(relay trajectory construction)。當觸發條件滿足時,教師接管,把它傾向說的那個反思詞寫出來作為起點,然後繼續生成L段後再把控制權交回學生。段落以雙換行( )為分隔單位,平均每段約包含23.2個詞,這樣每次接管都能完成一個完整的推理單元而不是半截話。研究團隊設置了一個"接力預算"(relay budget),用參數M控制一次訓練軌跡里最多允許教師接管M次。當第M次接管結束後,這條軌跡的生成就終止,不再繼續。這個預算機制的作用是:把教師介入集中在最早出現問題的位置,避免軌跡整體偏離學生自身的行為模式太遠。

第三部分是訓練目標。在這條包含學生段落和教師段落的"接力軌跡"上,訓練優化的方式與標準在線蒸餾一脈相承——逐詞對比"學生現在有多傾向說這個詞"和"教師有多傾向說這個詞",鼓勵學生向教師靠攏。關鍵在於:優化是對實際生成出來的詞進行的,無論哪個位置是學生生成的還是教師生成的。這樣一來,教師在接管段落里寫下的那些糾正性推理步驟,不只是給了學生一個更好的"語境接力棒",本身也直接成為學生模仿學習的示範材料。

五、用一個引擎完成教師與學生的無縫切換

實現這套機制時,研究團隊還面臨一個工程上的挑戰:如何讓教師和學生的來回切換既準確又高效?

樸素的做法是維護兩條獨立的生成流水線,隨時在它們之間切換。但這意味著每次換手都要做大量的狀態同步和通信協調,開銷極大。研究團隊選擇了一個聰明得多的方案:把整個接力過程統一放進一個"投機解碼"(speculative decoding)引擎里。

投機解碼原本是一種加速大模型推理的技術,它的核心邏輯是:讓一個小而快的"草稿模型"先猜出接下來的幾個詞,再讓大而準的"目標模型"批量驗證這些猜測,一次性接受或拒絕,速度遠快於讓大模型逐詞生成。在Relay-OPD里,學生模型充當草稿模型,教師模型充當目標模型。在學生段落,學生模型的每個猜測都會被100%接受(因為目標模型就是學生本身),等同於正常的學生自主生成。在教師段落,則執行標準的投機解碼驗證流程,每個學生的猜測都要經過教師審核,不符合教師分布的詞會被替換。

這個設計的額外收益是:教師模型在驗證學生猜測的同時,順手就計算出了自己在當前位置最傾向於說什麼詞——這正是觸發換手所需要的資訊——完全不需要額外的計算開銷。

六、實際效果:在八個數學競賽基準上的比拼

研究團隊在正式實驗中使用Qwen3-4B-Instruct-2507作為教師,分別對Qwen3-0.6B-Non-Thinking和Qwen3-1.7B-Non-Thinking兩個學生模型進行訓練,並在八個數學推理基準測試上進行評估,涵蓋AIME 2024、AIME 2025、AIME 2026、MATH500、AMC 2023、OlympiadBench、HMMT February 2026和HMMT November 2025。訓練數據使用DAPO-Math-17K的英文子集,整個訓練過程在8塊H100 GPU上進行。

對於1.7B的學生模型,Relay-OPD的平均正確率達到46.96%,而標準在線蒸餾(OPD)只有41.23%,差距為5.73個百分點。最強的競爭對手FastOPD平均為45.47%,Relay-OPD領先1.49個百分點。在最難的競賽題目上,提升尤為顯著:AIME 2025的準確率從25.52%提升至32.81%,提升了7.29個百分點;AIME 2026從23.33%提升至30.52%,提升了7.19個百分點。對於0.6B的學生模型,同樣的趨勢成立,平均準確率從28.03%提升到31.04%,比FastOPD高出0.62個百分點。

除了準確率,訓練效率的提升同樣驚人。1.7B學生的訓練軌跡平均長度只有2296個詞,而標準OPD需要4658個詞,縮短了50.7%;0.6B學生的軌跡從6900個詞壓縮到2490個詞,縮短了63.9%。Relay-OPD在第35步就達到了最佳表現,而標準OPD需要55步,FastOPD需要45步。更短的軌跡、更少的訓練步數,意味著消耗的計算資源大幅減少。

研究團隊還在HMMT的兩個競賽基準上測試了"pass@k"——即給每道題生成k個答案,只要有一個答對就算通過,考察模型的"上限能力"。無論k取8、16、32、64還是128,Relay-OPD的pass@k都穩定高於標準OPD,說明它不僅提升了平均水平,也拓展了模型的能力邊界。

在推理階段(即訓練完成後的實際使用),Relay-OPD生成的答案更短。與FastOPD相比,在AIME 2025上短17.9%,AIME 2026上短14.2%,HMMT February 2026上短28.3%——同時準確率還更高。換句話說,Relay-OPD訓練出來的模型不僅答得更對,還答得更精煉。

七、對比同類方法:各自的優劣

在實驗中,研究團隊還和幾種同樣致力於解決"軌跡偏差"問題的方法進行了比較,每種方法都有各自的思路,也各自有各自的局限。

TRD(軌跡重寫蒸餾)的做法是讓學生先完整解一遍題,然後把學生的解題過程交給教師,讓教師"修改作文",再在改好的版本上訓練學生。這個方法聽起來合理,但實驗結果卻遠低於預期——1.7B學生用TRD訓練後平均只有30.69%,比不用任何特殊手段的標準OPD的41.23%還要低。研究團隊在查看訓練數據時發現了原因:教師改出來的"作文"里,出現了大量明顯的改稿痕跡,比如"根據我的初始解法……"、"經過修改……"、"重新評估後……"這類語言,讓整個解題過程讀起來像是在描述一次作文修改,而不是像一個人自然地思考數學題。這種"不自然"的軌跡反而干擾了學生的學習。

SKD(投機知識蒸餾)的做法是在每個詞的位置,檢查學生猜的詞是否落在教師最可能說的前K個詞裡,如果不在,就用教師的詞替換。這種方法是逐詞介入的,但介入信號來自於通用的分布差異,而不是專門識別"推理方向是否走偏"。實驗中,SKD在1.7B上只比標準OPD好了一點點(42.35% vs 41.23%),在0.6B上反而更差(24.38% vs 28.03%)。更具體的問題在於:研究團隊在案例分析中發現,當學生進入了一個反覆輸出相同答案的循環時,那些重複內容的詞語通常也在教師的候選詞裡,於是SKD的替換機制完全無法打破這個循環,學生就一直重複輸出"最終答案:沒有整數n……最終答案:沒有整數n……"。

FastOPD(快速在線蒸餾)的思路是:既然訓練軌跡的後半段充滿了基於錯誤前綴的不可靠內容,那乾脆截斷,只訓練前面固定長度的部分。在1024、2048、4096、8192四個截斷長度里,4096效果最好,達到了45.47%的平均準確率,是除Relay-OPD外最強的方法。但FastOPD只是"少看錯誤的部分",並沒有給學生展示"當錯誤發生時應該怎麼糾正",學生依然不知道遇到岔路該怎麼辦。Relay-OPD的優勢恰恰在於它不僅截短了軌跡,還在截斷之前插入了一段由教師示範的"糾錯過程",讓學生學到了"遇到問題時應該退一步重新審視"這個能力。

八、訓練過程的動態變化與多組消融實驗

研究團隊還詳細追蹤了整個訓練過程中Relay-OPD的行為變化,以及通過消融實驗驗證了各個設計選擇的必要性。

在訓練動態方面,隨著訓練步數的推進,三個指標都在發生變化。"預算耗盡率"(每條訓練軌跡都用完了全部M次接管機會的比例)從訓練初期的75%-85%逐步下降到後期的50%-60%,說明學生模型越來越少地觸發換手條件,自己走偏的情況減少了。"教師詞占比"從訓練初期的約13%急速下降,在約20步之後穩定在2%-3%,說明隨著學生能力的提升,需要教師介入的時刻越來越少。這兩個趨勢共同說明,隨著訓練進行,學生和教師的能力差距在縮小,前綴失敗的發生率降低了。與此同時,Relay-OPD的策略熵(可以理解為模型在做選擇時的"開放程度"或"探索意願")在整個訓練過程中都高於標準OPD和FastOPD。研究團隊認為這是因為教師接管改變了學生見到的前綴分布,讓學生探索了更多不同的推理路徑,從而保持了更高的多樣性。

在消融實驗方面,研究團隊首先驗證了"教師腿"本身的價值。他們對比了兩種只允許接管1次(M=1)的變體:一種是在觸發後立刻終止軌跡、不生成任何教師詞(Trigger-stop);另一種是在觸發後讓教師生成L=3段(Relay-OPD M=1)。前者平均準確率43.48%,後者46.25%,差距2.77個百分點。這說明僅僅"及時截斷錯誤軌跡"是不夠的,教師生成的那段糾正性內容本身帶來了額外的學習價值。

研究團隊還對比了三種不同的訓練目標。他們發現,直接對教師實際生成的詞(relay token)計算損失的效果最好(46.96%)。如果改成對學生原本會說的詞(student draft token)計算損失,效果下降到44.56%——因為這種方式主要是壓制學生不該說的詞,但沒有明確告訴學生應該說什麼。如果改成讓學生模仿教師的完整分布(Teacher FKL),效果下降到44.08%——因為在已經走偏的前綴上,教師自己的判斷也並不完全可靠,強迫學生全面模仿會引入噪聲。這一結果印證了設計時的直覺:在錯誤的上下文下,選擇性地吸收教師的糾正信號,比全面模仿教師分布更合適。

在超參數敏感性方面,L從0到4,準確率從44.31%穩步上升到47.10%;L=5時小幅下滑到46.47%,說明教師腿不宜過長。M從1到2提升效果明顯,但M=4時準確率跌到44.01%,說明接管次數過多會讓軌跡離學生自身策略太遠,破壞在線蒸餾的優勢。K從1到5,準確率從44.27%提升到46.96%;K=10時下降到43.14%,K等於整個詞表時退化為標準OPD的41.23%。K=5是最優配置,太小會在微小分歧上頻繁觸發,太大則錯過真正需要介入的時機。

九、方法的局限與未來方向

研究團隊在論文末尾坦誠地說明了這項工作目前的局限。評估只覆蓋了數學推理任務,使用的也是Qwen3系列的教師-學生配對。接力機制本身在設計上並不局限於數學,但在代碼生成或智能體任務等其他領域的有效性還有待驗證,而且換到不同的模型家族時,反思詞列表可能需要重新調整。此外,這套方法的核心假設是教師模型在糾正錯誤前綴方面明顯強於學生,當教師和學生的能力差距本就很小時,接力介入的價值會自然縮減。最後,接力預算的超參數是在1.7B學生上調出來的,復用到0.6B時雖然也表現良好,但在面對新的模型配對時可能需要重新尋優。

歸根結底,這項研究用一個相當樸素的直覺解決了一個長期困擾AI訓練的實際問題:學生一旦走錯路,就讓更有經驗的老師短暫接手,扭轉方向後再放手。這個"點到為止"的介入哲學,在實驗數據上被證明是既有效又高效的。它讓小模型在資源有限的訓練條件下,能學到的不只是"正確答案是什麼",更是"發現自己走錯時該怎麼辦"。對於那些關心AI如何在有限計算資源下變得更聰明的讀者,這篇來自浙江大學與阿里巴巴聯合團隊的工作,提供了一個值得認真對待的思路。有興趣深入了解技術細節的讀者可以通過arXiv:2607.26057查閱完整論文。

Q&A

Q1:Relay-OPD的換手觸發器是怎麼判斷該介入的,需要知道答案對錯嗎?

A:不需要。Relay-OPD的觸發條件完全基於教師和學生對"下一個詞"的偏好差異——當教師最傾向於說某個反思詞(如"But""Wait"),而學生最可能說的前5個詞裡沒有任何反思詞時,系統判定出現了推理方向分歧,觸發介入。整個過程不依賴答案標註、過程標籤或任何外部評分模型。

Q2:為什麼訓練軌跡縮短超過50%,準確率反而比標準OPD更高?

A:因為Relay-OPD同時做了兩件事:一是截斷了錯誤方向上的冗長推理,避免這些低質量內容干擾訓練;二是在截斷前由教師生成了一段糾正性的推理示範,讓學生學到"遇到錯誤時如何反思和調整方向"。相比之下,標準OPD把那些建立在錯誤前提上的長段推理全部納入訓練,浪費計算資源的同時還引入了有害的訓練信號,所以又長又差。

Q3:Relay-OPD和FastOPD都比標準OPD短,兩者核心區別是什麼?

A:FastOPD是硬截斷——固定截掉軌跡的後半段,不管那部分是對是錯,也不給學生示範遇到問題該怎麼辦。Relay-OPD是智能截斷加示範——在檢測到推理走偏的那一刻才介入,由教師生成幾步糾正性內容後就停止,把"如何從錯誤中恢復"這一能力傳授給學生。結果是Relay-OPD不僅軌跡比FastOPD更短,準確率還更高,推理時生成的答案也更簡潔。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新