宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

新國立、慕尼黑大學等多校聯手:讓AI從「失敗草稿」中學習推理,效果反而更好?

2026年08月12日 首頁 » 熱門科技

這項研究由新加坡國立大學、慕尼黑大學、慕尼黑工業大學、南洋理工大學、北京大學、華為海森堡研究中心、東南大學及中國科學院自動化研究所等多家機構聯合完成,於2026年8月以預印本形式發布,論文編號為arXiv:2608.03972v1,研究方向屬於人工智慧與大語言模型推理能力的增強訓練。

**一個反直覺的發現**

教一個孩子做數學題,你會怎麼做?大多數人的第一反應是:給他看正確的解題步驟,讓他照著學。如果有一道題連老師都做錯了,那份寫滿錯誤推導的草稿,通常就直接進了垃圾桶。

然而,這篇論文的研究者們發現,對於當前最先進的AI語言模型來說,這個直覺是錯的——至少不完全對。他們的核心發現是:當模型面對特別困難的問題時,給它看一份"專家寫錯了的解題過程",並要求它找出錯誤、加以糾正,比直接讓它從零開始解題,成功率要高得多。

這個發現催生了一套叫做ReflectRL的訓練方法。它的基本思路是:不要扔掉那些失敗的草稿,而是把它們變成一種特殊的學習材料。

**一、大語言模型是怎麼"練推理"的?先講清楚背景**

要理解這項研究,先得弄清楚AI是怎麼學會推理的。

現在最強的AI語言模型,比如DeepSeek-R1,已經能夠解答相當複雜的數學題和邏輯題。它們之所以能做到這一點,很大程度上依賴一種叫做"在線強化訓練"的方法。可以把這個過程理解成這樣一個場景:給模型出一道題,讓它自己想出幾個不同的解題過程,然後用一個自動判卷器檢查哪些是對的、哪些是錯的。對的解法會得到"獎勵",錯的會受到"懲罰",模型在這個反覆練習的過程中逐漸提升解題能力。

這種訓練方法有一個核心依賴:必須要有足夠多"做對了"的解題過程,獎勵信號才有意義。當題目簡單時,模型偶爾能答對,訓練就能順利推進。但當題目非常困難時,模型每次都答錯,獎勵信號幾乎全是零,訓練就像在黑暗中亂撞,效率極低。

為了解決這個問題,研究者們通常會請來一個"更強的老師模型",讓它先把解題過程寫出來,再把這些正確的解題過程餵給學生模型參考。老師寫對了,學生就有好的範本可以學習。

但問題來了:就連這位"老師"有時也會解不出特別難的題。老師寫的解題過程是錯的,那這份材料就只能被丟進垃圾桶嗎?這正是ReflectRL試圖回答的問題。

**二、那堆"廢棄草稿"里究竟藏著什麼?**

研究團隊首先做了一個非常有意思的實驗,來搞清楚那些"失敗的專家解題過程"到底有沒有價值。

他們選擇了一個數學能力很強的模型(Qwen2.5-Math-7B),然後設計了兩種不同的解題模式。第一種叫"直接推理":只給模型看題目,讓它自己想出答案。第二種叫"反思推理":在題目之外,額外給模型看一份解題草稿,但特別聲明"這份草稿是專家寫的,但裡面有錯誤,你的任務是找出錯誤,糾正它,然後給出正確答案"。

實驗結果非常清晰。對於那些難題,當模型進入"反思推理"模式並且草稿來自強大專家模型時,它的解題成功率大幅提升,而同樣的模型在"直接推理"模式下卻經常束手無策。研究者把這種現象命名為"反思優勢"——在困難問題上,反思一份有瑕疵的專家草稿,比從零開始獨立解題要容易且有效得多。

這個結論背後有一個樸素的道理:一份雖然有錯但整體思路接近正確的草稿,其實已經幫模型完成了很多探索性的工作。模型不需要在茫茫可能性中盲目搜索,而是可以沿著這條"大體走對了方向、只是最後幾步出了岔子"的路徑繼續前進,同時識別並修正那個關鍵的錯誤。

但研究者們並沒有止步於此,他們還追問:是不是任何錯誤的草稿都能起到這種效果?

答案是否定的。實驗表明,這種"反思優勢"非常挑剔。首先,草稿必須來自能力強的專家模型。用學生模型自己寫的失敗草稿,或者用一個能力更弱模型的失敗草稿,效果非常有限,甚至會產生負面影響。其次,草稿的長度也不是關鍵——研究者故意構造了一些長度相近但內容來自不匹配專家的草稿,結果同樣起了反效果。真正關鍵的是草稿的"質量結構":一份好的失敗草稿,前面大部分推理是正確的、邏輯清晰的,只在某個具體環節出了錯,並且這個錯誤是局部的、明確的。

為了驗證這一點,研究者用了一個專門評估推理步驟質量的工具(過程獎勵模型,PRM),來給不同來源的失敗草稿做"體檢"。結果顯示,來自強大專家模型的失敗草稿,在出錯之前的推理部分質量非常高,分數接近正確解法;而來自弱模型的失敗草稿,從一開始質量就參差不齊,充滿混亂。

他們還做了一組"外科手術式"的消融實驗:把草稿的各個部分逐一刪除,看哪部分貢獻了主要價值。結果發現,草稿中"推理正確的前半段"和"出錯的具體位置"這兩個部分缺一不可。前半段給了模型一個高質量的推理起點和腳手架,後半段則給了模型一個明確的糾錯目標。如果把草稿的內容打亂順序,或者只告訴模型最終答案是多少,效果反而會跌破基線——還不如直接讓模型獨立解題。

這些來自強大專家模型的失敗草稿,研究者給它們起了一個專有名稱:黃金負軌跡(Golden Negative Trajectories,簡稱GNT)。"黃金"是因為它們來自高質量的強模型,"負"是因為它們給出了錯誤的答案,"軌跡"則是因為它們完整記錄了一個推理過程。

**三、ReflectRL:把廢稿變成教材的完整方案**

發現了這個現象之後,研究者面臨的下一個挑戰是:怎麼把它變成一個實際可用的訓練方法?

最樸素的想法是:用黃金負軌跡來訓練模型的反思能力就好了。但這會帶來一個問題:模型會變得依賴外部草稿。訓練的時候,每道題都有一份專家草稿可以參考;但實際使用的時候,不可能每次都有這樣的草稿。如果模型學會了"看到草稿才能回答",那這種能力在現實中毫無用處。

ReflectRL的核心設計就是解決這個"訓練時有草稿、推理時沒草稿"的矛盾。它的思路可以用一個學鋼琴的比喻來理解。

一個鋼琴學生在練習困難曲目時,老師會在旁邊實時提示:"這裡要輕一點"、"那裡節奏要穩"。有了這些提示,學生能把曲子彈得更流暢、更準確。但演出時老師不可能坐在台上提示。真正的目標是:經過足夠多的"有提示練習"之後,那些關鍵技巧已經內化成了肌肉記憶,演出時自然能夠流暢發揮,不再需要外部提示。

ReflectRL中的"反思推理"就是"有提示的練習",而"直接推理"就是"演出"。訓練的全過程分為兩個階段,中間有一個漸進的過渡。

訓練早期,大量題目以"反思推理"模式進行:模型看到黃金負軌跡,識別錯誤,糾正推理,給出答案。同時,也會混入一些"直接推理"模式的題目,讓模型不完全忘記獨立解題的感覺。

隨著訓練推進,"直接推理"的比例逐步增加,"反思推理"的比例逐步減少。這個過渡採用餘弦曲線形式——開始時變化緩慢,中間階段變化加快,末期再次放緩,最終完全切換到直接推理模式。這種平滑的過渡方式被證明比突然切換效果要好得多,因為它給了模型足夠的時間把"反思時學到的技巧"慢慢內化到自身參數中。

訓練結束後,模型進入"直接推理"模式做最後強化,不再依賴任何外部草稿。而那些在反思練習中學到的"發現錯誤、糾正推理、找到正確路徑"的能力,已經悄悄沉澱在模型的參數裡,成為它獨立解題時自發調用的內在能力。

ReflectRL被設計為一個"即插即用"的模組,可以疊加在多種現有的訓練框架上,不需要修改獎勵函數,不需要引入額外的模型或參數,只需要調整訓練時的輸入構造方式即可。

它適配了兩類主流訓練範式。一類是強化學習類方法(RLVR),比如GRPO和DAPO:在這類方法中,每次給模型出一道題,同時生成一批混合的解題嘗試——部分使用反思推理模式(附帶黃金負軌跡),部分使用直接推理模式。所有解題嘗試用同一個自動判卷器評分,然後根據分數計算每個解法的"相對優勢",統一更新模型。由於直接推理和反思推理共享同一個獎勵評估過程,兩種模式的結果都受到公平對待,不存在系統性的偏差。

另一類是在線蒸餾方法(OPD):學生模型始終以"直接推理"模式生成解題過程,但老師模型在評估學生的解法時,被額外提供了黃金負軌跡作為參考。有了這份參考,老師能夠做出更高質量的指導——它會先識別失敗草稿的錯誤,再結合學生的實際推理過程,提供更精準的改進方向。學生通過模仿老師的分布來學習,但整個過程中學生從未直接見過黃金負軌跡,因此推理時完全不依賴外部草稿。

在這兩種範式下,黃金負軌跡都是提前離線生成好的,訓練時不需要實時調用任何外部模型,額外的計算開銷幾乎可以忽略不計。

**四、實驗結果:數字背後的故事**

研究者在非常廣泛的場景下測試了ReflectRL的效果,涵蓋了9個測試基準、4種不同大小和系列的語言模型(從1.5億參數的小模型到80億參數的大模型,包括Qwen2.5系列和LLaMA-3.1系列),以及4種不同的訓練方法。

在數學推理任務上,ReflectRL疊加在GRPO基礎上,綜合得分從37.0提升到42.4,提升幅度約5.4個百分點;疊加在DAPO上,從38.4提升到43.5,提升5.1個百分點;疊加在在線蒸餾方法上,也有穩定的2.3個百分點提升。

更有趣的是模型在"題目範圍之外"的表現。研究者用了三個與數學完全無關的測試來檢驗模型是否獲得了更通用的推理能力:ARC-c(科學常識推理)、GPQA-Diamond(研究生級別的科學問答)以及MMLU-Pro(多學科綜合知識測試)。在這些測試上,ReflectRL帶來的提升甚至比數學本身更為顯著。以GRPO+ReflectRL為例,綜合得分從20.9大幅提升至40.0,提升了整整19.1個百分點。這說明從黃金負軌跡中學到的"發現錯誤、糾正推理"的能力,確實具有跨領域遷移的特性,而不只是數學技巧的堆砌。

與此同時,研究者還仔細觀察了訓練過程中的一些指標變化,發現了幾個令人意外的副作用。

首先是推理效率的提升。標準GRPO訓練到500步時,模型的平均回答長度超過800個token;而加了ReflectRL之後,模型的回答長度穩定在約420個token,縮短了將近一半,但準確率反而更高。這說明模型學到的不是"話說得更多就更對",而是更直接、更有針對性的推理路徑。

其次是訓練穩定性的改善。研究者測量了一個叫做"策略熵"的指標,可以理解為模型在回答問題時的"多樣性"或"探索欲望"。標準GRPO訓練到250步時,熵值從0.97驟降至0.03以下,模型陷入了"回答高度重複、不再探索新解法"的狀態,通俗說就是"思路僵化了"。而ReflectRL在同樣的訓練步數時,熵值仍維持在約0.15,是GRPO的五倍多,模型保持著持續探索的活力,準確率也隨之穩定增長。

研究者還測試了一個容易被忽視的對照實驗:如果不給模型看"失敗的草稿",而是給它看"正確的草稿",效果會更好嗎?結果出乎意料——給正確草稿的模型在訓練初期確實進步更快,但隨後發生了嚴重的"策略漂移"(模型的行為偏離預期軌道),最終導致性能崩潰。而用黃金負軌跡訓練的模型則一直保持穩定。這個發現說明,"失敗草稿"中那種必須主動糾錯而非被動模仿的任務設計,對訓練穩定性有著意想不到的保護作用。正確答案太容易被直接複製,反而導致模型失去獨立思考的能力。

**五、從失敗中學習,人和AI都一樣**

歸根結底,ReflectRL揭示的是一個頗具普遍意義的道理:高質量的失敗,遠比低質量的成功更有學習價值。

當我們面對一道難題,看到一位高手寫的解題過程,發現他在關鍵步驟犯了一個錯誤,此時我們的大腦並不會直接關閉這份材料。相反,我們會順著他正確的推理走到出錯的那一步,然後思考:為什麼他在這裡犯了錯?正確的做法應該是什麼?這種主動糾錯的過程,比單純欣賞一份完美答案往往更能加深理解。

ReflectRL就是在AI身上復現了這個過程,並且給出了讓這個能力在推理時無需依賴外部草稿就能自然發揮的完整方案。

這對AI技術的實際發展來說有幾層具體的意義。其一,數據效率大幅提升。之前被丟棄的大量強模型失敗案例,現在都可以被重新利用,意味著同樣的數據採集成本能換來更多的訓練信號。其二,對於難題的處理能力有了明顯改善,而難題正是當前AI系統的核心短板。其三,方法本身的通用性極強,幾乎可以疊加在任何現有的訓練流程上,不需要大幅改造原有系統。

當然,這項研究也有其局限性。黃金負軌跡必須來自能力足夠強的專家模型,如果手頭只有弱模型,這套方法的效果會大打折扣。此外,訓練數據依然限於數學和推理類任務,對於其他類型任務的推廣效果還有待驗證。

如果你對這項研究感興趣,想深入了解技術細節和完整實驗數據,可以通過論文編號arXiv:2608.03972在學術預印本平台上查閱全文。研究者還同步公開了包含6.9萬條黃金負軌跡的數據集OpenR1-GNT-69k,以及訓練好的模型權重,方便研究社區進一步探索和復現。

---

Q&A

Q1:ReflectRL中的"黃金負軌跡"是什麼,為什麼普通失敗案例不能替代它?

A:黃金負軌跡是由強大專家模型生成的、總體錯誤但推理過程大部分高質量的失敗解題記錄。普通模型自己寫的失敗案例質量雜亂,從推理一開始就問題重重,沒有清晰的"正確前半段+局部出錯"結構,因此無法提供有效的反思支點。用弱質量的失敗案例反而會讓模型的推理能力下降。

Q2:ReflectRL訓練後的模型在實際使用時還需要外部草稿嗎?

A:不需要。ReflectRL通過"反思到直接推理的漸進過渡",在訓練結束時模型完全切換到直接推理模式,推理時只需要看到題目本身,不依賴任何外部草稿。反思訓練階段學到的糾錯和推理能力已經內化到模型參數中,會在獨立解題時自然發揮作用。

Q3:ReflectRL對數學以外的任務有效果嗎?

A:實驗結果顯示,在與訓練數據完全無關的科學常識推理、研究生級別科學問答和多學科知識測試上,ReflectRL同樣帶來了顯著提升,有時提升幅度甚至超過數學任務本身。這說明從黃金負軌跡中學到的推理糾錯能力具有一定的跨領域遷移性,不局限於數學場景。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新