宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

Capital One研究團隊發現:AI做數學題時為什麼越想越錯?

2026年08月12日 首頁 » 熱門科技

這項由美國金融科技公司Capital One的研究團隊完成的工作,以預印本形式發布於arXiv(論文編號:arXiv:2607.00482),於2026年8月4日更新至第二版。研究方向涉及推理語言模型的訓練優化,感興趣的讀者可通過該編號在arXiv平台上查閱完整論文。

一、當AI越想越錯:一個讓人頭疼的老問題

你有沒有遇到過這樣的情況:考試時某道題,第一次做出來答案是對的,然後忍不住反覆檢驗,越檢驗越覺得不對,最後把正確答案改成了錯的?這種"想多了反而壞事"的體驗,其實在目前最先進的AI推理模型里也普遍存在,而且嚴重程度出乎意料。

DeepSeek-R1這類推理型AI模型,核心能力就是通過一長串的"思考鏈"來解題——一步一步分析,就像在草稿紙上列出演算過程一樣。理論上,思考得越詳細,答案應該越可靠。然而現實恰恰相反:Capital One的研究團隊通過大量實驗發現,AI生成的回答越長,答對的概率反而越低。在他們測試的數據中,最短的回答組正確率接近80%,而最長的回答組正確率僅剩個位數。

這究竟是怎麼回事?難道AI在"思考"的時候不是真的在思考,而是在原地打轉?研究團隊決定深入挖掘這個問題,他們的發現揭示了一種比單純"回答太長"更微妙、也更有趣的現象。

二、偵探拿到了正確答案,卻把它扔掉了

研究團隊用來分析的核心比喻,可以理解成一位偵探辦案的過程。偵探在推理過程中,有時會在中途得出一個正確結論,但隨後因為過度懷疑自己,開始推翻這個結論,另闢蹊徑,最終走進死胡同,交出一份錯誤的結案報告。

在AI的語境裡,這種現象被研究團隊稱為"答案漂移CapitalOne研究團隊發現AI做數學題時為什麼越想越錯"(Answer Drift)。具體來說,一個推理過程中,AI會多次給出中間答案,就像偵探不斷更新自己的推斷一樣。如果AI在某個中途節點給出了正確答案,但最終交卷的答案卻是錯誤的,那麼這條推理鏈就發生了"漂移"——正確的答案被丟棄了,被錯誤的自我反思所取代。

研究團隊特別強調,這不僅僅是"回答太長"的問題。他們將不同長度的回答分成五組,在每一組內部對比答對和答錯的回答,結果發現:即使控制了長度這個變量,答錯的回答依然比答對的回答包含更多的無效自我反思。也就是說,冗長只是表象,真正的問題是這些多餘的思考內容在主動把AI往錯誤方向引導。

三、六種"越想越亂"的具體行為

為了把這個模糊的感覺變成可以測量的東西,研究團隊設計了六種具體的語言信號,用來檢測AI推理過程中的"過度思考"行為。這六種信號全都基於簡單的文字匹配規則,不需要任何額外的AI模型來判斷,成本極低。

第一種叫做"重複",指的是AI在不同位置用不同措辭反覆說著同一件事,就像一個人在兜圈子、原地踏步,句子換了皮,內容沒有進展。第二種叫做"對沖",指AI頻繁說出"等等,不對"、"讓我重新想想"這類充滿自我懷疑的表達,這往往是它即將推翻正確答案的前兆。

第三種叫做"策略放棄",是最能預測答案出錯的單一指標——在所有測試的模型上,答錯的推理過程里,"這個方法不對,換個思路試試"、"從頭來過"這類表達出現的頻率,是答對推理過程的4倍以上。第四種叫做"自相矛盾",指AI自己得出了與之前結論相悖的判斷,卻沒能解決這個矛盾,就這樣帶著未解決的衝突繼續向前走。

第五種叫做"重複計算",指同一個數值被反覆推導三次以上,明明已經算過了,卻不斷重算確認,這種行為鮮少真正發現錯誤,卻消耗大量的"思考空間"。第六種叫做"長度異常值",不是簡單地說"回答太長就是有問題",而是在同一道題的多個回答中,把那些明顯比其他回答長很多的異常情況標記出來——對於簡單問題來說,這種異常往往意味著推理陷入了泥沼。

這六種信號共同構成了一套診斷工具,讓研究團隊得以在不依賴人工標註的情況下,系統性地衡量AI的過度思考程度。

四、DASHCapitalOne研究團隊發現AI做數學題時為什麼越想越錯:一套讓AI學會"見好就收"的訓練方法

問題找到了,解決方案是什麼?研究團隊提出了一個名為DASH的訓練方法,全稱是"漂移感知優勢塑形"(Drift-Aware Advantage Shaping)。這個名字聽起來複雜,但核心思想用一個日常場景來理解就很直觀了。

假設你正在輔導一個學生做題。這個學生在解題過程中,中途算出了正確答案,但隨後又開始懷疑自己,換了個思路,最終給出了錯誤結果。作為老師,如果你只是簡單地在試卷上打一個大叉,告訴他"整個過程都是錯的",那顯然不公平——他中途明明找到了正確路徑,只是不應該繼續走下去。更合理的做法,是鼓勵他做到正確答案時的那段推理,同時批評他在正確答案之後多此一舉的那段"反思"。

DASH的邏輯正是如此。它將AI每一次推理的全過程切分成若干"段落",每個段落的邊界,就是AI給出中間答案的位置。然後,它對每個段落獨立評分:如果這段推理最終導向了正確答案,就給予正面強化;如果導向了錯誤答案,就給予負面懲罰。

目前主流的訓練方式(GRPOCapitalOne研究團隊發現AI做數學題時為什麼越想越錯,一種強化學習方法)處理這種情況的方式則粗暴得多:一旦最終答案是錯的,整個推理過程里的每一個字都被打上相同的負分,包括那些實際上走對方向的部分。這相當於那位老師不分青紅皂白地批評了學生所有的解題步驟,最終可能導致學生連正確的解題思路也不敢用了。

在DASH的設計中,還有幾個細節值得留意。對於反覆確認同一個正確答案的情況,系統會逐漸降低獎勵——第一次找到正確答案得滿分,但如果之後反覆重申同一個結論,獎勵會指數級遞減,防止AI養成"瘋狂確認"的壞習慣。對於漂移之後繼續錯誤推理的部分,懲罰力度會隨著在錯誤路徑上走得越遠而不斷加重,就像是"你已經偏離了正確答案,繼續偏離只會讓情況更糟"。對於發生漂移的推理鏈整體,系統會給它一個介於"完全錯誤"和"完全正確"之間的部分分——因為這條推理鏈畢竟曾經找到過正確答案,完全當成失敗案例來懲罰,是一種資訊浪費。

五、實驗結果:在最難的題目上,效果最明顯

研究團隊用一個4B參數的Nemotron模型(來自NVIDIA的一款推理模型)作為主要實驗對象,在四個競賽級別的數學測試集上驗證了DASH的效果,這四個測試集分別是OlympiadBench(數學奧林匹克題)、MinervaMath、AIME 2024和AIME 2025(美國數學邀請賽題目)。

從平均準確率來看,原始模型在這四個測試集上的平均分是55.65%,標準GRPO訓練後提升到56.95%,另一個改進版基線DR-GRPO(一種針對長度偏差做了修正的變體)達到58.13%,而DASH與DR-GRPO結合後,達到了59.45%,是所有方法中最高的。

更有意思的是,AIME 2025這個測試集上出現了一個耐人尋味的現象:標準GRPO訓練後,成績反而比原始模型下降了0.7個百分點——也就是說,訓練之後反而變差了。研究團隊分析,AIME 2025是四個測試集中"答案漂移"現象最嚴重的一個,而標準GRPO不分好壞地懲罰了整個漂移推理鏈,恰恰把那些"中途找到正確答案"的有效推理策略也一併壓制了。DASH則沒有出現這個問題,在AIME 2025上相比原始模型提升了4.7個百分點。

研究團隊還專門測量了"自我糾錯率"——也就是在推理過程中出現過錯誤中間答案的情況下,最終仍能給出正確結果的比例。DASH訓練的模型,這一比率顯著高於其他所有方法。以AIME 2024為例,DASH模型的自我糾錯率遠高於GRPO和DR-GRPO,同時最終準確率也更高,說明DASH培養的是真正有效的自我糾正能力,而不是盲目的自我懷疑。

六、跨模型驗證:換個AI,規律依然成立

有人可能會問:這套方法是不是只對某個特定模型有效?為了回答這個問題,研究團隊又在兩個完全不同架構的模型上重複了實驗——一個是微軟的Phi-4-reasoning-plus(14B參數),另一個是Allen AI的OLMO-3-think(7B參數)。

結果顯示,DASH在三個模型上都帶來了一致的提升:Nemotron-4B提升了0.5個百分點,OLMO-3-think提升了1.5個百分點,而Phi-4-reasoning-plus提升幅度最大,達到了4.1個百分點。這種跨越了模型規模、訓練數據來源和架構設計的一致性,表明"用中間答案檢測漂移、分段賦予獎懲"這一機制,抓住的是推理訓練中的一個普遍規律,而不是某個模型的特定弱點。

七、拆解方法:哪些部件最重要?

DASH由幾個相互配合的部件組成,研究團隊逐一拆除每個部件,觀察效果的變化,來判斷哪個最關鍵。

結果顯示,最核心的是"漂移部分信用"機制——也就是給發生了漂移但曾經找到正確答案的推理鏈一個介於正負之間的評分,而不是直接按完全錯誤處理。去掉這個機制後,平均分從57.5跌至54.6,是所有拆除實驗中跌幅最大的,也是唯一一個導致結果低於訓練之前的配置。第二重要的是"負段落長度懲罰"機制——在漂移之後的錯誤推理段落中,越走越遠的懲罰越重。去掉這個機制後,成績跌至55.3。"條件中立處理"(對漂移推理鏈的前段給予弱正信號而非零信號)和"重複確認衰減"對整體準確率的影響相對較小,但在一些子測試集上會帶來額外收益,說明它們主要影響推理效率和穩定性,而非直接決定對錯。

八、過度思考畫像:DASH訓練的AI,反思方式變了

研究團隊用前面提到的六種語言信號,繪製了不同訓練方法下AI的"過度思考畫像",直觀地呈現出各種方法在減少無效推理上的差異。

結果顯示,DASH訓練的模型在策略放棄(減少了41%)、對沖表達(減少了14%)和長度異常值(減少了17%)上,都明顯優於DR-GRPO基線。這意味著DASH有效地減少了AI在推理過程中反覆換方向、反覆懷疑自己、無休止地延伸推理鏈這三類最常見的無效行為。

有一個有趣的例外:在"自相矛盾"這個指標上,DASH的數值反而比DR-GRPO高了13%。乍看之下這似乎是個壞信號,但研究團隊通過進一步分析發現,這實際上反映的是一種質的轉變。在答對的推理鏈里,DASH模型的矛盾標記增多,通常伴隨著"察覺到矛盾、找出根源、解決矛盾、得出正確答案"的完整閉環,這是一種有益的錯誤檢測行為。而DR-GRPO遇到矛盾時,傾向於用對沖和策略放棄來迴避問題,不去真正解決矛盾,只是繞開它繼續走,最終更容易出錯。

用一個形象的說法來區分:DASH培養的是"偵探思維",遇到線索矛盾時會停下來分析矛盾、找出真相;DR-GRPO更像是一個被矛盾搞得慌了神的人,不去解決矛盾,只是不斷嘗試新的方向,直到精力耗盡。

九、真實案例:一道幾何題,兩種截然不同的命運

研究團隊在論文中展示了一道AIME 2025的圓幾何題(答案為293)的實際推理過程對比,這個案例非常直觀地展現了兩種方法的本質差異。

標準GRPO訓練的模型在面對這道題時,從未真正識別出題目中關於內切圓幾何關係的核心誤解,而是不斷地用不同的數值組合去"碰運氣",先後嘗試了8種不同的參數代入方式,整個推理過程長達61000個字符,最終因為達到字符上限而被截斷,沒能給出任何答案。

DASH訓練的模型面對同一道題時,在推理進行到約8%的位置,就明確表達了"這說不通,讓我檢查一下——內切在B點,所以圓心必須共線",識別出了幾何關係的矛盾所在。隨後經過幾次疊代,在推理進行到59%的位置完成了對內切關係的正確理解,之後線性推進計算,在34000個字符(比GRPO短43%)內給出了正確答案293。

這個案例精準地展現了研究團隊想要傳達的核心:問題不在於AI是否應該自我反思,而在於反思應該指向哪裡。有效的反思是找到矛盾、解決矛盾;無效的反思是逃避矛盾、盲目換路。

說到底,這項研究揭示的是一個關於"什麼時候該停下來"的樸素道理。推理能力強不等於推理越長越好,真正聰明的思考者懂得在找到答案時認可自己,而不是永無止境地懷疑自己。Capital One團隊用一套聰明的工程設計,把這個樸素道理嵌入了AI的訓練過程。當然,研究也有明顯的局限:目前的實驗主要在數學和代碼這類有明確答案的領域進行,因為只有在能驗證中間答案正確與否的場景下,DASH的漂移檢測才能工作。對於那些沒有標準答案的開放性推理任務,這套方法還需要找到新的"漂移指示器"。此外,大部分實驗基於4B參數的小模型,在更大規模的模型上,訓練動態是否會有所不同,還有待驗證。

如果你對背後的技術細節感興趣,可以在arXiv平台上搜索論文編號arXiv:2607.00482找到完整論文,裡面包含了所有實驗配置、數學公式推導和更多案例分析。

---

Q&A

Q1:答案漂移是什麼意思,AI推理中為什麼會發生這種情況?

A:答案漂移指的是AI在推理過程中曾經給出過正確的中間答案,但隨後通過多餘的自我反思推翻了這個正確答案,最終交出錯誤結果的現象。這種情況發生的原因,是現有的推理模型被訓練成"不斷驗證、不斷反思"的模式,缺乏識別"已經找到答案、應當停止繼續推理"的能力。

Q2:DASH和普通的GRPO強化學習訓練有什麼本質區別?

A:GRPO對最終答案錯誤的推理鏈一刀切地打負分,不管其中是否有過正確的中間答案。DASH則把推理鏈切成若干段落,對每段分別評分:找到正確答案的段落得獎勵,找到錯誤答案的段落受懲罰,漂移前的有效推理則得到保護。這讓AI能從一次失敗的推理中同時學到"什麼該做"和"什麼不該做"。

Q3:DASH方法在數學之外的領域能用嗎?

A:目前DASH依賴於能提取並驗證中間答案的能力,因此適合有明確標準答案的場景,比如數學題和有測試用例的代碼題。對於開放性推理任務,由於無法判斷中間答案是否正確,漂移檢測機制就無法工作。研究團隊在論文中也明確指出這是當前方法的主要局限之一。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新