宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

沒有標籤能讓模型考完試卻不知道自己考的題是對是錯,這聽起來是個悖論,但這正是「測試時訓練」要解決的怪事:讓一個大語言模型在做題過程中自我提升,而全程沒有人告訴它答案對不對

2026年09月08日 首頁 » 熱門科技

先說一件讓人有點摸不著頭腦的事。

大語言模型做數學題這幾年進步飛快,靠的是強化學習和一種叫"策略蒸餾沒有標籤能讓模型考完試卻不知道自己考的題是對是錯這聽起來是個悖論但這正是測試時訓練要解決的怪事讓一個"的訓練方法。但這些方法有個共同的死穴:它們都需要標準答案。沒有標準答案,模型就不知道自己做對了沒有,訓練信號從哪來都是個問題。

問題是,有一種場景標準答案壓根不存在。這個場景叫"測試時訓練沒有標籤能讓模型考完試卻不知道自己考的題是對是錯這聽起來是個悖論但這正是測試時訓練要解決的怪事讓一個"

測試時訓練:模型在真正要解決的那批題目上直接進行訓練和優化,而這批題目往往連出題人都沒給答案,因為這本身就是考試。

如果一個模型要在考場上邊做題邊訓練自己,它拿什麼當老師?

一個自然的想法是投票。讓模型對同一道題生成很多個答案,出現次數最多的那個當作"偽標籤",就假裝這是正確答案。TTRL沒有標籤能讓模型考完試卻不知道自己考的題是對是錯這聽起來是個悖論但這正是測試時訓練要解決的怪事讓一個這類方法就是這麼做的,用投票結果當獎勵信號去做強化學習。聽起來挺聰明,但這裡藏著一個致命缺陷:如果多數票本身就是錯的呢?

在競賽級別的數學題上,這不是小概率事件。論文裡做了個統計,用Qwen3-1.7B沒有標籤能讓模型考完試卻不知道自己考的題是對是錯這聽起來是個悖論但這正是測試時訓練要解決的怪事讓一個模型在AIME 2026沒有標籤能讓模型考完試卻不知道自己考的題是對是錯這聽起來是個悖論但這正是測試時訓練要解決的怪事讓一個這套題上做測試時訓練,發現投票選出來的"多數答案"竟然有85%左右的概率是錯的。這不是異常,這是常態,因為競賽題本來就是設計給人類高手都會犯難的題目。

如果多數票經常是錯的,那用它當老師教模型,豈不是越訓練越糟?

這就是這篇論文真正的起點。研究者們沒有迴避這個問題,而是往更深處挖了一層,發現了一個非常反直覺卻極其關鍵的現象。

核心問題:錯的標籤里,藏著對的信號

先把這個"偽標籤會不會誤導訓練"的問題想清楚。

假設一道題,模型跑了64次,得到64個答案。這些答案聚類之後,出現次數最多的那個被選為偽標籤。研究者觀察到一個規律:即便這個多數票是錯的,那些不跟它站在同一邊的少數答案里,大約79%其實也是錯的。

換句話說,投反對票的樣本,絕大多數時候不是因為它猜中了正確答案而跟多數派意見不合,它們只是單純地錯了,跟多數票是不是對的沒什麼關係。

這個發現值得琢磨一下,它揭示了兩種訓練信號完全不同的"抗噪性"。

如果你用懲罰的方式去糾正那些"跟主流意見不一樣"的答案,即便主流意見本身是錯的,你的懲罰大概率依然是對的,因為你懲罰的理由從來不是"你沒選中真正的正確答案",而是"你和大多數人不一樣",這個判斷本身跟偽標籤的內容無關。

但如果你反過來,想把所有跟多數票"一致"的答案都當作正確範本去教模型模仿細節,一旦這個多數票是錯的,你教給模型的每一個字、每一步推理,都在往錯誤的方向拉。

這就像小區里兩種不同的居委會工作方式。一種是有人在業主群里發了個明顯錯誤的通知,居委會主任站出來說"這條通知內容有誤,大家先別照做",這句糾錯話,就算主任對細節記錯了一兩處,"先別照做"這個判斷本身通常沒問題,因為糾錯不需要精確知道正確答案是什麼,只需要判斷這條通知不對勁。另一種是居委會直接把這條錯誤通知原文列印出來,一字不改地發給全體業主當作官方文件貼在公告欄上,這時候只要通知本身有一個字錯了,所有業主看到的都是錯的資訊,錯誤被原樣複製、放大、傳播到每一個接收者手裡。如果居委會選擇後一種做法,代價就是錯誤資訊被系統性地擴散,而選擇前一種糾錯式的做法,即便對細節判斷有偏差,至少不會把錯誤當作正確答案四處散播。

論文把這個觀察總結成一句很精煉的話:一個被污染的獎勵信號,只會誤導一整條軌跡一次;而一個被污染的老師,會在每一個字上都誤導模型。

TTPO沒有標籤能讓模型考完試卻不知道自己考的題是對是錯這聽起來是個悖論但這正是測試時訓練要解決的怪事讓一個的設計:讓每種信號只在它可靠的地方發揮作用

搞清楚了"哪種信號更抗噪",接下來的設計思路就順理成章了。

論文提出的方法叫TTPO

TTPO:全稱Test-Time Policy Optimization,測試時策略優化,核心思路是把模型生成的一批答案分成"跟多數票一致"和"跟多數票不一致"兩組,分別用不同的方式處理。

具體怎麼分組處理?論文裡的做法是:讓模型針對同一道題採樣K個答案(論文裡用的是K=64個),把答案按數學意義上是否等價進行聚類,選出人數最多的那一類作為偽標籤。跟偽標籤一致的答案叫"正樣本",不一致的叫"負樣本"。

對正樣本,用一種叫OPSD沒有標籤能讓模型考完試卻不知道自己考的題是對是錯這聽起來是個悖論但這正是測試時訓練要解決的怪事讓一個的策略去蒸餾

OPSD:全稱On-Policy Self-Distillation,在策略自蒸餾,做法是讓同一個模型"扮演"兩個角色,一個是學生(正常做題),一個是老師(提前知道答案,站在答案的角度重新梳理這道題該怎麼推理),然後讓學生的每一步推理去逐字逼近老師的推理分布。

這裡有個巧妙之處。既然正樣本本身就是跟偽標籤答案一致的,那給它當老師的那個"知道答案的模型",其實條件是學生自己算出來的那個答案,就算這個答案是錯的,老師教給學生的東西也不是"某個憑空冒出來的錯誤答案",而是"用更細緻、更謹慎的思考方式,重新走一遍你自己得出這個答案的路"。論文裡管這個叫從"思考模式"到"非思考模式"的蒸餾,即便終點答案是錯的,這一路上教的審慎推理習慣本身依然有價值。

對負樣本,用GRPO沒有標籤能讓模型考完試卻不知道自己考的題是對是錯這聽起來是個悖論但這正是測試時訓練要解決的怪事讓一個做懲罰

GRPO:全稱Group Relative Policy Optimization,分組相對策略優化,這裡的用法很簡單,就是給跟偽標籤不一致的答案打上負分,讓模型在訓練中降低生成這類軌跡的概率。

這個負分的判斷標準非常乾淨:只看"你是不是跟多數票不一樣",完全不涉及偽標籤具體是什麼內容。這正好對應前面那個79%的觀察,懲罰"不合群"這個行為本身,比懲罰"沒說出正確答案"這個行為,抗噪能力強得多。

論文做了個對照實驗,很能說明問題。如果反過來操作,把FKL沒有標籤能讓模型考完試卻不知道自己考的題是對是錯這聽起來是個悖論但這正是測試時訓練要解決的怪事讓一個用在負樣本上、把GRPO用在正樣本上,AIME26上的準確率只有37.2%,甚至比什麼都不做還要糟糕(基線是37.8%)。而正確的組合方式(正樣本用FKL,負樣本用GRPO)能做到48.9%。中間反轉一下角色,效果直接掉了11.7個百分點。這不是玄學,是設計邏輯本身決定的:把該穩健的信號用在脆弱的地方,把該脆弱的信號用在不設防的地方,代價立刻顯現。

每個字都不是同等重要的:token級別的精細篩選

光是分組處理還不夠,論文又往下細化了一層,細到"每一個字"這個粒度。

先看正樣本這邊。一段推理里,有些字詞是死板的、幾乎不需要學的,比如設好坐標系之後,寫下"x=0"這種純粹的代數替換,模型對這種位置早就很熟練了,教它教了也是白教。但另一些位置是真正決定推理走向的關鍵判斷,比如"這條延長線應該往哪個方向延伸",這種位置學生往往還不確定,老師和學生的判斷分歧也大,這才是真正值得花力氣去教的地方。

論文設計了一個權重公式,同時看兩個信號:學生此刻的不確定程度(熵沒有標籤能讓模型考完試卻不知道自己考的題是對是錯這聽起來是個悖論但這正是測試時訓練要解決的怪事讓一個)、老師和學生判斷的分歧程度(KL散度)。只要這兩個信號里有一個顯示"這裡還值得學",權重就高;只有兩個信號都很低,也就是學生已經很自信而且跟老師意見一致時,權重才會趨近於零。

這就像給一份需要精讀的會議紀要做重點標註。會議里大部分寒暄和程序性發言不需要劃重點,但涉及關鍵決策、有爭議的判斷的那幾句話,必須標出來反覆讀。如果不做這種區分,把整份紀要從頭到尾同等力度地精讀一遍,讀完之後印象最深的可能反而是那些無關緊要的寒暄,真正的決策要點被稀釋在大量低資訊量的內容里,這跟直接對整段推理不加區分地做蒸餾是同一個問題,重要信號被平均掉了。

負樣本這邊,問題反過來了。既然是懲罰,那麼一條錯誤的推理鏈里,是不是每個字都該被懲罰?答案是不。一條最終走向錯誤答案的推理里,大部分步驟其實是局部正確的算術和格式,真正的問題往往就出在一兩個"自信地犯錯"的關鍵節點上。論文設計了一個評分公式,專門找那種"模型給出的概率很高,但熵很低,同時這個詞本身出現概率就低"的位置,直白說,就是模型自信滿滿地說了一句不該說的話。只保留分數最高的一半詞參與懲罰。

這個思路可以類比給一份考卷判錯。老師改卷子的時候,不會因為學生某一步推理最後導向了錯誤答案,就把整張卷子裡所有的字都打紅叉,那樣做的代價是,學生連"平方根怎麼算"這種他明明算對了的步驟都被否定了,下次遇到同類計算他反而會犯糊塗,因為他分不清哪一步真的錯了。真正有效的批改,是精準圈出那個"想岔了"的關鍵轉折點,其餘步驟原樣保留。這也是為什麼論文裡去掉這個精細篩選之後,效果掉得很明顯:在HMMT26上從31.6%掉到29.5%,BRUMO25上更是從54.7%直接掉到50.0%。

實驗結果:沒有標籤,也能打平甚至超過有標籤的方法

這套設計到底管不管用?論文在Qwen3的1.7B、4B、8B三個規格上都做了測試。

先看一種叫"OpenThoughts設定"的場景,模型是在帶標籤的數據上訓練的,只是TTPO刻意不去看那些標籤,純粹靠自己投票生成偽標籤來訓練。結果是,TTPO在三個規格上都超過了使用真實標籤訓練的OPSD:1.7B上40.1對39.7,4B上58.6對58.4,8B上62.6對61.7。這個結果說明一件挺讓人意外的事:偽標籤配合這套非對稱設計,效果不比真標籤差,甚至更好。

再看真正意義上"完全沒有標籤"的測試時訓練場景,模型直接在測試題目上訓練,全程沒有任何人工標註。這才是最考驗方法的地方。

方法 | AIME26 | HMMT26 | BRUMO25 | 平均

基礎模型 | 37.8 | 28.8 | 47.5 | 38.0

TTRL | 39.2 | 30.6 | 50.9 | 40.2

OPSD-TTT | 44.7 | 30.3 | 50.8 | 41.9

TTPO | **48.9** | **33.6** | **53.1** | **45.2**

在1.7B模型上,TTPO把平均分從38.0提升到45.2,漲了7.2個百分點,比TTRL高出5個百分點,比另一種自蒸餾基線OPSD-TTT也高出3.3個百分點。更有意思的是一個跨規模對比:TTPO訓練出的4B模型平均分達到61.1,已經超過了沒經過任何訓練的8B基礎模型(60.7)。也就是說,靠著在測試題目上自我訓練,一個更小的模型能追上甚至反超一個體量是它兩倍多的大模型。

如果把模型的"思考模式"關掉(也就是不讓它寫長長的推理過程,直接給答案),效果差異會更誇張。1.7B模型上,TTPO帶來的提升是25.2個百分點,4B上是30.6個百分點,8B上是36.4個百分點,而有標籤的OPSD在同樣條件下只能提升7.1、5.8、3.5個百分點。這說明TTPO那種"用懲罰主動糾偏"的機制,把帶著思考過程學到的推理習慣,更徹底地壓縮進了不帶思考過程的直接輸出里。

一個反直覺的實驗:真標籤反而不如假標籤好用

論文裡還做了一個挺有意思的對照實驗,結果乍看有點違背常識。

研究者把偽標籤換成貨真價實的正確答案,其他設計原樣保留,想看看這樣是不是能進一步提升效果,相當於探一探理論上限。結果發現,用真實標籤訓練出來的效果,反而比用偽標籤還要差。

為什麼會這樣?答案藏在題目難度里。AIME這類競賽題對模型來說是真的難,如果按照"是否等於標準答案"來劃分正負樣本,很多題目模型跑64次可能一次都沒蒙對,正樣本集合幾乎是空的。這時候用來做精細蒸餾的老師沒了教學對象,同時負樣本這邊由於幾乎所有樣本都被劃入"錯誤"這一類,組內相對優勢的計算方式讓懲罰信號也趨近於零,兩個分支同時失活,模型壓根學不到東西。而偽標籤這種"多數票"的劃分標準要寬鬆得多,總能湊出健康比例的正負樣本,兩個分支都能持續產生有效的訓練信號。

這就像一個班級里,如果按照"必須答對聯考真題標準答案"來分組討論,一道超綱的壓軸題可能全班沒一個人答對,討論小組根本組不起來。但如果按照"跟主流思路一樣還是不一樣"來分組,哪怕主流思路本身有問題,至少每次都能分成兩組,討論能持續進行下去,慢慢地大家的思路會互相校正、逐漸趨同於正確方向。硬性要求"必須完全正確才能參與討論",代價是討論根本無法啟動;放寬到"看多數人怎麼想",代價是可能被錯誤的多數意見帶偏,但換來的是討論持續發生的可能性,而論文的核心發現恰恰是,只要設計好非對稱的處理方式,這種"持續發生但不完全準確"的討論,長期看比"完全準確但很難發生"的討論更有價值。

論文還專門跟蹤了訓練過程中模型的"多數票質量"這個指標,結果顯示它不是停滯不前的,而是隨著訓練穩步提升。這形成了一個自我強化的循環:模型變強了,投票質量跟著變好,投票質量變好又反過來給後續訓練提供更可靠的信號,這個循環一旦轉起來,就能持續突破最初那個由基礎模型能力決定的天花板。

跨題目的遷移能力

還有一點值得單獨說一下。研究者擔心TTPO會不會只是把測試集裡的題目死記硬背下來,訓練完了在這批題上表現好,換一批題就打回原形。

為了驗證這個疑慮,他們分別在AIME2026、HMMT2026、BRUMO2025這三套題上單獨訓練,然後互相交叉評測。結果是,無論用哪一套題訓練,模型在另外兩套題上的表現都同步提升了。這說明TTPO學到的不是某道具體題目的答案,而是某種更通用的推理習慣,這種習慣能遷移到沒見過的新題目上。

Q&A

Q1:TTPO是什麼?

A:TTPO全稱Test-Time Policy Optimization,是一種不需要標準答案的大語言模型訓練方法,通過讓模型自己投票生成偽標籤,再用非對稱策略區分處理跟多數票一致和不一致的答案,讓模型在測試題目上自我提升。

Q2:為什麼用錯誤的多數票偽標籤訓練還能有效?

A:因為研究發現即便多數票是錯的,跟它意見不一致的答案里大約79%本身也是錯的,懲罰這些不合群的答案通常是對的,跟偽標籤具體內容無關,這種信號比直接模仿多數票答案抗噪性強得多。

Q3:TTPO和TTRL有什麼區別?

A:TTRL只用二元獎勵信號做強化學習,每條軌跡只有一個整體分數;TTPO額外引入了逐字逐詞的蒸餾信號,讓模型學習正確推理的具體步驟,在Qwen3-1.7B上平均分比TTRL高出5個百分點。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新