這項由中國人民大學高瓴人工智慧學院、獨立研究者、中國科學院計算技術研究所、杜克大學、中國科學院自動化研究所以及浙江大學電腦科學與技術學院聯合完成的研究,於2026年7月以預印本形式發布於arXiv,編號為arXiv:2607.16169v1。感興趣的讀者可通過該編號查閱完整原文。
訓練一個能幹活的AI智能體,就像培養一個能獨立完成家務的機器人助手。你得教它認識環境、理解任務、一步步執行操作,直到最終完成目標。然而,這個"培訓過程"本身有著極大的改進空間——用什麼方式來"糾正"AI的錯誤,用什麼節奏來調整它的行為,都深刻影響著最終能培養出多優秀的助手。這篇論文的核心問題,正是關於這個"糾正方式"的選擇。
研究團隊專注於一個看似技術細節、實則影響深遠的問題:當我們用強化學習(一種讓AI通過反覆試錯來學習的方法)來訓練智能體時,用一種叫做"Muon"的新型優化器,是否比傳統的"AdamW"更有效?結果出乎許多人的意料。
一、先搞清楚"優化器"是什麼
要理解這項研究,首先得明白"優化器"扮演的角色。可以用學鋼琴來做類比:AI模型就像一個鋼琴學生,每次彈錯了,需要有人告訴它哪裡錯了、怎麼改。這個"告訴它怎麼改"的機制,就是優化器。
AdamW是目前AI訓練中最常用的優化器,就像一位經驗豐富的鋼琴老師,它會針對每一個手指(模型的每個參數)單獨分析,根據這根手指最近的表現來決定它該調整多少。這種"逐個細調"的方式在很多場景下效果很好。
Muon則是一種較新的優化器,它的思路有所不同。它不單獨看每根手指,而是看整隻手的"姿勢結構"——從數學上來說,它會對所有參數的更新方向做一種叫"譜歸一化"的處理,粗略地理解,就是把強的方向和弱的方向拉到同一水平線上,讓每個方向的調整都相對均衡。這個過程通過一種叫"牛頓-舒爾茨疊代"的數學技巧來實現。
在大規模預訓練(就是從頭開始訓練超大模型)中,Muon已經展現出很大優勢——有研究表明,用Muon訓練一個十億參數規模的大模型,只需要AdamW一半左右的計算量就能達到同樣效果,甚至還被用於萬億參數級別的超大模型訓練。然而,沒有人系統研究過:在強化學習階段(也就是讓AI通過試錯來學技能的階段),Muon是否同樣有效?這正是本文要回答的問題。
二、測試場景:讓AI在虛擬房間裡幹家務
研究團隊選擇了一個名為ALFWorld的虛擬環境作為測試場。ALFWorld是一個文字描述的家庭場景模擬器,AI需要理解諸如"把蘋果放進冰箱"這樣的任務,然後一步步執行:先找到蘋果,再找到冰箱,打開冰箱門,放進去。任務分為六大類:拿取物品、查看物品、清潔物品、加熱物品、冷卻物品,以及同時拿取兩件物品。
這類任務有幾個特點使它特別有挑戰性。第一,每個任務最多需要50個步驟,是典型的"長期決策"任務。第二,獎勵非常稀少——只有在成功完成整個任務時才會得到正向獎勵,中途做了大量正確操作也不會立刻得到鼓勵,就像參加一場考試,只有交卷後才知道分數,過程中沒有任何提示。第三,動作格式有嚴格要求,如果AI輸出了格式不對的指令,會受到小小的懲罰。
被訓練的AI模型是Qwen2.5-0.5B-Instruct,這是阿里巴巴開發的一個5億參數規模的語言模型。研究在8塊英偉達
H20顯卡上進行,總共訓練200輪,每5輪進行一次測試,測試時評估128個任務的完成率。
三、三種不同的"評分方式"產生了截然不同的結果
強化學習的核心,是如何告訴AI它做得好不好——這就是"優勢估計"的問題。研究團隊比較了三種不同的評分方式,理解這三者的區別,是理解整篇論文結果的關鍵。
第一種叫GRPO(來自深度求索數學推理團隊的工作),用最簡單的方式評分:完成任務得分高,沒完成得分低,把同一批任務的得分做個對比,每條完整軌跡(從開始到結束的整個過程)只得到一個總評價。這就像給一場足球比賽只看最終比分,贏了全隊都好,輸了全隊都差,至於哪個球員在哪個時刻做了關鍵貢獻,完全不區分。
第二種叫GiGPO(來自NeurIPS 2025的工作),在GRPO的基礎上增加了一個"步驟級別"的評分。它的聰明之處在於:在不同的訓練軌跡中,AI經常會遇到完全相同的中間狀態(比如都走到了廚房門口)。GiGPO把所有在同一個狀態下做出的不同選擇收集起來,橫向比較這些選擇各自帶來的後續結果,從而給每一步單獨評分。這就像不只看比賽結果,還分析每個球員在每一次跑位時的表現——站對位置的球員得分高,站錯位置的得分低。
第三種叫GraphGPO(被ICML 2026接收),走得更遠。它把所有訓練軌跡里出現過的狀態和轉移關係整合成一張大的"狀態轉移圖",然後根據每個狀態離任務目標的距離來評分——離目標越近的狀態,越有價值,越應該被強化。這就像有一張完整的地圖,知道每個位置距離終點有多遠,每次移動是靠近終點還是遠離終點,都可以精確計算。
這三種方式代表了從粗到細的三個層次:只看最終結果、看每個中間步驟、看整體結構中每次轉移的價值。
四、Muon的表現:驚喜與差異並存
研究團隊的做法很乾淨利落:只把模型內部矩陣參數(注意力機制和前饋網路的權重矩陣)換成Muon來更新,而嵌入層、歸一化層等其他參數仍然保持用AdamW更新。這種"混合配置"是Muon的標準用法,因為Muon本就是為矩陣參數設計的。
在GiGPO框架下,這一改動帶來了最顯著的提升。以最終20%訓練階段(第175到200輪)的平均測試成功率來衡量,AdamW是0.290,而Muon達到了0.546,相對提升幅度高達88%。在最後一個檢查點,AdamW成功率是0.320,Muon達到了0.633,差不多是兩倍的差距。從整條訓練曲線來看,Muon從大約第50輪開始就持續領先,且領先優勢隨著訓練推進而不斷擴大,最終呈現出一條穩步攀升的漂亮曲線,而AdamW的曲線則相對平坦。
六大任務類別中,GiGPO+Muon在冷卻物品、同時拿取兩件物品和加熱物品這三類任務上的提升最為突出。沒有哪個任務類別單獨拉高了整體數字,改進是廣泛分布的,說明這不是偶然的個別現象。
在GRPO框架下,Muon同樣有改善,但幅度小得多。最終窗口均值從0.161提升到0.268,相對提升約67%。然而,如果看整條訓練曲線的面積(研究中稱為"歸一化驗證AUC"),提升幾乎可以忽略不計,從0.08到0.09。這說明大部分改善集中在訓練後期,Muon在訓練前中期的優勢並不明顯。
在GraphGPO框架下,情況又有所不同。由於GraphGPO本身的評分機制更精細,AdamW的基準表現就已經相當不錯(0.810),留給Muon"超越"的空間自然更小。當Muon學習率設為3×10^-5時,最終窗口成功率從0.810小幅提升到0.828;當學習率降低到1×10^-5時,最終窗口成功率達到0.901,但更值得關注的是:整條訓練曲線的AUC從0.399提升到0.556,並且達到50%和75%成功率的時間分別提前了30輪和60輪。也就是說,在GraphGPO下,Muon的優勢主要體現在"學得更快",而不是"最終學得更好"——因為最終兩者都接近上限了。
五、一個重要的排除實驗:單純提高學習率有用嗎?
有一種可能的質疑聲音是:也許Muon的優勢只是因為它使用了更大的學習率(相當於更激進地調整AI的行為),換成AdamW用同樣大的學習率是不是也能達到同樣效果?
研究團隊專門做了這個排除實驗。他們在GiGPO框架下,測試了AdamW在1×10^-5和3×10^-5兩個較高學習率下的表現。結果非常明確:兩個高學習率版本的AdamW在整個訓練過程中幾乎從第5輪開始就完全失效,測試成功率歸零並維持到第200輪結束。診斷數據顯示,這兩個版本的AI響應長度飽和(每次都生成最長的可能回復,把所有可用長度用滿)、有效動作率崩潰(生成的指令越來越多格式錯誤),同時KL散度(衡量模型偏離初始狀態程度的指標)出現大幅波動。簡而言之,更高學習率的AdamW把模型"訓壞了",而Muon在同樣高的學習率下卻能穩定運行200輪並持續改善。
這個對比非常有力地說明:Muon的優勢不僅僅來自學習率的數值大小,更來自其更新方式本身。Muon的譜歸一化機制提供了某種穩定性,防止了高學習率下常見的訓練崩潰。
六、步驟級評分和Muon各自貢獻了什麼?
為了精確區分"是GiGPO的步驟評分有用"還是"是Muon有用",研究團隊做了一個2×2的完整對比實驗。他們同時控制了兩個變量:優化器(AdamW還是Muon)和是否啟用步驟級評分(ω=0代表只用軌跡級評分,ω=1代表啟用步驟級評分)。
結果顯示了一個有趣的"雙贏"圖景。僅看是否啟用步驟評分的影響:AdamW在關閉步驟評分時成功率為0.141,開啟後提升到0.290,幾乎翻倍;Muon在關閉時為0.361,開啟後提升到0.546,同樣大幅提升。再看同一評分方式下換優化器的影響:在關閉步驟評分的條件下,Muon比AdamW高出0.220;在開啟步驟評分的條件下,Muon比AdamW高出0.255。兩個維度各自都有顯著貢獻,而且它們加在一起的效果似乎大於簡單相加——更細緻的評分和更好的優化器可能存在某種相互增強的關係。
七、為什麼會這樣?一個關於"信號質量"的猜想
研究團隊提出了一個理論框架來解釋觀察到的現象,雖然這只是一個猜想,尚未得到直接實驗驗證,但邏輯上頗具說服力。
核心思路是這樣的:每次訓練疊代中,AI實際收到的梯度信號(關於"如何修改參數"的資訊)可以分為兩部分:真正有用的"信號"和無關的"噪聲"。在長達50步的任務中,假設真正影響任務成敗的關鍵決策只有K個,但整條軌跡有T個步驟。如果只用最終結果來評分(GRPO的做法),那麼所有T個步驟都會被賦予同樣的權重,其中T-K個非關鍵步驟就成了噪聲來源。而步驟級評分的意義,就在於儘可能區分出哪些步驟真正重要,從而提高整體信號質量。
Muon的更新方式會把所有方向的更新幅度拉平:原本強勢的方向被壓低,原本微弱的方向被放大。這在信號質量高的時候非常有用——那些微弱方向往往包含被噪聲掩蓋的真實信號,放大它們有助於學習。但在信號質量低的時候,微弱方向可能只是純噪聲,放大噪聲就會適得其反。
研究團隊用一個數學公式來表達這個直覺:假設梯度矩陣中第i個方向的信號強度為si、噪聲標準差為σi,那麼Muon的極化更新與真實信號的對齊程度,正比於各個方向信號噪聲比si/σi的函數之和。信號噪聲比越高,Muon就越有用;信號噪聲比太低,Muon就可能幫倒忙。
這個猜想能夠統一解釋論文中的所有觀察:在長視野任務(而非單輪問答)中,加上步驟級評分(提升信號質量),Muon的優勢最為明顯;在GraphGPO這個評分更精細的框架下,即使是AdamW的表現也已經很好,Muon的邊際貢獻因此縮小;而之前其他研究中Muon在強化學習中失敗的案例,恰好集中在單輪任務、純結果評分的低信噪比場景。
這個猜想還給出了具體的可驗證預測:用更細緻的評分方式,應該能在訓練早期(而非只在訓練後期)就體現出優勢,因為它改善的是整條訓練曲線的效率。這與觀察到的"GraphGPO+Muon在時間門檻上提前30-60輪"高度吻合。
八、誠實面對局限
這篇論文的研究者非常坦誠地說明了研究的局限性。整個實驗是單次隨機種子運行的結果,這意味著觀察到的數字代表的是個別軌跡,而非統計意義上穩定的群體規律。換句話說,如果換一個隨機種子重跑,結果可能有所不同。
學習率的覆蓋範圍也比較有限:GiGPO和GraphGPO各測試了兩個Muon學習率,GRPO只測試了一個,沒有進行系統性的大範圍掃描。AdamW的高學習率控制實驗也只在GiGPO下進行,沒有擴展到其他框架。
所有實驗都只用了一個0.5B參數的小模型,在ALFWorld這一個任務環境下進行。更大的模型、更多樣的任務環境是否會復現同樣的結果,尚不清楚。此外,由於全矩陣不分片的實現方式,當前方案在擴展到更大模型時面臨顯存挑戰,需要分布式版本的Muon才能解決。
機制方面的證據也純屬相關性,沒有直接測量梯度更新的頻譜、有效秩或信噪比,所有理論分析都是"猜測性框架",而非經過驗證的因果機制。
說到底,這項研究的價值更多在於"打開了一扇門"——它說明Muon在強化學習後訓練階段是值得認真對待的選項,而不是一個已經蓋棺論定的最優解。它證明了之前"Muon不適用於強化學習"的負面結論是有條件限制的,在合適的任務結構和評分機制下,Muon可以帶來相當可觀的改進。
更重要的發現可能是,優化器的選擇和評分機制的設計應該被視為一個整體來考慮,而不是兩個可以獨立調優的旋鈕。當兩者的特性相互匹配——精細的信用分配遇上善用微弱信號的優化器——才能發揮出最大潛力。未來的研究需要更多隨機種子、更大的模型、更多樣的任務,以及真正測量梯度頻譜的實驗,才能把這個猜想變成紮實的結論。
Q&A
Q1:Muon優化器和AdamW優化器的根本區別是什麼?
A:AdamW對每個參數單獨調整更新幅度,就像針對每根手指單獨調整力度;Muon則對整個權重矩陣的更新方向做"譜歸一化",把強方向壓低、弱方向放大,讓所有方向的調整幅度趨於均衡。這種特性在信號質量高的場景下有助於發現被噪聲掩蓋的有用信號,但在信號噪聲比低的場景下也可能適得其反。
Q2:為什麼高學習率的AdamW在GiGPO實驗中會直接訓練失敗?
A:當AdamW使用1×10^-5或3×10^-5的學習率時,每次參數更新的步長過大,模型偏離初始狀態過快,出現了KL散度暴漲、生成響應長度飽和、有效動作率崩潰等一系列連鎖反應,AI幾乎從第5輪開始就失去了正常完成任務的能力,成功率歸零且一直維持到訓練結束。而Muon在同樣數值的學習率下卻能穩定運行,說明其譜歸一化機制本身提供了某種對大步長的抵抗力。
Q3:GiGPO、GRPO和GraphGPO三種方法中,哪種和Muon的配合效果最好?
A:從最終成功率的絕對提升來看,GiGPO配合Muon的效果最顯著,最終窗口成功率從0.290提升到0.546,相對提升88%;從整條訓練曲線的學習效率來看,GraphGPO配合Muon的AUC提升最大,並且能將達到關鍵成功率門檻的時間提前30至60輪。GRPO與Muon的配合有改善但幅度最小,且主要集中在訓練後期。






