你有沒有教過小孩騎自行車?
如果你在後面一直扶著車座,孩子永遠學不會平衡。如果你一開始就完全放手,孩子摔一次就再也不肯騎了。真正管用的做法是,扶一段路,然後鬆手讓他自己騎一小段,摔了再扶一下。鬆手的那個"度",不多不少,才是學習真正發生的地方。
這篇論文討論的問題,本質上就是這個"鬆手松到什麼程度"的問題,只不過對象換成了正在學習完成複雜任務的AI智能體。
**這件事難在哪**
先說清楚背景。現在訓練AI智能體(比如讓它在虛擬房間裡撿東西、在網上買東西)常用一種叫強化學習的方法,簡單說就是讓AI自己不斷嘗試,做對了給獎勵,做錯了沒獎勵,靠這個信號慢慢學會怎麼做事。
強化學習*:一種讓AI通過反覆試錯、根據結果好壞調整自己行為的訓練方式,跟訓練寵物做動作類似,做對了給零食,做錯了不給。
問題出在哪裡?這類任務往往要走十幾步甚至幾十步才能知道成不成功,中間每一步都沒有反饋。你讓AI從零開始瞎試,它大概率永遠走不到成功的那一步,連續幾十步全靠猜,成功率幾乎是零。論文裡提到,在這種情況下,策略幾乎不可能靠自己摸到成功的終點狀態。
研究者們想出的辦法叫"提示引導",英文叫hint-based RL。思路很簡單:既然AI自己走不到終點附近,那就先給它看一段"專家走過的路",讓AI從半路開始接著走,這樣它離成功近了,更容易撞上正確答案,也就更容易學到東西。
專家軌跡*:由人類或更強模型提前示範好的一整套完整操作步驟,比如"先開冰箱、拿出蘋果、放進鍋里、開火"這樣一條完整的成功路徑。
這個思路聽起來挺合理,但馬上冒出一個新問題:這段"專家路"該給多少?給太少,AI還是走不到終點附近,等於沒給;給太多,AI幾乎是原樣抄完專家的操作直接成功,它自己什麼都沒學到,因為獎勵變得太容易拿,沒有對比性,它分不清哪一步做得好哪一步做得差。
論文裡管這個"給多少"叫引導深度。這個深度定得不好,訓練效果就大打折扣,這正是整篇論文要解決的核心矛盾。
**已有方法都卡在哪兒**
在Agent-G?之前,業界大致分兩條路。
第一條路叫schedule-based,也就是按訓練進度定一個統一的深度。比如訓練剛開始給多一點提示,隨著訓練進行逐漸減少提示,用一條曲線(線性下降、餘弦下降、階梯下降)來控制。這類方法的問題很直接:整批任務共用同一個深度值,完全不管每個任務本身有多難。
論文舉了個特別形象的例子:在ALFWorld這個虛擬家居環境裡,"撿一個東西"可能只需要兩步,"撿兩個東西"卻要走二十步。用同一個深度去套這兩種任務,簡單任務給多了浪費,難任務給少了根本不夠。論文用實際數據驗證了這個問題的嚴重性,他們測試的幾種按進度調整的方法,把提示分配到"有效區間"里的比例只有15%到23%,剩下六成以上的分配都是過多或過少,屬於無效引導。就連表現最好的那種(根據批次準確率動態調整的方法),也有38%的分配落在無效區間外。
第二條路叫per-sample probing,給每個任務單獨測試出最合適的深度。做法是先在幾個候選深度上各跑幾次,看哪個深度讓成功率最接近50%(因為50%成功率意味著"半懂不懂",正是學習信號最強的地方),選中它作為這個任務的深度。這個方法確實更精準,但代價是要多跑很多次探測性的實驗。論文的數據顯示,如果每個候選深度只跑2次去探測,用二分搜索的方法依然有75%的任務被分配錯了深度;想要把錯誤率降到接近於零,得每個候選深度跑32次,探測成本是正常訓練的20倍。
這就好比找鑰匙掉在了哪個房間。一種辦法是隨便猜一個房間去翻箱倒櫃,翻錯了大概率還得再來一次;另一種辦法是每個房間都仔細搜一遍,肯定能找到,可是這樣一來找鑰匙的時間比開門出去要用的時間還長得多。如果不多花時間去精確定位,就找不准;如果花時間精確定位,代價又太大,成本會失控。這正是per-sample probing面臨的兩難。
**藏在數據里的真相:最佳深度根本不是一個點**
論文作者做了一件很紮實的診斷工作,他們想搞清楚,"有效的引導深度"到底長什麼樣。
他們在ALFWorld環境裡,針對每一個任務,把好幾個候選深度都跑了32次,統計每個深度對應的成功率。結果發現一個特別關鍵的現象:能讓訓練最有效的深度,不是孤零零的一個值,而是一整片區域。
論文裡畫了一張圖,橫軸是不同的引導深度,縱軸是成功率,可以看到成功率並不是在某個深度突然從0跳到1,而是像坡度一樣緩慢爬升再緩慢下降,中間那一片"半懂不懂"(成功率在0.4到0.6之間)的區域,往往覆蓋好幾個相鄰的深度值,不是單一的一個數字。
更進一步,他們把訓練信號的強弱(用伯努利方差衡量,成功率越接近50%這個值越大)按"相對最佳深度的偏移量"對齊後畫出來,發現這條曲線長得幾乎就是一個正態分布(也就是常說的"鐘形曲線"),擬合出來的標準差是0.22,擬合優度R?達到0.92,說明這個鐘形分布的形態非常吻合。
這個發現推翻了此前所有方法的一個隱藏假設,就是"每個任務存在唯一的最佳深度,任務是要把它找出來"。而事實是,有效深度是一整個鄰域,而不是一個孤立的點。就像找一個人能不能聽清楚你說話的最佳距離,不是精確到毫米的某一個數字,而是一米到三米之間都能聽得清楚,你沒必要非要量出精確的那一個數字,只要站在這個區間裡就行。
如果繼續把這個"區間"問題當成"單點定位"問題來解決,自然會撞上前面說的兩條路的困境:統一深度覆蓋不了區間的差異性,per-sample探測又為了精確定位單點付出了本不必要的成本。真正該做的不是更精確地定位一個點,而是讓引導深度本身變成一個可以覆蓋那片區間的分布。
**Agent-G?的做法:把"給多少提示"變成一個概率分布**
這就是Agent-G?的核心創新。它不再給每個任務分配一個固定的深度數字,而是給每個任務分配一個高斯分布(也就是正態分布),深度值從這個分布里隨機抽一個出來用。
高斯分布*:就是那個經典的鐘形曲線,中間概率最高,兩邊逐漸降低,抽樣時大概率抽到中間附近的值,偶爾也會抽到稍遠一點的值。
關鍵在於這個分布的兩個參數(中心位置和分散程度)怎麼定。論文設計了一套"全局加局部"的估算辦法,完全從已經跑出來的訓練數據里現算,不需要額外多跑一次實驗去專門探測。
具體來說,系統維護一個全局基線,追蹤整體訓練進度處於什麼水平。如果這批任務整體成功率偏低,說明當前策略還比較弱,就把全局基線往"提示更深"的方向調;如果整體成功率偏高,說明策略已經不錯了,就往"提示更淺"的方向調。
同時,系統把所有任務按專家軌跡長度(也就是任務本身的複雜程度)離線分成幾個簇(論文裡分成短、中、長三類),對每個簇單獨維護兩個統計量:這個簇當前的平均成功率,以及這個簇內部成功率的波動程度。簇內成功率越低,說明這類任務偏難,中心就往更深的引導方向偏移;簇內波動越大,說明簇里任務的難度參差不齊,分布的散布程度就調寬一些,讓抽樣能覆蓋更寬的範圍。
拿一個具體場景來說明這套機制。假設"長任務"這個簇(比如需要撿兩個東西再放進冰箱這種二十步任務)本身內部差異很大,有些變體接近簡單任務的難度,有些則特別繞。如果強行給這個簇一個固定深度,就會出現前面說的問題:某些子任務提示夠了但另一些還差得遠。而Agent-G?通過把這個簇的分布調得更寬,讓抽樣結果本身自然覆蓋到簇內的不同難度層次,某次抽樣給深提示,某次抽樣給淺提示,整體上就能兼顧簇內的差異性。如果不這麼做,簇內差異越大的任務群體,效果損失就越明顯,論文的實驗後面會證實這一點。
每個任務確定好分布後,就從這個分布里抽一個具體的深度值,轉換成對應的提示步數,讓所有的實驗重複都從這個統一的"半路起點"出發繼續探索。而這批實驗跑出來的結果,又反過來更新前面提到的那些統計量,進入下一輪循環。整個過程不需要額外的探測性實驗,也不需要訓練一個專門的深度預測模型,所有需要的資訊都是正常訓練過程中本來就會產生的副產品。
這套機制最巧妙的地方在於,它把"探測成本"和"覆蓋不到位"這兩個此前互相矛盾的問題同時解決了。不用額外跑實驗去精確定位,因為壓根不需要精確定位一個點;覆蓋面又足夠寬,因為分布本身就是設計用來覆蓋那片有效區間的。
**訓練效果:數字說話**
論文在ALFWorld(虛擬家居任務)和WebShop(網購任務)兩個環境上,分別用1.5B和7B兩種規模的Qwen2.5模型做了實驗。
在ALFWorld上,Agent-G?在1.5B規模下整體成功率達到95.3%,在7B規模下達到98.4%。相比之下,最強的按進度調整方法(Target-acc)在兩個規模下分別是93.8%和92.9%,最強的探測式方法(Enumeration)分別是86.0%和96.1%,最強的輔助監督類方法(RLVMR)分別是87.9%和91.8%。Agent-G?全面超越了這些對手,且隨著模型規模從1.5B變大到7B,它的領先優勢沒有縮小反而從1.5個百分點擴大到2.3個百分點,說明這套方法不會因為模型變強就失效。
在WebShop上,Agent-G?在兩個規模下都拿到了92.3的獎勵分數,最終購買成功率分別是78.9%和84.4%,同樣是所有不依賴額外探測的方法中最強的。
有一個特別值得說的細節。1.5B規模的Agent-G?,效果居然超過了7B規模的另一個基線方法BEACON(91.4%)。這意味著一個更小的模型,配合更聰明的引導策略,能打過一個更大的模型配合普通策略。這說明調度設計這件事本身,價值可以等價於把模型規模做大,不是可有可無的輔助優化。
論文還專門做了個對照實驗,證明這個提升不是靠"抄專家答案"取巧得來的。他們試了純粹靠模仿專家完整軌跡訓練的模型(Full SFT),成功率只有56.3%;只在Agent-G?訓練過程中採樣到的那些提示片段上做模仿訓練的模型(Sampled-Prefix SFT),成功率更低,只有26.6%。而Agent-G?本身是95.3%,中間差了68.7個百分點。這個巨大的差距說明,真正起作用的不是模仿了多少專家的操作,而是AI在"從提示末尾接著走"這個後續探索階段學到的東西,模仿只是打底,強化學習才是主力。
再看訓練速度。論文對比了達到同等準確率所需的訓練步數,Agent-G?比表現最好的固定調度方法快了大約一倍。雖然Agent-G?每一步訓練的耗時比簡單調度方法略高(88秒對57到80秒),但相比探測式方法(285到425秒,是Agent-G?的3.24到4.83倍)依然便宜得多。綜合收斂速度和單步成本,Agent-G?的整體訓練效率是所有方法裡最優的。
**拆解一下:中心和散布分別管什麼**
論文做了細緻的消融實驗,把Agent-G?拆開看每個部件到底貢獻了多少。
如果去掉隨機抽樣這一步,每個任務直接用分布的中心值當固定深度(相當於退化成一個確定性調度器),整體成功率從95.3%掉到89.8%,降了5.5個百分點。這證明單點估計確實覆蓋不了那片有效區間,隨機性本身就是價值所在。
如果把高斯分布換成方差匹配的均勻分布(也就是抽樣範圍內每個值概率相等,不再是中間高兩邊低),成功率降到88.3%,說明抽樣要覆蓋區間沒錯,但呈鐘形分布地覆蓋比平均地覆蓋效果更好,跟前面觀察到的信號強度本身就是鐘形分布這一點是吻合的。
如果去掉按簇調整中心的機制,所有任務共用一個全局中心,成功率降到91.4%。如果去掉按簇調整散布寬度的機制,成功率降到93.8%,其中長任務這個簇的成功率單獨從94.7%暴跌到78.3%,跌幅特別大。這說明長任務這類難度參差不齊的任務群體,恰恰最依賴分布寬度的自適應調整,一旦分布寬度固定住不能變,最先受傷的就是這類任務。
如果把所有任務全部塞進一個簇,不做任何區分,成功率降到89.1%,長任務的成功率單獨暴跌29.3個百分點。這幾乎證實了論文開頭提出的觀察:任務難度差異巨大是agentic任務區別於數學推理這類任務的核心特徵,忽略這種差異性會帶來實實在在的性能損失。
**關於聚類方式的補充實驗**
論文額外做了一組實驗,看聚類數量和聚類依據本身對結果的影響。
結果顯示,按專家軌跡長度分成3類和分成5類效果基本相當(分別是95.3%和96.5%,在實驗的誤差範圍內難分高下),但如果分成10類,每個批次里每一類平均分不到兩個任務,統計量根本沒法穩定估計,成功率反而跌到86.2%。而如果完全隨機地把任務分成3組(不按任何難度信號),成功率只有89.4%,跟完全不分組的89.1%幾乎沒差別。
這說明分組這件事本身不產生價值,真正產生價值的是分組依據要和任務難度對齊。論文選擇用軌跡長度這個簡單指標來分組,原因也很樸素:軌跡長度天然跟"不給提示能不能靠自己摸到成功"這件事的難度相關,而且不需要額外的人工標註或語義理解,同一套規則可以直接套用到不同的任務環境上。
**寫在後面**
讀完這篇論文,最讓我停下來想了很久的一點是,這裡面藏著一個更普遍的道理:很多"最優參數"類問題,可能壓根不該被當成尋找單點最優解的問題。
平時做技術選型或者調參的時候,很容易陷入一種思維定勢,覺得一定存在唯一的"最佳值",任務就是想辦法逼近它。但這篇論文用紮實的數據證明,至少在這個場景下,有效區間是一片而不是一個點,把尋找單點的精力,不如用來把這片區間摸清楚,然後設計一個機制讓系統自然落在這片區間裡。
另一個讓我覺得挺妙的地方是,這套方法完全不需要額外的探測成本,所有的統計量都是訓練本身產生的副產品。這其實是一種"零成本感知環境狀態"的思路,系統一直在自然產生的數據里,藏著足夠的資訊去指導下一步該怎麼調整,只是需要有人願意把這些資訊利用起來,而不是又去跑一遍額外的實驗來單獨測量。
這讓我想起一個不完全相關但感覺上有點像的場景。有些好的管理者不需要專門開會去"了解團隊狀態",因為日常匯報、代碼提交、消息回復速度里已經藏著足夠的信號,只是大部分人選擇性忽略了這些免費的資訊,反而去搞額外的績效考核。資訊可能一直都在那兒,缺的往往不是數據,而是把數據用起來的那套機制。
論文裡沒細談的一點是,如果任務的難度分布本身是雙峰的(比如某類任務有明顯的"簡單變體"和"困難變體",中間沒有過渡),鐘形分布這個假設會不會失效?論文自己也承認了這一點,說這屬於開放方向。這個問題留著,也許下一篇論文會給出答案。
Q&A
Q1:Agent-G?是什麼?
A:Agent-G?是一種給AI智能體訓練用的引導深度分配方法,它不再給每個任務固定一個提示深度,而是從一個高斯分布里隨機抽取,這個分布的中心和寬度都從已有的訓練數據里在線估算出來,不需要額外探測實驗。
Q2:Agent-G?和傳統的按進度調整提示深度方法有什麼區別?
A:傳統方法給整批任務用同一個提示深度,忽略了任務難度差異;Agent-G?給每個任務單獨分配一個概率分布,還會按任務簇的難度和波動程度動態調整分布的中心和寬度,能覆蓋不同難度任務各自的有效區間。
Q3:Agent-G?的效果比其他方法好多少?
A:在ALFWorld環境下,Agent-G?整體成功率達到95.3%(1.5B模型)和98.4%(7B模型),比最強的探測式方法和輔助監督方法都高出好幾個百分點,同時訓練成本只有探測式方法的三分之一左右。






