這項由浙江大學、新加坡國立大學、上海交通大學與美團聯合完成的研究,於2026年7月以預印本形式發布,論文編號為arXiv:2607.26784,感興趣的讀者可通過該編號查閱完整論文。研究團隊提出了一個名為SkillRise
的強化學習框架,核心目標是讓AI智能體在完成一系列相關任務的過程中,不斷積累可復用的"經驗技巧",並將這些技巧帶到下一個任務中去——就像一位經驗豐富的手藝人,每做完一件活兒,都能把心得記在腦子裡,下次遇到類似的活兒就能做得更順手。
現有的AI智能體大多患有一種"健忘症"。每次開始一個新任務,它們都得從零開始摸索,完全不記得之前做過什麼、踩過哪些坑。就好比一個學徒工,每天上班都會忘記昨天學的所有東西,永遠停留在"初學者"階段,這顯然既低效又浪費。SkillRise就是為了解決這個問題而生的——它讓AI智能體擁有了一本可以隨時翻閱、不斷更新的"工作手冊",並且學會了如何把每次的經驗提煉成真正有用的通用技巧,而不只是記住某一件具體事情的做法。
研究團隊在三個經典的文字交互環境中驗證了這一框架的效果。ALFWorld是一個模擬家居場景的環境,AI需要在虛擬房間裡找到物品、放到指定地方,甚至加熱或清潔東西。WebShop則是一個模擬網路購物的環境,AI需要根據自然語言描述的需求,搜索、篩選併購買合適的商品。ScienceWorld則更有趣,它是一個模擬小學科學實驗的交互環境,AI需要完成各種科學探究任務。在這三個場景中,SkillRise的表現都超過了所有對比方法,優勢幅度從2.3個百分點到8.5個百分點不等。
一、為什麼"會總結經驗"的AI比"努力幹活"的AI更厲害
先來理解一下這個研究想解決的根本問題。傳統的AI強化學習方法,通常是讓AI反覆嘗試同一個任務,通過不斷試錯來改進自己的行為策略。這就像讓一個孩子每天做同一道數學題,做上幾千遍,他當然會做那道題了,但換一道類似的題,他可能還是不會。
另一種思路是給AI建一個"經驗庫",把之前遇到過的好方法存進去,下次遇到相似問題就去查一查。聽起來不錯,但這種方法有個麻煩:經驗的提取、儲存、檢索、使用是四個不同的步驟,每一步都可能出問題,而且一旦最終結果不好,你很難判斷到底是哪個環節出了差錯,就像一道工序複雜的菜不好吃,你不知道是食材有問題、調料放錯了,還是火候沒掌握好。
SkillRise的解決思路則簡潔得多。它不搞複雜的多階段流水線,而是讓同一個AI策略(可以理解為同一個"大腦")既負責完成任務,也負責在任務結束後總結經驗、更新"工作手冊"。這本手冊的內容會直接傳遞給下一個任務時的AI,而不需要經過任何中間環節的檢索或篩選。這就好比一個老工匠在每天收工後,親自把當天的心得寫進自己的筆記本,第二天上工時就把這本筆記放在手邊翻閱——整個過程完全由他本人掌控,省去了中間人傳話可能產生的誤差。
二、SkillRise的工作方式:手藝人的三步修煉法
SkillRise的整體設計可以用一個手藝人學藝的故事來理解,而且這個故事貫穿整個系統的始終。
故事的第一步,是精心安排練習順序。就像一個好的師傅不會讓徒弟一上來就做最難的活兒,SkillRise會把同一類任務從簡單到複雜排成一列。比如在WebShop購物場景中,同一個產品類別下,先安排只需要匹配一兩個屬性的簡單購物任務,再安排需要同時滿足顏色、尺寸、價格等多個條件的複雜任務。這樣,前面簡單任務中積累的經驗,就能在後面複雜任務中發揮出更大的價值。每一批訓練數據包含16個任務序列,每個序列由3個來自同一任務家族但具體內容不同的任務組成,並且對每個序列同時進行8次獨立嘗試,以便比較不同嘗試之間的好壞。
故事的第二步,是幹活與總結交替進行。當AI面對序列中的第一個任務時,它的"工作手冊"還是空白的,只能憑本事硬幹。任務結束之後,AI立刻切換身份,變成一個"總結者":它回顧剛才的整個交互過程,把有用的經驗提煉成通用的步驟,把踩到的坑記錄為"注意事項",然後把這些內容寫進手冊,交給處理下一個任務的自己。值得注意的是,切換身份的是同一套AI參數,只是使用的提示語(相當於"崗位職責描述")不同。此外,手冊里絕對不允許出現"蘋果1號放在抽屜3里"這種具體實例的記錄,而必須提煉成"把目標物品放入指定容器"這樣的通用規則。這個"去實例化
"的要求非常關鍵,它確保了手冊里的內容能跨任務通用,而不是成為某道題答案的小抄。
故事的第三步,是聰明地分配"功勞"與"反饋"。這裡有一個微妙但重要的設計。AI幹活時收到的好壞反饋(即這個任務有沒有完成),用來訓練它的"幹活能力";而AI總結經驗寫手冊時收到的反饋,則來自後續任務的完成情況。具體來說,如果AI在第一個任務後寫了一份手冊,這份手冊的質量好不好,要等到第二個、第三個任務完成後才能知道,而且越近的後續任務反饋權重越大(通過一個折扣係數γ來調節,研究中設為0.6)。這就像一個老師傅評價自己指導徒弟的效果,不是看自己寫的筆記有多漂亮,而是看徒弟拿著這本筆記之後,後續的工作做得好不好。這種設計讓"總結技能"的訓練信號與"幹活技能"的訓練信號彼此獨立,不會相互干擾,從而讓AI能同時把兩件事都學好。
在計算每次嘗試的"進步信號"(即強化學習中的優勢值)時,SkillRise也很講究:同樣位於序列第一個任務、同樣處於"幹活"階段的多次嘗試,才會互相比較好壞;幹活階段和總結階段的嘗試,絕不混在一起比較。這就像體育比賽的賽制,跳高選手和跳遠選手不會放在同一組排名,否則比較毫無意義。
三、手冊長什麼樣:從具體案例看技能是如何沉澱的
研究團隊在論文中展示了兩個真實的訓練案例,非常生動地展示了這本"工作手冊"的更新過程。
第一個案例講的是從失敗中學習。AI面對的第一個任務是把兩個噴霧瓶放進柜子,但它只放了一個就找不到另一個了,任務失敗。任務結束後,AI總結道:如果需要放置多個同類物品,應該對每個物品重複整套"找到-拿起-移動-放入"的流程。這條通用規則被寫進手冊。下一個任務是把兩個胡椒粉瓶放進柜子,任務涉及的是完全不同的物品,但手冊里的規則同樣適用,AI順利完成了任務。一個來自失敗的教訓,在不同的具體場景中發揮了作用,這正是"可遷移技能"的價值所在。
第二個案例展示的是成功之後的技能疊代。第一個任務是把一部手機放到床上,目標位置(床)不需要打開,AI順利完成,手冊里記錄了基本的"找到物品-拿起-移動到目的地-放下"流程。第二個任務是把一個番茄放進微波爐,AI發現微波爐的門是關著的,所以需要先開門再放東西。任務成功後,手冊更新了:在第五步"把物品放到目標容器"之前,增加了一條新規則:"檢查目標容器是否可以打開,如果是關閉狀態,先開門"。這條新增規則使用的是"目標容器"這種通用表達,而不是"微波爐"這個具體詞語,因此未來遇到柜子、冰箱、箱子等任何需要開門的容器時,同樣適用。這種從具體經驗提煉通用規則的能力,正是SkillRise著力培養的核心技能。
四、實驗結果:數字背後的意義
研究團隊在三個基準測試環境中,與多種方法進行了系統比較。對比的方法涵蓋三類:零樣本提示、ReAct(一種將推理和行動交替進行的經典方法)、Reflexion(一種讓AI通過語言自我反思來改進的方法)屬於不需要專門訓練的提示類方法;PPO、RLOO、GRPO、GiGPO屬於標準強化學習方法;LaMer則是一種元學習方法,它讓AI對同一個任務反覆嘗試,並從每次嘗試的反思中積累經驗。
在ALFWorld的六種家居任務(拿取物品、查找物品、清潔物品、加熱物品、冷卻物品、拿取兩件物品)上,SkillRise的總體成功率達到85.9%,而表現最好的基線方法GiGPO為83.6%,領先了2.3個百分點。在六個子任務中,SkillRise有五個排到了第一或第二名。在WebShop購物任務上,SkillRise的成功率為84.4%,而GiGPO為77.3%,領先幅度擴大到7.1個百分點。在ScienceWorld科學實驗場景中,SkillRise達到54.6%,GiGPO為46.1%,領先了8.5個百分點。
論文還測試了"Pass@2"和"Pass@3"指標,也就是對同一個測試任務進行兩次或三次嘗試時,只要有一次成功就算通過。在這個設定下,AI會把上次嘗試的手冊帶入下一次,相當於在同一個任務上使用技能疊代。SkillRise在這兩個指標上同樣領先所有方法,並且超越了專門為"同任務多次嘗試"而設計的LaMer方法。在ScienceWorld的Pass@3上,SkillRise達到61.0%,而LaMer僅為46.8%,差距高達14.2個百分點。這說明SkillRise學到的"總結經驗"能力,不僅能跨任務工作,也能在同一任務的反覆嘗試中發揮作用——儘管它壓根就不是為這個目的專門訓練的。
五、越干越聰明:序列越長,表現越好
這項研究中最有趣、也最有說服力的一個發現,是"跨任務測試時間擴展"現象。研究團隊做了這樣一個實驗:把相同的128個測試任務,分別組織成長度為2、4、6的相關任務序列,每個任務只嘗試一次,但AI可以在序列內積累手冊。結果發現,SkillRise的Pass@1成功率從序列長度為2時的83.6%,穩步提升到序列長度為6時的87.5%,提升了3.9個百分點。
這個發現的關鍵之處在於:每個任務都只嘗試一次,所以性能的提升絕對不是因為對同一題目多次抽樣帶來的運氣成分,而是真真切切地因為之前任務積累的技能幫助了後面的任務。相比之下,LaMer、GiGPO、GRPO這三個對比方法在序列長度增加時,並沒有表現出持續穩定的提升趨勢。這正好印證了SkillRise學到的是真正可遷移的技能,而不僅僅是對某一具體任務的過擬合。當序列長度增加到6時,SkillRise與最強基線之間的差距從3.9個百分點擴大到8.6個百分點,優勢隨著"積累的任務經驗越多"而越來越顯著。
六、消融實驗與效率對比:哪些設計真正有效
研究團隊還做了一系列對照實驗,來驗證各個設計選擇的必要性。
關於折扣係數γ的選擇,研究團隊測試了0.3、0.4、0.6、0.7四個取值,發現四種設置下的訓練曲線幾乎重合,最終性能相差不超過一個百分點。這說明SkillRise的設計對這個超參數非常不敏感,不需要精心調參才能奏效,具有很強的實用性。
關於"總結經驗"這一步驟是否真的有必要,研究團隊設計了一個"無總結變體":保持同樣的K=3任務序列和同樣的環境交互次數,但去掉任務間的手冊更新步驟,阻止技能在任務間傳遞。實驗結果顯示,在訓練初期三種方法差不多,但隨著訓練的推進,有手冊總結的SkillRise開始拉開差距,最終比"無總結變體"高出約3個百分點,比普通的GRPO高出超過6個百分點。這證明了兩件事:僅僅把任務排成序列是不夠的,必須顯式地把經驗提煉成手冊;跨任務的技能積累提供了超越單任務優化的額外學習信號。
在與其他"有外部技能管理流水線"的方法相比時,SkillRise的效率優勢更為突出。RetroAgent是一種生成反思、存入記憶庫、檢索相關經驗、更新效用分數的多步驟系統;SkillRL則需要藉助強大的教師模型來提煉軌跡、分層構建技能庫、冷啟動監督微調、技能檢索和疊代更新等多個階段。在ALFWorld上,SkillRise的平均成功率與RetroAgent持平,均為85.9%,比SkillRL高出12.5個百分點。然而在運行時間上,RetroAgent需要SkillRise的6.0倍,SkillRL需要4.3倍。由此可見,複雜的外部管理流水線並不一定帶來性能提升,反而會大幅增加計算開銷,而SkillRise用更簡潔的端到端設計,實現了同等甚至更好的效果。
七、從小到大都管用:不同模型規模下的表現
研究團隊還測試了SkillRise在不同模型規模下的表現,以確認其優勢不依賴於特定大小的模型。實驗使用了Qwen3-1.7B(約17億參數)和Qwen3-4B(約40億參數)兩個規模的語言模型,並與GRPO和LaMer進行比較。
在1.7B的較小模型上,SkillRise就已經達到78.1%,超過最強基線3.1個百分點。換到4B的較大模型後,SkillRise提升到85.9%,領先優勢進一步擴大到6.2個百分點。更值得關注的是提升幅度:從1.7B到4B,GRPO提升了4.7個百分點,LaMer提升了3.3個百分點,而SkillRise提升了7.8個百分點。這意味著模型越大,SkillRise從中獲益越多。研究團隊的解釋是,SkillRise需要AI同時學會"完成任務"和"從任務中抽象通用技能"兩種能力,更大的模型在處理這種複合型學習任務時擁有更強的能力上限,因此提升空間也更大。
說到底,SkillRise想要解決的是一個非常基礎但長期被忽視的問題:AI應該能從經驗中學習,而且這種學習應該是可遷移的,而不是對某一具體場景的死記硬背。通過把相關任務組成序列、讓AI在任務間維護一本不斷更新的"技能手冊"、並用後續任務的結果來評價手冊的質量,這個研究提供了一種清晰、高效、可端到端訓練的解決方案。
歸根結底,這項研究告訴我們,讓AI變得"越來越聰明"不一定需要無限增加模型的規模,也不一定需要搭建極其複雜的管理系統。有時候,給AI一本可以自己更新的工作手冊,並且讓它學會如何正確地總結經驗、如何把具體的遭遇提煉成通用的智慧,才是更根本的進步方向。隨著未來更大規模的模型和更複雜的現實任務場景被納入測試,這種跨任務技能學習的範式是否能持續穩定地發揮作用,以及如何在沒有"任務家族"標籤的開放環境中自動識別相關任務,仍然是值得深入探索的方向。有興趣深入了解技術細節的讀者,可以通過論文編號arXiv:2607.26784查閱完整原文。
Q&A
Q1:SkillRise與傳統強化學習方法有什麼根本區別?
A:傳統強化學習把每個任務當作獨立的事件來處理,AI完成一個任務後不會把經驗帶到下一個任務,每次都從零開始。SkillRise則讓AI在完成一個任務後,立即總結經驗並更新一份"技能手冊",這份手冊會直接傳遞給處理下一個任務的AI,形成跨任務的經驗積累。這種設計讓AI在面對一系列相關任務時,表現會隨著任務數量的增加而持續提升。
Q2:SkillRise的技能手冊里會記錄什麼內容,又怎麼保證不同任務都能用得上?
A:手冊里記錄的是提煉過的通用步驟和注意事項,而不是某次具體經歷的原始記錄。系統的設計要求AI在總結時必須把具體實例替換為通用概念——比如"蘋果1號放在抽屜3里"要被改寫成"把目標物品放入指定容器"。這種"去實例化"處理確保手冊內容能夠適用於不同具體對象,從而在新任務中同樣有參考價值。
Q3:SkillRise的訓練成本比其他技能學習方法高嗎?
A:恰恰相反,SkillRise比其他有外部技能管理流水線的方法效率更高。實驗數據顯示,RetroAgent和SkillRL的運行時間分別是SkillRise的6倍和4.3倍,但它們的性能並沒有相應的優勢,SkillRL甚至比SkillRise低12.5個百分點。SkillRise不需要外部教師模型、獨立的記憶儲存模組或檢索系統,用同一套AI參數完成任務執行和經驗總結兩件事,結構簡潔,計算開銷低。






