先說一個讓人撓頭的場景。
你讓一個機器人去撿桌上的杯子。它的大腦里有一個很聰明的設計:不光要算出手臂該往哪兒動,還要先在腦子裡"想像"一下未來幾秒鐘畫面會變成什麼樣,杯子被抓起來是什麼樣子,桌子會不會晃。這種一邊預測畫面一邊生成動作的模型,學界給它起了個名字。
世界動作模型
:一種同時預測機器人動作和未來畫面的AI模型,讓機器人在行動前先在腦內"演一遍"接下來會發生什麼,從而做出更可靠的決策。
聽起來很美好對不對?機器人有了想像力,行動更審慎了。但問題也隨之而來,這個"想像"的過程一點都不便宜。
**核心問題出在哪**
先說清楚一件事:這類模型的工作方式,通常叫"去噪
"。
去噪:擴散模型生成內容的方式,一開始是完全隨機的噪聲,模型通過很多步計算,一步步把噪聲"擦乾淨",最終變成有意義的圖像、影片或動作序列。
一個標準的世界動作模型,每次要重新規划動作時,都得把整段未來的影片和動作從純噪聲開始,一步步去噪到乾淨結果。這就好比你每次換一個紅綠燈路口,都要把導航軟體重新打開、重新聯網、重新規劃從頭到腳的整條路線,哪怕你其實只是想知道下一個路口該左轉還是右轉。
論文裡給出了具體數字:標準的聯合世界動作模型(論文裡叫Joint-WAM
),每次重新規劃要花978毫秒,接近一秒。這意味著機器人每次收到新的攝影機畫面後,要愣一秒鐘才能做出下一步反應。在動態環境裡,一秒鐘夠多少事情發生?桌上的杯子可能已經倒了。
也有人想到了取巧的辦法:乾脆別生成未來畫面了,直接出動作,這樣確實快(論文裡的Fast-WAM
,548毫秒),但代價是丟掉了"預判"這個能力,機器人變得更"短視"。
這就是研究者們面臨的兩難:要麼慢而有遠見,要麼快而盲目。
**滾動去噪
:把一次性大工程拆成分期付款**
Rolling-WAM這篇論文的作者們琢磨出的辦法,說穿了非常樸素:既然每次重新規劃都要把整段未來從頭去噪一遍太浪費,那能不能把這個"去噪"的工作量,分攤到多次規劃周期里,像分期付款一樣?
具體怎麼做?
論文裡設計了一個滑動窗口
機制,把未來要執行的動作和對應的畫面切成好幾段,叫做"塊"。
滑動窗口:論文中維持一個包含多個"動作-影片塊"的窗口,每個塊對應一段時間的動作序列和相應畫面,這個窗口會隨著機器人執行動作不斷往前滑動更新,而不是每次都推倒重來。
窗口裡離現在最近的那個塊,噪聲水平最低,接近"乾淨";越往後的塊,允許的噪聲水平越高,越模糊、越"暫定"。機器人執行完最近的一個動作塊之後,這個塊就從窗口裡移出去,剩下的塊整體往前挪一位,然後在窗口最後補一個全新的、純噪聲的塊。整個過程中,之前那些還沒執行完的、部分去噪過的未來預測**不會被扔掉**,而是繼續在下一輪里接著被精煉。
這個設計的關鍵在於,作者們發現了一個數學上很巧妙的性質:如果去噪的進度調度設計得當,某個塊在這一輪結束時達到的噪聲水平,正好等於它挪到新位置後下一輪開始時應該有的噪聲水平。這意味著不需要額外的調整,直接無縫銜接。
打個比方,這就像一個廚房裡的流水線烘焙,而不是每次只烤一個蛋糕從頭開始和面。第一爐麵包已經進了烤箱快烤好了(馬上要執行的動作),第二爐剛揉好麵團正在醒發(部分去噪的未來預測),第三爐的麵粉才剛倒進盆里(純噪聲的新塊)。每隔一段時間,烤好的麵包出爐(動作被執行),後面的進度往前推一格,最後再往流水線尾端加一批新麵粉。如果不這樣做,會發生什麼?你每次都得等一整爐麵包從和面到烤好全部完成才能吃上第一口,中間誰都別想動。
這樣一來,每次重新規劃時,機器人真正需要"從頭算起"的工作量就大大減少了。論文裡的默認配置是:整個去噪過程分成10步,窗口裡有5個塊,那麼穩定運行狀態下,每次重新規劃只需要2步去噪,而不是10步。這就是為什麼Rolling-WAM能把每次規劃的時間壓到215毫秒,比標準方法快了4.5倍。
**近的想清楚,遠的先打個草稿:這符合人類的直覺嗎**
論文裡有一句話我覺得挺打動人的:這種設計"類似於人類規劃的直覺:近期的行動是具體的,而更遠的計劃仍是初步的,會隨著新觀察的到來而不斷修正"。
仔細想想,這確實是我們每個人做計劃時的常態。你今天晚上要不要點外賣,這個決定很清楚很明確;但你對下周末去哪裡玩,可能只有一個模糊的方向,等臨近的時候再根據天氣、心情、錢包情況來細化。沒有人會在周一就把下周末每一分鐘的行程都規劃到位,因為那樣做既費腦子,又很可能因為計劃趕不上變化而全部作廢。
Rolling-WAM把這個直覺寫進了模型架構里。近處的動作塊必須變得"乾淨"、可執行;遠處的動作塊可以保持模糊,等真正臨近時再逐步收斂。
這裡有一個技術上的支撐,叫做擴散變換器
。
擴散變換器:一種結合了擴散模型(逐步去噪生成內容)和Transformer架構(一種擅長處理序列數據、能捕捉長距離依賴關係的神經網路結構)的模型,廣泛用於圖像和影片生成任務。
Rolling-WAM里有兩個這樣的"專家"網路,一個專門處理影片畫面,一個專門處理動作序列,兩者通過一種叫"混合專家變換器
"的架構耦合在一起,共享資訊但各自專精。
混合專家變換器:一種神經網路設計思路,讓不同的子網路(專家)分別處理不同類型的數據(比如影片和動作),同時通過注意力機制
讓它們互相"看得到"對方,從而實現資訊共享又保持專業分工。
影片專家的初始參數來自一個預訓練好的影片生成大模型Wan2.2
,這樣它天然就懂得畫面該怎麼變化,不用從零學起。動作專家則是從影片專家的權重插值初始化而來的,參數量大約10億。
**注意力機制的取捨:誰能看見誰**
模型內部還有一個很講究的設計,叫注意力掩碼。
注意力機制:神經網路里讓不同位置的資訊互相"關注"、互相影響的一種計算方式,可以理解為讓模型在處理某個資訊時,能同時參考其他相關資訊。
Rolling-WAM里做了個規定:每一個動作塊,都可以看到整個窗口裡的所有影片畫面資訊,但不同動作塊之間不能直接互相看,同一個塊內部的動作是可以互相參照的。影片資訊不會反過來去看動作資訊。
這個設計聽起來有點像公司里的資訊流轉規則。所有部門(動作塊)都能看到公司整體的戰略簡報(影片窗口),但各個部門之間不能繞過流程互相打聽對方的具體執行細節,只能通過統一的簡報來協調。論文的消融實驗證明了這一點的重要性:如果打開動作塊之間的直接互相關注(論文裡叫A2A),在RoboTwin基準上的成功率反而從78.2%降到76.3%。這說明資訊共享要有一個統一的、乾淨的渠道(視覺畫面),直接的"小道消息"(動作間的相互關注)反而會引入噪音,拖累整體表現。
**實驗結果:又快又不差,甚至更好**
理論說得再漂亮,最後還是要看效果。論文在三個場景里做了驗證。
第一個是LIBERO,這是一個常用的機器人操作仿真基準,包含空間、物體、目標、長程四類任務。Rolling-WAM拿到了98.1%的平均成功率,只比表現最好的兩個方法(LingBot-VA和Joint-WAM,都是98.5%)低了0.4個百分點,同時明顯超過了Fast-WAM的97.6%。
第二個是RoboTwin 2.0,一個雙臂操作基準,包含50個任務,分為"乾淨場景"和"隨機化場景"兩種設置(後者會給場景加入更多干擾變化,考驗模型的魯棒性)。這裡Rolling-WAM表現更亮眼,乾淨場景93.5%、隨機場景93.0%,平均93.3%,**超過了所有對比方法**,包括需要額外預訓練的LingBot-VA(92.2%)。
第三個最有說服力,是真實世界的實驗。研究者們在一台人形機器人Unitree G1上跑了三個實際任務:把玩偶放進盒子、疊三個盤子、把珠子從瓶子倒進杯子。
真實世界的數據不會撒謊,也沒有仿真環境的"美顏濾鏡"。結果是Rolling-WAM平均成功率85.0%,領先第二名Joint-WAM的78.3%將近7個百分點。研究者還觀察到一個有意思的細節:用Joint-WAM控制的機器人在動作塊之間的銜接處會出現明顯的停頓,有時候還會打斷任務的連貫性;而Rolling-WAM的執行明顯更流暢連續。這恰恰印證了論文的核心論點:規劃延遲不是一個純粹的理論指標,它會實實在在地體現在機器人手臂動作的頓挫感上。
**窗口開多大合適:不是越大越好**
論文還做了一系列細緻的消融實驗,其中一個很值得說道的發現是:滑動窗口的大小並不是越大越好。
研究者把窗口大小從1一路調到8去測試,發現成功率在窗口為5的時候達到峰值78.2%,窗口開到8反而跌到了69.5%。
這個現象其實也挺符合直覺。窗口越大,意味著模型要對越遙遠的未來做預測,而這些遙遠的預測本身就更不確定,跟眼下的真實觀察關聯度也更低。這就像你計劃下個月的行程,計劃得越細緻越具體,反而越容易因為現實情況變化而整個推翻重做;相反,如果只是劃定一個大致方向,反而更容易隨機應變。窗口太大,等於讓模型把太多精力浪費在猜測遙遠又多變的未來上,對眼下這一步該怎麼走反而沒有實質幫助。
**這套方法解決的根本矛盾是什麼**
回到最初的問題:世界動作模型給了機器人"想像力",但這份想像力太貴,貴到會拖慢機器人的反應速度。
Rolling-WAM給出的答案不是砍掉想像力(像Fast-WAM那樣),也不是硬扛著算力成本(像Joint-WAM那樣),而是把想像這件事拆成了一個持續進行、逐步細化的過程,而不是每次都從零開始的一次性大工程。
這背後其實藏著一個更普遍的工程智慧:很多"重新計算"的成本,本質上來自於把可以復用的中間狀態當成了一次性消耗品。論文裡提到,標準方法"完全丟棄"了未執行完的那部分預測,而不是把它們"跨規劃周期復用"。這句話點出了問題的關鍵,浪費不在於計算本身有多難,而在於計算完了沒有被好好利用。
論文的作者們還提到,這個思路來自於"滾動擴散"(Rolling Diffusion)這一系列在影片生成領域的先驅工作,他們把這個思路第一次系統地引入到了機器人的聯合影片-動作建模里,並讓動作token能夠關注到部分去噪的視覺未來。這算是把一個原本用於生成影片序列的技巧,成功嫁接到了機器人控制這個截然不同卻又高度相關的領域。
值得說一句,這個方法本身和其他加速手段並不衝突。論文裡提到過其他一些團隊嘗試過的方向,比如乾脆不生成未來畫面、把視覺特徵緩存起來復用、用蒸餾壓縮模型體積等等。Rolling-WAM選擇的這條路,理論上完全可以和這些方法疊加使用,進一步壓榨出更快的速度。
**寫在後面**
讀完這篇論文,最觸動我的其實不是那個4.5倍的加速數字,而是背後那個簡單到有點樸素的洞察:為什麼之前沒有人這麼做?
標準做法裡,每次規劃都從頭去噪一遍,這幾乎是一種"路徑依賴"式的思維慣性,大家默認了擴散模型就應該這樣用,卻沒有認真質疑過"重新規劃一定要從零開始"這件事本身是不是必要的。Rolling-WAM提醒我們,很多看似理所當然的計算流程,其實是歷史遺留下來的默認選項,而不是唯一正確答案。
還有一個細節值得單獨拎出來說:論文裡提到窗口大小為8的時候,成功率反而下降到69.5%,比窗口為1的63.0%只高一點點。這說明"預測得更遠"這件事本身並不是免費的禮物,它是有代價的,代價就是這些遠期預測的可信度會隨著距離衰減,而模型如果被迫去關注這些不可靠的遠期資訊,反而會被帶偏。這讓我想起做長期計劃這件事,計劃得太細太遠,反而容易變成自我束縛,而不是真正的幫助。
論文的作者們在結尾也坦誠地承認了局限:窗口和塊大小這些超參數,在不同的任務動態和控制頻率下可能需要重新調試,目前還沒有一個通用的自適應方案。如果場景變化得特別快,那些還在窗口裡"排隊等待精煉"的預測,可能會跟不上現實的變化速度,反而誤導了動作生成。這是一個誠實的未解問題,也留給了後來者繼續探索的空間:機器人的"想像力"應該多具備前瞻性、又該多快地跟著現實修正自己,這個平衡點,或許永遠沒有一個放之四海而皆準的答案。
Q&A
Q1:Rolling-WAM是什麼?
A:Rolling-WAM是一種世界動作模型,它通過維持一個滑動窗口,讓未來的動作和畫面預測在多個重新規劃周期里逐步精煉,而不是每次都從純噪聲重新生成整段預測,從而大幅降低機器人的規劃延遲。
Q2:Rolling-WAM比標準方法快多少?
A:在默認配置下,Rolling-WAM每次重新規劃只需215毫秒,而標準的聯合世界動作模型(Joint-WAM)需要978毫秒,速度提升約4.5倍,同時在仿真和真實機器人任務上的成功率也不遜色甚至更高。
Q3:Rolling-WAM的滑動窗口越大效果越好嗎?
A:不是。實驗發現窗口大小為5時成功率最高(78.2%),窗口開到8反而降到69.5%,說明過遠的預測可信度低,窗口不是越大越好,需要根據任務權衡。






