你有沒有想過,一個機器人要學會疊衣服,到底需要經歷多少次失敗?
如果是人類小孩學繫鞋帶,摔幾次跤、扎幾次手,問題不大。但機器人不一樣:每一次真實世界的試錯,都意味著真金白銀的機械臂磨損、場地調度、人工看護,慢得讓人心焦。業內一直在想一個辦法:能不能讓機器人在"腦子裡"先演練一遍,覺得可靠了再動手?
這就是"世界模型
"要解決的事情。它像是給機器人配了一個內置的預測引擎,輸入一張現在的照片和一串打算執行的動作,它就能"想像"出執行完之後會是什麼樣子。北京人形機器人創新中心最近發布的 Pelican-Sim 1.0
,就是這樣一個系統,而且它解決的問題比聽起來更棘手:市面上的機器人五花八門,單臂的、雙臂的、帶夾爪的、帶靈巧手的,型號一換,以前訓練的模型可能就直接報廢了。
Pelican-Sim 1.0 想做的,是造一個通用的"夢境模擬器",不管什麼機器人、什麼場景、什麼任務,都能塞進去用。
這事到底難在哪
先說一個可能出乎意料的事實:在 Pelican-Sim 之前,行業里已經有不少動作條件影片生成模型了,比如 IRASim、Ctrl-World、EnerVerse-AC,但它們幾乎都有一個共同的軟肋,要麼只認數字指令,要麼只認圖像指導,很少有人把兩者擰到一起用。
世界模型:一種能根據當前畫面和候選動作,預測未來會發生什麼的AI系統,相當於給機器人裝了一個"預判引擎"。
這裡面的矛盾其實很微妙。機器人的動作可以用一串數字精確表達,比如每個關節轉了多少度、夾爪張開了多大。這套數字很嚴謹,但問題是,模型光看這些數字,根本不知道這在畫面里會變成什麼樣的運動軌跡。反過來,如果你把動作畫成骨架影片,讓模型直接"看圖說話",圖像資訊雖然直觀,卻可能丟失掉精確的數值細節,比如一個末端執行器的圖只能告訴你手在哪,卻說不清整條手臂是怎麼彎的。
論文裡專門做了個對比表格,列出了 IRASim、Ctrl-World、EnerVerse-AC、OSCAR 等九種方法在"動作數值"和"視覺動作"這兩個維度上的取捨,幾乎沒有一個方法能同時做到跨具身、又保留精確構型資訊、又有清晰的圖像動作提示。Pelican-Sim 1.0 是表里唯一一個五個維度全部打勾的。
數字與畫面的雙重保險
Pelican-Sim 的做法說起來不複雜:給模型同時餵兩份關於同一個動作的描述,一份是精確的數字,一份是渲染出來的骨架影片。
具體來說,他們設計了一個28維的統一動作數值表示。左邊14維描述機器人左側,右邊14維描述右側,每一側包含7個手臂關節角度、1個夾爪開合值、6個靈巧手關節值。哪怕是單臂機器人,缺失的那一側也會被填零占位,這樣不管什麼型號的機器人,輸入進模型的永遠是同一個"接口"。
與此同時,團隊用機器人的URDF
文件和相機標定參數,把這串動作數字重新渲染成一段骨架影片,跟原始RGB畫面嚴格對齊。
URDF:機器人的"骨骼說明書",記錄了每個關節和連杆的物理結構與運動關係,是做正向運動學
計算的基礎。
正向運動學:知道每個關節轉了多少度,反推出整條手臂在三維空間裡到底擺成了什麼姿勢。
這個骨架影片裡,夾爪還會用不同顏色標出開合狀態,藍色代表打開、灰色代表過渡、橙色代表閉合,這樣模型一眼就能"看懂"抓取動作進行到哪一步了。
這套雙通道設計像什麼呢?
想像你要給一個從沒做過西式料理的廚師描述"如何切洋蔥絲"。如果只給他一份文字菜譜,寫著"刀與案板呈15度角,下刀深度0.5厘米,間隔0.3厘米",他能照著數字比劃,但很難想像整個手部動作的流暢感,切出來的可能歪歪扭扭。如果只給他一段無聲影片,他能模仿大致的手勢,但看不清刀刃精確的角度和深度,學出來的技法可能失之毫釐。真正可靠的教學方式,是數字菜譜和示範影片一起給,數字保證精度,畫面保證直覺,兩者缺一不可。Pelican-Sim 選擇的正是這種"兩手抓"的策略。
實驗數據也印證了這個判斷。論文做了消融實驗,對比了"完全不給動作條件"、"只給數值"、"只給影片"、"數值加影片都給"這四種情況。結果顯示,同時使用兩種條件時,AgiBotWorld Beta數據集上的PSNR
(一種衡量畫面還原精度的指標,數值越高越好)達到22.276,比只用動作影片提升了整整1.0;而只用數值時PSNR只有19.238,比什麼都不給時的17.684好不了太多。這說明單獨一種信號都撐不起精確的動作控制,必須兩條腿走路。
那這兩路資訊具體怎麼塞進模型?團隊用的是交替注入,在28層的Video DiT
網路里,奇數層用動作數值做特徵調製,像給每一幀悄悄"評分調色";偶數層用動作影片提供殘差補充,像是往畫面里疊加一層運動引導線。他們也試過把兩種資訊同時塞進每一層,發現效果只比交替注入好那麼一點點,PSNR僅提升0.075dB,說明沒必要那麼"貪心",交替注入已經夠用了。
Video DiT:一種基於Transformer架構的影片擴散模型,通過逐層去噪的方式生成影片畫面。
專家分工制,應對形形色色的機器人
光有動作表示還不夠。現實里機器人的"脾氣"千差萬別:六軸機械臂和人形雙臂機器人的運動邏輯完全不是一回事,抓握葡萄和抓握酒瓶的力度手法也天差地別。如果用一個統一的神經網路硬扛所有這些差異,很容易出現"一招鮮吃遍天"卻哪個都吃不透的局面。
Pelican-Sim 的解法是引入稀疏混合專家層,簡稱MoE
。
MoE:一種神經網路設計思路,把原本一個統一處理層拆成多個"專家"子網路,每次只挑其中一小部分專家來處理當前輸入,而不是讓所有專家都參與運算。
具體配置是1個共享專家加8個路由專家,每次每個數據點(token)會激活其中2個路由專家。共享專家負責處理所有輸入都需要的通用變換,路由專家則根據輸入內容動態挑選,系統會自動判斷"這個動作片段更像是哪種類型的運動",然後交給最合適的專家去處理。
這套機制像一家大型醫院的分診系統。所有病人(數據)先經過一個全科醫生(共享專家)做基礎檢查,不管什麼病都得測個血壓體溫。但複雜的病症還需要專科醫生會診,骨科看骨折、心內科看心律不齊,分診台(路由器)會根據症狀自動派單,同一批病人里,不同的人會被送到不同的診室。如果沒有分診,全靠一個全科醫生看所有病,效率低不說,遇到罕見病症很可能誤診。Pelican-Sim 面對的正是這種"病症"極其多樣的局面,機器人型號、任務類型、場景環境組合起來千變萬化,硬塞給一個統一網路處理,必然顧此失彼。
實驗證明了這一點的價值。在完全相同的訓練數據和優化步數下,把普通的稠密前饋網路換成稀疏MoE層後,FVD
指標(衡量影片時空質量,越低越好)從17.380降到10.850,降幅高達6.530。這不是一個小數字,相當於影片質量在時間連貫性和空間細節上都有肉眼可感的提升。
四步頂三十五步:給"做夢"提速
有了精準的動作理解能力,還有一個現實問題擺在面前:如果每次"預演"一遍動作都要跑35步擴散採樣,那這個"夢境模擬器"用起來就太慢了,尤其是當你需要靠它反覆篩選最優動作、或者拿它當強化學習的訓練環境時,採樣速度直接決定了整套系統能不能落地。
團隊的解法叫因果自回歸
蒸餾,分兩步走。第一步是"因果適配",把原本可以看到整段影片前後資訊的雙向注意力機制,改造成只能看當前和之前片段的"塊因果注意力",這樣模型可以支持流式生成,邊生成邊往後推,不用等整段影片算完。第二步是"少步蒸餾",用一個訓練好的35步"教師模型"去教一個只需要4步的"學生模型",讓學生儘量模仿老師的生成軌跡。
自回歸:模型按時間順序一步步生成內容,後面生成的部分依賴前面已經生成的結果,類似寫文章時一句接一句往下寫,不會突然跳到結尾再補前面。
這套流程用一個類比來說,很像老師傅帶徒弟。老師傅(35步教師模型)做一道菜可能要經過35道精細工序,焯水、爆香、勾芡、收汁,每一步都不能省。但徒弟(4步學生模型)如果非要照搬這35步的節奏,在快餐店根本忙不過來。於是老師傅把整套流程的"精髓"提煉成4個關鍵動作教給徒弟,雖然步驟少了很多,但只要提煉得好,出品口感依然接近。如果沒有這套蒸餾過程,硬讓模型直接學4步生成,畫面質量很可能崩掉,細節全無。
效果如何?在21幀的推理基準測試里,加速後的模型只需要2.2秒生成一段影片,比原本35步的模型快了5.67倍。這個提速幅度直接決定了後面幾個下游應用能不能跑得動,畢竟數據生成、動作篩選這些場景,往往需要成百上千次調用模型。
數據說話:影片生成質量到底提升了多少
光講設計思路還不夠,得看實打實的數字。
Pelican-Sim 1.0 在三個數據集上和多個基線方法做了對比,AgiBotWorld Beta(真實機器人數據)、RoboMIND(另一個真實數據集)、RoboTwin(仿真數據集)。
| 數據集 | 方法 | PSNR↑ | FVD↓ |
|---|---|---|---|
| AgiBotWorld Beta | EnerVerse-AC(最強基線) | 17.640 | 21.390 |
| AgiBotWorld Beta | Pelican-Sim 1.0 | 22.276 | 10.850 |
| RoboMIND | Ctrl-World(最強基線) | 21.770 | 16.700 |
| RoboMIND | Pelican-Sim 1.0 | 23.850 | 15.930 |
| RoboTwin | Ctrl-World(最強基線) | 20.040 | 26.600 |
| RoboTwin | Pelican-Sim 1.0 | 30.383 | 4.980 |
RoboTwin這個數據集上的差距尤其誇張,PSNR從20.040直接跳到30.383,提升了10.343分,FVD更是從26.600降到4.980,降幅超過80%。這個跨度意味著什麼?意味著在同樣的動作指令下,Pelican-Sim生成的預測影片,不管是畫面清晰度還是動態連貫性,都比之前最好的方法有質的飛躍。
四個應用場景,從"預演"到"落地"
光會預測影片還不夠實用,論文花了大量篇幅證明這套系統能真正幫上機器人訓練的忙,一共驗證了四個下游場景。
第一個是數據生成。團隊從50條乾淨的示範軌跡出發,用圖像編輯工具生成10種場景變體,再用Pelican-Sim給每個變體生成對應的動作影片,相當於"一魚多吃"。結果顯示,在只有10條原始示範的極端情況下,加上100條生成軌跡後,策略成功率從28.5%飆升到64.5%,提升了36個百分點。哪怕是有50條原始示範的相對充足場景,加上500條生成數據後成功率也從70%漲到93%。
這個結果直接呼應了開篇的問題:真實數據採集太貴太慢,而Pelican-Sim生成一條完整軌跡只要24秒,比人工採集的60秒快了2.5倍,比仿真器生成的55秒也快了將近3倍。
第二個場景是策略評估與排名。團隊專門微調了一個視覺語言模型(VLM
)當"裁判",輸入任務指令和16幀關鍵畫面,輸出任務是否成功、完成進度、畫面是否有效等判斷。
VLM:一種能同時理解圖像和文字的AI模型,可以看圖回答"這個任務完成了沒有"這類問題。
這個裁判先在1000條真實仿真影片上驗證過,判斷準確率達到92.6%;換到Pelican-Sim生成的影片上,準確率也有91.4%,相差不大。用這套"世界模型+裁判"的組合去評估5個不同訓練階段的策略,當積累了200條適配數據後,排名的斯皮爾曼相關係數達到1.0,意味著預測排名和真實排名完全一致;積累到1000條數據時,成功率估計的平均誤差只有2.4個百分點。
第三個場景是動作選擇。讓一個擴散策略一次性生成10個候選動作方案,世界模型分別預測每個方案執行後的畫面,VLM裁判評分挑出最佳方案再執行。結果顯示,這套"預演選優"策略把成功率從43.2%(隨便選一個)提升到63.8%,相對提升47.7%,離理論上限(用真實仿真器跑遍10個方案再選最好的,68.1%)只差4.3個百分點。
第四個場景最有意思,叫策略改進,直接讓策略在Pelican-Sim營造的"閉環夢境"里做強化學習訓練,不用碰真實機器人。VLM裁判給出的分數變成強化學習的獎勵信號,通過GRPO算法更新策略參數。
GRPO:一種強化學習優化算法,通過對比同一批採樣結果的相對好壞來調整策略,不需要額外訓練一個價值網路。
最終這套方法把策略平均成功率從62.7%提升到75.4%,相對提升20.3%,雖然距離用真實仿真器反饋訓練出的"理論上限"(83.8%)還有差距,但已經證明了閉環想像訓練這條路是走得通的。
五個維度的"舉一反三"
除了在同分布數據上表現好,論文還專門設計了五組分布外測試,來檢驗這個模型是不是真的學到了"動作的本質",而不是死記硬背訓練數據。
第一組是軌跡反轉。把一段正向執行的動作序列倒過來播放,看模型能不能生成對應的"倒放"畫面。結果顯示,無論是真實數據還是仿真數據,模型都能準確地把機械臂"送回"初始姿態,而不是繼續沿著原來的方向亂動。
第二組是場景外觀變化。用AI圖像編輯工具把同一個疊褲子任務的背景換成洗衣房、攝影棚、白色房間、走廊、車庫、客廳六種完全不同的環境,動作軌跡保持不變。生成結果顯示,不管背景怎麼換,疊衣服的動作邏輯始終保持一致。
第三組是機器人本體遷移。團隊把一個Panda機械臂執行的抓取任務,通過逆運動學重新解算,遷移到訓練時從未出現過的Sawyer、IIWA、UR5e三款機械臂上。結果這些陌生型號的機器人也能完成類似的堆疊積木動作,說明模型學到的是任務層面的運動語義,而不是死記某一款機器人的關節角度。
第四組是物體替換,用圖像編輯把要抓取的物體換成外觀、形狀、大小都不同的五個新物體,動作指令不變。生成的抓取動作依然準確地對準了替換後的物體。
第五組是視角變化,用不同的相機機位拍攝同一個抓碗任務的初始畫面,重新渲染對齊的動作影片。哪怕視角的俯仰角、方位角、距離發生很大變化,生成的動作序列依然和指令保持一致。
這五組測試放在一起看,其實是在回答一個更根本的問題:這個模型學到的到底是"死記硬背的畫面對應關係",還是"可遷移的動作規律"?如果只是前者,換個背景換個視角就會露餡。測試結果偏向後者,雖然論文也坦誠說明,這些是定性觀察而非嚴格的量化對照實驗,還不能說完全證明了模型的泛化邊界。
寫在後面
讀完這篇論文,最觸動我的其實不是某個具體的技術指標,而是這個團隊處理"矛盾"的方式。
數字動作和視覺動作明明是兩種互相衝突的表達方式,一個精確但抽象,一個直觀但可能失真,大多數團隊會選擇"押寶"一種,要麼死磕數值精度,要麼死磕視覺引導。Pelican-Sim 選擇了都要,而且用實驗證明了"都要"確實比"選一個"效果更好。這種不走捷徑、老老實實做加法的思路,在現在這個追求"一招制勝"的研究氛圍里,反而顯得難得。
還有一個細節值得單獨說一說:論文裡提到,他們用VLM裁判去評分的時候,專門驗證了裁判在"真實仿真影片"和"世界模型生成影片"上的判斷準確率差異,前者92.6%,後者91.4%,只差1.2個百分點。這說明什麼?說明這套VLM評估系統本身已經足夠穩健,不會因為畫面是"想像"出來的就大幅失准。這個細節比很多顯眼的主指標更讓人安心,因為它證明了整條評估鏈路是經得起交叉驗證的,而不是自說自話。
不過論文最後也坦率承認了一件事:策略改進這個環節,用世界模型訓練出來的策略成功率是75.4%,而用真實仿真器反饋訓練出來的"理論上限"是83.8%,中間還有8.4個百分點的差距沒填上。這個差距具體是從哪裡來的,是VLM評分不夠細膩,還是世界模型對接觸力學細節的建模還不夠精確,論文沒有細究。這大概是留給後來者的一道題。
如果有一天,機器人真的能在腦子裡把每個動作預演一百遍再動手,那它會不會比我們更擅長"三思而後行"這件事?
Q&A
Q1:Pelican-Sim 1.0是什麼?
A:Pelican-Sim 1.0是北京人形機器人創新中心開發的通用世界模型模擬器,能根據一張初始圖像和動作指令預測機器人執行後的未來畫面,支持跨機器人型號、跨場景的動作條件影片生成。
Q2:Pelican-Sim 1.0如何同時處理不同類型的機器人?
A:它設計了統一的28維動作數值表示,涵蓋單臂、雙臂、夾爪、靈巧手等各種構型,缺失部分用零填充,配合URDF渲染的骨架動作影片,讓不同型號機器人能共用同一套模型接口。
Q3:Pelican-Sim 1.0在實際應用中效果如何?
A:在數據生成、策略評估、動作選擇、策略改進四個下游任務中均有提升,比如50條示範數據加上500條生成軌跡後,策略成功率從70%提升到93%。






