你有沒有想過,一個能在實驗室里把玩具準確無誤放進盒子的機器人,為什麼一換個攝影機角度就完全懵了?
這不是段子,是真實發生的事。研究人員訓練了一個機器人操作模型,讓它在固定的實驗台、固定的燈光、固定的攝影機位置下反覆練習抓取、放置、清理桌面這些任務,成功率高達98%以上。聽起來很厲害對不對?可一旦把攝影機挪個位置,或者換個燈光,或者桌上多擺個不相關的小物件,這個成功率能直接腰斬,甚至更慘。
這篇來自新加坡國立大學、南洋理工大學和華南理工大學聯合團隊的論文,標題叫《打破視覺-動作捷徑
:面向通用機器人基礎模型的潛在接口訓練》,揭示了這個現象背後一個挺反直覺的原因:機器人不是學得不夠好,而是學得"太投機"了。
**問題出在哪:機器人學會了"作弊"**
先說說這類機器人模型是怎麼工作的。
現在主流的機器人基礎模型,專業說法叫VLA
(視覺-語言-動作模型)和WAM
(世界-動作模型),大致分為兩種技術路線:VLA直接把視覺畫面和語言指令餵給一個統一的模型來預測動作,而WAM會先在內部構建一個對世界如何變化的"預測",再據此生成動作。這兩類模型都會用一個預訓練好的"大腦"(通常是視覺語言模型或者影片生成模型)來理解畫面和語言,再由一個專門的"動作專家"模組把理解結果轉換成具體的機械臂運動指令。
這套流程聽起來天衣無縫:看懂場景,理解指令,生成動作。問題恰恰出在"看懂場景"這一步上。
機器人在訓練時看到的畫面,往往是高度重複的。同一張桌子,同一個攝影機角度,同一種光線,物體擺在差不多的位置。這種情況下,神經網路這種極其擅長找捷徑的系統,很容易發現一些"偷懶"的辦法:它不需要真正理解"這個物體在什麼位置",只需要記住"這個像素區域的顏色和亮度,通常對應著往左伸手這個動作"就夠了。這種走捷徑式的關聯,論文裡管它叫"視覺-動作捷徑"。
一旦你換個攝影機角度,這些像素區域的顏色亮度全變了,但機器人壓根沒學會"位置"這個真正有用的資訊,它只學會了和位置強相關但本身沒有意義的視覺噪音。於是它就懵了。
這個現象在機器學習里有個更古老的名字,叫捷徑學習
。2020年一篇發表在《自然-機器智能》上的論文就系統總結過:深度網路特別擅長找到訓練數據里那些"看起來有用但其實是巧合"的相關性,而不是學習真正的因果關係。這就好比一個學生準備考試,如果每次模擬卷的第三題答案都是B,他很快就會學會"看到第三題就選B",而完全不去理解題目在問什麼。等真正考試換了題目順序,這個學生就全軍覆沒了。
那怎麼辦?過去的研究者試過兩條路。第一條路是"餵給模型更豐富的資訊",比如讓模型額外學習深度資訊、歷史運動軌跡、3D位置這些結構化的線索,希望模型能藉助這些資訊避免瞎猜。但問題是,給模型更多資訊,並不代表模型會正確使用這些資訊,它完全可能依然抓著那些"投機取巧"的捷徑不放,只是捷徑變得更隱蔽了。
第二條路是"分階段訓練":先不給模型看圖,只用語言和機器人狀態訓練一版動作生成的"先驗",然後再引入視覺資訊接著訓練。這個思路聽起來更接近這篇論文的做法了,但研究者發現它還是有漏洞:這種方法沒有給每個動作片段設定一個明確的"空間目標",而且第二階段引入視覺資訊的時候,依然沒有對視覺資訊的使用方式做任何約束。相當於你告訴一個學生"先別看書本練習做題",然後又突然把整本書扔給他,卻不告訴他該怎麼用這本書,他大概率還是會走老路子,直接翻到答案頁抄。
這就是這篇論文想要解決的核心問題:怎麼才能讓機器人既學會利用視覺資訊里真正有用的空間線索,又不去依賴那些和任務無關、容易在環境變化時失效的視覺噪音?
**LIT
的解法:先蒙眼練動作,再用一把"窄門"放視覺資訊進來**
研究團隊提出的方法叫潛在接口訓練(Latent Interface Training,簡稱LIT),核心思路可以概括成兩個階段。
第一階段,叫空間目標條件化的動作預訓練。這個階段完全不給模型看任何圖像。模型只能拿到三樣東西:語言指令、機器人當前的狀態資訊,以及每一段演示動作結束時機械臂末端執行器的三維姿態,也就是說,它知道這個動作最終應該"停在哪裡、朝向哪個方向"。
這裡有個專業詞需要解釋一下:
SE(3)姿態
:一種數學表示方法,用來描述一個物體在三維空間中的完整位姿,包含位置(x、y、z坐標)和朝向(旋轉角度)。機械臂末端夾爪在空間中"停在哪個點、朝向哪個方向",就是用SE(3)姿態來精確描述的。
在這個階段,模型被要求根據語言指令、機器人狀態和這個終點姿態,去生成一整段動作軌跡。因為完全看不到圖像,它沒有任何機會去"作弊記住畫面顏色對應什麼動作",它唯一能學的,就是"從當前狀態出發,怎麼運動才能抵達指定的終點"這件事本身。這就相當於蒙著眼睛練太極,你的每一個動作都必須靠身體感知和明確的目標位置來完成,沒法靠"看到牆上那幅畫就知道該往哪邊轉"這種投機取巧的辦法。
這個類比值得往深了說一說。如果一個太極教練允許學員睜著眼睛練習,而訓練場地永遠只有一套固定布景,學員完全可能記住"看到那盆綠植就該左轉",而不是真正理解身體重心轉移的原理。等換了個場地,布景不一樣了,這個學員立刻就轉不明白該往哪邊動。蒙眼訓練強迫學員必須依靠身體自身的感知系統,而不是依賴外部環境裡那些和動作本身無關的視覺線索。這正是LIT第一階段要達成的效果:讓動作生成模組先學會一套不依賴視覺的、純粹基於目標和狀態的運動邏輯。
第二階段,叫視覺-動作接口學習。這個階段才開始真正引入圖像,但引入的方式非常講究。
研究者設計了一組可學習的潛在令牌
(Latent Tokens):一組初始狀態相同、數量固定為100個的向量,它們的作用是充當視覺資訊和動作模組之間的"翻譯官"或者說"傳聲筒"。
這裡又要解釋一個術語:
潛在令牌:一組可學習的中間向量,不直接對應任何具體的物理量,而是通過訓練學會去"提煉"和"打包"它需要的資訊,再傳遞給下游模組使用。
這些潛在令牌通過一種叫交叉注意力
(cross-attention)的機制,去"查閱"預訓練視覺語言模型里的語義資訊(也就是文字和場景類別層面的理解)和視覺資訊(也就是畫面里的像素級細節)。查閱完之後,這些令牌就成了動作專家模組獲取視覺資訊的唯一通道,動作專家再也不能直接偷看原始畫面,它只能通過這100個令牌間接了解畫面里發生了什麼。
這一步的關鍵設計是"唯一通道"這四個字。如果不設這個限制,動作專家依然可以繞過潛在令牌直接接觸原始視覺特徵,那前面辛辛苦苦搭的這道"關卡"就形同虛設了。這就好比機場安檢,如果乘客可以選擇走安檢口,也可以選擇直接翻牆進入登機口,那安檢口設計得再精密都沒有意義。必須讓所有人都只能走這一條路,安檢的過濾效果才能真正生效。
但光設一道關卡還不夠,因為這道關卡本身也需要被"教會"該提煉什麼資訊、過濾掉什麼資訊。這就是LIT最巧妙的地方:研究者給這些潛在令牌加了一個額外的訓練任務,叫姿態重建監督。具體做法是,用一個小型解碼器,試圖從這100個潛在令牌的最終狀態里,反推出第一階段用過的那個終點姿態。如果反推得准,說明這些令牌確實把畫面里和"機械臂該往哪裡運動"相關的空間資訊給保留下來了;如果反推不准,說明這些令牌可能學到了一堆和任務無關的視覺噪音,就會受到損失函數的懲罰,被迫調整。
這一整套設計,本質上是把第一階段學到的"目標姿態"當成了一根線,串起了兩個階段:第一階段用它來訓練動作生成的邏輯,第二階段用它來監督視覺資訊的提煉質量。視覺資訊只有一條窄門可以進入動作模組,而這道窄門被反覆訓練,只能放行那些真正和空間目標相關的資訊,把顏色、紋理、背景這些和任務無關的視覺噪音儘量擋在外面。
**四種不同架構,LIT都能打**
方法講完了,接下來看實際效果如何。研究團隊沒有隻在一種模型上驗證,而是選了四種設計理念完全不同的機器人基礎模型:π0.5
、MolmoAct2
、FAST-WAM和ImageWAM。這四個模型分別代表了VLA里兩種不同的視覺-動作耦合方式(一種靠共享自注意力,一種靠逐層交叉注意力),以及WAM里兩種不同的未來預測使用方式(一種只在訓練時用,一種連推理時也保留)。選這麼多樣化的架構做驗證,某種程度上就是在說:這個方法不是針對某個特定模型的補丁,而是一套能跨架構復用的通用訓練策略。
先看同分布下的表現,也就是訓練和測試場景高度一致的情況。研究者用的評測基準叫LIBERO,涵蓋空間、物體、目標、長序列四類共40個任務,每個任務跑50次實驗,一共2000次。結果顯示,四個模型用了LIT之後,平均成功率不但沒有下降,反而都有小幅提升:π0.5從87.75%提高到91.80%,MolmoAct2從93.50%提高到94.10%,FAST-WAM從97.60%提高到98.10%,ImageWAM從98.10%提高到98.40%。
這個結果本身就值得停下來想一想。通常我們會擔心,為了追求泛化能力而做的各種約束設計,可能會犧牲一部分在訓練分布內的精度,這是常見的權衡。但LIT不但沒有犧牲,反而略有提升,說明這套"先蒙眼學邏輯,再窄門放視覺"的設計,並沒有削弱模型處理正常場景的能力,反倒可能因為逼著模型學到更乾淨的表徵而帶來了額外收益。
真正的重頭戲是分布外泛化能力的測試,用的基準叫LIBERO-Plus,一共設置了七種場景擾動:攝影機視角變化、傳感器噪聲、機器人初始狀態變化、語言指令變化、物體布局變化、光照條件變化、背景紋理變化,總共評測了10030個擾動樣本。
|架構|類型|原始綜合成功率|LIT後綜合成功率|提升幅度|
|---|---|---|---|---|
|π0.5|VLA|68.97%|**79.67%**|+10.70|
|MolmoAct2|VLA|63.62%|**71.92%**|+8.30|
|FAST-WAM|WAM|51.44%|**60.63%**|+9.19|
|ImageWAM|WAM|83.02%|**86.89%**|+3.87|
這組數字挺有意思的。原本表現最差的FAST-WAM(只有51.44%的分布外成功率),在攝影機視角變化這一項上從16.40%直接跳到43.83%,提升了27.43個百分點,幾乎翻了近兩倍。而π0.5在攝影機視角這一項上也從58.29%漲到80.30%,提升22.01個百分點。這說明攝影機視角變化恰恰是"視覺-動作捷徑"最容易露餡的地方,因為換個角度,畫面里的像素分布會發生劇烈變化,而如果模型之前依賴的是這種表面像素關聯,自然會遭遇斷崖式下跌。LIT在這個維度上的提升幅度最大,某種程度上正好印證了研究者最初的猜測:模型確實存在依賴視覺捷徑的問題,而約束視覺資訊的使用方式確實能緩解這個問題。
不過也不是所有維度都全線提升。MolmoAct2在語言指令變化這一項上出現了輕微下降,從75.69%降到73.58%,降了2.11個百分點。這提醒我們,LIT的核心目標是約束視覺資訊的使用方式,對語言理解能力的影響相對間接,不是萬能藥。
**真實機器人上的驗證:從實驗室走到現實世界**
仿真環境的數據固然有說服力,但機器人研究最終還是要看真實世界裡跑不跑得通。研究團隊用一台真實機械臂做了三個任務的測試:收拾樂高積木裝進盒子、用簸箕清理桌面垃圾、把煎蛋從平底鍋轉移到碗裡。每個任務用100條演示數據,三個任務聯合訓練一個多任務策略。
測試場景分成同分布和三種分布外條件:光照變化、只用頂部攝影機視角、加入無關干擾物體。每種同分布條件跑25次,每種分布外條件跑10次。
三個任務綜合下來,LIT把同分布成功率從74.7%提升到88.0%,光照變化條件下從53.3%提升到70.0%,攝影機變化條件下從30.0%提升到46.7%,干擾物體條件下從50.0%提升到63.3%。
其中最驚艷的一個數據點出現在"轉移煎蛋"這個任務上。原本的同分布成功率只有52.0%,用了LIT之後飆升到92.0%。而在光照變化和干擾物體兩種分布外條件下,成功率分別從30.0%和20.0%,雙雙躍升到90.0%。從兩三成的成功率直接跳到九成,這已經不是小幅改善,而是質變級別的提升了。
另一個值得說的細節是"清理垃圾"任務:在同分布條件下,LIT和原版模型打了平手,但在換成只用頂部攝影機這個分布外條件下,原版模型的成功率只有10.0%,幾乎等同於隨機瞎撞,而LIT達到了80.0%。這說明在某些任務里,視覺捷徑問題可能被同分布測試完全掩蓋,只有真正換個視角才會暴露出來,而這恰恰是LIT想要修復的問題。
**研究者是怎麼證明"捷徑確實被打破了"的**
光看成功率數字還不夠有說服力,畢竟成功率提升了也可能是別的原因導致的。研究團隊專門設計了幾組分析實驗,試圖從行為層面證明模型確實是"更少依賴視覺捷徑了"。
第一組分析是可視化注意力圖。簡單說就是看模型在生成每個動作的時候,到底把注意力放在畫面的哪個區域。結果發現,原版模型的注意力會隨著場景擾動大幅飄移,有時候甚至聚焦到跟任務完全無關的角落;而用了LIT之後,不管場景怎麼變,注意力都能穩定地鎖定在機械臂和目標物體所在的區域。這就好比一個真正理解棋局的棋手,不管棋盤的花紋圖案怎麼換,他的注意力始終盯著關鍵的幾個棋子;而一個只是記住"這個花紋通常配這步棋"的門外漢,一旦棋盤圖案變了,他的注意力就會瞬間失焦。
第二組分析更巧妙,叫反事實幹預測試。研究者做了兩類實驗:一類是"任務保留型視覺干預",比如往畫面里加個無關物體,或者把畫面模糊化,但不改變語言指令、目標姿態和機器人狀態。結果原版模型的運動軌跡會因為這些無關的視覺變化而大幅偏離原來的路徑,而LIT訓練出來的模型軌跡幾乎保持不變。
另一類實驗反過來,叫"目標改變型干預":保持畫面和機器人狀態完全不變,只改變語言指令里指定的目標。這時候原版模型居然還在朝著原來的目標運動,像是沒聽懂新指令一樣;而LIT模型能及時調轉方向,朝新目標前進。
這兩組反事實實驗放在一起看特別有說服力。一個理想的模型應該做到"該忽略的忽略,該響應的響應":視覺畫面里的無關變化不該影響動作,但真正的任務指令變化必須能觸發動作調整。原版模型恰恰反過來了,對不該在意的視覺噪音過度敏感,對真正該響應的指令變化卻反應遲鈍。這正是"視覺-動作捷徑"最典型的症狀,而LIT在這兩個維度上都表現出了修正效果。
**拆解LIT:哪個部件在真正起作用**
一個方法有效不奇怪,難的是搞清楚到底是哪個部件在起作用。研究團隊做了六組消融實驗,逐一拆掉LIT的各個組件,看看少了它成績會掉多少。
去掉第一階段的空間目標預訓練,直接隨機初始化動作專家再進入第二階段,分布外成功率從71.92%掉到68.23%,降了3.69個百分點。
去掉第二階段的姿態重建監督,只保留潛在令牌結構本身,分布外成功率從71.92%降到68.86%,降了3.06個百分點,其中傳感器噪聲這一項跌得最狠,從70.77%直接掉到60.02%,少了10.75個百分點。
允許動作專家繞過潛在令牌、直接接觸原始視覺特徵(也就是拆掉"唯一通道"這道限制),雖然同分布成功率幾乎沒變化(94.25%對94.10%),但分布外成功率從71.92%掉到67.74%,降了4.18個百分點。這組實驗特別說明問題:在訓練場景里表現完全看不出差異,只有換到陌生場景才會露餡,這也解釋了為什麼很多同類研究光看同分布指標很容易忽略掉這類隱患。
研究者還測試了幾種"簡化版"的替代方案,想確認LIT的效果不是靠單一組件撐起來的巧合。只用潛在令牌聚合機制,但去掉第一階段預訓練和姿態監督,分布外成功率只有65.70%,只比原版基線高2.08個百分點,離完整版LIT差了6.22個百分點。參照另一篇論文LA4VLA的思路做分階段訓練,但不加姿態監督也不設唯一通道,成績是65.46%,同樣遠低於完整版。只給原版模型加一個姿態重建的輔助損失,不改變其他任何視覺接入方式,成績是65.45%,依然差距明顯。
這組對比說明一個道理:三個組件(先蒙眼訓練動作邏輯、用唯一通道限制視覺接入、用姿態重建監督這個通道)是相互配合、缺一不可的,任何單獨拿出來用效果都大打折扣。這就像做一道菜需要同時控制火候、調料比例和下鍋順序,單獨把某一項做到極致而放棄其他兩項,菜依然做不出應有的味道。
**這篇論文接上了誰的話,又留下了什麼話題**
這篇論文並不是憑空冒出來的,它站在幾條研究脈絡的交匯點上。
一條脈絡是關於"如何豐富視覺表徵"的研究,比如讓機器人額外學習深度圖、歷史運動軌跡或者3D位置資訊,代表工作包括SpatialVLA和TraceVLA。這類方法的問題在於,資訊豐富了不代表模型會正確使用資訊,LIT恰恰是在這個思路基礎上往前邁了一步:與其給更多資訊,不如直接約束資訊的使用通道。
另一條脈絡是分階段動作預訓練,比如2026年發表的LA4VLA,提出先用純語言和狀態訓練動作先驗,再引入視覺資訊。這篇論文裡專門做了一組"LA4VLA啟發式分階段訓練"的對照實驗,證明單純的分階段思路不足以帶來LIT的全部收益,還差著6個多百分點,這也是為什麼LIT要額外加上姿態目標的貫穿設計和唯一視覺通道的限制。
還有一條脈絡關注捷徑學習和因果混淆這類更基礎的機器學習問題,比如2020年那篇關於捷徑學習的綜述,以及2019年關於模仿學習中因果混淆的研究。LIT某種程度上是把這些更抽象的理論洞察,轉化成了一套具體可落地的機器人訓練工程方案。
論文本身也坦誠地提到了局限性:目前的真實機器人實驗規模還比較有限,只測了三個任務,未來需要在更大規模、更多樣化的機器人演示數據上驗證這套方法能不能繼續奏效。
Q&A
Q1:LIT是什麼,它解決了機器人的什麼問題?
A:LIT全稱潛在接口訓練,是一種讓機器人操作模型減少依賴"視覺-動作捷徑"的兩階段訓練方法。它先讓模型不看圖像、只靠語言和目標姿態學習動作邏輯,再通過一個專門監督過的"潛在接口"引入視覺資訊,防止模型偷懶記住和任務無關的畫面細節,從而提升換攝影機、換光照等場景下的表現。
Q2:LIT在真實機器人實驗裡效果如何?
A:在三個真實任務(收拾積木、清理桌面、轉移煎蛋)測試中,LIT把同分布成功率從74.7%提升到88.0%,光照變化條件下從53.3%提升到70.0%,攝影機變化條件下從30.0%提升到46.7%,干擾物體條件下從50.0%提升到63.3%,部分任務提升幅度超過60個百分點。
Q3:LIT為什麼要先不給模型看圖像訓練?
A:因為如果一開始就讓模型同時看圖像和學動作,模型很容易記住"某種畫面顏色對應某個動作"這種表面關聯,而不是真正理解空間目標。先用語言、狀態和終點姿態訓練動作邏輯,能避免這種投機取巧,之後再通過限定的窄通道引入視覺資訊,並監督這個通道只保留真正有用的空間資訊。






