宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

TANGO:讓人形機器人學會用整個身體「讀懂」房間

2026年09月30日 首頁 » 熱門科技

2026年的某一天,一台Unitree G1人形機器人走進了加州大學伯克利分校的一間辦公室。它接到的指令很日常:"向前穿過開放的休息區,路過左邊的花壇和長椅,右邊的沙發和桌子。走到右邊的沙發處向右轉……最後停在右邊的柜子旁邊。"

這條指令要走30米,中間要轉好幾個彎,穿過好幾個區域。機器人出發了,一路上沒有人遙控,全靠自己"看"和"走"。它側身擠過一條窄道,蹲下鑽過一個懸空的障礙物,抬腳跨過地上的雜物,最終穩穩停在目標位置。

整個過程,這台機器人從沒在真實世界裡訓練過一步。它所有的經驗,全部來自電腦里的模擬仿真。

這就是本文要講的研究:TANGO,一套讓人形機器人在雜亂室內環境裡,靠自然語言指令自主導航的系統。它的特別之處不在於"能聽懂話去走路",這事兒很多機器人都能做,特別之處在於它真正解決了一個長期被忽略的問題:機器人的身體,到底該怎麼根據周圍環境實時調整姿態。

導航這件事,為什麼對人形機器人特別難

先說一個可能顛覆你直覺的事實:市面上大多數所謂"視覺語言導航"系統,其實完全不管機器人的身體長什麼樣。

它們的工作方式是這樣的:攝影機拍下畫面,模型分析一下"我該往哪走",然後輸出一個二維坐標點,或者"前進""左轉"這樣的離散指令。這套邏輯對輪式機器人、掃地機器人非常好用,因為輪式底盤的形狀是固定的,只要平面上沒有障礙物,它就能過去。

但人形機器人不是這樣。

人形機器人的身體形態在移動過程中是持續變化的,胳膊會擺動,軀幹會前傾後仰,腿部姿態隨著步態不斷切換。這意味著一條在平面地圖上看起來完全暢通的路徑,實際執行起來可能因為機器人此刻的手臂位置、身體傾斜角度而撞上什麼東西。

這就好比你讓一個不了解房間布局的人,只拿著一張地面平面圖去搬家具穿過房間。地圖上顯示地面沒有障礙,他大步走過去,結果腦袋撞上了低垂的吊燈,或者肩膀刮到了斜掛的畫框。地面乾淨不代表整個三維空間都乾淨。如果導航系統只在平面上做規劃,完全不考慮身體在三維空間裡的占用情況,那麼"路徑可行"和"機器人能走過去"根本就是兩碼事,差的就是這個維度的資訊。

論文裡管這個叫做"具身鴻溝"

具身鴻溝:指的是導航決策層面看起來完全合理的動作,在真實物理身體執行時卻可能行不通的差距,因為規劃時沒有考慮身體的實際幾何形狀。

這個鴻溝不是理論問題,是實打實會撞車的問題。傳統視覺語言導航方法,哪怕訓練得再好,只要動作空間還是"往前走一米""左轉30度"這種平面指令,就永遠填不上這個坑。

在TANGO出現之前,業內其實已經有幾條不同的技術路線在嘗試解決類似問題,但各自都有明顯的短板。一類是人形機器人的"全身控制"基礎模型,比如GR00T-N1.6、Ψ0這些系統,它們能做出很複雜的上肢動作,但導航部分往往是"外包"給下層控制器處理的高層指令,模型本身並不直接參與"怎麼繞開這個箱子"這種精細決策。另一類是專門研究人形機器人越障的強化學習方法,比如HumanoidPF,它們在特定場景里表現很好,能讓機器人成功避開障礙物,但這類方法通常嚴重依賴訓練時見過的場景分布,換個新環境或者要走很長的路,效果就會打折扣。

換句話說,市面上要麼有"聰明的大腦"但"身體僵硬",要麼有"靈活的身體"但"腦子跟不上語言指令和長距離規劃"。TANGO想做的,就是把這兩件事擰到一起。

TANGO怎麼解決這個問題:直接預測全身動作

TANGO的核心設計思路其實很直白:既然平面動作空間不夠用,那就別用平面動作空間了,直接讓模型預測機器人全身29個自由度的關節角度。

29自由度:指的是人形機器人身體上可以獨立轉動或伸縮的關節數量,包括腿部、腰部、手臂、手腕等各個部位加起來一共29處可控關節。數字越大,機器人姿態可調整的精細程度越高。

模型接收到的輸入是這樣的:一段自然語言指令,加上前方攝影機和下方攝影機拍到的實時畫面,以及機器人自身關節的當前狀態。輸出則是接下來一段時間內、一整串連續動作的關節角度序列,外加機器人軀幹的旋轉姿態。這個輸出不再是"往哪個方向走"的抽象指令,而是"每個關節接下來該擺到什麼角度"的具體執行方案。

這裡就帶出一個問題:訓練這樣一個模型,需要的數據和訓練平面導航模型完全不是一個量級的。平面導航你錄一段GPS軌跡就行,全身動作導航你得知道每一幀里手臂在哪、腰彎了多少度、腳踩在哪個位置。這種數據,現實世界裡幾乎不可能大規模採集,靠人工動作捕捉再重定向到機器人身上,成本高得嚇人,而且經常因為人和機器人身體結構不一樣出現"翻譯失真"。

TANGO團隊的解法是完全在仿真里造數據,造出來的這套流程他們叫PET,一個三步走的自動化管線。

Plan-Edit-Track(PET):TANGO團隊設計的自動化數據生成管線,分為規劃、編輯、跟蹤三個階段,用來批量合成物理上可行、且帶有全身避障動作的機器人訓練軌跡,全程不需要人工採集真實動作數據。

第一步是規劃

給定起點和終點,系統先用經典的A星算法在地圖上找一條基礎路徑,這一步會給靠近障礙物的區域加一個軟懲罰,讓路徑本能地往安全區域偏。碰到窄道的時候,系統會主動把身體朝向旋轉90度,讓機器人側身通過,這樣能通過的空間比正面走要寬鬆得多。找到路徑之後,交給一個叫SONIC的動作跟蹤模型,生成一段自然流暢的人形行走動作。

SONIC:一個在約800小時高質量動作捕捉數據上訓練出來的運動跟蹤模型,能把一串速度指令轉化成自然的人形行走動作,同時能讓機器人實時跟蹤一段參考動作並保持物理穩定。

第二步是編輯,這是整個流程里最有意思的部分。規劃階段生成的動作雖然走得挺自然,但它其實"不知道"路上有障礙物,是純粹按地圖走的。編輯階段要把這個"盲走"的動作,改造成真正會躲避障礙的全身動作。

具體做法借鑑了一個叫"人形勢場"的思路,給機器人身上的關鍵部位,比如肩膀、肘部、手腕、軀幹,施加一種模擬的排斥力,這個力會根據周圍障礙物的距離場自動計算方向和大小,離障礙物越近,推開的力越大。這個力不是生硬地拿來強制改變動作,而是轉化成一個柔性的位移目標,交給一個全身逆運動學求解器去權衡,既要滿足這個避障要求,又不能破壞原有走路姿勢的自然度和穩定性。

針對不同類型的障礙物,系統還做了專門的適配。碰到懸空障礙物需要低頭彎腰的場景,系統提前幾步就開始探測頭頂空間,一旦發現快撞上了,會提前觸發彎腰動作,而不是等腦袋快貼到障礙物才反應,這樣動作看起來才自然連貫。碰到地面矮障礙需要跨步的場景,系統會重新規劃抬腳落地的位置,讓腳落在障礙物遠端之外,同時調整擺動腿抬起的高度曲線,保證整個腳掌在跨越過程中都能安全越過障礙物頂部。

這個編輯過程讓我想到一件生活里很常見的事:你走在自家熟悉的客廳里,閉著眼睛都能走個大概不撞牆,但如果客廳里臨時多擺了一張茶幾,你不會重新規劃整條路線,而是身體會本能地微調,側身讓一讓,或者邁大步跨過去,核心的走路節奏和步伐感覺完全不變。TANGO的編輯階段做的就是這件事:保留原本自然的走路節奏和風格,只在真正遇到障礙的局部區域做精細調整。如果不這樣設計,而是讓模型每次遇到障礙物都重新規劃一整套完全不同的動作,那生成出來的動作會顯得生硬割裂,機器人走起來就會像被逐幀拼接出來的傀儡,而不是一個流暢的整體。

第三步是跟蹤過濾,這一步的作用像質檢員。前面編輯出來的動作是純粹運動學層面的產物,理論上合理,但不一定符合物理規律,可能存在動作太快、蹲得太猛這種實際執行不了的情況。系統把這些編輯後的動作交給SONIC跟蹤器,在仿真物理引擎里真實地跑一遍,如果跟蹤失敗或者發生了碰撞,這條軌跡就直接被丟棄。

這裡有個反直覺的設計選擇:過濾通過之後,訓練用的監督信號用的不是跟蹤器實際執行出來的那份軌跡,而是編輯階段生成的原始參考動作。

為什麼要這樣繞一圈?因為跟蹤器在執行過程中,為了保持物理穩定,往往會對動作做一些微小的妥協和平滑,這種妥協會讓動作看起來稍微沒那麼"人味兒"。研究團隊想要的是既物理可行、又保留人類自然運動質感的監督信號,所以跟蹤器在這裡只承擔"驗證是否可行"的角色,真正教給模型的還是那份更乾淨、更接近人類動作的參考軌跡。

整套PET流程跑下來,團隊一共生成了64633條訓練軌跡,覆蓋了VLNVerse和SAGE-3D兩個仿真數據集裡挑選出來的578個室內場景。這個規模的數據,如果靠真人動作捕捉去採集,幾乎是不可能完成的任務,而在仿真里,整個數據生成加渲染只花了211個GPU小時。

模型架構:三套系統各司其職

數據有了,接下來是模型本身怎麼設計。TANGO採用了一種"三層系統"架構,這個思路不是TANGO首創,業內一些前沿工作比如Ψ0已經在用類似的分層設計,但TANGO把它具體落到了人形導航這個場景里。

三層系統架構:把整個決策鏈條拆分成三個不同響應速度的模組,慢速的負責理解語言和場景做高層判斷,中速的負責生成具體動作序列,快速的負責把動作穩定執行到硬體上,三者配合工作而不是一個模型包打天下。

最上層負責視覺語言理解,用的是Qwen2.5VL-7B這個視覺語言大模型底座,並且用InternVLA-N1的權重做了熱啟動,這樣模型一開始就帶著一些導航相關的先驗知識,不用從零學起。前方攝影機和下方攝影機的畫面會被豎直拼接成一張圖,再餵給模型。

考慮到長時間導航過程中歷史畫面會越積越多,直接全塞進去內存和算力都吃不消,團隊用了一個叫BATS的採樣機制,按照一個隨時間遞減的概率函數,對歷史幀進行不均勻採樣,離當前時刻越近的畫面保留得越細緻,越久遠的畫面採樣得越粗略。這個設計其實很符合人的記憶習慣,你回憶五分鐘前發生的事情能記得很清楚,回憶一小時前的事情大概只剩個模糊印象。

中間層是動作專家,用的是一個基於流匹配訓練的多模態擴散Transformer,負責根據視覺語言層給出的語義理解,結合機器人當前的關節狀態,預測接下來一段時間的全身動作序列。這裡有個細節值得說一下,團隊沒有直接用絕對坐標系下的軀幹朝向作為訓練目標,而是把它轉換成相對於動作序列第一幀的相對量,同時額外加了一組輔助的位移和轉向增量資訊。這種參數化方式讓模型更容易學到穩定的回歸目標,不會因為絕對坐標的巨大變化範圍而訓練困難。

為了讓預測出來的動作序列在真實執行時銜接得順滑,團隊還用了一種叫RTC的訓練技巧。

實時分塊(RTC):訓練階段讓模型學會以一部分已經確定要執行的動作作為條件,去補全接下來還沒確定的動作,這樣模型學到的動作分塊之間銜接自然,而不是每次推理都從零開始生成一段獨立的動作,導致執行時出現卡頓或跳變。

最底層是執行層,也就是前面提到的SONIC跟蹤器,它以200赫茲的頻率運行,把動作專家給出的參考動作轉化成實時的關節控制指令,並且能夠處理跟蹤過程中的實際擾動,保證機器人不會因為輕微的姿態偏差而摔倒。

這個三層架構的設計邏輯,其實很像一家餐廳的運作方式。主廚(視覺語言層)根據顧客的點單(語言指令)和廚房現狀(視覺觀察)決定要做什麼菜、大致怎麼擺盤,這個決策不需要每秒鐘都重新想一遍,可以慢慢琢磨。傳菜員(動作專家)拿到主廚的方案後,規劃出具體端菜走哪條路、先上哪道菜,這個節奏比主廚稍快一些。而真正端著盤子在擁擠後廚里穿梭、隨時躲避同事和障礙物的,是手腳利索的服務生(跟蹤執行層),他們的反應速度必須是毫秒級的,不然盤子就摔了。如果讓主廚親自去端盤子穿梭廚房,效率會極其低下,因為深度思考和快速反應本來就是兩種完全不同的能力,硬塞進同一套系統里,兩頭都做不好。

實驗結果:數字說話

聊了這麼多設計,效果到底怎麼樣?先看標準的視覺語言導航基準測試VLNVerse。

VLNVerse:一個基於IsaacSim構建的、具有照片級真實感室內場景的視覺語言導航評測基準,用來衡量導航模型在給定語言指令後能否準確抵達目標位置。

| 方法 | 是否有底層控制 | 已見場景成功率 | 已見場景SPL | 未見場景成功率 | 未見場景SPL |

|---|---|---|---|---|---|

| CMA | 否 | 37.35 | 33.36 | 31.15 | 27.92 |

| RDP | 否 | 47.28 | 41.69 | 48.60 | 42.72 |

| InternVLA-N1 | 否 | 51.56 | 34.37 | 45.56 | 34.98 |

| Uni-NaVid | 否 | 51.88 | 39.72 | 45.00 | 39.42 |

| TANGO | 是 | **54.69** | 40.18 | **52.89** | 40.18 |

這張表里有個特別值得注意的地方:除了TANGO,所有其他方法都是在"傳送"設定下評測的,也就是說機器人不需要真的用身體走過去,模型給出個坐標點,系統直接把機器人瞬移過去,完全繞開了真實物理執行這一關。而TANGO是唯一一個真刀真槍跑完整個物理執行流程的方法,卻依然拿到了最高的成功率和最低的導航誤差。

這說明什麼?說明在同樣有物理約束、真實走路會撞牆會摔跤的條件下,TANGO的表現比那些"作弊式"跳過物理執行的方法還要好。SPL指標上TANGO沒有明顯領先,論文裡給出的解釋是底層跟蹤器出於安全考慮,傾向於選擇更保守但更安全的路徑,犧牲了一部分路徑效率去換取更高的成功率,這個權衡在實際部署里其實是合理的,誰也不想要一個走最短路但天天撞牆的機器人。

再看雜亂場景下的越障能力測試,這個測試專門加入了低矮障礙、懸空障礙、窄道這些真實生活中常見但傳統導航很難處理的元素。

| 方法 | 導航誤差 | 成功率 | SPL | 碰撞率 |

|---|---|---|---|---|

| InternVLA-N1零樣本 | 5.34 | 26.67 | 11.92 | 19.03 |

| InternVLA-N1 + HumanoidPF | 4.04 | 41.88 | 29.49 | 15.81 |

| TANGO | **4.01** | **43.75** | **31.83** | **9.90** |

碰撞率這一項特別關鍵。TANGO把碰撞率壓到了9.90%,而表現最接近的對手InternVLA-N1配合HumanoidPF跟蹤器,碰撞率是15.81%。差了將近6個百分點,意味著每走100趟路,TANGO能少撞6次左右。更值得說的是,HumanoidPF這套對比方案還額外用了雷射雷達做三維幾何感知,而TANGO全程只靠兩個RGB攝影機,沒有深度資訊,沒有雷射點雲,純靠視覺理解就做到了更低的碰撞率。

真實世界的測試同樣給出了紮實的數字。團隊在三種場景里各測了三個不同地點、每個地點五次試驗,一共45次試驗對比TANGO和微調後的InternVLA-N1加Unitree官方控制器。

| 場景 | InternVLA-N1成功率 | InternVLA-N1平均碰撞次數 | TANGO成功率 | TANGO平均碰撞次數 |

|---|---|---|---|---|

| 短距離2D環境 | 11/15 | 1.40 | **12/15** | **0.40** |

| 長距離2D環境 | 6/15 | 3.47 | **8/15** | **1.07** |

| 雜亂3D環境 | 6/15 | 1.93 | **10/15** | **0.73** |

雜亂環境這一欄差距最大,成功率從6/15提升到10/15,幾乎翻倍,同時平均碰撞次數從接近2次降到不到1次。這個場景恰恰是最考驗全身協調能力的,需要機器人根據具體指令做出跨步、側身、蹲下這類真正意義上的全身動作,而不只是簡單地往前走或轉彎。

消融實驗:拆開來看哪個部件最關鍵

研究團隊還做了一系列拆解實驗,看看去掉某個設計之後效果掉多少,這種實驗對讀者理解"每個設計到底值不值得"特別有幫助。

先看動作空間本身的價值。團隊做了一個只預測平面軌跡的簡化版模型,叫Ours-2D,用來對比全身動作預測和純平面預測之間的差距。

| 方法 | 是否底層控制 | 成功率 | SPL |

|---|---|---|---|

| InternVLA-N1(有底層控制) | 是 | 42.37 | 22.50 |

| Ours-2D(有底層控制) | 是 | 26.67 | 8.34 |

| TANGO | 是 | **52.89** | **40.18** |

這組數據挺扎心的:Ours-2D在傳送設定下表現和InternVLA-N1差不多,甚至略好一點,可一旦換成真實物理執行,成功率直接從45.74暴跌到26.67,SPL更是從35.44跌到8.34,幾乎只剩零頭。這說明單純預測平面軌跡的方法,在沒有物理約束的理想環境下看起來還不錯,一旦真正上機器人跑,就會因為完全沒考慮身體幾何形狀而頻繁撞車摔跤。這也從反面印證了TANGO選擇全身動作空間這個設計不是畫蛇添足,而是解決真實問題的必需品。

再看RTC和運動編輯這兩個組件各自的貢獻。

| 方法 | 成功率 | SPL | 碰撞率 |

|---|---|---|---|

| 去掉RTC | 10.94 | 10.94 | 14.60 |

| 去掉運動編輯 | 36.25 | 30.36 | 20.60 |

| SONIC換成ScaleBFM | 40.94 | 29.65 | **9.10** |

| TANGO完整版 | **43.75** | **31.83** | 9.90 |

去掉RTC之後成功率從43.75暴跌到10.94,跌幅超過32個百分點,這是整個消融實驗裡降幅最大的一項。這說明動作分塊之間的銜接問題如果處理不好,會讓整套系統幾乎失效,機器人可能在每次動作切換的瞬間出現卡頓或者姿態突變,進而導致跌倒或撞擊。

去掉運動編輯,也就是不做障礙感知的姿態調整,成功率降到36.25,碰撞率從9.90升到20.60,翻了一倍還多。這直接證明了PET流程里那個"編輯"階段不是可有可無的美化步驟,而是真正教會模型躲避障礙的核心環節。

把SONIC換成另一款通用跟蹤器ScaleBFM之後,各項指標只是輕微下降,都在3個百分點以內。這說明TANGO這套動作生成框架不是綁死在某一個特定跟蹤器上的,具備一定的可遷移性,換個底層執行系統依然能正常工作。

寫在後面

讀完這篇論文,一個讓我反覆琢磨的細節是"編輯階段完成後,訓練監督信號不用跟蹤器執行出來的軌跡,而用編輯階段的原始參考動作"這個選擇。

這其實揭示了一個很少被討論的矛盾:物理可行性和動作自然度,很多時候是有輕微衝突的。跟蹤器為了保證不摔倒,會在執行時做出一些妥協,這些妥協單獨看沒問題,累積起來卻會讓動作顯得不夠"人"。TANGO團隊沒有偷懶地直接拿跟蹤器輸出當訓練數據,而是專門設計了一套"驗證但不採用"的流程,只用跟蹤結果做篩選,真正的監督信號另取一份更乾淨的版本。這種對訓練數據質量的較真程度,某種意義上比模型架構本身更能決定最終效果的上限。

另一個值得琢磨的地方是論文裡提到的一個局限:整套系統目前只用RGB攝影機,沒有深度資訊,也沒有雷射雷達。作者自己也承認,在光線昏暗或者視覺上比較模糊的場景里,這可能會成為瓶頸。TANGO已經證明了純視覺方案能做到比帶雷射雷達的對手更低的碰撞率,這本身已經是個不小的成績,但如果加上深度感知,效果會提升多少,還是一個懸而未決的問題。

一台完全沒在真實世界訓練過的機器人,在陌生的辦公室里走了30米,中間轉彎、側身、蹲下、跨越,全靠仿真里生成的想像經驗。這件事本身,值得多想一會兒。

Q&A

Q1:TANGO是什麼?

A:TANGO是加州大學伯克利分校等機構提出的首個全身視覺語言導航框架,能讓人形機器人根據自然語言指令,直接預測29自由度的全身關節動作,在雜亂室內環境中自主完成側身、下蹲、跨越等避障動作。

Q2:TANGO和普通的機器人導航方法有什麼區別?

A:普通方法只預測平面上的移動軌跡,不考慮機器人身體的三維形狀,容易在真實執行時撞到障礙物。TANGO直接預測全身關節角度,能根據障礙物類型做出跨步、側身、彎腰等針對性動作,碰撞率明顯更低。

Q3:TANGO的訓練數據是怎麼來的?

A:TANGO團隊開發了一套叫PET的自動化仿真數據生成管線,通過路徑規劃、全身動作編輯、物理跟蹤驗證三個步驟,在仿真環境裡合成了64633條帶避障行為的訓練軌跡,完全不依賴真人動作捕捉。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新