宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

北京大學造出會「聽指揮」的靈巧機器人手:它是怎麼從看人類做飯學會幹活的?

2026年07月23日 首頁 » 熱門科技

這項由北京大學人工智慧研究院與北大-PsiBot聯合實驗室主導、聯合賓夕法尼亞大學共同完成的研究,於2026年6月以預印本形式發布,論文編號為arXiv:2607.09701。研究提出了一套名為EgoSteer的完整機器人操控系統,旨在讓雙手靈巧機器人能夠理解人類的自然語言指令並完成各種複雜操作任務。

你有沒有想過,教一個孩子學做飯,最自然的方式是什麼?大概不是給他一本厚厚的操作手冊,而是讓他站在廚房裡,看大人怎麼切菜、怎麼翻炒、怎麼把盤子端到桌上。孩子通過觀察大量真實的操作過程,慢慢就懂了——什麼叫"炒至金黃",什麼叫"輕輕攪拌"。

北京大學的研究團隊做的事情,本質上和這個道理一模一樣。他們想讓機器人也能通過"看別人做"來學會幹活,而且不只是機械地復現動作,而是真正聽懂人類用自然語言說出的指令,比如"把茶葉放進茶壺"或者"把手機放到支架上",然後自己去完成。

這聽起來簡單,但在機器人研究領域,這件事長期以來極其困難。現有的大多數機器人系統要麼只能做一兩個固定任務,要麼雖然號稱"通用",但實際上只能控制簡單的夾爪式機械手,完全沒有真正意義上的手指靈巧度。而配備多根手指的靈巧機器人手雖然在動作豐富度上遠勝夾爪,但訓練起來需要的數據量大得嚇人,而且專門為機器人收集的操作演示數據向來費時費力、成本高昂。

研究團隊的核心突破在於:他們意識到人類自己每天產生的第一視角影片——也就是佩戴頭部攝影機拍攝的,看到自己雙手在操作的那種影片——本質上就是天然的學習素材庫。全世界已經積累了超過十一萬小時這樣的影片,裡面記錄了人類如何拿起物體、如何擺放、如何用工具。如果能從這些影片裡提煉出有效的訓練信號,再把它遷移到真正的機器人身上,就相當於給機器人配備了一個從海量人類操作經驗中自學而來的"肌肉記憶"。

這套系統由三個緊密咬合的部分組成:一個叫EgoSmith的數據處理流水線,一套統一的機器人操控平台,以及一個叫EgoSteer的核心模型。下面就一層層把這三件事說清楚。

一、EgoSmith:把亂糟糟的生活影片變成高質量教材

原始的第一視角影片就像一堆未經整理的錄像帶——有人在走路、有人在聊天、有人的手根本就沒在幹什麼有意義的事。把這些統統塞給機器人學習,不僅沒用,反而會把它教壞。研究團隊因此設計了一條名為EgoSmith的四步精煉流程,就像一家專門處理食材的中央廚房,把進來的生貨變成可以直接下鍋的淨料。

第一步是"初篩",也就是預過濾。系統會先快速掃描每一段影片,把那些明顯沒價值的內容扔掉。具體來說,它會分析影片裡的畫面運動模式:如果鏡頭在大範圍移動,說明拍攝者正在走路,這段影片就沒用;如果畫面里看不到手,或者手被遮擋了,同樣跳過。這一步用的是一種叫做光流的技術,可以理解成"追蹤畫面里每個點的流動方向",就像看水流的紋路判斷河道走向一樣。與此同時,系統還會用一個叫YOLO的圖像識別工具來檢測畫面里有沒有清晰可見的雙手,如果手的位置或大小不對勁,也會被過濾掉。

第二步是"四維動作重建",這是整個流程里技術含量最高的環節。經過初篩的影片只是普通的二維畫面,但研究團隊需要知道手在三維空間裡的真實位置和運動軌跡。他們用一個叫DPVO的相機追蹤算法來估算攝影機在空間中的移動路徑,再用一個叫Any4D的工具來估算場景中物體的真實距離,把兩者結合起來,就能把畫面里的手從二維坐標換算成真實世界裡的三維坐標。打個比方:這就像你拿著一張照片,通過照片裡的透視關係和物體的已知大小,反推出拍照時你站在哪兒、手伸到了多遠。

經過這一步改良,系統的處理速度比此前最先進的同類工具HaWoR快了整整九倍,同時準確度也全面提升——在衡量手部追蹤精度的四項指標上均勝出,其中最關鍵的"世界坐標手部關節誤差"從106.9毫米降到了86.0毫米。

第三步是"語言標註"。光有動作數據還不夠,系統還需要知道每段影片裡的手在做什麼,這樣才能讓機器人學會把語言指令和具體動作對應起來。研究團隊調用了一個強大的視覺語言模型Qwen3.5-VL-Plus,讓它自動為每段影片生成五個層次的文字描述。第一層最簡短,只有動詞加名詞,比如"裝飾蛋糕";第二層是一句話的概要,比如"把藍色紙張固定在蛋糕周圍";第三層聚焦於被操作的物體,描述其特徵和位置;第四層聚焦於雙手各自的角色和動作細節;第五層則是分步驟的詳細過程描述,幾乎像一份操作說明。這種從粗到細的分層標註,讓機器人能夠理解不同詳細程度的語言指令,不管你說"拿起蛋糕"還是"用左手穩住蛋糕底部同時右手纏繞包裝紙",它都能對應起來。

第四步是"質量把關",在三個粒度上進行最終篩查。在整段影片的層面,系統檢查攝影機的運動統計是否異常,頭部晃動過猛的片段會被丟棄;在幾秒鐘長的片段層面,檢查手的位置是否在合理範圍內,畢竟人類的手再怎麼伸,也不可能離頭部超過1.5米;在逐幀的層面,檢查相鄰幀之間的動作跳變是否超過了人類生理極限,超過的就認為是數據錯誤,同樣去掉。

經過這套流程,研究團隊從十二個不同來源的第一視角數據集中,整理出了一個包含9600小時、超過兩百萬段影片、共十億幀圖像的預訓練語料庫。這些數據覆蓋了8969種不同的被操作物體和623種動作詞彙,從日常的拿起放下,到複雜的組裝焊接,應有盡有。

二、統一機器人操控平台:讓人類隨時能"接管"機器人

有了大量人類操作的影片數據作為"課本",下一步是讓機器人真正在現實世界裡把這些知識用上。問題是,人類的手和機器人的手結構不同,人類影片裡的視角也和機器人攝影機的視角有差異。要彌補這個鴻溝,就需要額外收集機器人自己實際操作的演示數據,也就是讓人類直接遠程操控機器人做各種任務,錄下來作為"接地氣"的訓練素材。

研究團隊開發的這套機器人操控平台做了一件很聰明的事:它讓遙控操作、模型自動執行、以及人類隨時介入糾錯這三件事共用同一套底層控制代碼。這意味著什麼?意味著不管是人在操控,還是AI在執行,機器人的手臂和手指都走完全一樣的運動路徑,不會因為切換模式而產生任何額外的誤差。

具體實現上,操控者戴上專門的手套和手腕追蹤器,系統會實時捕捉操控者雙手的姿態,然後把這些姿態轉換成機器人手臂和手指的目標位置。兩台機器人手臂和兩隻六自由度靈巧機器人手會跟隨操控者的動作同步運動。

更關鍵的是"隨時接管"功能。在機器人自動執行任務的過程中,如果它做錯了什麼——比如夾歪了、放偏了——旁邊的人類專家可以踩一下腳踏開關,立刻接管控制權,幫機器人糾正動作,糾正完再踩一下把控制權還給AI繼續執行。但問題來了:當人類接管的那一刻,機器人的狀態和人類手的狀態可能完全不同,如果直接切換,機器人會因為兩者之間的位置差突然"跳一下",不僅嚇人,還可能損壞設備或物體。

研究團隊提出的解決方案非常優雅:接管的那一刻,系統不是讓機器人直接跟著人類的手走,而是只記錄人類手在之後的相對移動量,然後把這個相對移動量疊加到機器人當前位置上。就像你騎自行車轉彎,不是要求你的身體突然移到某個絕對位置,而是你扭多少度,車頭就跟著轉多少度。這樣切換就變得完全平滑,這套機制實現了超過85%的接管成功率。

利用這套平台,研究團隊讓操控者在真實的機器人上演示了193種不同的操控任務,涵蓋從簡單的拿起放下,到需要雙手配合的複雜操作,再到需要精細物理接觸的任務,比如用海綿擦盤子、用熨斗熨衣服、在白板上寫字。場景布置刻意保持混亂和隨機,桌布顏色、物體種類和擺放位置每次都不同,這樣收集到的數據才更貼近真實世界的多樣性。最終收集了187小時、超過五萬五千段演示,並用語言模型自動生成了多層次的文字描述,再經過人工核驗。

三、EgoSteer模型:一個裝了"預見未來"能力的機器人大腦

有了九千多小時的人類操作數據,再加上一百多小時的機器人演示數據,現在需要的是一個能把這些數據轉化為實際操控能力的模型。研究團隊提出的EgoSteer就是這個"大腦"。

EgoSteer的核心結構可以理解為兩個專家的協作。第一個專家是"語言視覺理解專家",負責看懂眼前的畫面、讀懂語言指令、理解當前局面。研究團隊用的是Qwen3-VL這個成熟的視覺語言模型的2B版本作為骨幹,它本身就具備很強的圖像理解和語言理解能力。第二個專家是"動作生成專家",負責把前者的理解轉化成具體的機器人運動指令,生成一系列連續的手腕位姿和手指關節目標位置。這個動作專家採用的是一種叫做流匹配的技術,可以把它理解成:先把目標動作想像成一團隨機噪聲,然後一步步把它"雕刻"成清晰精確的運動軌跡。

為了讓人類操作數據和機器人數據能無縫對接,研究團隊統一了兩者的數據格式:無論是人類影片還是機器人演示,動作都被表達為手腕在三維空間中的位置和朝向,加上十五個手指尖關鍵點的位置,共四十八個數值。人類的手和機器人的手雖然外形不同,但都可以用這套統一語言描述,就像不同語言的文字都可以翻譯成國際音標一樣。

EgoSteer的一個特別設計是"實時分塊執行"機制。機器人在執行動作時,模型每次要生成未來一段時間內的動作序列,但生成這個序列本身需要一定時間。如果等模型算好了再讓機器人動,機器人就會周期性地"卡一下",這在精細操作中是致命的。研究團隊的解決方案是:模型在生成一段新動作序列時,把序列開頭的幾步作為"已知"輸入,然後只預測後面的部分;與此同時,機器人就用開頭的那幾步繼續執行,等後面的預測算好了,再無縫銜接上去。這樣機器人的動作就始終是連續的,不會出現卡頓。

更有意思的是EgoSteer里的第三個模組——"世界模型專家"。這是一個只在訓練時使用、推理時完全丟棄的輔助網路。它的任務是:根據當前的畫面和即將執行的動作序列,預測未來某個時刻的畫面會長什麼樣——不是預測真實像素,而是預測一種叫DINOv3的視覺編碼器提取出的深層語義特徵。可以把它理解為:不是預測"螢幕上會顯示什麼顏色",而是預測"這個場景的語義本質會變成什麼"。這種對未來的預判能力,會通過訓練過程中的梯度反傳,實實在在地改善"語言視覺理解專家"的表徵質量,讓它在理解當前局面時就自然地考慮到動作的後果。訓練完成後,這個世界模型專家就被丟棄,推理時不消耗任何額外計算資源。

整個訓練過程在工程優化上也下了很大功夫。系統採用了一種叫HSDP的分布式訓練策略,讓計算和通信可以同時進行而不互相等待;用FlexAttention來優化注意力計算;用WebDataset格式進行順序數據流讀取,大幅降低了儲存系統的讀取壓力。最終系統在八塊A800顯卡的單台伺服器上達到了97個樣本每秒的訓練速度和44.5%的理論計算峰值利用率,並且幾乎線性地擴展到了128塊顯卡的規模。

四、實驗結果:這個機器人到底有多能幹?

研究團隊對EgoSteer進行了一系列嚴格的測試,測試場景全部是真實的機器人在真實的桌面上完成真實的任務,沒有任何簡化或模擬。

在核心的多任務指令跟隨測試中,研究團隊在九千六百小時的人類影片上預訓練,再在一百八十七小時的機器人演示上後訓練,最後還做了三輪DAgger糾錯優化(下文詳述),然後測試機器人能否在自由形式的語言指令下完成超過四十個不同的任務。結果顯示,整體平均成功率達到75%,有22個任務的成功率在80%以上。更重要的是,機器人在面對雜亂的桌面時,能夠嚴格按照語言指令選擇正確的目標物體和正確的操作手法,而不是隨便拿個什麼東西就動。它還能在一次嘗試失敗後自動重試,表現出魯棒性。

在四個從未見過的全新組合任務上,機器人平均成功率為65%;在四個完全陌生動作語義的任務上,成功率為62%。這說明機器人不只是在背題庫,而是真正理解了操作的內在邏輯,能夠遷移到新情境。

另一個重要測試驗證了DAgger糾錯機制的價值。研究團隊比較了兩種訓練方式:一種只用遙控演示數據,另一種在此基礎上加了三輪人類介入糾錯,每輪採集糾錯數據並重新訓練。在四個特別棘手的任務上,只用演示數據的模型平均成功率只有22.5%,而加了糾錯之後飆升至62.5%,總共只用了8.3小時的糾錯數據。效果之顯著,成本之低,令人印象深刻。

預訓練數據量對最終效果的影響也得到了系統性驗證。研究團隊分別用三千小時、六千小時和九千六百小時的數據預訓練,再加上一個完全從零訓練的對照組,在同樣的十個任務上測試。結果非常清晰:從零訓練只有30%成功率,三千小時預訓練提升到40%,六千小時達到43%,九千六百小時達到60%。預訓練損失曲線也隨著數據量增加持續下降,沒有出現平台期,說明更多數據還會帶來更多收益。

與兩個強基線系統的比較結果同樣突出。π0.5和Being-H0.5都是近期發表的優秀機器人大模型,研究團隊把它們也在自己的機器人演示數據上訓練後進行對比。在同樣十個任務上,π0.5平均成功率22%,Being-H0.5為39%,而EgoSteer達到74%。研究團隊分析認為,這兩個基線系統的預訓練和後訓練階段的動作表示方式不統一,而且它們使用的圖像解析度較低,也缺少實時分塊執行這樣的部署優化。

消融實驗(也就是逐一去掉某個模組看效果下降多少的測試)則驗證了每個設計決策的必要性。去掉世界模型專家,成功率從44%跌至31%;關掉實時分塊執行機制,成功率跌至39%,而且接觸類任務因為動作抖動幾乎全部失敗;用沒有經過EgoSmith過濾的原始噪聲數據,成功率只剩33%,語言理解和動作精度都嚴重下降。

五、從"快速上手"到"舉一反三":幾步就學會折箱子

最後一個測試場景是研究團隊最引以為傲的部分:EgoSteer的預訓練模型在只有少量演示的情況下,能否快速學會全新的、極其複雜的長流程任務?

研究團隊選了兩個任務。第一個是在RealMan機器人上"摺疊紙箱",這個任務需要連續完成18個步驟,整個過程耗時40秒,涉及大量精準的雙手協調和物理接觸。第二個是在AgiBot G1機器人上"拆蛋糕包裝盒",需要9個步驟,耗時約一分鐘。兩項任務都在從未見過這些任務的機器人上進行,都使用隨機的初始物體位置,都只提供了非常有限的演示數量——折箱子用了120段演示,拆包裝盒用了229段。

結果是:EgoSteer預訓練模型經過快速微調後,折箱子成功率75%,拆包裝盒成功率83%。而那些沒有預訓練的對照組呢?無論是擴散策略(Diffusion Policy)、隱式最大似然估計(IMLE),還是從零訓練的EgoSteer,在這兩個任務上的成功率統統是0%。任務完全無法完成。這個對比結果非常有力地說明:正是那九千六百小時的人類操作預訓練,給機器人裝上了一套關於"手該怎麼動"的底層物理直覺,讓它面對全新複雜任務時能夠快速適應,而不是從一片空白開始摸索。

歸根結底,這套系統解決的是一個很根本的問題:如何讓機器人在無需大量專門針對它定製的訓練數據的情況下,依然能夠掌握豐富的操控技能並聽懂人類的自然語言。答案是:充分利用人類自己產生的大量第一視角影片,用精心設計的數據處理流程提煉出高質量的訓練信號,再用一個架構合理、訓練目標設計周全的模型來消化這些信號,最後通過少量的機器人專屬演示和人類介入糾錯來落地。

當然,研究團隊自己也坦承了幾個尚未解決的問題。機器人的自由度限制讓它無法完美復現人類手部最精細的動作;系統缺少觸覺反饋,在需要感知力度的任務上還有明顯短板;預訓練數據的規模可以繼續擴大。這些都留給了未來的研究去繼續推進。

對普通人來說,這意味著什麼?也許再過不太久,你家裡的機器人助手就不再需要你用專門的遙控界面一步一步發指令,而是可以直接告訴它"幫我把快遞箱子拆開",然後看著它思考一兩秒,再靈活地用雙手把事情幹完。而這一切能力的來源,是它在某個數據中心裡默默"看"了數以億計幀的人類日常操作影片。

有興趣深入了解技術細節的讀者,可以通過arXiv編號2607.09701查閱完整論文,研究團隊也承諾開源全套系統代碼、數據集和模型權重,項目主頁為egosteer.github.io。

Q&A

Q1:EgoSmith數據處理流水線比之前的HaWoR工具強在哪裡?

A:EgoSmith在處理速度上快了整整九倍,同時追蹤精度也全面超過HaWoR。它的核心改進是把HaWoR依賴的DROID-SLAM相機追蹤算法換成了更輕量穩定的DPVO,並引入Any4D來估算真實物理尺度,讓手部在三維空間中的位置估計更準確。此外EgoSmith還增加了多層質量過濾機制,能自動丟棄因頭部抖動或算法漂移產生的錯誤數據。

Q2:EgoSteer的世界模型專家在推理時為什麼可以直接丟棄?

A:世界模型專家的作用發生在訓練階段,它通過預測未來幀的語義特徵,給視覺語言理解模組施加額外的梯度信號,促使主幹網路學到更有利於動作預測的表徵。這種影響已經被"烙印"進模型權重里了。推理時不再需要這個輔助網路,去掉它既不影響效果,又節省了計算資源,可以說是一種只花訓練成本、不花推理成本的提升方式。

Q3:DAgger糾錯是怎麼收集數據的,為什麼只需要8小時就能大幅提升成功率?

A:DAgger的做法是讓機器人自己跑任務,在它出錯的時候人類專家通過腳踏開關接管控制、糾正動作,再把這段糾錯過程錄下來加入訓練數據,重新訓練後再繼續部署。因為收集的都是真實失敗場景的糾正示範,針對性極強,所以少量數據就能顯著改善策略在部署時的實際表現。研究團隊只用了8.3小時的糾錯數據,就把四個難度較高任務的平均成功率從22.5%提升到了62.5%。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新