機器人,認識你自己:新型視覺系統讓機器賦予身體自我認知能力
在MIT電腦科學與人工智慧實驗室(CSAIL)的一間辦公室里,一隻軟體機械手正小心翼翼地彎曲手指,抓取一個小物體。令人稱奇的不是它的機械設計或內置傳感器——事實上,這隻手根本沒有任何傳感器。整個系統僅依賴一台攝影機,通過觀察機器人的動作並利用視覺數據來控制它。
這一能力來自CSAIL科學家開發的全新系統,為機器人控制提供了一種全新視角。該系統無需手工設計的模型或複雜的傳感器陣列,僅通過視覺就能讓機器人學習自身如何響應控制指令。這一方法被稱為"神經雅可比場"(NJF),賦予了機器人一種身體自我感知能力。相關開放獲取論文已於6月25日發表在《自然》雜誌上。
"這項工作標誌著一種轉變——從編程機器人到教導機器人,"MIT電氣工程與電腦科學專業博士生、CSAIL成員、該研究首席研究員李思哲表示,"如今,許多機器人任務需要大量工程設計和編程工作。未來,我們設想只需向機器人展示要做什麼,讓它自主學習如何實現目標。"
這一研究的動機源於一個簡單卻深刻的重新定義:實現經濟實惠、靈活機器人的主要障礙不在於硬體,而在於能力控制,而這可以通過多種方式實現。傳統機器人被設計為剛性且傳感器豐富,便於構建數字孿生體——一種用於控制的精確數學副本。但當機器人是軟體、可變形或形狀不規則時,這些假設便不再成立。NJF沒有強迫機器人去適應我們的模型,而是反其道而行之——賦予機器人從觀察中學習自身內部模型的能力。
觀察與學習
這種將建模與硬體設計解耦的方式,有望大幅拓展機器人設計空間。在軟體和仿生機器人領域,設計師往往需要嵌入傳感器或加固結構的某些部分,僅僅是為了使建模成為可能。NJF消除了這一限制。該系統無需板載傳感器或設計調整即可實現控制,設計師可以更自由地探索非常規、無約束的形態,而無需擔心日後能否對其建模或控制。
"想想你是如何學會控制手指的:你擺動、觀察、適應,"李思哲說,"這正是我們系統所做的。它通過隨機動作進行實驗,找出哪些控制信號能移動機器人的哪些部位。"
該系統已在多種機器人類型上驗證了其魯棒性。團隊在氣動軟體機械手(可捏取和抓握)、剛性Allegro機械手、3D印表機械臂,甚至一個沒有內置傳感器的旋轉平台上測試了NJF。在所有情況下,系統僅憑視覺和隨機運動,就學會了機器人的形狀及其對控制信號的響應方式。
研究人員看到了遠超實驗室的應用潛力。配備NJF的機器人未來有望以厘米級定位精度執行農業任務,在無需複雜傳感器陣列的情況下在建築工地作業,或在傳統方法失效的動態環境中自主導航。
NJF的核心是一個神經網路,它捕捉機器人具身性的兩個相互交織的方面:三維幾何形狀和對控制輸入的響應靈敏度。該系統基於神經輻射場(NeRF)構建——這是一種通過將空間坐標映射到顏色和密度值來從圖像重建三維場景的技術。NJF在此基礎上進一步擴展,不僅學習機器人的形狀,還學習雅可比場——一個預測機器人身體上任意點如何響應電機指令而運動的函數。
為訓練該模型,機器人在多台攝影機記錄結果的同時執行隨機動作。整個過程無需人工監督或對機器人結構的先驗知識——系統僅通過觀察,就能推斷出控制信號與運動之間的關係。
訓練完成後,機器人只需一台單目攝影機即可實現約12赫茲的實時閉環控制,從而持續觀察自身、規劃並做出響應。這一速度使NJF比許多基於物理的軟體機器人仿真器更具實用價值,因為後者的計算量往往過大,難以實時運行。
在早期仿真中,即便是簡單的二維手指和滑塊,也能僅憑少量樣本學會這種映射關係。通過對特定點在動作響應下如何變形或位移進行建模,NJF構建了一張密集的可控性地圖。這一內部模型使其能夠在整個機器人身體上泛化運動,即便數據存在噪聲或不完整也不例外。
"真正有趣的是,系統能自行找出哪些電機控制機器人的哪些部位,"李思哲說,"這不是編程實現的——它通過學習自然湧現,就像一個人摸索新設備上的按鈕一樣。"
軟體機器人的未來
幾十年來,機器人領域一直青睞剛性、易於建模的機器——比如工廠里的工業機械臂——因為其特性簡化了控制。但該領域正逐漸轉向能更流暢適應現實世界的軟體仿生機器人。代價是什麼?這類機器人更難建模。
"如今的機器人技術因昂貴的傳感器和複雜的編程而讓人望而卻步。我們開發神經雅可比場的目標,是降低這一門檻,讓機器人技術變得經濟實惠、適應性強,並讓更多人能夠使用。視覺是一種強韌可靠的傳感器,"論文通訊作者、MIT助理教授文森特·西茨曼表示,他領導著場景表示研究組,"它為機器人打開了一扇門,使其能夠在雜亂、非結構化的環境中運作——從農場到建築工地——而無需昂貴的基礎設施。"
"僅憑視覺就能提供定位和控制所需的線索,從而消除對GPS、外部追蹤系統或複雜板載傳感器的依賴。這為機器人在非結構化環境中實現魯棒、自適應行為打開了大門——從在室內或地下無地圖導航的無人機,到在雜亂家居或倉庫中作業的移動操作臂,乃至穿越崎嶇地形的足式機器人,"共同作者、MIT電氣工程與電腦科學教授、CSAIL主任達妮埃拉·魯斯表示,"通過從視覺反饋中學習,這些系統建立起對自身運動和動力學的內部模型,在傳統定位方法失效的場景下,實現靈活的自監督運作。"
目前,訓練NJF需要多台攝影機,且每台機器人都需重新訓練,但研究人員已在構想一個更易獲取的版本。未來,愛好者只需用手機錄製機器人的隨機動作——就像租車前拍一段影片一樣——然後利用這段素材創建控制模型,無需任何先驗知識或專業設備。
該系統目前尚不能跨不同機器人泛化,也缺乏力覺或觸覺感知,限制了其在接觸密集型任務中的效果。但團隊正在探索解決這些局限的新方法:提升泛化能力、處理遮擋問題,以及擴展模型在更長空間和時間跨度上的推理能力。
"正如人類對自身身體如何運動和響應指令形成直覺理解一樣,NJF僅憑視覺就賦予了機器人這種具身自我感知能力,"李思哲說,"這種理解是在真實環境中實現靈活操控與控制的基礎。我們的工作,本質上反映了機器人領域的一個更廣泛趨勢:從手動編程詳細模型,轉向通過觀察和交互來教導機器人。"
這篇論文匯聚了西茨曼實驗室在電腦視覺和自監督學習方面的工作,以及魯斯實驗室在軟體機器人領域的專業積累。論文共同作者還包括CSAIL成員:電氣工程與電腦科學專業博士生張安南(SM '22)、博士生陳博遠、機械工程本科研究員漢娜·馬圖西克,以及MIT可感知城市實驗室博士後劉超。該研究得到了MIT研究支持委員會所羅門·布赫斯鮑姆研究基金、MIT總統獎學金、美國國家科學基金會以及光州科學技術院的資助。
Q&A
Q1:神經雅可比場(NJF)是什麼?它是如何讓機器人實現自我感知的?
A:神經雅可比場(NJF)是MIT CSAIL開發的一種機器人控制系統。它的核心是一個神經網路,通過攝影機觀察機器人的隨機運動,同時學習機器人的三維形狀和各部位對控制指令的響應方式,從而建立機器人的內部模型。整個過程無需傳感器、無需人工標註,機器人僅憑視覺就能"認識"自己的身體,並實現實時閉環控制。
Q2:神經雅可比場系統目前有哪些局限性?
A:目前NJF存在幾個主要局限:訓練階段需要多台攝影機,且每台機器人都需單獨訓練,無法跨不同機器人直接泛化;系統缺乏力覺和觸覺感知,在需要大量接觸的任務中效果有限;此外,對遮擋情況的處理以及長時空跨度的推理能力也有待提升。研究團隊正在積極探索解決這些問題的方法。
Q3:神經雅可比場技術未來有哪些實際應用場景?
A:研究人員認為NJF的應用潛力遠超實驗室。未來可能的場景包括:以厘米級精度執行農業採摘任務、在無需複雜傳感器的建築工地作業、室內或地下無地圖導航的無人機、在雜亂倉庫或家居環境中工作的機械臂,以及穿越崎嶇地形的足式機器人。此外,普通愛好者未來或許只需用手機錄製機器人動作,就能為其創建控制模型。






