宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

南洋理工大學與ACE Robotics聯手打造,讓機器人真正學會「過日子」的超級數據集

2026年08月07日 首頁 » 熱門科技

這項由南洋理工大學S-Lab實驗室與ACE Robotics聯合完成的研究,以預印本形式發布於2026年7月30日,論文編號為arXiv:2607.28625。有興趣深入了解的讀者可以通過該編號在arXiv平台查閱完整論文。

**人類從未"教"過機器人的事**

每天早晨,你起床後會去廚房燒水、找茶包、把茶倒進杯子、端著杯子走到桌子旁坐下。這整個過程對你來說輕而易舉,甚至根本不需要思考。但對於一台機器人來說,這卻是一座幾乎無法翻越的山。原因不是機器人不夠聰明,而是它從來沒有機會看到一份完整的"家庭生活教學"——一份記錄了眼睛在看什麼、手在怎麼用力、身體如何移動、桌上的杯子怎麼滑動、倒水時發出什麼聲音的全方位教學。

這正是當前人工智慧領域一個隱蔽卻關鍵的瓶頸。語言模型的崛起靠的是人類幾百年來積累的文字,圖像識別靠的是海量照片,但"怎麼用手拿東西"、"抓玻璃杯時該用多大力氣"、"從沙發上起身走向冰箱時身體如何協調"——這些技能從未被人類系統性地記錄下來。機器人想要學會在真實家庭環境中生活和工作,必須有人重新把這些日常智慧從零開始收集。

南洋理工大學和ACE Robotics的研究團隊決定正面解決這個問題。他們構建了一套名為**ACE**(Ambient Capture Engine,環境捕捉引擎)的採集系統,並用它收集了一個前所未有的數據集,命名為**ACE-Data-0南洋理工大學與ACERobotics聯手打造讓機器人真正學會過日子的超級數據集**。這個數據集記錄了50位真實人類在真實家庭環境中進行各種日常活動的全過程,總計超過150小時、1700萬幀畫面、7.5萬個交互片段,涵蓋200種任務類別。更關鍵的是,這份記錄是全方位、多感官、時間對齊的——攝影機、動作捕捉、觸覺傳感器、麥克風同時工作,所有數據都精準對準同一個時間軸。

**一、現有數據集的三大硬傷**

要理解這項工作的價值,先得明白問題出在哪裡。

目前學術界已有不少相關數據集,但它們都像是盲人摸象——每個數據集只摸到了大象身體的一部分。以大規模第一人稱影片數據集為例,Ego-Exo4D收錄了1286小時的影片,EPIC-Kitchens有100小時廚房操作錄像,這些數據集拍攝了大量真實人類行為,但沒有身體動作的精確測量,不知道手在三維空間中究竟位於哪裡,更沒有觸覺資訊。反過來看,使用動作捕捉技術的數據集,比如ARCTIC、GRAB、BEHAVE等,確實提供了精確的身體和物體三維姿態,但這些數據幾乎全部在實驗室里拍攝,環境簡單幹淨,沒有家具遮擋,沒有凌亂的桌面,完全不像真實家庭;而且這些數據集普遍只記錄了幾秒到幾十秒的單一動作——抓一下杯子、打開一個盒子——根本不涉及"燒水、找茶、泡茶、端茶"這樣需要幾分鐘甚至幾十分鐘完成的連續任務。觸覺數據南洋理工大學與ACERobotics聯手打造讓機器人真正學會過日子的超級數據集則更是稀缺中的稀缺,幾乎所有數據集都沒有採集手部接觸壓力資訊。

研究團隊將這三個缺陷概括為:模態碎片化、環境不自然、時間跨度過短。任何一個單獨的問題都足以讓數據集無法支撐真正有用的機器人學習,三個問題疊加在一起,使得現有數據集與實際需求之間存在一條巨大的鴻溝。

**二、ACE系統:把家變成錄音棚**

ACE系統的核心理念是:在保留家庭環境真實感的同時,把它改造成一個專業級的數據採集中心。就像一些影視製作團隊會在真實建築里布置專業攝影設備,而不是把演員帶進攝影棚——真實的凌亂感、真實的光線、真實的家具遮擋,全都保留下來,同時所有必要的傳感器悄悄安裝在角落裡、天花板上、演員身上。

為了應對家庭活動在空間上的兩種極端需求,ACE被設計成兩種互補的配置。

第一種叫**桌面尺度配置**,專門針對精細手部操作。這套系統布置在一張工作桌周圍,覆蓋約30平方米的空間,桌上擺放了超過25種可交互物品,包括刀具、碗、食品容器等。8台近距離GoPro相機以0.3到0.5米的間距密集包圍工作區,16台OptiTrack紅外攝像機安裝在共享支架上,負責追蹤手部和物體的精確運動。這個配置的解析度高到驚人,能捕捉手指與物體接觸時毫米級別的細節。

第二種叫**房間尺度配置**,面向全身運動和跨房間活動。這套系統部署在一套約200平方米的全裝修公寓裡,包括廚房(帶廚房島台)、餐廳、客廳和臥室,同樣擺放了超過25種物品。8台ZED One寬基線相機懸掛在貫穿公寓的天花板支架上,每台相機都有可調節的延伸杆來優化角度,確保公寓內任何一個位置都能被至少4台相機同時看到。12台OptiTrack攝像機分布在同一支架上,覆蓋整個公寓的追蹤體積。

每位參與者在兩套配置中都會佩戴同一套裝備:一頂由ACE Robotics研發的**ACE-Ego-Head-V02 Lite**頭戴式攝像裝置,內置四顆魚眼攝影機(朝向前左、前右、後左、後右,解析度1088×1280,每秒20幀),頭盔上還附有5顆OptiTrack反光標記球,用於實時定位頭盔在空間中的六自由度姿態;一件帶有41個關節標記球的動作捕捉服,覆蓋全身每個主要關節;兩隻Manus南洋理工大學與ACERobotics聯手打造讓機器人真正學會過日子的超級數據集動作捕捉手套,以每秒60次的頻率記錄每根手指的精確彎曲角度;兩隻ACE-Sense-Glove Lite觸覺手套,記錄整個手掌和手指的接觸壓力分布;所有相機同時錄音,包括頭戴設備上的麥克風和外置GoPro的音頻,構成多通道音頻記錄。

這套設備的組合,讓每一個"拿起杯子倒水"的動作都同時被記錄成:頭盔看到的第一視角畫面、8個外部視角的同步畫面、身體41個關節的三維坐標軌跡、兩隻手42個手指關節的精確角度、每個物體在空間中的六自由度位姿軌跡、手掌接觸物體時的壓力分布圖、以及周圍環境的多通道音頻。這就相當於給每一個家庭動作同時安上了十幾雙"眼睛",並且每雙眼睛都有自己專門的感知能力。

**三、讓時間軸對齊:一個精妙的"拍快板"系統**

擁有這麼多傳感器之後,最大的工程挑戰不是採集數據,而是讓所有傳感器的數據精確地對準同一條時間軸。每台相機、每個動作捕捉攝影機、每個傳感器都有自己的時鐘,它們之間哪怕差幾毫秒,在高速動作中就可能體現為手已經握住了杯子,但觸覺數據還沒顯示接觸——這樣的數據用來訓練機器人是有害的,不如沒有。

研究團隊採用了以OptiTrack動作捕捉系統的時鐘為"主時鐘"的方案,因為這套系統內部所有攝影機已經硬體同步,每秒60幀的精確脈衝是最可靠的時間基準。

對外部攝像機的同步,他們設計了一個極其巧妙的"光學時鐘"方案:動作捕捉主機的顯示器上持續顯示以納秒為單位的當前時間(以二維碼形式呈現),這個時間就是OptiTrack的內部時鐘時間。每次錄製開始前,參與者會用頭戴攝像機短暫掃一眼這個顯示器約10秒;外部攝像機也會拍到這個顯示器。通過從影片幀中讀取二維碼時間,再與每台攝像機自身的幀時間戳做對比,就能精確計算出每台攝像機的時鐘偏差(一個固定偏移量加上一個緩慢漂移的線性項)。最終,所有攝像機的時間精度達到毫秒級別,在動作捕捉的60Hz幀率內完全對齊。對於觸覺手套,則利用手套內置的IMU傳感器與頭戴設備IMU的運動相關性來做時間對齊——錄製開始時,操作員做一個特定的手部加速動作,兩個IMU都會感受到,通過匹配這個運動模式來確定時間偏差。

空間對齊同樣需要精心設計。對於固定的外部攝像機,研究團隊使用了一塊特製的ArUco標定板——板的四個角上粘貼了紅外反光標記球。這樣一來,紅外動作捕捉攝像機可以看到標記球(確定標定板在三維空間中的精確位置),RGB攝像機可以看到棋盤格圖案(確定標定板相對於自身的位置),兩者共享同一個物理參照物,從而建立起從動作捕捉坐標繫到每台RGB攝像機坐標系的精確轉換關係,最終實現所有傳感器在同一個世界坐標系下的空間統一。對於會隨頭部移動的頭戴攝像機,則通過"手眼標定"方法確定每顆魚眼攝影機相對於頭盔上標記球組成的剛體的固定空間關係,此後每幀圖像的攝像機位姿都可以直接從動作捕捉系統讀取,精度不依賴於視覺算法,不會隨時間漂移。

**四、如何收集數據:目標導向的自然行為**

系統建好之後,如何讓人類參與者自然地表現出真實行為,是另一個關鍵設計問題。

研究團隊將任務設計成三種類型,以覆蓋家庭活動的完整譜系。

第一種是**原子級手部物體交互任務**,每次錄製包含一到三個簡單家務動作,比如"倒水"、"喝水"、"給植物澆水"、"切蔬菜"、"燒水"、"整理桌面"等,每次錄製約3分鐘。這些任務提供了乾淨、獨立的基礎操作樣本,就像烹飪教材里的單步驟練習。

第二種是**連鎖式手部物體交互任務**,把多個短任務串聯成一個持續20到30分鐘的完整家務循環。參與者從整理廚房開始,到烹飪,到用餐,到清洗,到收拾房間,每個子任務之間自然銜接,最終把場景恢復到初始狀態。這種設計讓數據集捕捉到了真實家務活動中的長時間規劃、跨任務狀態記憶和子任務穿插現象。

第三種是**人場景交互任務**,記錄幾乎不涉及物品操作的全身運動,比如做深蹲、做扭腰運動、在房間裡隨意走動、坐在沙發上、躺在床上等,每次約5分鐘。這些數據捕捉了人類身體與場景要素(椅子、桌子、沙發、床)之間的接觸和協調,為機器人的全身運動規劃提供了參考。

在指令設計上,研究團隊刻意避免了逐步驟指導。參與者收到的是目標級別的指令,比如"準備一杯茶並把它端到桌上",而不是"先走到櫥櫃,打開左邊的櫃門,取出第三個杯子……"這種設計讓每位參與者都能按照自己的習慣和節奏來完成任務,自然地產生行為差異——有人先找茶包再燒水,有人先燒水再找茶包;有人站在水槽旁倒水,有人端到桌邊倒。50位參與者的這種自然差異性,正是數據集的價值所在。

**五、精密的標註體系**

原始傳感器數據經過處理後,研究團隊為每一個片段添加了五類標註,構成了一套完整的語義-物理描述系統。

物體標註涵蓋了每個被跟蹤物體的類別名稱、每幀的六自由度姿態(位置和旋轉)、在所有攝像機畫面中的二維和三維邊界框,以及整個錄製過程中物體運動軌跡的完整歷史記錄。每個物體都事先通過3D掃描或二維高斯濺射重建獲得了精確的三維網格模型,因此物體標註不僅有位姿,還有幾何形狀,可以精確推算出物體在任意時刻的空間占位。

人體姿態標註提供了全身41個關節的三維坐標序列,並同步轉換為SMPL-X格式的參數化人體模型表示。這些姿態數據是通過動作捕捉系統直接測量的,而非由圖像估計得到,因此在家具遮擋、極端姿勢和快速運動時仍然準確可靠。同時,所有姿態數據都被反向投影到每台攝像機的每一幀圖像上,生成了與圖像像素對齊的二維骨架標註,為視覺模型的訓練提供了即用型監督信號。

手部姿態標註單獨列出,提供了兩隻手42個關節的精確角度序列,並同樣投影到所有視角的圖像中。在房間尺度配置中,手部數據來自Manus動作捕捉手套的直接測量;在桌面尺度配置中,則通過對8台外部相機的二維關鍵點進行RANSAC三角化後人工校正獲得。

觸覺標註將觸覺手套採集的壓力圖標準化處理後,以每幀一張"手形壓力熱圖"的形式儲存,並與影片幀、物體標註共享同一時間軸,可以直接查詢任意時刻手掌各區域的接觸強度。

語言標註則由Gemini多模態大模型南洋理工大學與ACERobotics聯手打造讓機器人真正學會過日子的超級數據集對頭戴相機的第一視角影片逐段理解並生成自然語言描述,記錄每個時間段內參與者正在做什麼、場景中發生了什麼。所有自動生成的標註最後經過人工審核校正,確保準確性。

這套標註體系的精妙之處在於:除語言描述外,所有標註都來自傳感器的直接測量,而非通過算法估計得到。這意味著即使面對重度遮擋、快速運動或極端姿勢,標註數據仍然是可靠的真值,而不是某個算法猜出來的結果。

**六、三級基準測試:從感知到理解再到互動**

收集數據只是第一步,讓數據產生價值需要建立配套的評測體系。研究團隊在ACE-Data-0的基礎上設計了一套三級遞進式基準測試,從底層感知信號到場景組件理解,再到交互行為理解,層層遞進。

第一級測試關注**低層感知信號**,具體任務是"從視覺畫面預測觸覺信號"。給定一段手部操作的第一視角影片,算法需要預測每一幀手掌各區域的接觸壓力分布。這個任務的意義在於:如果機器人身上沒有觸覺傳感器,是否能從攝影機看到的畫面"猜出"手正在經歷什麼樣的觸感?研究團隊評測了三種現有方法。PressureVision通過卷積編解碼器直接從RGB圖像回歸壓力圖;EgoPressureDiff將這個問題建模為條件擴散過程;TouchAnything則通過跨視角融合學習通用的視覺-觸覺映射。結果顯示,TouchAnything表現最好,但三種方法的空間重疊精度(接觸區域的IoU指標)都維持在相對較低的水平,說明從視覺"讀取"觸感仍然是一個極具挑戰性的開放問題,尤其是當手和物體相互遮擋時,壓力分布的精確估計遠比判斷"是否有接觸"難得多。

第二級測試關注**場景組件恢復**,即從影片中重建人體在三維空間中的完整姿態。研究團隊評測了22種方法,覆蓋了單視角逐幀估計、單視角時序估計、場景感知估計和多視角聯合估計四大類別,是迄今為止在真實家庭場景中規模最大的人體運動估計評測。結果揭示了一個重要規律:局部姿態估計(關節相對位置)和全局軌跡估計(人在房間裡的移動路徑)之間存在顯著落差。很多方法在局部姿態指標上表現接近標準數據集上的水平,但一旦需要估計全局軌跡,誤差就會大幅上升。場景感知方法(利用房間幾何資訊約束人體位置)在軌跡估計上確實優於純視覺方法,但對局部關節估計幫助有限。第一視角方法(從頭戴攝像機估計全身姿態)整體表現最差,因為身體大部分區域都在攝像機視野之外,只能從頭部運動推斷。

第三級測試關注**具身交互**,即從影片中精確重建手部在三維空間中的運動軌跡。這個任務對機器人學習尤其重要,因為手的軌跡可以相對直接地轉化為機器人夾爪的操作軌跡。研究團隊分別評測了第一視角和第三視角兩種設置,並用同一套數據進行了直接對比。

在第一視角設置下,三種方法分別是逐幀回歸的WildHands、時序影片處理的Dyn-HaMR和HaWoR。結果發現,逐幀方法在局部關節精度上反而優於時序方法,原因可能是時序方法需要同時估計攝像機運動(頭部移動)和手部運動,攝像機運動估計的誤差會直接污染手部位置估計。在全局軌跡估計方面,兩種時序方法的誤差都在98至102毫米左右,說明頭部運動補償是第一視角手部軌跡重建的主要瓶頸。

在第三視角設置下,評測了HaMeR、WiLoR、OmniHands(逐幀)和HaPTIC(時序)以及HORT(同時估計手和物體)五種方法。局部關節精度方面,五種方法相差不大,最佳的WiLoR達到9.1毫米PA-MPJPE,與逐幀第一視角方法(11.2毫米)接近。在全局軌跡方面,第三視角的時序方法HaPTIC只有63毫米誤差,明顯優於第一視角的兩種方法,原因正是固定攝像機提供了穩定的空間參考系,無需估計攝像機自身的運動。

這次跨視角對比清晰地表明:第一視角提供了更近距離的手部細節,第三視角提供了更穩定的空間參考,兩者的失效模式互補——第一視角害怕截斷、畸變和運動模糊,第三視角害怕身體和物體遮擋手部。將兩者融合使用很可能是未來更準確手部重建的方向。

**七、這個數據集能做什麼**

ACE-Data-0的價值遠不止於支撐這三項基準測試。由於它包含了時間對齊的第一視角觀察、多視角第三視角影片、身體運動軌跡和接觸級別的觸覺監督,每一個訓練信號都指向同一個物理時刻,這使它天然地適合支持一系列前沿機器人學習任務。

在模仿學習領域,機器人可以直接從數據集中提取人類操作手勢的三維軌跡,用於訓練抓取和操作策略。在世界模型領域,多模態同步南洋理工大學與ACERobotics聯手打造讓機器人真正學會過日子的超級數據集數據可以用來學習家庭環境中動作的因果關係——按下開關後會發生什麼聲音,把杯子放在桌邊可能會滑落。在視覺-語言-動作系統領域,語言標註和動作軌跡的對齊為直接訓練"聽懂指令就能執行操作"的端到端系統提供了素材。在觸覺感知遷移領域,視覺與觸覺的同步配對數據可用於訓練機器人從攝影機讀取接觸資訊,從而在沒有觸覺傳感器的情況下也能估計抓取質量。

研究團隊特別提到,ACE-Data-0還具備擴展潛力。當前版本覆蓋2個採集地點,未來可以向更多家庭環境、更多物體種類、更多人口多樣性擴展。系統本身的設計也預留了這種擴展性——採集流程標準化,每個新地點只需重新標定,不需要重新設計整套系統。

**說到底,這是一次認真的還債**

說到底,ACE-Data-0是在認真償還一筆"數據債"。機器人研究者們早就知道,要讓機器人真正融入家庭,就必須讓它們從人類的日常智慧中學習。但這份智慧從來沒有被系統地記錄過,大家只是隱約知道這個缺口很重要,卻沒有人真正去填補它。

這項研究的意義在於,它把"全面、同步、真實家庭場景"這三個本來很難同時滿足的條件湊在了一起。基準測試的結果同樣重要:現有方法在接觸估計、全身運動軌跡、第一視角手部重建等任務上都暴露出了明顯的能力邊界,這為未來研究指明了值得努力的方向。

當然,這個數據集並不完美。它只覆蓋了兩個採集場地,布局風格和光線條件都有限;被追蹤的物體必須提前掃描和安裝標記球,無法處理流動的液體、可變形物體或關節式設備的狀態變化;參與者身上的動作捕捉服、手套和頭盔在畫面里清晰可見,可能讓模型學到一些只在實驗場景中才存在的視覺特徵。這些局限是真實的,需要在未來工作中逐步克服。

對於關心家用機器人未來的讀者,這項研究意味著一個具體的進展:幫助機器人學習家務的"教材"正在被認真編寫,而且正變得越來越完整。有興趣深入了解所有技術細節、查閱數據集使用協議或關注後續進展的讀者,可以通過arXiv編號2607.28625找到完整論文,數據集本身也已在Hugging Face平台的ACERobotics賬戶下公開發布。

---

Q&A

Q1:ACE-Data-0數據集和現有的機器人訓練數據集有什麼區別?

A:ACE-Data-0最核心的區別是"多模態同步"——它同時記錄了第一視角影片、8個外部攝像機影片、全身動作捕捉、手指關節角度、物體三維位姿、觸覺壓力和多通道音頻,並且所有數據都精確對準同一條時間軸。現有大多數數據集只提供其中一兩種模態,或者是在實驗室里拍的,沒有真實家庭的家具遮擋和環境複雜性。ACE-Data-0把這些條件同時滿足,這是它的主要貢獻。

Q2:觸覺數據在機器人學習中為什麼重要?

A:觸覺告訴機器人"抓到了沒有"以及"抓得多緊",這是視覺看不出來的資訊——玻璃杯拿起來了但攝影機看不到手指受力多大。ACE-Data-0里每幀畫面都配有對應的手掌壓力分布圖,讓研究者可以訓練模型從影片畫面預測觸感,相當於用攝影機模擬觸覺傳感器的功能,對沒有觸覺硬體的機器人平台很有實用價值。

Q3:ACE-Data-0數據集是否對外公開可用?

A:是的,數據集已在Hugging Face平台公開發布,賬戶名為ACERobotics,數據集名稱為ACE-Data-0。相關代碼和項目主頁也可通過搜索"ACE-Data-Engine"找到。數據集收錄了超過150小時、1700萬幀的多模態同步數據,並附帶完整標註,研究者可以直接下載使用。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新