宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

小米機器人造出「全能選手」:靠10萬小時真實操作錄像,教會機器人做任何家務

2026年07月29日 首頁 » 熱門科技

這項由小米機器人團隊完成的研究,以預印本形式發布於2026年7月16日,論文編號為arXiv:2607.15330,有興趣深入了解的讀者可通過該編號查詢完整論文。

如果你家裡有一個機器人,你最希望它能做什麼?疊衣服、收拾書包、把散落在沙發上的玩具整理進收納箱?這些聽起來平常的事情,對機器人來說其實極其困難——不是因為機器人力氣不夠,而是因為它根本不知道面對一個從未見過的房間、一件從未碰過的物品時,手該怎麼動。小米機器人團隊花了大量時間和精力,試圖徹底解決這個問題。他們構建了一個名為Xiaomi-Robotics-1的系統,而這個系統背後的核心秘密,是超過10萬小時的真實人類操作錄像。

要理解這件事的分量,可以換個角度思考:10萬小時,相當於一個人不睡覺地連續工作超過11年。這些錄像記錄的不是在實驗室里精心布置的場景,而是在家庭、餐廳、辦公室、工廠、戶外等各種真實環境裡,人拿著特製的手持抓夾裝置(一種叫做UMI的工具,像手套一樣讓人在操作物體時自動記錄手的動作)完成各種任務的過程。這套數據集涵蓋超過1700個不同場所、240萬個操作片段、260種以上的任務類型,是目前機器人領域規模最大的真實操作數據集之一。

一、為什麼機器人學不會"隨機應變"

要搞清楚Xiaomi-Robotics-1解決了什麼問題,先得理解機器人為什麼那麼難"教"。

教一個小孩疊衣服,你只需要示範幾次,孩子就能舉一反三——今天疊藍色T恤,明天換成紅色毛衣,他照樣能做。但機器人不行。傳統的機器人培訓方式,就像給一個人死記硬背"菜譜":告訴它在哪個位置抓、往哪個方向移動、放到什麼高度,只要場景稍微變化,整套動作就全部失效。

這背後的核心矛盾是:收集機器人訓練數據既貴又慢。讓機器人真正在現場操作來錄製數據,需要真實的機器人硬體、需要人在旁邊操作遙控器、需要反覆調試、還需要大量重複試驗。更糟糕的是,這樣收集來的數據高度重複,總是同一套任務、同一批場景,機器人學到的"經驗"非常狹窄。

小米糰隊的突破在於換了一個思路:既然機器人的手不好用,那就先用人的手來收集數據。UMI裝置讓普通人手持操作就能生成高質量的動作數據,不需要真正的機器人在場。這個方法讓數據收集的效率提升了數倍,也讓數據的多樣性徹底爆發。

二、從錄像到"理解":給每段影片打上"說明書"

收集了10萬小時的操作錄像之後,下一個難題是:機器人看這些錄像,能學到什麼?

單純讓機器人看錄像模仿,就像把一個完全不認識字的人扔進圖書館,他能看到每一頁紙,卻根本不知道上面寫的是什麼意思。機器人需要的不只是"動作畫面",還需要"理解這段動作在做什麼"。

傳統做法是讓人工來給每段錄像寫說明:這段影片裡,人把紅色的盒子從桌上拿起來,放進了背包。但面對10萬小時的錄像,這種人工標註完全不可行——如果每小時標註需要1小時,那就需要10萬小時的人力,差不多等於50個人不休息地工作整整一年。

小米糰隊開發了一套自動打標籤的流水線。他們首先把每段錄像切割成固定長度的小片段,然後用一個已經很懂圖像和語言的大模型(Qwen3.5-27B,一個能看圖說話的AI)來自動描述每個片段里發生了什麼狀態變化——不是簡單地說"手在動",而是具體描述"一隻手抓著一塊白布,正在擦拭桌面"或者"兩隻手把一條黃色毛巾對摺,收疊起來"。

為了讓這套流水線能以足夠快的速度運轉,工程師們設計了一個"生產-消費"並行架構:一組處理器專門負責把錄像切成小片段存到內存里,另一組同時把這些片段送給AI打標籤,兩組互不干擾、同時工作。憑藉這套設計,整整10萬小時的錄像,只用了大約兩周時間就完成了全部標註。

有了這些語言描述,機器人在訓練時就不再只是機械地模仿手的動作,而是學習"當我收到某種語言描述的目標時,應該產生什麼樣的動作序列,使場景從當前狀態變成目標狀態"。這是一個質的飛躍:機器人開始學會把語言和動作聯繫起來。

三、兩階段培訓:先"博覽群書",再"專項訓練"

Xiaomi-Robotics-1的訓練分為兩個明確的階段,兩者之間的關係,就像培養一個廚師的過程。

第一階段叫做預訓練。在這個階段,機器人並不急著學怎麼用機器臂,而是先靠著那10萬小時的UMI錄像,廣泛吸收各種場景下的操作經驗。預訓練的目標是讓模型形成一種"通用操作感知"——知道在各種情況下,手(或者類似手的工具)應該怎麼動,才能讓物體從一個狀態變化到另一個狀態。這就像一個未來的廚師先在全球各地旅行,品嘗各種菜餚,了解食材的特性,而不是急著拿起鍋鏟。

第二階段叫做後訓練。這時候,團隊拿出了另一批數據:超過1萬小時的真實機器人操作錄像。其中包括他們自己收集的超過7200小時的移動機械臂和雙臂機器人數據,覆蓋多種家庭場景;超過1000小時的UMI數據,但這批數據配的是人類日常說話時會用的指令(比如"把黃色運動鞋放到鞋架上"),而不是狀態描述;此外還有來自開源社區的Bridge V2、RT-1、DROID等數據集。

後訓練的目標是讓模型完成兩個"適配":一是把在UMI手持夾上學到的操作技能,遷移到真正的機器人手臂上;二是把在狀態描述語言下學到的能力,對接到人類平時對機器人說話時用的那種命令式語言。這兩個適配都非常重要——沒有第一個,機器人手臂不會動;沒有第二個,你對機器人說"幫我把書包收拾好",它根本聽不懂。

在後訓練中,團隊還用Qwen3.5模型對人工切割的影片片段重新標註指令語言,確保這批數據里的語言風格和真實人類與機器人對話時保持一致。同時,他們過濾掉了所有"靜止"片段——就是那些機器人什麼都沒做、只是待著不動的部分,避免模型學到"不動"這個無效行為。

四、"大腦"的構造:兩個專家組成的團隊

Xiaomi-Robotics-1的內部結構也頗有設計感。它採用了一種叫做"混合變換器"(Mixture-of-Transformers)的架構,可以理解為由兩個功能不同的專家模組合作完成任務。

第一個模組是視覺語言模型,基於Qwen3-VL構建。它的工作是接收攝影機拍到的當前畫面和操作人員給出的語言指令,然後理解"現在是什麼情況""要做什麼"。除了理解這些資訊,它還會直接預測一批候選的動作方案——但這些方案更像是"草稿",而不是最終決策。

第二個模組是擴散變換器(DiT),專門負責生成最終的動作序列。它接收視覺語言模型處理過的資訊緩存,加上機器人當前的關節狀態,然後通過一種叫做"流匹配"的技術,從一片隨機噪聲出發,逐步生成精確的動作序列。這個過程就像雕刻家從一塊毛坯大理石開始,一刀一刀削掉多餘的部分,最終呈現出精準的雕塑。具體來說,推理時只需要5步疊代就能完成這個"雕刻"過程。

兩個模組之間有一個細節處理值得關註:視覺語言模型生成的那些"候選動作方案",被特意隱藏在擴散變換器的注意力範圍之外。團隊發現,如果讓擴散變換器"看到"這些草稿,它會偷懶——直接複製視覺語言模型的結論,而不去認真地從視覺和語言資訊中自己推導動作。這個"防止偷懶"的設計讓最終的動作質量明顯提升。

模型一共有三個尺寸:2B版本參數總量約26億,5B版本約51億,10B版本約105億。不同尺寸分別對應不同的計算資源需求和性能水平,可以根據實際硬體條件選擇。

五、越大越好:數據和模型規模帶來的提升

研究團隊用一系列嚴格的實驗,驗證了Xiaomi-Robotics-1在規模上是否真的"越大越好"。

在數據規模方面,他們用5B版本的模型,分別在12.5%、25%、50%和100%的約2萬小時UMI數據上訓練,然後在同一批留出的測試數據上評估動作預測的準確度(用均方誤差衡量,數字越小越好)。結果非常清晰:隨著數據量的增加,預測誤差單調下降。特別是當數據只有12.5%和25%時,模型的誤差曲線會先下降後上升——這是典型的"過擬合"現象,意思是數據太少,模型把那點數據記得太死,到新場景就不靈了。而當數據達到50%和100%時,誤差曲線全程下降,且100%數據的下降速度更快,說明模型還沒有"吃飽",繼續加數據仍然能持續提升。

在模型規模方面,他們把2B、5B和10B三個版本都在同一批2萬小時數據上訓練,結果同樣是規模越大、誤差越小。不過一個有趣的現象是,三個尺寸之間的差距,比數據規模之間的差距要小。這說明在現階段,數據量是更重要的瓶頸——模型已經足夠大,但數據還不夠多。

更關鍵的發現是:預訓練階段的規模效益,會直接傳導到後訓練階段的實際表現。團隊測試了一個極具挑戰性的指標:在從未見過的新環境裡,機器人不經過任何額外練習,直接完成任務(即"開箱即用")的成功率。結果顯示,用100%預訓練數據初始化的模型,開箱即用成功率達到75%;而沒有經過任何UMI預訓練、直接從Qwen3-VL權重開始的模型,成功率只有26%。僅僅用12.5%的預訓練數據,成功率就直接翻倍到53%。在模型規模上,10B版本的開箱即用成功率達到79%,顯著優於5B的75%和2B的61%。

六、四個任務的真機測試

團隊設計了四個貼近真實家庭場景的任務,用來在真實機器人上測試開箱即用能力,而且測試環境和訓練環境完全不同——不僅房間不一樣,就連具體的物品也是從沒見過的新款。

第一個是鞋子整理。機器人需要把一雙黃色運動鞋拿起來,放到鞋架的指定位置。這個任務看似簡單,但鞋子形狀不規則、質地特殊,抓握需要相當精確的力度控制。

第二個是背包收拾。這個任務分成多個步驟:先拉開拉鏈,然後把一個小汽車模型放進去,再把一個紅色罐頭放進去,再放一個藍色小包,最後把拉鏈拉上。這是一個多步驟、需要記住順序的任務。

第三個是桌面整理。機器人需要把桌上的幾件零散物品(太陽鏡、牙膏、黃色固體膠、一個蘋果)分別放到指定的容器和位置,同時還要遵從具體的語言指令(比如"把蘋果放到木質托盤上")。

第四個是沙發整理。機器人需要把沙發上的紅色毛絨玩具、小玩具車、白色衣物、黑色褲子分別放到收納箱,並把一個靠墊放正。

在10B模型的開箱即用測試中,鞋子整理的成功率高達92%,背包收拾和桌面整理分別為75%和89%,沙發整理為77%。這些數字放在當前的機器人研究中屬於相當高的水準,特別是考慮到測試環境和物品完全是模型從未見過的。

七、用極少的數據快速學會新任務

開箱即用能力驗證了模型的通用性,但機器人還需要一個重要能力:用少量數據快速適應全新的、更複雜的任務。

團隊設計了四個全新的、在整個訓練數據集中從未出現過的任務,用來測試這種適應能力。

第一個是手機裝箱。機器人需要用雙手配合,把手機放進箱子,再把說明書放進去,然後蓋上蓋子。這個任務需要兩隻手的精細協調,難度較高。

第二個是衣物入洗衣機。這是一個移動操作任務,分為五步:打開洗衣機門、把裝有衣物的籃子移到洗衣機門口、把衣服從籃子轉移到洗衣機里、拿走籃子、關上洗衣機門。整個流程跨越較大空間,需要多步驟記憶和執行。

第三個是印表機加紙。機器人需要抓取一疊紙,把它遞給另一隻手(雙手交接),然後把紙的一端塞進印表機紙盒,再把整疊紙完全推入,最後把兩隻手臂歸位。紙張是高度柔軟易變形的材料,操控難度極大。

第四個是箱子收納。機器人需要根據語言指令,把桌上的多個指定物品依次放進箱子,考驗的是語言理解和物品識別能力。

測試分兩種數據量:低數據設定每個任務平均不到10小時的訓練數據,高數據設定總計144小時。對比的基準是兩個同類頂級系統:π0.5(Physical Intelligence公司開發)和Xiaomi-Robotics-0(小米上一代系統)。

在低數據設定下,Xiaomi-Robotics-1的平均成功率達到75%,遠超π0.5的40%;高數據設定下,這個優勢進一步拉大,平均成功率達到85%。在印表機加紙這個最難的任務上,Xiaomi-Robotics-1在低數據設定下成功率達到70%,而最好的對比方法只有20%——差距是3.5倍。在衣物入洗衣機任務上,π0.5因為經常卡在"打開洗衣機門"這一步而失敗,Xiaomi-Robotics-0在低數據設定下根本無法完成全流程,而Xiaomi-Robotics-1在低數據設定下就達到了80%的成功率和96%的進度得分(進度得分衡量的是"雖然沒完成,但做到了哪一步")。

八、四大模擬基準測試的全面領先

除了真機測試,團隊還在四個權威的模擬測試平台上進行了評估,與當前最頂尖的系統進行了橫向比較。

RoboCasa是一個模擬廚房環境的基準,包含24種日常廚房任務,測試時使用的是訓練中從未出現過的物品款式和部分全新的廚房風格。Xiaomi-Robotics-1在這個基準上的平均成功率達到74.5%,超過了之前最好的World2Act系統(72.6%),也超過了NVIDIA的GR00T N1.6(66.2%)。

RoboCasa365是RoboCasa的升級版,把任務數量從24種擴展到365種,場景超過2500個,物品超過3200種,還特別設計了"從未見過的複合任務"評測——也就是把模型以前學過的簡單技能組合成新的複雜任務,考驗真正的泛化能力。Xiaomi-Robotics-1在總平均成功率上達到57.4%,比之前最好的ABot-M0.6系統(46.6%)高出了10.8個百分點。在最難的"未見複合任務"分項上,Xiaomi-Robotics-1達到32.1%,而ABot-M0.6隻有7.9%——差距接近4倍,說明Xiaomi-Robotics-1具備了將已學技能靈活重組的能力。

VLABench是一個更加注重語言理解和泛化的基準,包含100種任務類別和超過2000個物品,特別設計了多種"分布偏移"測試:指令中包含隱含的人類意圖、跨類別物品遷移、常識推理、以及材質和外觀的變化。在這個基準上,Xiaomi-Robotics-1的平均成功率達到59.1%,明顯超過ERVLA(53.2%)和π0.5(48.1%)。特別值得一提的是材質變化測試,也就是相同物品換了顏色或紋理後機器人還認不認得——Xiaomi-Robotics-1的成功率達到62.6%,比最好的對比方法高出15.2個百分點,展現了極強的視覺魯棒性。

RoboDojo是目前最全面的綜合評測基準之一,包含超過42種模擬任務,覆蓋五個維度:泛化能力(換物品換場景還能做嗎)、精度(精細操控)、長時序(多步連續操作)、記憶(需要記住之前狀態)、開放(理解開放性語言指令)。Xiaomi-Robotics-1的總平均得分為20.07,而之前最好的Hy-Embodied-0.5-VLA只有13.07;平均成功率為13.93%,而前者為8.80%。在五個維度中,Xiaomi-Robotics-1在泛化、精度、長時序、開放四個維度均排名第一,只有記憶維度略低於Hy-Embodied-0.5-VLA——因為後者專門在設計上加入了歷史觀測記憶機制,而Xiaomi-Robotics-1在RoboDojo測試中完全沒有使用歷史觀測資訊。

說到底,Xiaomi-Robotics-1這個系統的意義,不僅僅在於它在各種測試上拿了第一。更深遠的價值在於,它系統地驗證了一件之前在機器人領域存在很大不確定性的事情:規模真的有效。在大語言模型領域,大家已經接受了"數據越多、模型越大、性能越好"的規律;但在機器人領域,因為數據收集太難,這個規律一直沒有被充分驗證。小米糰隊的這項工作,用10萬小時的數據和從2B到10B的模型對比實驗,給出了一個相對清晰的答案:機器人也遵循同樣的規律,而且預訓練階段的規模效益會直接傳遞到真實機器人的實際操控表現。

這對整個行業的啟示在於,收集真實、多樣、大規模的操作數據,可能是機器人走向通用化最值得投入的方向之一,而不是不斷設計更聰明的算法來彌補數據的不足。當然,這項研究也存在一些尚未解決的問題:在記憶型任務上的短板、在完全開放式指令下的表現仍有提升空間,而且目前的測試主要集中在家庭室內場景,戶外或工業場景的表現還有待進一步驗證。

對於普通人來說,這項研究可能距離你家裡真正出現一個能幫你疊衣服、收拾書包的機器人,還有相當一段距離。但它讓這個距離變得更短了一些,也讓這件事變得更加可期。有興趣深入了解的讀者,可以通過arXiv:2607.15330查閱完整論文,小米糰隊也承諾會開放代碼和模型權重。

Q&A

Q1:Xiaomi-Robotics-1和普通機器人有什麼不同?

A:普通機器人通常只會在特定環境執行固定任務,換個場景就失靈了。Xiaomi-Robotics-1經過10萬小時真實操作數據訓練,能在從未見過的新環境裡直接完成任務,還能用極少數據快速學會全新任務,靈活性遠超傳統方案。

Q2:UMI裝置是什麼,為什麼用它來收集數據?

A:UMI是一種手持抓夾裝置,人拿著它操作物體時,裝置會自動記錄手的動作軌跡。它的優勢是不需要真正的機器人在場,普通人就能在家、在餐廳、在戶外隨時隨地收集數據,成本低、場景多樣、可大規模部署,解決了機器人數據收集既貴又慢的核心難題。

Q3:Xiaomi-Robotics-1目前能在真實家庭里用嗎?

A:目前還處於研究階段,還不是可以直接買到家裡用的消費級產品。但真機測試顯示它在鞋子整理、桌面整理等家庭任務上成功率已達75%到92%,研究團隊也計劃開放代碼和模型,未來商業化落地的路徑正在逐步清晰。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新