教會一台機器人疊襪子,一共分幾步?
攤平、對齊、摺疊,再將襪口翻過來,這些看似簡單的動作,過去機器人要學會,往往需要四五個小時的訓練。但現在,只需一段數十秒的演示影片,就能快速掌握。
好傢夥,這是哪來的東方神秘力量?
最近,自變量機器人發布了一套名為 HOST 的機器人學習框架。HOST 全稱為 Human-to-robot One-Shot Skill AcquisiTion,也就是「人類到機器人單樣本技能獲取」。
有了它,機器人只要看一段 29 秒的人類演示短影片,就能當場上手幹活,期間甚至完全不需要更新模型參數,也不必專門採集幾十條機器人遙操作數據。
不僅技能獲取速度比最快傳統方案飆升了 500 倍,連成功率都實現了反超。更簡單粗暴點說,高冷死板的機器人,光靠「刷影片」就能進化為全能管家。

機器人學習做家務,進入「刷短影片」時代
別看如今的具身機器人能文能武,各個都是練習時長兩年半的練習生,但熟悉機器人的圈內人都知道,以前讓 AI 學干一件新家務,到底有多費勁。
目前常見的模仿學習方案,仍依賴數據採集與模型微調。
怎麼教?先請個專業工程師坐在遙操作台前,像玩極品飛車一樣,手把手控制機械臂幹上 50 遍。
這就完了?早著呢。這幾十條數據還得拿去給模型做監督微調(SFT),一通離線「煉丹」下來,少說也要花上 4 個小時。
如果機器人真進了千家萬戶,同樣是整理桌子,涉及的動作可能完全不一樣。難道每碰上個新活兒,都得呼叫工程師上門服務,再等幾個小時?
這筆賬,怎麼算怎麼離譜。
但 HOST 這套方案,則對傳統流程帶來了明顯改變。研究團隊搭建了一個雙臂機器人平台,測試了 50 項訓練階段從來沒見過的全新任務(比如放水果、堆碗、擦盤子、插筆、疊襪子)。

不採集數據,不改通用參數,只給機器人看一段人類普通演示影片。結果它在 50 項新任務中全都有成功記錄。在主要的測試任務中,僅觀看一次數十秒的人類演示影片,學會技能的平均成功率達到了 62%!

AI 之間的差距有多大,直接看數據吧。
當前最強的微調基線,需要專業人員遙操作機器人完成 50 條示範,從採集數據到訓練出新技能,通常要花 4 小時。HOST 讓機器人只需要觀看一段平均 29 秒的普通人操作的影片,不需要反覆演示和微調,就能學會新技能。
相比監督微調的方案,HOST 需要的示範數量降至五十分之一,技能獲取時間較最快的 SFT 基線縮短約 507 倍。
這下,機器人是真體驗到了人類那種「看一遍就會」的快樂。
不再模仿人類動作,而是想像結果、反推動作
你可能會問:讓機器人看影片,不就是對著人類動作照貓畫虎嗎?
真沒那麼簡單。人和機器的「手速」能一樣嗎?影片裡人類小哥 2 秒鐘就把杯子拿起來了,機器人的鐵胳膊可能需要 5 秒。
如果硬卡影片播放時間,影片裡的人都開始倒水了,機器人還在那瞄準杯把手呢,任務步驟越多,雙方的偏差也會越明顯。
於是 HOST 的研究團隊想了個絕招:不看時間,看進度。他們把影片畫面和機器人的動作,映射到同一個叫「向量空間」里,然後用動態時間規整算法自動對齊。簡單說,就是給任務打上進度條。
不管人類用了 2 秒還是機器人用了 5 秒,只要雙方都進入了「杯子已經被拿起」的狀態,進度就算同步。這種操作,讓進度誤差從 0.079 暴降到了 0.006,直接縮小了一個數量級。

這時,聰明的你可能又會想到一個問題:即便節奏對上了,人類與那些「鐵疙瘩」之間仍然存在明顯的身體結構差異。
比如人的手掌可以貼合杯壁,機器人的夾爪需要尋找合適的夾取位置。人可以捏住襪子的一角,機械臂還要考慮夾爪開合、運動角度和兩隻手臂之間的配合。
讓機器人直接複製人類動作,很難得到有用的結果。
對此,HOST 想出了一套非常巧妙的解決思路:先讓機器人從人類執行完任務的結果,「想像」出機器人執行完任務的畫面,再根據畫面反推出機器人需要動作的動作。
為實現這個方案,HOST 還設計了一個核心策略模型——雙專家 MoT 架構。
更通俗點理解,就是它有兩個分工明確的大腦,一個「視覺大腦」負責理解影片、定位進度和預測未來場景,另一個「動作大腦」負責把視覺目標變成機器人動作:

視覺大腦(Localization & Vision):先看懂機器人干到哪一步了,對應的人類影片到哪一步。然後根據人類動作結果,腦補出將這個畫面轉換為機器人視角應當看到的畫面(比如想像出水杯被夾爪拿起的畫面)。
動作大腦(Action):負責把腦補出的機器人畫面變成現實,電腦械臂怎麼動才能達到目標。
不強行模仿人類手臂的角度,只盯著需要實現的最終效果,然後從最終效果想像出動作。這樣就繞過了「讓機器人模仿人類動作」這個最難的跨越。
當然,「單樣本技能獲取」容易讓人產生誤解,以為機器人此前完全沒有接受訓練。
但其實這裡的 one-shot 指機器人面對一項新任務時,只需要接收一段人類演示,整個任務都是在「推理過程」中完成的,無需再為這項任務更新模型參數。支撐這種能力、讓機器人能從影片學習的基礎模型,依然經過了大規模訓練。
機器人出廠前可是見過大世面的。
第一階段主要使用機器人數據。會團隊先餵給它 193462 條機器人軌跡以及對應的機器人執行任務影片(涵蓋 229 項任務),讓它嘗試從機器人的任務影片中想像出結果,再拆解出自己這副鋼鐵身軀怎麼動。

第二階段再加入人類與機器人的配對數據。比如用 5847 段人類任務影片和對應的機器人軌跡配對,讓它學會把人的執行任務的畫面翻譯成機器的視角,好從人類影片學習。
先利用規模更大的機器人數據建立任務理解和預測動作結果的能力,再用數量相對較少的人機數據完成能力的遷移,這樣的好處是可以充分利用數據、降低對人機配對數據的依賴。
而出山之後,再遇到新任務,直接把人類影片當操作指南,邊看邊干就行。
學會疊襪子,也沒忘了洗盤子
掌握新技能只解決了一半的難題,更關鍵的是,機器人學會新技能後,原來的能力能否保留,同樣決定了它能否長期「有用」。
這就涉及到機器人一個極其令人頭痛的痛點:災難性遺忘。比如用後訓練微調教機器人,會改變模型的參數、侵蝕模型原本已經學會的技能。這會導致「狗熊掰棒子」,看似學會了疊襪子,但以前很溜的洗盤子反而退步了。
論文中也注意到了這個問題。論文選取了七項來自訓練集、模型此前已經掌握的任務,包括取出瓶子、對齊襪子、堆疊杯子、整理包裝材料、蓋住中央物體、放置紙巾和排列花朵。
研究人員先測試 HOST 與三種監督微調基線在這些舊任務上的表現。隨後,三種基線通過監督微調學習新任務,HOST 則通過一段人類影片獲取新技能,再重新測試各自的舊任務表現。
在舊任務測試中,三種微調基線幾乎被「災難性遺忘」打回原形。學完新任務後,π0.5+SFT 只保留了原有表現的 17%,就連舊技能保留率最高的 Wall-OSS+SFT,也只保住了 40%。

但 HOST 因為全程沒改模型的腦迴路(參數),舊任務表現基本沒受影響,比最好的微調基線高出了整整 59 個百分點!
在 HOST 眼裡,那段人類影片就像一份可以保存和再次讀取的「菜譜」。今天疊襪子,翻開第一頁;明天理餐具,讀第二頁。技能隨時調取,互不干涉。
而且,這種機器人的學習方式極其「抗造」。
研究團隊設置了光線變化、替換同類物體、更換操作場景和執行過程中移動物品等干擾。

HOST 在標準環境中的平均成功率為 62%。改變光照後下降 1 個百分點,替換物體後下降 4 個百分點,更換場景後下降 6 個百分點,執行中人為移動物品後下降 9 個百分點。最後一種情況下,平均成功率仍達到 53%。
這還有個冷知識,物品被臨時移動後,原有動作計劃已經失效。但 HOST 會根據新的觀察結果重新判斷任務進度,再生成對應動作。這說明它真正理解了任務,在動態規劃每一步,而不是在「背」動作序列。
全面開源「技術家底」,普通人也能教機器人幹活兒
老實說,62% 的成功率,距離進工廠幹活兒還有提升空間。反而是在家庭場景,不太關心單次成功率,更關心泛化性,也就是「多摸索幾次沒關係,最後做成了就行」。
HOST 的出現,讓行業看到了一條具身智能極其性感的落地路線。
2023 年底成立的自變量機器人,算是國內死磕「完全端到端路線」的具身智能硬核玩家,至今發布並開源的各種技術,已經「多如牛毛」。
研發範圍已經覆蓋具身智能的 VLA 基礎模型、世界模型、用來拆分動作的「動作分詞器」、訓練模型的底層「神經網路優化器」、數據採集系統和機器人本體。自變量不僅發布基礎模型,還延伸到用來訓練模型的底層基礎設施。
今年 4 月,他們發布了從零聯合訓練的具身大模型 WALL-B,採用獨特的「世界統一模型」架構,已經部署在機器人里,在大量用戶家庭做起家政服務。後來又發布了世界模型 WALL-WM,還開源了 VLA 模型 WALL-OSS-0.5,後者已經被很多科研機構用起來了。

在機器人本體上,自變量已經自研並量產量子一號、量子二號。機械臂、關節模組、動力驅動器和主控制器等核心部件均為自主研發,並與算法深度適配,為機器人進入家庭和工業產線提供了載體。
今年 3 月起,自變量又與 58 到家合作,讓機器人與保潔人員共同進入普通家庭提供服務。5 月推出的「X 家庭成員計劃」,還讓機器人在用戶家中連續駐留一個月,接受真實、隨機家庭需求的檢驗。
「從零開始」訓練具身模型,在具身智能領域有相當高的門檻。真正能在國內從零預訓練出好的具身模型,還搭建起從數據採集到模型訓練的整套管線的,更是寥寥無幾。
購買現成模型、拼接幾個模組,可以更快做出演示 Demo。真正從基礎架構起步,意味著團隊需要自己解決模型設計、數據生產、分布式訓練、動作表達、真機控制和部署效率。
自變量選擇從零訓練自己的基礎模型,同時開放部分核心成果,已經形成一條從具身基礎模型延伸到底層設施的開源技術「全家桶」,也成為國內開放具身智能核心技術、建設開發者生態的「扛把子」之一。
在這些研究之外,HOST 正是讓機器人在應用場景快速學習技能、真實落地的又一塊技術拼圖。現在,他們連同北理工和清華,直接把 HOST 的核心家底給開源了(論文、GitHub、Hugging Face 一應俱全)。

項目主頁:
https://host-site.host-robotics.workers.dev
論文鏈接:
https://arxiv.org/abs/2607.20033
Github 鏈接:
https://github.com/CGuangyan-BIT/HOST
Huggingface 鏈接:
https://huggingface.co/papers/2607.20033
這就很有格局了。具身智能現在百家爭鳴,處於技術路線快速變化的階段。
模型架構、動作對齊方法、數據規範、訓練方法和評測標準都沒有完全確定。單靠一個預訓練模型,即使訓得再好,距離能勝任家庭這個最終場景的「一切任務」仍很遙遠。
在這個特殊的時間點,能讓機器人快速學到預訓練沒有的新技能,就對機器人真正「用起來」十分重要。HOST 就是讓機器人先能「快速用起來」的技術神器。
開源能夠讓更多研究機構和開發者參與其中。
研究者可以復現論文結果,機器人公司可以嘗試適配不同本體,開發者也能基於已有模型繼續改進。同行的復現、質疑和改進,也會反過來加快模型疊代。這也讓自變量進一步成為國內具身智能開源陣營中最鮮明的技術派之一。
文章的最後,我們不妨開個腦洞。過去,教機器人意味著採集專業數據;但在 HOST 展示的未來里,教學一個新技能終於不再需要「高薪算法工程師」,變成了普通人皆可完成、皆可受益的工作。
你家機器人不會給衣服疊出你想要的效果?沒關係,你親自站在它面前疊一遍,剩下的它自己悟。
或許不久的將來,網際網路上最火的不再是搞笑段子,而是各種《讓機器人慾罷不能的 100 個家務教學短片》。普通人教機器人做事的時代,這次是真的要來了。






