
沒去過你家,也不耽誤幫你疊被子。
9 月 17 日,Figure AI 發布了新一代模型 Helix 2.5,在 30 個真實的灣區民宅里做了一次零樣本測試。
Today we’re releasing Helix 2.5 We rented 30 homes in the Bay Area. The robots arrived with no additional training and started doing useful work https://twitter.com/Figure_robot/status/2100657350952779925
我的很多朋友都觀看了這段影片,他們感到習以為常,「這看起來不至於令人驚嘆,不就是機器人疊毛巾、整理床鋪以及撿東西而已嘛。」
是的,我們之前已經看到機器人能夠整理床鋪、摺疊毛巾以及打掃房間。不過我們沒見過的是,這些機器人把訓練好的行為模式,直接搬進 30 個從未打過交道的家庭——面對完全陌生的物體、完全陌生的房間布局,事先沒有任何數據採集,也沒有做任何針對性微調。

在 420 次試驗里有 237 次成功,零樣本成功率為 56%,評測過程為盲測,且沒有任何單一評測任務在 Index 預訓練數據中的占比超過 1.90%。
這意味著機器人幾乎是「憑空」應對每一個新家庭。作為參照,同樣硬體、同樣任務數據、只是沒有經過 Index 預訓練的策略,成功率只有 9%。
隨著預訓練數據的增加,機器人的表現呈現出可預測的、類似語言模型的比例關係。在其他條件不變的情況下,Index 的預訓練讓零樣本任務的成功率從 9% 提升到了 56%,整體成功率則提升了 522%。
更引人注意的是,Figure 還把 Helix 2.5 和自己上一代模型 Helix 02 放在一起比較:後者需要先在目標場地採集數據才能訓練,而 Helix 2.5 僅用一半的適應數據量,就在 30 個從未見過的家庭里追平了 Helix 02 在單一場地的成功率。
這次真的不一樣嗎
很多人對家用機器人最早的印象,來自半個世紀前的動畫片《傑森一家》。裡面那個叫 Rosey 的機器人管家,圍裙拖把一應俱全,做飯打掃鋪床樣樣能幹。

Rosey 在後來的幾十年裡激勵了無數機器人設計。例如,像 Miss Honeywell ——她是一名魔術師的人類助手,曾經銷售過各種家電和電腦產品——與 Rosey 非常相似,甚至連顏色搭配都一模一樣。
到了 1970 年代和 80 年代,人們對家用機器人的期望越來越高,不過隨之出現的也有許多假冒公司。似乎每一種新技術都會吸引那些投機取巧的人。
20 世紀的機器人也不例外,其中最著名的騙局就是來自新澤西州的 Quasar Industries 公司,他們在 1970 年代承諾推出了家用機器人。然而,Klatu 這款家用機器人甚至無法完成 Quasar 所宣傳的半數任務:打掃衛生、修剪草坪,甚至遛狗……不過,這並沒有阻止該公司繼續宣稱自己已經邁入了未來時代。

半個世紀過去,家用機器人的敘事似乎又走到了同一個路口。
對人而言,換一張床不至於忘記怎麼鋪被子。對機器人而言,床的高度、牆邊的空隙、被角垂落的位置,都可能讓熟悉的動作瞬間失效。如果每進入一個家庭都得有人重新採集示範、調整模型,那麼機器人賣出去之後,訓練工作才剛剛開始。
這也是過去幾年裡,幾乎所有「看起來很厲害」的家用機器人演示背後共同的短板:特斯拉的 Optimus、1X 的 Neo,無一例外都要依賴大量場地專屬數據或人工遠程操作才能完成任務。
Figure 今年 1 月發布的上一代模型 Helix 02,可以完成卸洗碗機這類連續幾十步的長時任務,但也需要先在目標場地採集數據。

Helix 2.5 想回答一個更難的問題,機器人能不能走進一個從沒見過的家,直接開始幹活,不需要主人先配合錄一遍自己家的樣子。
Figure 在評測前專門把要用到的玩具、毛巾和床品挑出來單獨存放,先由一個 AI 模型初篩、再由人工覆核,確認它們沒有出現在任何任務訓練數據里;30 個住宅也保留了各自原有的沙發、床鋪和摺疊台面,沒有做任何針對評測的改造。

CEO Brett Adcock 說,這是「我們迄今做過最重要的項目」。他和 AI 總監 Corey Lynch 在發布影片裡強調,機器人在 30 個家庭中「每一個都記錄到了成功」。

近幾年比較紮實的項目,大多依賴在特定場地反覆採集和調優。Helix 2.5 第一次讓人看到,隨著預訓練數據規模增長,機器人在陌生環境裡的表現呈現出某種可以預測的比例關係,而不是每換一個房間就要從零開始。
機器人先向人類借一點經驗
支撐這次變化的 Index,看起來更像一門數據採集生意。
Figure 早在今年 5 月就以另一款應用的形式低調上線了數據採集入口,直到 8 月 25 日才正式以 Index 之名公開亮相,並稱其為「迄今最龐大、最多樣的機器人訓練數據集」。
Introducing Index Today we're coming out of stealth with Index, the largest & most diverse robot dataset in the world → 30min of video uploads/sec → 16M video uploads → Paid $15M to date → 264k downloads We're committed to spending $1B the next 12 months on data & compute https://twitter.com/adcock_brett/status/2092303633559982106
據官方披露,Index 上線時已有 26.4 萬次下載,覆蓋 108 個國家,每周活躍創作者超過 4.4 萬人,累計上傳影片超過 1600 萬條;上傳速度一度達到每秒鐘 30 分鐘的新影片,相當於每天有 4.9 年人類工作量湧入系統,到 9 月初這一速度進一步提高到每秒 35 分鐘。

Figure 已經為此向「創作者」支付了 1500 萬美元,並計劃在未來 12 個月投入超過 10 億美元用於數據和算力,把採集規模再擴大 100 倍。
每 1000 小時收集到的數據里,包含 373 個不重複任務、1146 個不重複操作對象和 116 個不重複環境。
Figure 披露,數據還要經過篩選、反作弊檢查、去重、分布再平衡和文字標註這五道工序,才能進入訓練環節。

Index 之於人形機器人,多少有點像早期網際網路文本語料之於大語言模型的意思。沿著這個類比,人類日常行為有機會成為機器人的基礎教材。過去需要為一處場地重複收集的經驗,或許能被提前學到,並帶進下一處環境。
在模型規模和下游訓練條件固定時,將 Index 預訓練數據逐次翻倍,機器人動作預測誤差會規律性下降。實驗使用了四檔數據規模,最大與最小相差 8 倍,誤差曲線平滑到可以提前用小規模實驗預測出最大規模訓練的損失值,偏差只有整體波動範圍的 0.54%。公司把這稱作人類到人形機器人遷移的一條縮放定律。

其他公司也在尋找擴大經驗來源的方法。1X 的 Neo 在今年 2 月開始面向家庭預訂,售價 2 萬美元,但幾乎所有稍微複雜一點的動作,例如從冰箱裡取水、往洗碗機里放餐具、疊一件毛衣,都要靠公司內部代號「Turing」的遠程操作員戴著 VR 設備實時接管才能完成。

1X 把這些遠程操作數據和家庭日常影片一起餵給今年 1 月發布的世界模型,希望以此逐步降低對人工接管的依賴。
特斯拉的 Optimus 則更依賴大規模人類遙操作,讓操作員戴著傳感設備完成分揀、使用電動工具之類的動作,再把這些軌跡交給神經網路去模仿和優化。
相比之下,Figure 先讓模型從海量人類影片裡學會一般性的行為模式,再用少量任務數據把它適配到具體動作上,理論上不再需要為每一個新家庭單獨派人採集或遠程接管。

疊毛巾之後,還有真實生活
疊毛巾看起來無聊,是因為我們太熟悉了。觀眾通常從動作是否新奇來判斷進展。研究者在解釋泛化,螢幕前的人只看見又疊好了一條毛巾。
我個人唯一感到失望的是,測試中只有三個任務。我希望能有更多任務,比如擦拭鏡子、整理食物、做飯等等。
如果 Figure 能將這三個任務擴展到 10 到 12 個任務,同時將零樣本成功的幾率提升到 80% 到 90%,那麼我們就離真正能夠把機器人部署到家庭中而不需要先收集該家庭的數據不遠了。

目前 56% 的成功率並不意味著機器人永遠都會失敗——因為 Helix 2.5 在長時間任務中已經有了自我修正和重試的功能。就像孩子們小時候需要多次嘗試才能把床鋪整理好一樣,機器人也需要多次嘗試才能成功完成任務。
租來的住宅提供了不同布局,卻未必涵蓋日常生活的全部混亂。地毯上的樂高積木,沙發縫裡的充電線,孩子臨時堆起的玩具,都可能改變原本能夠通過的路線。收拾之前先替機器人收拾一遍,顯然不符合人們購買它的初衷。

可以設想,如果任務從 3 類增加到 10 至 12 類,成功率提升到 80% 至 90%,會讓限定範圍的家庭試點更有吸引力。
Figure 正在為擴大訓練準備資源。9 月初,雲計算公司 Nscale 宣布向 Figure 提供至少 35 億美元的算力,雙方計劃把這一規模擴大到 60 億美元以上,最多部署 10 萬塊英偉達 Vera Rubin 晶片,首批設備預計 2027 年下半年在得州巴斯托落地;作為交易的一部分,Nscale 還入股 Figure,成為其「優先算力供應商」。
Today, we’re partnering with Nscale to deploy up to 100,000 GPUs on the NVIDIA Vera Rubin Platform We're committing $3.5 billion initially, with plans to scale beyond $6 billion Bringing a robot into every home demands compute at an unprecedented scale https://twitter.com/Figure_robot/status/2095499507991744723
Adcock 在聲明中表示,要把人形機器人送進全世界的每一個家庭,公司眼下最大的瓶頸就是數據和算力。
Index 已經在大規模收集人類經驗。從 Figure 的報告中可以看出,隨著數據量增加,遷移效果會有可預見的提升。需要持續關注的是:在完成幾次更大規模的 Index 訓練、面對更龐大的任務集合之後,56% 這個數字能被推到多高。
相關參考:https://www.figure.ai/news/helix-2-5-zero-shot-30-home-generalization






