宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

英偉達與斯坦福聯手打造的「機器人大腦」:讓機器人像人一樣從經驗中學習

2026年07月27日 首頁 » 熱門科技

這項由英偉達英偉達與斯坦福聯手打造的機器人大腦讓機器人像人一樣從經驗中學習(NVIDIA)、斯坦福大學以及德克薩斯大學奧斯汀分校聯合開展的研究,於2026年7月以預印本形式發布,論文編號為arXiv:2607.15275。有興趣深入了解的讀者可以通過該編號在arXiv平台查閱完整論文。

**一切從一個問題開始:機器人為什麼"沒有記憶"?**

假設你是一位外科醫生,正在做一台持續五個小時的手術。你不可能每做完一個步驟,就徹底忘記之前發生的一切,再從頭判斷該做什麼。你的大腦會一直保留著這台手術從開始到現在每一刻的記憶,這樣你才能在第四個小時裡,清楚地知道第一個小時你已經處理了哪根血管、現在該進行到哪一步了。

然而,絕大多數現有的機器人"大腦"並不是這樣工作的。它們就像一個嚴重失憶的手術助手——每次眨眼之後,就只記得眼前這一秒發生了什麼,完全不知道過去發生了什麼。在機器人領域,這被稱為"單步或短歷史視覺運動上下文"——換句話說,機器人的視野只局限在當下這個瞬間,或者最多是幾幀畫面之前。

這種設計在簡單任務里還說得過去,但一旦任務變得複雜,比如要在五分鐘內完成一項包含十個連續步驟的裝配工作,機器人就會像一個在密室里轉圈的人,總是忘記自己剛才走了哪條路、繞過了哪面牆。

英偉達領導的這支研究團隊決定從根本上改變這個局面。他們的答案,就是本文要介紹的核心成果:**RoboTTT**——一套讓機器人策略能夠記住、理解並利用超長歷史經驗的全新系統。

---

一、記憶的維度:從"瞬間記憶"到"五分鐘長卷"

要理解RoboTTT有多不尋常,先來感受一下"量級差距"這個概念。

目前最先進的機器人基礎模型,其視覺運動上下文長度大約在個位數到幾十個時間步的範圍內。換算成時間,也就是最多觀察過去幾秒鐘的內容。RoboTTT則將這個上下文長度擴展到了**8000個時間步**——在每秒30幀的控制頻率下,這相當於整整超過四分鐘的連續歷史。

這是什麼概念?這比現有最先進機器人策略的上下文長度,足足多出了**三個數量級**,也就是一千倍以上的差距。更關鍵的是,RoboTTT做到這一切的同時,**並沒有讓機器人的反應變慢**。

傳統方法中,如果你想讓機器人記住更長的歷史,就需要把所有歷史資訊都保存下來供隨時查閱,但這會讓運算量隨時間線性增長——機器人工作了一分鐘,要查閱一分鐘的記錄;工作了五分鐘,就得查閱五分鐘的記錄,越來越慢。RoboTTT用一種全新的機制徹底繞開了這個瓶頸,後面會詳細解釋。

這套系統解鎖了四種在現有機器人中從未出現過、或表現極其有限的能力:從人類演示影片中進行"一次性模仿學習"、在工作過程中持續改善自己的表現、在受到外力干擾後能自主恢復,以及在跨越數十個階段的超長任務中保持穩定的高水平表現。

---

二、核心機制:用"快速筆記"代替"記憶相冊"

RoboTTT最核心的技術創新,借用了一個叫做"測試時訓練"(Test-Time Training,簡稱TTT)的思想。

通常來說,神經網路(也就是AI的"大腦")的學習過程分兩個階段:訓練階段更新參數,推理階段(即實際使用時)參數凍結不動。這就像一個學生在課堂上學習,然後參加考試——考試時不能再臨時修改記憶,只能用已有的知識回答問題。

TTT打破了這個慣例。它在神經網路內部引入了一種叫做**"快速權重"(fast weights)**的特殊參數。與普通參數(稱為"慢速權重",在訓練完成後就鎖定不變)不同,快速權重在機器人實際執行任務的過程中,也可以通過梯度下降(AI學習的核心算法)持續更新。

用一個比喻來理解:慢速權重就像刻在石碑上的古老知識,永遠不變;快速權重則像你手邊的一本便簽本,隨時可以根據當前情況寫下新的註記、劃掉過時的內容、整理出此刻最重要的資訊摘要。

在RoboTTT中,這本"便簽本"是由一個小型神經網路(具體來說是一個兩層的MLP,即多層感知機)來充當的。每當機器人接收到一幀新的觀察畫面,它就會更新這本便簽本,把當前狀態的關鍵資訊寫進去,同時自然地淡化掉不再重要的舊資訊。當機器人需要決定下一步動作時,它不需要翻閱過去幾千幀的"相冊",而是直接查看這本高度濃縮的便簽本——因此推理速度始終恆定,不隨歷史長度增加而變慢。

從數學角度來說,快速權重的更新遵循一個精確的規則:在每個時間步 $t$,系統將上一時刻的快速權重狀態 $W_{t-1}$ 以及當前的"鍵"(Key)和"值"(Value)向量輸入,通過最小化一個均方誤差損失函數來更新快速權重,得到新的狀態 $W_t$。然後,用這個更新後的 $W_t$ 對當前的"查詢"(Query)向量進行計算,得到輸出。整個"更新然後應用"的循環,在訓練和推理時都持續進行,這就是資訊被壓縮進參數空間、又能隨時被檢索出來的關鍵所在。

---

三、架構設計:在巨人肩膀上加裝"時間感知模組"

RoboTTT並不是從零開始構建的。研究團隊選擇了英偉達自家的**GR00T N1.7**作為基礎,這是一個專為人形機器人和雙臂機器人設計的視覺-語言-動作(VLA)基礎模型——可以理解為機器人界的"GPT底座"。

在GR00T N1.7的架構中,動作生成部分由一個叫做"擴散變換器"(Diffusion Transformer,DiT)的模組負責,它通過逐漸"去噪"的方式生成機器人的動作序列。RoboTTT在這個DiT的每一層(共16層)的注意力機制層之後,都插入了一個TTT層。

這個設計的精妙之處在於分工明確:注意力機制層負責處理"當下這一刻"的所有資訊——當前畫面里有什麼、機器人關節現在的狀態、噪聲化的動作序列——而TTT層則專門負責處理"時間維度上"的資訊流動,也就是把來自不同時間步的資訊整合起來,形成對歷史的理解。

除了注意力層和TTT層,系統還在每個時間步的開頭插入了16個"寄存器令牌"(register tokens)。這些寄存器令牌可以理解為專門的"信使"——它們能夠在注意力層中自由地讀取當前時間步的所有視覺-語言資訊,然後再通過TTT層把這些資訊傳遞到時間軸上。這樣的設計避免了把所有視覺-語言令牌都傳過TTT層(會帶來巨大計算開銷),而是用少量的"信使"來高效搬運關鍵資訊。

為了防止新加入的TTT層一開始就"淹沒"掉GR00T N1.7原有的知識,研究團隊還引入了一個"tanh門控"機制。簡單來說,TTT層的輸出被乘以一個初始值接近於零(0.001)的可學習參數,再加到注意力層的輸出上。這意味著訓練剛開始時,TTT層的貢獻幾乎為零,機器人完全依賴原有的知識;隨著訓練深入,門控參數逐漸增大,TTT層的影響也越來越大,整個過程平滑過渡,不會產生突兀的"知識衝突"。

---

四、訓練配方:兩個讓長序列訓練成為可能的秘密武器

在架構之外,讓RoboTTT真正能夠處理8000步長序列的,是兩項關鍵的訓練技術。

**第一項技術:序列動作強制(Sequence Action Forcing)**

RoboTTT使用流匹配(flow matching)來訓練動作生成——這是一種與擴散模型類似的技術,通過學習如何把"噪聲動作"逐漸還原成"真實動作"來生成高質量的機器人行為。

訓練時,模型需要同時處理整個時間序列上的多個動作塊。一個容易犯的錯誤是,對序列中所有時間步的動作使用同一個噪聲級別:要麼全部處於"低噪聲"狀態(任務很簡單),要麼全部處於"高噪聲"狀態(任務極難)。這會讓訓練極不穩定——就像同時讓一個學生面對一百道完全一樣難度的題目,要麼全都太簡單沒有收穫,要麼全都太難無從下手。

序列動作強制的做法是:**對序列中每個時間步的動作塊獨立採樣噪聲級別**。這樣一來,同一個訓練序列中,有些時間步的動作處於高噪聲狀態(模型需要從很嘈雜的輸入中重建動作),有些處於低噪聲狀態(任務相對輕鬆),整體難度分布更加均衡,訓練因此穩定了許多。實驗證明,去掉這一設計會讓模型的閉環控制性能大幅下滑,機器人會產生不精準的運動,無法推進任務。

**第二項技術:截斷時間反向傳播(Truncated BPTT)**

訓練神經網路時,需要通過"反向傳播"來計算梯度並更新參數。對於序列模型,這意味著要沿著整個時間序列往回傳播梯度,同時在內存中保存每個時間步的中間計算結果。序列越長,需要的內存就越多——對於8000步的序列來說,這個內存消耗會直接超出GPU的承載極限。

截斷時間反向傳播的解決方案簡潔有力:把長序列切分成若干個較短的"段",梯度只在每個段內部傳播,到段的邊界就截斷。但關鍵在於,**快速權重本身並不截斷**——它攜帶著壓縮後的歷史資訊,從一個段的末尾傳遞到下一個段的開頭,就像接力賽跑一樣,確保整個序列的上下文資訊連續流動。這樣,GPU內存消耗由段的長度決定,而不是整個序列的長度,從而在固定的硬體預算下,支持任意長度的訓練上下文。

這兩項技術合在一起,就構成了RoboTTT的完整訓練配方,讓模型可以在現實可行的硬體條件下,真正地從超長歷史中學習。

---

五、從歷史中學習:兩種全新的機器人能力

擁有了長上下文處理能力之後,研究團隊設計了兩種特殊的訓練方式,讓機器人能夠從不同類型的歷史經驗中學習。

**能力一:從人類演示影片中一次性學會新任務**

機器人能不能看一段人類演示影片,然後立刻模仿人類的做法?這種"一次性模仿學習"一直是機器人領域的一個核心挑戰。RoboTTT通過長上下文條件化給出了一個令人眼前一亮的解法。

具體做法是:在訓練時,把一段人類演示影片和一段機器人完成同一任務的軌跡拼接在同一個訓練序列里。影片部分的數據只負責更新快速權重(相當於讓機器人"看"並"理解"人類在做什麼),而不計算動作損失(機器人不會試圖在這個階段輸出動作);機器人軌跡部分則在更新了快速權重之後,正常計算動作損失,讓模型學習如何在"看懂了影片之後"輸出正確的動作。

這樣訓練出來的模型,在實際部署時就可以做到:給機器人看一段人類組裝某個特定配置的電路板的影片,機器人就能在從未見過這個配置的情況下,復現人類的組裝過程。

**能力二:DAgger蒸餾——從失敗中提煉糾錯能力**

DAgger(Dataset Aggregation)是機器人學習領域的一種經典技術,簡單來說就是:讓機器人執行任務,當它犯錯時,人類操作員介入並給出正確的糾正動作,然後把這些糾正動作加入訓練數據,讓模型從失敗-糾正的對應關係中學習。

標準的DAgger訓練方法會把人類糾正動作作為訓練目標,但直接拋棄了機器人的錯誤動作——畢竟,錯誤動作不應該被模仿。然而,研究團隊發現,這些"失敗動作"其實包含著非常重要的資訊:正是這些失敗,才讓後續的糾正動作有了具體的含義。知道機器人"在這一步做錯了什麼",才能真正理解"為什麼糾正動作要這樣做"。

RoboTTT的DAgger蒸餾採用了一種不對稱的角色分配:所有執行過的動作(無論是機器人的錯誤動作還是人類的糾正動作)都會更新快速權重,但**流匹配損失只在人類糾正動作上計算**。

這意味著什麼?快速權重見證了"失敗-糾正"的完整過程,把這種映射關係壓縮進了自己的參數空間。到了實際部署時,當機器人犯下類似的錯誤,快速權重就能檢索出對應的糾正模式,引導機器人進行自我糾正——完全不需要人類在場干預。研究團隊將這一機制類比為"算法蒸餾"(Algorithm Distillation)在機器人領域的具體落地:把人類糾正的算法邏輯,蒸餾進機器人的快速權重之中。

---

六、實驗場景:五分鐘、十個步驟的"機器人奧運會"

研究團隊設計了三個難度遞增的真實機器人實驗任務,全部在一個叫做YAM的雙臂雙手機器人平台上進行,並配備了頂部、底部、左腕、右腕四個RGB攝影機。

第一個任務叫"Pup Go Car"(小狗跑車),機器人需要組裝一輛玩具車的車頂和第一個車輪,過程包括擰螺絲、用電鑽、雙手協作傳遞工具、把車翻轉過來等步驟,平均完成時間約兩分鐘。

第二個任務叫"Circuit"(電路板),機器人需要在一塊電路板上安裝兩到三個電路元件,元件的種類和安裝順序會變化,共有約80種不同的配置組合,訓練時只見過其中20種,測試時面對的是從未見過的另外60種。這個任務還可以通過一次性人類演示影片來指定目標配置,平均完成時間約一分鐘。

第三個任務叫"Gear Bot"(齒輪機器人),這是三個任務中難度最大的。機器人需要在底盤兩側各安裝一個齒輪和兩個車輪(需要兩次翻轉底盤),然後安裝紅色的"機器人頭部",最後拿起遙控器推動搖桿讓齒輪機器人動起來——整整十個階段,平均完成時間長達五分鐘。

研究團隊共採集了Pup Go Car任務8小時、Circuit任務6小時、Gear Bot任務5小時的真實機器人操作數據用於訓練。

---

七、實驗結果:數字背後的真實含義

研究團隊將RoboTTT與三個基線模型進行了對比。第一個基線是原版GR00T N1.7,只使用當前時刻的單幀觀測;第二個是GR00T N1.7 Hist.,使用當前幀加上一幀歷史;第三個叫GDN(門控DeltaNet),使用與RoboTTT相同的架構框架,但把TTT層換成了"門控DeltaNet"層——這是另一種循環記憶機制,可以壓縮歷史資訊,但不依賴測試時的梯度下降來更新。

評測指標分為兩種:一是基於詳細評分表的"任務完成分數"(0到1之間,換算成百分比),二是完整完成任務的試驗次數。

在三個任務上的平均完成分數上,RoboTTT達到了79%,比單步基線GR00T N1.7的42%高出了87%,比表現最好的基線GDN的56%高出了41%。

Gear Bot任務的結果最能說明問題:在10次試驗中,RoboTTT有2次完整完成了所有十個階段——而其他三個基線方法,一次都沒有完整完成過。換句話說,面對這個持續五分鐘、包含十步操作的複雜任務,只有RoboTTT能夠真正"做到底"。

在Pup Go Car任務中,GR00T N1.7 Hist.(帶一幀歷史的版本)的表現反而比完全沒有歷史的GR00T N1.7更差——39.5%對比57%。這揭示了一個容易被忽視的問題:粗糙地堆砌歷史幀,反而會引入虛假的時間關聯,導致機器人在推理時出現"時間錯位",弄不清自己現在處於什麼狀態。歷史不是越多越好,關鍵在於如何有效地利用歷史。

---

八、上下文長度是一個新的縮放軸

研究團隊還專門研究了一個更深層的問題:隨著預訓練時使用的上下文長度從128步增加到8000步,機器人的實際表現會如何變化?

實驗結果呈現出一條清晰的上升曲線:RoboTTT的任務完成分數隨預訓練上下文長度的增長持續穩步攀升。從128步時接近於零的表現,一路提升到8K步時的71.5%;8K步版本比1K步版本高出63%,比最好的短上下文基線GR00T N1.7 Hist.高出57%——而且從圖像上看,曲線還沒有呈現出任何飽和的跡象,意味著繼續增加上下文長度可能還會帶來進一步提升。

相比之下,GDN基線完全沒有表現出這種隨上下文長度增長而改善的趨勢。研究團隊認為,根本原因在於兩種機制的本質差異:GDN的線性關聯狀態更新是固定形式的,沒有辦法通過更長的訓練序列來"元學習"自己的更新方式;而RoboTTT的快速權重初始化 $W_0$ 以及更新動態,都可以通過更長的訓練序列中更多次的梯度更新步驟來持續優化。

這是機器人領域第一次觀察到"預訓練上下文長度"作為一個獨立的縮放維度帶來持續的閉環性能提升,類似於在大語言模型領域觀察到的"上下文窗口是一個重要的縮放軸"這一現象。

---

九、一次性模仿與抗干擾:長上下文的具體體現

在Circuit任務中,研究團隊專門測試了一次性模仿學習的能力。為此他們收集了額外的人類演示影片——人類手動拼接電路板,機器人在旁邊靜止不動,四個攝影機完整記錄整個演示過程。訓練時,對於訓練集中的20種配置,每種收集了5到20段不同初始布局的人類影片,並將影片與機器人軌跡拼接成完整的訓練序列,影片部分的流匹配損失被隱藏。

測試時,面對60種從未見過的電路配置,機器人只能看到一段人類演示影片(系統任務提示詞對所有配置都一樣,是"組裝電路板",不包含任何關於具體配置的資訊),然後獨立完成組裝。

結果是:RoboTTT在10次試驗中成功完成了6次,任務完成分數達到65%;而GDN只有33%的任務完成分數,且沒有一次完整成功,經常拿錯元件或以錯誤順序安裝。這表明,擁有循環記憶的GDN雖然能在某種程度上"編碼"上下文資訊,但在真正需要"檢索和利用"演示資訊時,它的能力明顯不足;而RoboTTT通過梯度下降更新的快速權重,能夠在需要時精準檢索出演示中展示的配置資訊。

在抗干擾實驗中,研究團隊在Pup Go Car任務中額外施加了人為干擾:機器人安裝好黃色車頂後,人類把車頂取走;或者機器人安裝好輪胎後,人類把輪胎取走。能夠利用自身歷史的模型,應該能意識到剛剛完成的工作被打亂,並返回到安裝階段重新完成。為此收集了30分鐘的干擾數據並與任務數據一起訓練。

在車頂干擾測試的20次試驗中,RoboTTT成功恢復了15次,GDN恢復了13次,而最好的短上下文基線只恢復了10次。在輪胎干擾測試中,RoboTTT和GDN都恢復了18次,顯著優於短上下文方法。這說明對自身歷史的長上下文條件化,確實能夠增強機器人在任務執行過程中應對突發擾動的能力。

---

十、DAgger蒸餾的實際效果:自我糾錯能力的量化

在Pup Go Car任務上,研究團隊系統比較了不同DAgger數據使用方式的效果。他們分別用RoboTTT和GR00T N1.7作為基礎策略,各收集了50條帶有人類干預的DAgger軌跡,共100條。

標準DAgger方法(只用人類糾正動作訓練)在四個方法上平均帶來了9%的提升,在兩個序列模型上平均帶來了13%的提升。而DAgger蒸餾(快速權重接觸完整交互歷史,但損失只在人類糾正部分計算)在同樣的數據上帶來了平均33%的提升——RoboTTT提升36%,GDN提升29%。

一個對照實驗證實了"失敗動作作為上下文"的核心價值:把GR00T N1.7直接在包含機器人失敗動作的完整軌跡上訓練(也就是把錯誤動作也當成模仿目標),其結果與只訓練人類糾正動作完全相同,都是57%的完成分數。換句話說,對於不能利用歷史上下文的模型來說,失敗動作的資訊完全是無用的;而對於RoboTTT來說,這些失敗動作作為快速權重更新的上下文輸入,極大地增強了模型的在線糾錯能力。

這種糾錯能力的典型表現,就是機器人在電鑽對準螺絲時發現未能接觸,會自動抬起手臂重新對準再試,甚至經過兩次調整後才成功——這種行為完全是從DAgger蒸餾中自發湧現的,無需人類在實時操作中給出任何指令。

---

十一、設計細節的消融實驗:每個零件為何不可或缺

研究團隊還通過消融實驗(逐一去掉或替換某個設計組件,觀察性能變化)驗證了各個設計選擇的必要性。

去掉序列動作強制之後,模型的閉環控制性能大幅下滑,機器人的動作變得不精準,無法推進任務流程。用線性層代替MLP作為快速模型時,性能比完整版本低了27%,儘管仍然好於沒有歷史的GR00T N1.7基線——這說明快速模型的非線性表達能力對於壓縮複雜的機器人歷史至關重要。

在漸進式構建RoboTTT的實驗中,從只讓TTT層處理狀態令牌開始,加入動作令牌之後提升了23%(機器人因此能感知自己的歷史動作,更好地理解環境動態),再加入寄存器令牌之後又提升了18%。而同樣數量的寄存器令牌加到GR00T N1.7上卻沒有任何提升,說明寄存器令牌的價值,來自於與TTT時間建模機制的協同配合,而不是單純的參數數量增加。

---

**歸根結底,RoboTTT意味著什麼**

說到底,RoboTTT回答了一個既簡單又深刻的問題:如果給機器人一個足夠大的"記憶容量",並且教它如何有效地利用這段記憶,機器人能做到什麼?

答案是:它能像人一樣跟蹤自己在一項長任務里走到了哪一步,能在犯錯後自我調整,能看懂人類的演示並復現,能在遭受外力干擾後冷靜恢復。這些能力,聽起來理所當然,卻是機器人領域長期以來難以跨越的鴻溝。

這項研究還帶來了一個對整個領域影響深遠的發現:預訓練上下文長度,就像模型參數量和訓練數據量一樣,是機器人基礎模型的一個獨立的縮放維度。更長的預訓練上下文,持續帶來更好的實際表現,而且目前還沒有看到天花板。這意味著,未來在機器人基礎模型的研究與開發中,"給模型更長的記憶"應當和"給模型更多的參數"、"給模型更多的數據"並列,成為一個核心的追求方向。

當然,這項研究也坦誠地承認了一些還沒有解決的問題。更長的預訓練上下文會顯著增加訓練成本,研究團隊在16塊NVIDIA GB200 GPU上進行了30000步的預訓練,然後針對每個下游任務進行了20000步的微調,計算資源的需求相當可觀。此外,雖然RoboTTT大幅提升了任務性能,它仍然不能處理所有可能的失敗模式——與強化學習結合,直接對任務成功率進行優化,是研究團隊認為自然的下一步。TTT層本身的訓練目標,目前還是通用的均方誤差,是否可以設計出專門針對機器人任務特性的TTT目標,也是值得探索的方向。

感興趣的讀者可以通過arXiv編號2607.15275,在arXiv.org上查閱完整論文,或訪問 research.nvidia.com/labs/gear/robottt 觀看實驗演示影片,那裡有機器人完成五分鐘長任務、從人類影片學習組裝、以及在受到干擾後自我恢復的完整錄像。

---

**Q&A**

Q1:RoboTTT的"快速權重"和普通神經網路的參數有什麼區別?

A:普通神經網路的參數(慢速權重)在訓練完成後就鎖定不動,實際使用時完全不變。快速權重則不同,機器人在執行任務的整個過程中,快速權重會持續通過梯度下降更新,隨時把當前觀察到的新資訊壓縮進去,同時淡化不再重要的舊資訊。打個比方,慢速權重是刻在石碑上的知識,快速權重是隨時可以增刪的便簽本。

Q2:RoboTTT能處理8000步上下文為什麼不會變慢?

A:傳統方法要查閱歷史,就得把所有歷史幀都保存下來,歷史越長查詢越慢。RoboTTT不保存歷史幀,而是把歷史資訊持續"壓縮寫入"快速權重這個小型神經網路的參數中。機器人做決策時,直接查閱這個已經濃縮好的參數,查閱時間始終恆定,不隨歷史長度增加而變慢。

Q3:DAgger蒸餾和普通DAgger訓練有什麼核心區別?

A:普通DAgger訓練只用人類的糾正動作作為學習目標,直接丟棄機器人的失敗動作。DAgger蒸餾則保留了失敗動作的角色,但用法不同:失敗動作用來更新快速權重(讓模型"看到"失敗是怎麼發生的),而流匹配損失只在人類糾正動作上計算(讓模型學習糾正應該怎麼做)。這樣,"失敗-糾正"的完整映射關係被蒸餾進快速權重,機器人部署時能自主實現類似的糾錯行為。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新