宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

機器人捏一個滴管,才過了1.17秒,觸覺信號已經面目全非

2026年09月08日 首頁 » 熱門科技

想像一下,你蒙著眼睛去擠一個裝滿液體的滴管。你的手指感受到的壓力、滑動、形變,每一瞬間都在劇烈變化。可你的眼睛(就算能睜開)看到的畫面,可能從頭到尾都沒什麼兩樣,滴管還是那個滴管,手還是那隻手。

這正是機器人在做精細操作時遇到的真實困境。上海交通大學鄧志傑實驗室的研究團隊做了一個實驗:讓機器人捏一個滴管,記錄下40步動作里的視覺畫面和觸覺數據。結果發現,1.17秒後,視覺表徵幾乎沒變化,用餘弦距離衡量只有0.005,幾乎可以忽略不計。但觸覺表徵呢?餘弦距離飆到了0.55,幾乎是完全不同的信號。

這個數字對比說明了什麼。

它說明了一件在機器人研究圈子裡其實有點反直覺的事情:很多主流的機器人控制模型,壓根沒有認真對待這個差距。

**機器人怎麼"看"和"想"的**

要理解這個問題為什麼重要,得先說說現在機器人是怎麼幹活的。

現在流行的機器人控制模型叫VLA

VLA*:全稱Vision-Language-Action,視覺語言動作模型,是一種能同時理解圖像、語言指令並輸出機器人動作的AI系統

這類模型看一眼攝影機畫面,聽一句語言指令,比如"把溶液從燒瓶轉移到燒杯",然後一口氣生成接下來一整串動作,可能是未來50個時間步的動作序列。這一整串動作被稱為一個動作塊

動作塊*:Action Chunk,指模型一次性生成的、包含多個時間步的連續動作序列,生成後交給機器人依次執行

問題就出在這裡。模型生成這一整串動作的時候,只看了一眼當下的畫面和觸覺,然後就閉著眼睛把後面幾十步全部想好了。可是就像前面那個滴管實驗展示的,觸覺信號在這幾十步里會劇烈翻天覆地地變化,而模型手裡攥著的還是最初那一眼看到的舊數據。

這就好比你請一個裝修師傅,師傅進門看了一眼牆面情況,然後轉身就把接下來兩個小時要用的力度、角度、工具全部計劃死了,中途不再看牆。如果牆面材質均勻倒也無妨,可萬一牆裡藏著一塊鋼板,一塊木頭,師傅的手感受到的阻力早就該變了,可他腦子裡的計劃還停留在進門那一眼,後面的動作只會越錯越離譜。這就是不做執行時反饋會付出的代價:動作和真實接觸狀態漸行漸遠。

已經有研究者注意到這個問題,做法是額外配一個高頻率的觸覺反應控制器,專門盯著觸覺信號做快速調整,和負責規劃的慢速大腦分開工作。這種思路被稱為慢快分層

慢快分層*:Slow-Fast Hierarchy,一種系統設計,用低頻率模組做整體規劃,用高頻率模組做局部快速反應,兩者協同工作

這個思路聽起來合理,但代價也不小:你得額外訓練一個獨立的控制器,架構變複雜了,訓練流程也變複雜了,相當於給機器人配了兩個大腦,還得教它們互相配合。

論文的團隊想的是另一條路:能不能不額外造一個控制器,而是讓原本負責生成動作的那個模組自己學會中途看一眼最新的觸覺信號,然後調整還沒執行的部分。這就是TacForcing的核心思路。

**流式生成:動作是一塊塊蹦出來的,不是一整塊甩出來的**

TacForcing的第一個關鍵設計,是把原本的動作專家

動作專家*:Action Expert,VLA模型中專門負責根據觀測和條件生成具體動作數值的子模組,通常基於擴散模型或流匹配技術實現

換成了一個流式動作專家

流式動作專家*:Streaming Action Expert,一種漸進式生成動作的模組,不是一次性生成整個動作塊,而是分批次、逐步完成生成,使執行中的反饋能夠介入後續生成過程

具體怎麼做的?研究者把一整個動作塊切成若干個小塊,比如50步動作切成10塊,每塊5步。生成過程中,每個小塊有自己獨立的生成進度,靠得近、快要執行的那塊先被"磨"完,磨好了立刻送去執行,而後面還沒磨完的那些塊,則保留著半成品狀態,等下一輪再繼續打磨。

這裡要理解一個背景知識,叫流匹配

流匹配*:Flow Matching,一種生成模型技術,通過學習一個連續的速度場,把隨機噪聲逐步"引導"變成目標數據,類似於給一團亂麻按照特定方向逐漸梳理成型

在傳統流匹配里,整個動作塊所有位置共享同一個進度時間,好比一鍋粥所有米粒同時熟。TacForcing把這個共享時間拆開,讓每個小塊有自己獨立的時間進度,靠前的塊進度快,先熟先出鍋,後面的塊進度慢,還在鍋里繼續煮。

這個設計像什麼呢?想像一個流水線上的麵包師傅,不是把整批麵團一起放進烤箱等全部烤熟才端出來,而是把麵團分成小份,第一份烤好了立刻端出去賣,第二份繼續留在烤箱裡接著烤,第三份才剛開始發酵。如果不這樣分批處理,非要等所有麵團同時達到出爐狀態,那麼最先做好的那份麵包只能幹等著,新鮮度早就打了折扣,顧客買到手的時候已經涼了。分批出爐的好處是,先做好的先給顧客,後做的還能根據顧客臨時反饋的口味微調配方。

機器人這裡的"顧客反饋",就是執行完前面幾個動作後傳回來的最新觸覺資訊。

**觸覺更新:每完成一個動作塊,就摸一次新的觸感**

流式生成解決了"動作能不能分批做"的問題,但還需要解決"新的觸覺資訊什麼時候插進來"的問題。

論文設計的機制是:動作塊完成執行後,立刻用裝在指尖的觸覺傳感器採集最新的形變圖,這個數據被稱為觸覺觀測,經過一個專門的觸覺編碼器

觸覺編碼器*:Tactile Encoder,把原始的觸覺形變圖數據轉換成模型可以理解的向量表示的神經網路模組,論文中用了FTP-1模型預訓練好的編碼器權重

處理成一組觸覺標記(tactile tokens),然後交給流式動作專家,用來指導接下來還沒生成完的那些塊。

這套流程聽起來直接,但研究者很快意識到一個隱患:如果不加約束,最新採集到的觸覺資訊會被允許直接影響所有還沒生成完的塊,包括那些要再過好幾輪才會真正執行的塊。

這就帶來一個新問題:一個觸覺快照,能管多久?

**執行感知觸覺注意力:讓新觸感只管眼前這一步**

這就是論文第二個核心貢獻,叫執行感知觸覺注意力,簡稱EATA

EATA*:Execution-Aware Tactile Attention,一種注意力掩碼機制,限定最新的觸覺資訊只能直接影響接下來即將執行的那個動作塊,其餘尚未輪到執行的塊暫時被隱藏,等待後續更新的觸覺資訊

為什麼要這麼限制?回到前面滴管實驗的數據,觸覺信號在幾十個時間步內變化幅度極大。如果讓當前這一刻採集到的觸覺資訊去指導三四個塊之後才會執行的動作,那等真正執行到那一步時,手指的接觸狀態早就變了,你現在這份觸覺快照早就過期作廢了,指導意義反而可能是負的。

研究者用了一個附加的注意力掩碼來實現這個限制,公式上簡單說就是:只有對應即將執行塊的動作位置,才被允許"看到"當前最新的觸覺標記,其餘位置一律隱藏,視覺上等同於設成負無窮大,注意力權重直接歸零。

這個設計像什麼?想像你在給一個正在下棋的朋友實時支招。棋盤局勢瞬息萬變,如果你把"現在這一步該怎麼走"的建議同時喊給他接下來準備走的第三步、第四步,那第三步第四步落子的時候,棋局早就不是你喊建議那一刻的樣子了,你的建議反而可能帶偏他。合理的做法是,你只針對他馬上要落的這一子給建議,再往後的棋步,等真到那個時候,你再看新的棋局給新的建議。EATA做的就是這件事:讓每一份觸覺反饋只服務於離它最近、最快要執行的那一步,而不是被強行攤派給整個未來。

如果去掉EATA會發生什麼?論文的消融實驗給出了答案,模擬環境裡平均成功率從60%掉到51%,現實世界任務里更明顯,從69%掉到48%,整整掉了21個百分點。這個差距足以說明,把觸覺反饋和執行時機對齊這件事,不是錦上添花,而是真正決定成敗的關鍵環節。

**訓練怎麼配合這套流式生成邏輯**

光是推理階段這樣設計還不夠,訓練過程也得跟上這套邏輯,否則模型在真正上場執行時會水土不服。

研究者的做法是,在訓練時隨機採樣一個生成進度,模擬流式推理過程中某一時刻的狀態:哪些塊已經完成,哪些塊還在半成品狀態,此時該用哪個時間點的觸覺觀測,該套用哪個EATA掩碼,全部按照真實執行時的邏輯還原出來。損失函數隻計算那些還沒完成的動作位置的誤差,已經定型的塊不再參與梯度更新。

這個安排背後的道理其實很樸素:考試考什麼,平時就得練什麼。如果訓練時用的是完整觀測到完整動作塊的老套路,測試時卻要應對"半成品狀態加上部分更新的觸覺"這種新場景,模型大概率會不適應。讓訓練分布和推理分布對齊,是機器學習里一個很基礎但常被忽視的原則。

**實驗結果說話**

論文在兩個場景下做了驗證:一個是仿真環境UniVTAC的六個接觸密集型任務,一個是三個真實世界任務。

仿真基準UniVTAC*:一個統一的視覺觸覺操作仿真平台,包含舉瓶子、拔鑰匙、舉罐子、放瓶子進架子、插孔、插管六個任務

對比的基線方法覆蓋了三種流派:不用觸覺的通用VLA模型π0.5,用固定觸覺編碼器增強的UniVTAC-ACT,把多種觸覺傳感器數據統一編碼的FTP-1,以及前面提到的慢快分層觸覺反應策略RDP。

仿真結果里,TacForcing平均成功率65%,比不用觸覺的π0.5高14個百分點,比慢快分層的RDP高23個百分點。六個任務里,TacForcing在五個任務上拿到最高或並列最高成績,唯一沒拿第一的是舉罐子任務,63%對比最好成績66%,差距很小。

真實世界的三個任務分別是把瓶子立起來、把液體從容器轉移到另一個容器、擦白板。這次對比的基線還多了一個不用觸覺的通用模型GR00T N1.7。TacForcing平均成功率69%,比FTP-1高17個百分點,比GR00T N1.7高27個百分點,比π0.5高42個百分點。

最誇張的差距出現在轉移液體這個任務上:TacForcing成功率50%,所有基線方法都不超過19%。這個任務需要機器人用滴管精確控制吸取和擠出的力度,恰恰是那個開篇實驗裡觸覺劇烈變化的場景,也是執行時反饋最有用武之地的場景。

| 配置 | 仿真平均 | 真實世界平均 |

|---|---|---|

| Base(無觸覺) | 43% | 42% |

| 固定觸覺(全程用初始觸覺) | 42% | 31% |

| TacForcing去掉EATA | 51% | 48% |

| **TacForcing(完整版)** | **60%** | **69%** |

這張表格里有個特別值得琢磨的細節:固定觸覺這一檔,也就是給整個動作塊加上一次初始觸覺觀測但不再更新,成績反而比完全不用觸覺更差,仿真里從43%降到42%,真實世界裡從42%降到31%。

這說明什麼?說明觸覺資訊如果只採集一次就鎖死不再更新,價值非常有限,甚至可能因為資訊過時而幫倒忙。真正有用的不是"有沒有觸覺輸入"這件事本身,而是"觸覺輸入能不能跟上真實接觸狀態的變化節奏"。這也從反面印證了論文最初的判斷:觸覺這種在幾十步動作內劇烈波動的信號,如果不做執行時更新,用了可能還不如不用。

**寫在後面**

讀這篇論文時,最讓我意外的其實是那張固定觸覺反而拖累成績的對比數據。

直覺上你會覺得,給模型多一種感知輸入總歸是有益無害的,多總比少好。可這個實驗結果打破了這個直覺:一個過時的、和當下真實狀態脫節的資訊源,不是中性的,它是有毒的。模型如果信任了這份過時數據,反而會做出錯誤判斷,比不獲取這份數據表現更差。

這讓我聯想到日常生活里一個很類似的現象。你查了一份三天前的天氣預報出門,結果比完全不查天氣預報還糟糕,因為你會帶著三天前的預期去決策,可能少帶了傘,也可能因為過度自信而做出了原本不會做的冒險選擇。資訊的價值從來不是絕對的,它和資訊的新鮮程度、和使用場景對資訊更新頻率的要求,是綁在一起的。

論文裡還有一個沒有深入展開但值得追問的地方:block size也就是每個小塊包含幾步動作,論文裡固定用了5步。如果這個數字變大或變小,觸覺反應的靈敏度和計算開銷之間會怎麼權衡?塊切得越細,觸覺更新越及時,但計算和觸覺採集的頻率也越高;塊切得越粗,效率是保住了,但可能又退回到舊問題上。這個平衡點該怎麼找,論文沒有細緻的消融數據,留給了後續研究去填。

一個滴管,1.17秒,0.55的餘弦距離。這幾個數字湊在一起,講了一個關於"眼見不一定為實,手感才是當下真相"的故事。機器人學會用手去感知世界,比學會用眼睛去看世界,或許還要難上幾分。

Q&A

Q1:TacForcing是什麼?

A:TacForcing是一種流式動作生成框架,讓機器人在執行動作過程中能夠實時接收最新的觸覺反饋並調整還未完成的動作,而不需要額外配備一個獨立的高頻觸覺反應控制器。

Q2:EATA解決了什麼問題?

A:EATA(執行感知觸覺注意力)解決了觸覺資訊過時誤導後續動作的問題,它規定最新採集到的觸覺反饋只能指導即將執行的那個動作塊,避免讓距離更遠、還要等好幾輪才執行的動作塊被過時的觸覺資訊帶偏。

Q3:TacForcing在實驗中表現如何?

A:在仿真的六個接觸密集型任務上平均成功率65%,在真實世界三個任務上平均成功率69%,均優於不使用觸覺的通用模型和使用固定觸覺、慢快分層等方案的基線方法,轉移液體任務上優勢尤其明顯。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新