宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

對話一目科技:機器人還缺失的「手感」,我們用「光」來搞定丨多樣性公司

2026年09月29日 首頁 » 熱門科技

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

當我們想喝可樂的時候,在極長的時間都只有兩個選擇:百事可樂和可口可樂。當我們選擇手機的時候,有 90%的概率在蘋果和華米 OV 等品牌里輾轉。當我們買運動服飾的時候,第一時間想到的,大概率是 Nike、Adidas。

但世界之所以繽紛多彩,是因為在這些巨頭之外,有一些不遵從傳統,力求創造不同,注重設計和功能,著眼於明日的公司存在。

它們有著非主流的商業模式,設計、技術與產品能提供獨特的用戶價值,和足夠的社交談資。重點是,它們沒有大公司的包袱,敢於不顧一切的進步。它們,是「多樣性公司對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司」。

多樣性,是開放世界的關鍵。相信,只有真正關注和理解多樣性公司才能比更多人更早地看見未來。在同名欄目中,將以專訪的形式,與你一同見證這些多樣性公司,如何重塑未來,定義新常態。

本文為「多樣性公司」欄目的第 14 篇。

1983 年,威廉·吉布森用一個比喻撕開真實世界與虛擬世界的藩籬,他在《神經浪遊者》的開頭寫道「港口上空的天色猶如空白電視螢幕」,而今天,我們正在用觸覺傳感器做同樣的事——讓虛擬世界直接伸手觸摸真實世界。

一目科技是一家專注於具身智能對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司觸覺感知的硬科技企業,貫通感知、操作與部署,讓機器人擁有可開發的靈巧操作能力,在真實世界可靠運行、持續進化。他們推出的視光學超薄仿生觸覺傳感器對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司SENTRA T0對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司 厚度已疊代至 3 毫米以下,是全球最薄可量產的仿生視觸覺傳感器,破解了靈巧手「裝不下」的行業難題。

我們和一目科技創始人 & CEO 李智強對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司博士聊了聊為什麼機器人需要觸覺感知能力,觸覺能力為什麼如此重要,獲得它為什麼這麼難,以及一目科技是怎麼用「光」來搞定機器人觸覺的。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

▲ 一目科技創始人 & CEO 李智強博士

智駕永遠不希望有接觸,但做機器人的價值在於接觸這個世界

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

Q1:為什麼給公司取名「一目科技」,這個名字聽起來和視覺更近,而不是觸覺?

A:所有生命智能的開始,都是源於感知,然後再有小腦和大腦。生命智能起源於 5.25 億年前的寒武紀對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司大爆發,其中很重要的起點,就是三葉蟲長了第一隻「眼睛」,或者說是「眼睛」也不那麼精確,可以說是開始有了感光的細胞和感光的器官。

我們最底層的事兒,就是把「光」給晶片化,應用在 AI 領域,推動 AI 的發展。

從寒武紀大爆發,到人工智慧的拐點,一目科技希望成為 AGI對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司 的第一隻眼睛。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司
Q2:一目科技最開始成立的時候,其實主要是做「微光譜感知」,現在的重心轉向了機器人觸覺和具身智能的執行。看起來其中的跨度還是挺大的,那麼其中有沒有一條技術主線,或者底層邏輯主線?

A:表面看上去跨度挺大,但我們自己看來,技術底座是連續的,不是跳躍式的。

一目科技開始起步的時候,所有的能力都是圍繞著「光」,把「光」的一些技術做成晶片,光晶片和 AI 結合應用在不同的領域,這個和我之前博士期間的課題是有強相關性的。當時我在卡內基梅隆大學的博士課題就是做一顆光晶片,應用在環境監測和分子分析等領域,結合了一些 AI 算法和模型,形成了我們技術認知的起點。

2015 年創立一目科技之後的第一個應用場景是做分子光譜儀,把光晶片用在光譜分析這個領域。

光這個技術呢,回過頭來看,確實是一個非常非常性感的技術,可以應用在很多領域,用在通訊上,就是光模組;用在計算上,就是光計算。

我們用光來檢測形變,用形變來反算受力、反饋,後來延伸到機器人觸覺能力,切入到了光觸覺對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司領域。可以看到我們底層的基座能力是延續的,七八成是一致的,但是在中間要補強 AI 強相關的能力,還要對材料學有更多的研究。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

Q3:目前處在行業早期的具身行業在技術上遠遠沒有收斂,從車企智駕行業過來的創業者可能會沿用 VLA對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司 或者世界模型對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司的技術路線,做過智能家居的創業者會看重機器人本身的硬體架構,一目科技的出發點是傳感器,感知和後續推理和執行,為什麼一目科技會相信「從感知開始」會是一條更接近 Physical AI 本質的路徑?

A:這是個好問題,首先我們要思考下Physical AI 的本質到底是什麼,其實就是跟人類一樣的「手感」。

不是讓機器人在螢幕里更像人,是讓它在真實世界裡像人一樣把手伸出去、把活干成。評判標準變了——不是「答得對不對」,是「抓不抓得住」。

按這個標準去看:類人不是某一項類人,是所有模態都得類人。

機器人的視覺已經很接近人了,攝影機加大模型,認東西比人還快;語言更不用說了。而觸覺恰恰是最原始的那個模態——人還沒睜眼就會摸了,可對機器來說它才剛起步。所以機器人看得見這個杯子,卻不知道用了多大力、會不會滑。

所以你也能理解,為什麼行業里有不同路線。智駕背景的人天然想到 VLA 和世界模型,做硬體的天然先想本體架構。不是誰對誰錯,是大家習慣從自己熟悉的經驗出發。

那對於我們來說,我們的第一條產品線源自我們之前就在做的光和感知,這是自己的延續性。

另外,我們也從第一性原理思考過具身智能本身的卡點和問題,我一直認為,它和傳統 AI 有相似性,但也有非常大的不同。

很多人跟我說,做汽車的智駕和做機器人很接近。我覺得有些地方是類似的,但它們有非常大的一個差異。

智駕永遠不希望有接觸,接觸了就是發生了碰撞,汽車的智駕是它不太想跟這個世界發生物理關係。

但機器人真正的價值,就在於它和世界發生了接觸。

所以原來智駕的那些技術範式,放在機器人面對的物理世界,是完全不足的,甚至底層邏輯都不一樣。

這是我們在行業起步看到的問題,那我就想,真正的物理 AI ,它的疊代和演進到底是什麼樣的過程?從第一性原理來說,人大腦的能力都是訓練和學習出來的, AI 大模型的語料,文字,影片,音頻這些都早已在網際網路上準備就緒了,所以 AI 大模型很容易學。

但是今天來看,具身智能機器人需要的物理世界數據是不夠的,那麼相應模型怎麼著都不可能有很好的語料,也就不會真正疊代到智能的那一天。

這就是我們的出發點,具身智能最大瓶頸是數據,數據往前推,最大的難點是採集數據。

採集這些準確數據的最重要的入口,就是感知。人的五感里,只有觸覺是完全沒有電子化的,這是具身智能機器人真正跟物理世界發生關係的重大卡點。

我們也想到人類學習的能力,剛生下的小 baby,一開始聽覺和視覺是比較弱的,沒有訓練出來相應的能力。但是人類生下來就有非常好的觸覺能力,小 baby 會咬東西、到處摸東西,所以你可以理解機器人現在需要的就是去把世界上的各種東西摸一遍、咬一遍,感受這個物理世界。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

Q4:在一目科技的理解里,「耳聽為虛,眼見為實」是不是也不成立?視覺上看到並推理「杯子會掉」,和機械手在杯子滑落的時候感受到摩擦力變化,這兩種「理解」有什麼本質上的區別?

A:孔子說眼見為實,後來又說目猶不可信。兩千多年後,我們給的答案是:

目猶不可信時,讓觸覺來做裁判。

裡面有幾個邏輯,我們可以探討一下,第一個就是「眼見為實」這句話。我覺得人類最牛的感知能力還是視覺,說實話這還是高智能動物獲取資訊最廣泛、資訊量最大的方式。不過視覺它可能有誤判,同時視覺在操作的時候可能也有阻擋,有各種問題。

我們大腦對於視覺的計算頻率是非常低的,如果眼睛看到一個東西,因為資訊量太大了,大腦理解的過程是很慢的,感知端最高大概是 100Hz 左右,大腦處理端比這個還更慢,大概也就 3Hz 到 5Hz。

這就是為什麼觸覺在這裡的表現很重要,以及為什麼「眼見為實」還不夠。

我們看一些論文,人在抓握一個玻璃杯時,鬆開再重新抓住這個過程,大概是要在 80ms 以下啟動糾正,不然玻璃杯真就掉下去摔碎了,這個鏈路需要是非常快的。

80ms 的時間也分好幾個東西,首先就是感知段,觸覺感知的話是 10ms 到 20ms,要在這個時間完成感知,還有 30ms 到 40ms,大腦和小腦做完決策下發電信號到肌肉,指揮肌肉收縮,到肌肉完成收縮,重新抓住杯子還需要 20ms 到 30ms。

所以這裡給到感知端的時間只有 10ms 左右,靠眼睛靠視覺是完全不夠時間做這個事情的,同時在決策端 30ms 也不夠,人根據視覺做一次決策可能需要一兩百毫秒。

從這個例子裡的各個環節來看,觸覺是人類在和物理世界交互里最重要的信號之一,也是最快速響應的信號。

另外我想再解釋一下,在操作層面,觸覺並不是視覺的補充了,而可能是最重要的信號,因為它會形成小閉環。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

▲ 機器人有了觸覺和對應算法,就可以分辨真花生和石頭材質假花生

AI 應該仿生,光觸覺是最接近人類的觸覺方案

Q5:過去幾年機器人視覺能力進步非常快,但觸覺的發展明顯更慢。你認為今天機器人最典型的「無觸覺後遺症」是什麼?有沒有哪些任務,人看起來覺得很簡單,但機器人只靠視覺幾乎永遠做不好?

A:有個成語叫「無能為力」,我覺得比較能形容「無觸覺後遺症」,最典型的就是看得見、幹不成——機器人能準確認出這是什麼、在哪兒,真一伸手就出問題:要麼捏碎,要麼打滑,要麼裝歪。

你看大家都在訓練各種模型,VLA,World Model 等等,如果這些模型沒有觸覺,帶著機器人真的下場去幹活就會出各種問題,事實上也出了各種問題。

模型的泛化性肯定不夠,準確率和成功率就非常非常低,很多 VLA 模型可能訓練好了,但最終實現的時候,就只有五六成的成功率,這是非常差的表現。這就是因為沒有觸覺反饋,其他模態沒辦法做到想要的泛化效果和準確率。

我說一個具體的發現,我之前對汽車製造行業的理解是自動化程度非常高,各種機械臂,各種自動化的生產線,但我們去年接觸一些全球頭部的汽車生產大廠,其實不是那回事,大概就只有兩個車間自動化程度很高,一個是噴塗車間,另一個是焊接車間,幾乎是無人的。

但是到了總裝車間,全是人,插拔裝配線束啊,座椅啊,捋一些那種膠條兒啊,一些細小接插件啊,都是人類靠手去做。

當時對我的觸動還是蠻大的,我一直以為汽車的工業自動化已經很高了,很普及了。後來我們意識到,這些東西都是缺了最後的那一點手感,缺了小模型能力,也就是機器人的小腦能力,導致機器人沒法像人去完成有點複雜的裝配工作。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

總結下來呢,我們認為有 3 類事情是一定需要機器人觸覺來幫助完成的。

第一類是有些東西,視覺具有欺騙性,比如石核桃和真核桃,看上去一樣,但伸手一拿,從重量,觸感,實心不實心就能感知到它們的不同。

第二類是操作的東西非常柔性,我們對柔性的定義是它一般的形變規律是非線性,本身是非剛體的,無法特別準確地被規則代碼預測的東西。比如汽車上的一些膠條,沒有力控和觸覺,機器人是完全裝不了的。

第三類其實是說很多場景需要一種很微妙的手感,就像老師傅的手藝活兒,很難傳承下去,就是因為老師傅自己練出來的手感。有個經典的例子,就是拿配得不太好的鑰匙開門,需要一個非常特定的角度,一個固定的巧勁兒才能開鎖。這個過程也是需要觸覺感知才能感知,不然機器人把鑰匙插進去一轉就把鑰匙轉斷了。

這個微妙的手感,無法用語言去描述、用視覺去觀察,只能靠觸覺反饋試探——這就是我們要把難以描述的、很精巧的手感,把它數位化、蒸餾出來,變成可以複製的模型能力,變成帶觸覺的物理 AI 能力。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

▲ 一目科技目前量產的觸覺傳感器

Q6:一目為什麼選擇用「光」和「視覺」去測量「觸覺」?在壓阻、壓電等等路線之外,視觸覺到底解決了什麼其他路線解決不了的問題?

A:你相信光嗎?哈哈哈哈哈

大家現在都喜歡稱視觸覺,其實一目科技的路線,我們喜歡叫它「光觸覺」,而不是「視觸覺」。本質上我們是用光來探測形變,而不是直接給物體拍照再進行判斷。

如果我們泛泛地講,人的觸覺在這幾個維度上收集資訊。

一是形貌學,我摸到的這個東西是光滑的,還是粗糙的,形態是什麼樣的,軟的還是硬的。

二是力學,我按壓之後會得到什麼樣的力反饋,這個力會不會變化,力的變化核心就是震動,震動的本質也是力在變化。

三是溫度,溫度也是人觸覺的重要部分,我們為什麼能感受到玻璃,金屬和橡膠等等材質的變化,核心就是把這幾維的資訊疊加在一起,有一個模型判斷,哦,玻璃摸起來光滑堅硬又冰涼,橡膠摸起來阻力有點大,有點軟,不太涼等等。

做機器人觸覺核心就是感受這幾個事兒,具體是看這幾件事用什麼樣的方法。

我還是覺得 AI 應該更仿生,更像人類。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

▲ 人類觸覺和光觸覺機制

人的皮膚是一種柔軟材質,皮膚接觸到物體之後,就會產生形變,皮膚下面一個節點會有四種觸覺受體,它們扮演不同角色,有的分析高頻,有的分析低頻,有的分析軟硬等等。

我們的第一性原理決定了我們的傳感器也應該是基於一種柔性材質發生形變,然後傳感器接收到了這些信號,這是光觸覺這條路線最不一樣的,它是和真實的物理世界發生了直接的接觸,產生了形變。

形變帶來了幾個資訊,一個就是形貌學的,可以在微米級的精度探測整個物體,我就可以知道它是粗糙的還是光滑的,粗糙的話,它的顆粒度大概是什麼樣的?甚至在我滑動之後,還能感覺它是不是柔順的。

第二是力學層面的,我們知道我們所用材質的楊氏模量,楊氏模量其實就是材質彈性和力的轉化之間的一個個參數嘛,那我按壓之後,它有形變,同時顯性的物理公式,就可以轉換成力的分布和變化。

所以我想說的是,光觸覺的工作機理,和人的觸覺是最像的,採集到的數據也跟人是最近的。

用光這種形式做檢測巧妙的點是,光本身的解析度非常高,穩定性和一致性非常好,因為我們已經有很多很好的光學晶片和光學器件被發明出來了,所以我們可以用非常好,低成本的方案去解決光探測形變這麼一個事兒。

前面是從原理上講,我們再看性能指標。

評價一個觸覺傳感器好不好,其實很簡單,就是看它的性能指標是不是類人。人的指尖觸覺是非常密的,大概 3000 個點,每個點有 4 種不同的觸覺受體,也就是說有大概 1.2 萬個受體點在做觸覺的感知。其他的壓阻或者電容觸覺方案,基本上只能做到 10-100 個點,跟人的差距非常大。而我們的光觸覺方案,做到了在指尖大小的面積上布置24萬個點。

還有就是對力的感知精度,我們的光觸覺方案可以做到 5mN 左右,再加上解析度有 24 萬個點,可以做很好的紋理檢測。這些精度和特性,也是其他方案很難做到的。

還有一個重要的點,其實在機器人操作的過程中,尤其是手的抓握,最重要的不是正向的力,而是側向的力,比如說握著滑動的杯子,保證不掉下去抓得穩的核心,是感受側向的摩擦力,其他的幾個技術方案感受不到這種力。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

▲ 一目科技實驗室里的觸覺採集設備

Q7:光觸覺有一個非常明顯的工程矛盾:形變材料越軟,感知通常越靈敏,但耐久性越差;越薄越適合機器人手指,製造和光學設計卻越困難。你們內部有沒有一個類似「不可能三角」的指標體系?為了真正商業化,主動犧牲過什麼?

A:我舉個例子,乾物流里做搬運的重體力活,如果我手上長滿了繭子,的確犧牲了一點靈敏度,但增加了耐用性和剛性,活幹得其實也挺好。

回到這個問題,「不可能三角」確實存在,但是我們得把那個三角形儘量往外推,就是一方面要做平衡,一方面從底層看能不能把三角形的外延擴大。

我定義的三角第一個角是軟,軟本身是楊氏模量的一種體現。為什麼要軟呢,因為人的皮膚是非常柔軟的,我們希望找到一種材料,跟人的皮膚更接近。這樣的話,一方面是更仿生,探測能力和人更接近,另一方面是具體到性能參數,材料越軟,對形態變化也會更靈敏。

另外一個角是回彈能力要強,一旦撤掉了力,我們希望它馬上能夠回到它原來的形狀位置。

第三個角是耐用性。

最早的時候我們找了很多材料,確實就像你說的,想湊齊不可能三角,找平衡做取捨,最後發現,這玩意兒沒法平衡,很多材料的耐用性太差了,按壓 1 萬次,2 萬次就壞了,沒法實際使用。

我們就問自己,怎麼解決這個問題?

那就自研嘛,從底層開始做設計,不僅僅是改配方,改配方其實就是買來別人的東西,調一調比例,這個沒法解決本質問題,反而是要從分子層面去分析我們到底要用什麼樣的東西,怎麼去聚合這種矽基高分子材料。

柔軟這種特性是和分子裡的長鏈相關,鏈的長度和特性決定了柔軟性和回彈力,我們要設計的是這個。

耐用性的話,除了使用過程中的損傷,就是材料本身的老化,老化的核心其實是分子間的斷裂,斷裂了就沒法恢復。所以我們再尋找一些有趣,有價值的官能團加入,讓斷裂發生的難度增加,還有一種可能性就是,我們也看到一些特別有意思的新型自修復性材料。

總結一句話就是我們在分子單體上做了很多研究,去做這種聚合物,把「不可能三角」的三個角先往外推,不要每個點都很弱,首先就解決了柔軟度,我們現在材料的楊氏模量和人手指的皮膚非常非常接近了,只硬百分之小幾十,一些競品一般是硬個十多倍。

另外兩個角,我們現在基本上也能 cover 住,再根據具體場景在工程化上做選擇,有的場景需要靈敏操作,穿針引線這種,材料可以軟一點,犧牲一點力矩的範圍。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

Q8:目前一目科技的全球首款可規模化量產的視光學超薄仿生觸覺傳感器 SENTRA T0 已經做到微米級深度感知、24 萬點檢測解析度,5 mN 三維力解析度和最快 8 ms 響應。但如果真正放到機器人任務里,這些參數中哪個最決定實際成功率?有沒有一些大家非常喜歡比較的參數,其實並沒有那麼重要?

A:我們的一個理念是在性能上跟人接近,或者超越一點就行。解析度不需要那麼高,24 萬點的解析度比人的高太多了。

還有一點就是決定成功率的不是某一個參數,是場景。

如果真要放棄一個參數的話,可能就是解析度,做到萬點級別,就足以應對大部分場景。

至於其他性能指標,我覺得挺難減配的,就說 8ms 的響應速度吧,前面也說了,慢到 20ms 30ms 的話,後續鏈路的計算反應時間就會被壓縮,很難做到感知決策動作的閉環,這個要儘量保障的。

比如說 5mN 里的感知精度,要看具體場景,做搬運做物流分揀不需要這麼靈敏,但要是繡花的話,就需要機器人觸覺特別靈敏了。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

Q9:一目科技的視光學超薄仿生觸覺傳感器 SENTRA T0 強調了可規模化量產,可以商用,一目科技怎麼定義「可商用」和「實驗室環境可用」的區別?是壽命、成本、一致性、量產良率,還是具身機器人廠家願不願意真正把它裝進去?

A:我先定義一下什麼叫「可商用」,什麼叫「實驗室可用」,這個問題說清楚了,才能知道鴻溝在哪裡。

實驗室可用一般來說是不追求復用的,只需要找到那一次的高光就夠了,我們做實驗很多時候是做 100 次成功 1 次,就可以發論文了。它對耐用性,一致性要求沒那麼高,只追求單一的性能參數。

商用其實是另一個極端,商用追求的是平均下來,最低的要求能邁過門檻,比如壽命和穩定性,還有一致性,不可能用幾次就壞了,也不可能把實驗室做 100 次成功 3 次的概率放到商用品上。

還有就是商用需要的量也比較大,實驗室手搓一個出來就可以發論文,商用的觸覺傳感器至少也是 10 萬套以上的級別。

所以說,商用和實驗室的鴻溝是巨大的,大家追求的方向不一樣,這也是為什麼光觸覺傳感器到今天很難量產的原因,大部分從業者還停留在實驗室階段,沒法跨越壽命,穩定性,一致性,長期使用下的漂移控制,以及大規模量產之間不同批次的差異控制等等挑戰。

我們希望明年能夠實現百萬顆的出貨量,也是鋪墊了好幾年,才累積出這樣的能力。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

▲ 一目科技機器人實驗室

Q10:似乎整個具身領域都在思考怎麼解決數據和數據採集的問題,通過視覺來採集人類動作給機器人模仿學習還好,採集人類觸覺數據的傳感器會阻隔人和物體之間的觸覺,缺乏觸覺又影響人類操作,進而導致採集的觸覺數據失真。一目科技怎麼解決這個看起來無解的問題?

A:其實不光是觸覺數據採集,整個機器人的數據採集成本都會比較高,不像傳統的大語言模型,可以用網際網路數據,這是一個沒法迴避的問題。

觸覺本身在機器人素材里的成本占比也沒有那麼高,但採集的質量怎麼樣?就像你說的,問題確實存在,戴了手套去採集觸覺數據,人類的觸覺就會被嚴重影響,和平時的手感不一樣,你要采的東西,偏偏被採集這個動作破壞了。我完全同意你說的,這個事情還沒有最優解。

但有幾種方式可以去做得更好。

第一就是儘量讓觸覺本身的影響減小,數據採集的傳感器做得更柔性更輕薄更接近人類皮膚,對人類觸覺感知的阻斷更弱一點。

第二也是我們在尋找的新方式,只通過指尖覆蓋觸覺傳感器,然後人手的軌跡通過其他的模式去捕捉,比如肌電信號,異構的視覺傳感器來捕捉。

還有個事兒,我們觀察到一個現象,就是預訓練在觸覺裡面的作用,未必是最有用的。因為我們也在思考,人是怎麼學的,大語言模型更像人讀書,學知識,就是預訓練為主,熟讀唐詩三百首,不會作詩也會吟,先背了再說,然後會湧現出自己的見解。

人對於動作能力,物理操作能力的訓練是不一樣的,這個範式還沒有人提到,我們可能是最先提到的,就是人學習打網球踢足球這些東西,看書學習的部分能占多少?其實不太多,就是預訓練的部分很少。

打網球踢足球其實大量時間在後訓練,自己練習,強化學習,揮拍的動作練幾百遍,感受擊球瞬間的感覺。

所以類比就是機器人的真機強化學習應該會占非常大的比例,預訓練的比例會很少。

我想說的是,哪怕我們在真實世界中沒有採集到那麼多那麼好的觸覺數據,但觸覺會被用到後訓練裡面去,用到真機強化學習的環境裡面去,這需要做非常多的自我校正。在觸覺數據採集成本過高,以及準確性還有與人類觸覺擬合度比較弱的情況,後訓練是更有用更有價值的一部分。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

還有個補充是仿真數據,宇樹機器人等等,行動力越開發越快的原因,一方面是因為有數據,另一方面就是可以在英偉達的 Omniverse 和 Isaac Sim 仿真平台里做步態等能力的學習和模型預訓練。

除了用人和真機去採集,還不如在一些環境裡把仿真能力建立起來,可能它跟人真實的觸覺數據還更接近一些。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

Q11:代表聽覺的音頻,代表語言的文本,代表視覺的有圖片和影片都有標準化的數據格式,採集,傳輸,處理和訓練都比較方便,觸覺目前是不是還沒有類似統一通用的標準化數據?一目科技對於這個現狀是怎麼思考的,有沒有想過更進一步,為行業掃平標準化的障礙?

A:對,完全認同,觸覺目前還缺它的「Type-C」 接口標準。

觸覺本身有幾個問題,硬體收斂比較晚,行業標準化是缺失的,但它確實又非常重要。我認為觸覺應該是跨傳感器,跨公司,跨品牌的標準化,最終都能收斂到一個標準體系里說數據的採集和數據的使用。

這事兒還遠遠沒有完成,我們發現硬體端真正成熟量產的挺少的,品牌更少,更不要提數據量和格式了。

我們希望用 Open 的方式,更開放的方式,而不是靠 authority,權威的方式去做,靠權威很難去推動,大家都有自己的想法,我們自己的下階段工作就是在 OpenTouch (一個低成本、高保真的機器人觸覺感知與數據集採集系統)里把 TouchNet (一個開源觸覺數據集項目)建立起來,把觸覺數據採集、標註、儲存、評測和使用的統一標準建立起來。

大家可以在這種開源數據集上各顯神通,找到歸一的方法,找到最好的標準模式,逐漸形成行業標準。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

機器人的「iPhone 時刻」,肯定不是以一個工業品的狀態出現

Q12:「大腦負責推理和思考,小腦負責感知和動作控制,身體負責具體執行」的具身智能比喻中,不少具身從業者都認為現在是身體比較成熟,但小腦不夠靈活,大腦尤其愚鈍的狀況,一目科技怎麼看這種比喻和現狀,是不是和行業主流認知有所不同?

A:大方向的話,我們的認知是一致的,就是硬體本體是比較成熟的。唯一的不同想法在於手,我們認為手這塊還沒成熟。

小腦這塊也有不太大的差別想法,也是和手相關。目前大家說的小腦還是偏下半身的小腦,跑跑跳跳,舞蹈武術這些。手部動作,尤其是手指動作,沒有真正跟物體操作這個層面掛鉤。可以認為現在的小腦更像智能駕駛,從 A 點到 B 點做一些動作,但不去改變物理形態和物理環境,真正能改變環境和物體的小腦能力還是缺的。

就是現在的小腦還指揮不了機器人做成熟的柔性裝配,繡花編織這些手藝活。

大腦確實就是更弱了,整個的空間理解判斷能力,計劃能力是非常弱的。核心還是說要有實際場景的數據,觸覺,力反饋來支撐操作型的小腦,然後操作型的小腦反饋到大腦的模型訓練裡面去。李飛飛在做的 spatial intelligence,空間智能,其實就是大腦對抓握這種空間裡的各種幾何形態,物理形態的理解力更強。

Q13:消費者和媒體都很想知道一個事件節點,類似於 2007 年的「iPhone 時刻」或者 2022 年的「 ChatGPT 時刻」來證明一個產品,一個技術,開啟一個時代。對於機器人觸覺,你覺得這個「時刻」應該由什麼事件定義?是百萬台機器人裝上觸覺傳感器,是機器人第一次穩定完成過去只能由人完成的精細操作,還是出現一套真正成熟的觸覺基礎模型?

A:我們想想 iPhone 時刻是什麼?

不是賣了多少台,也不是 iOS 多成熟,是有人第一次拿手一划,心裡感嘆「對了!就是這個!」。

在這個「時刻」來臨之前,可能是大家已經做了非常多的努力和工作,就像 iPhone 是 2007 年發布的,但之前的 iPod,還有晶片,螢幕,觸控交互,底層系統架構積累了很多年,然後才有「iPhone 時刻」。

早期版本的 ChatGPT 也可以回答一些問題,但是沒有人味兒,現在的 ChatGPT 對話你就感覺很絲滑,像和真人溝通一樣。

具身智能出現類似的時刻,肯定是一個令人會「Wow」一聲的產品,這個東西出來之後,會讓消費者覺得完成度非常高,從硬體到軟體,不是一個需要調校和用戶適應的產品。

這個時刻是一個瞬間,但我們為了這個瞬間在做很多外部看不到的努力,從實驗室到產線,再走到大眾的面前,我們崇尚真理、追求完美。

所謂時刻,就是圈裡的人熬了很久,圈外的人一抬頭,發現世界已經變了。

對話一目科技機器人還缺失的手感我們用光來搞定多樣性公司

Q14:比如前不久機器人運動會上,大量人類體育記錄被打破,機器人擁有超過人類的力量和速度,但因為觸覺等感知能力的缺失,它們可以很暴力,但不能夠「溫柔」,是不是只有機器人有和人類近似的感知能力,我們之間才有真正安全的接觸關係?

A:很多產品為什麼你覺得它笨,不成熟,沒有達到 iPhone 時刻,因為它實際上都還是工業半成品。

iPhone 出來之前,也有很多智慧型手機,側滑的,用軌跡球的,用筆戳的,你總會感覺它們不完整,不完整的點是因為人還是一種挺感性的動物,不會看到一個工業半成品就興奮起來,但是會感覺有距離感,不親切的感覺。現在機器人的狀態,我覺得更像早期的那些還帶著物理鍵盤的智慧型手機,比如說黑莓。

黑莓為什麼能賣這麼多?因為它解決了一些商務人士的痛點。為什麼又賣不了更多?因為它沒有跨越工業品到用戶體驗卓越產品之間的鴻溝,它其實還是個辦公工具。

機器人的 iPhone 時刻,肯定不是以一個工業品的狀態出現,它還是要考慮很多人文的東西,體驗的東西,其中有一點就是你說的,它還是要溫柔的,擁有理解人的交互,而不只是說它只是個工具。

工具這種東西很難成為非常偉大的產品,無法成就某某時刻。而「關懷」和「感觸」可以。觸覺和力反饋,正是機器人形成人文關懷和與人類交互裡面最重要的手段。

劉學文
穩中向好。
郵箱 1
宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新