宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

一隻攝影機領路,機器人走遍陌生房間——Mistral AI用8B視覺語言模型刷新導航天花板

2026年08月04日 首頁 » 熱門科技

這項由Mistral AI研究團隊主導完成的研究,以預印本形式發布於2026年7月22日,論文編號為arXiv:2607.20785,感興趣的讀者可通過該編號在arXiv平台查閱完整論文。

**機器人的眼睛,是一件奢侈品嗎?**

假設你被蒙上眼睛,只能靠一隻眼睛睜開後看到的畫面來找路——沒有地圖,沒有雷射雷達掃描,沒有測距儀,只是一幀一幀的普通照片。這正是絕大多數家用機器人、倉庫小車、送貨無人機面臨的現實處境:傳感器越多越精準,成本就越高,適用範圍也越窄。今天要介紹的這項研究,正是奔著打破這道門檻而去的。

Mistral AI的工程師和研究人員構建了一個名為**Robostral Navigate**的導航系統,其核心是一個擁有80億參數的視覺語言模型(可以簡單理解為一個既能"看圖"又能"讀文字指令"的超大腦)。這個系統只需要一個普通的RGB攝影機——就是你手機前置攝影機那種最平常的彩色鏡頭——然後根據自然語言指令,比如"穿過前面那扇門,在橙色沙發前右轉",自主規劃並走完整段路程。

在學術界的標準測試場上,Robostral Navigate以77.4%的任務成功率登頂Room-to-Room連續環境基準(R2R-CE),比此前最好的單攝影機方案高出整整10.5個百分點,甚至比那些配備了深度傳感器或多攝影機陣列的系統還高出5.3個百分點。這個結果放在機器人導航領域,猶如一個只帶了一支鉛筆的選手,在一群帶著全套繪圖工具的對手面前贏得了繪圖大賽。

---

一、為什麼"只用一隻眼睛"是一件難事,又是一件值得做的事?

現代機器人導航領域有一個共識:傳感器越多越好。深度攝影機可以直接測量物體距離,雷射雷達可以掃出精確的三維地圖,多攝影機組合可以覆蓋更大視野,這些都能讓機器人對周圍環境的理解更加立體和精準。但代價是:每一種額外傳感器都意味著更高的硬體成本、更複雜的安裝調試,以及只能在特定機器平台上使用的局限性。一套為配備雷射雷達的機器人訓練出來的導航模型,往往沒辦法直接用在一輛只有普通攝影機的配送小車上。

Mistral AI的研究者把這個問題稱為"可擴展性困境"——如果你的導航系統對傳感器要求越高,它能落地的場景就越少,最終只能服務於少數幾個高端機器人平台。他們想要的是另一種路徑:找到一套既省傳感器、又能跨平台、還能高效訓練的導航方案。

普通的RGB攝影機是幾乎所有機器人平台都標配的最基本傳感器,從工廠里的搬運小車到家用掃地機器人,從無人機到人形機器人,幾乎沒有哪台機器不帶一個彩色攝影機。如果一套導航算法能在這個最低配置下工作,那它就可以幾乎無縫地遷移到任意機器人上,真正實現"一套大腦,萬台機器"的願景。

然而,去掉深度傳感器之後,機器人就失去了直接感知距離的能力。它只能從二維圖像里推斷哪裡能走、目標有多遠、轉彎的時機在哪裡。這就好比你只能靠一張普通照片判斷前方的樓梯有多高、走廊有多長——人類靠後天積累的大量視覺經驗可以做到,機器要學會這件事卻需要極其豐富的訓練數據和足夠強大的視覺推理能力。Robostral Navigate的核心貢獻,正是在這兩個維度上同時取得了突破。

---

二、導航靠"用手指指"——一個聽起來簡單卻極為聰明的設計

Robostral Navigate導航的核心機制,用一句話描述就是:**在當前看到的畫面里,用像素坐標指出"下一步該往哪走"**。

研究團隊把這種方式叫做"指向式導航"(pointing)。每當機器人需要決定下一步動作時,模型會看著當前攝影機畫面,然後標出圖像中的一個點——那個點就是"往這個方向走"的目標位置,同時還會預測到達那裡時應該轉向多少度。這就像你在帶別人找路時,不是說"向前走23.5米再左轉90度",而是直接伸手指著前方的一扇門說"往那裡走"。

這個看似簡單的設計,蘊含著一個很關鍵的優勢:**圖像坐標與攝影機的物理規格無關**。不管攝影機裝在離地0.4米的矮小機器人上,還是裝在1.8米高的人形機器人上,不管焦距是多少、畫面比例如何,"圖像里左數200像素、上數300像素"這個描述方式始終成立,不需要知道攝影機的具體參數。相比之下,如果改用"向前移動1.2米"這樣的指令,那就必須知道機器人的確切尺寸和當前位置,換一台機器人就得重新校準。

當然,現實中總有"指不到"的情況。當目標位置不在攝影機視野範圍內時——比如需要先原地轉180度,目標才會出現在畫面里——"指向"就用不上了。這時系統會切換到備用的"位移模式",直接給出相對於當前位置的平移距離和旋轉角度(Δx、Δy、Δθ)。在實際訓練數據里,大約只有10%的情況屬於目標不可見,所以位移模式更多是作為補充手段存在,核心仍然是指向。當機器人判斷任務完成時,系統還會輸出一個特殊的"停止"指令。

這套預測體系里,模型在目標可見時同時輸出五個量:圖像坐標(u, v)、平移位移(Δx, Δy)和轉向角Δθ;目標不可見時只輸出後三個量。把位移預測作為共同訓練任務,也有助於模型在不同場景下保持對空間關係的一致理解。

---

三、從預測"指哪裡"到真正"走過去"——三層系統的接力

光是知道"往圖像里那個點走"還不夠,機器人的電機需要具體的轉速指令,而不是像素坐標。Robostral Navigate把整個導航過程分成了三個層級,各司其職、串聯運行。

最頂層是那個80億參數的視覺語言模型本身,負責"看懂指令、看懂環境、決定方向",每0.5秒更新一次決策。它的輸出就是前面說的指向坐標或位移量。

中間層是一個1.21億參數的擴散策略模型(diffusion policy,可以理解為一個專門負責把方向感轉化為具體步伐的小腦)。它接收大模型給出的路點、當前幀和參考幀,然後輸出接下來1秒內的30個動作步驟——每個步驟是機器人底盤的相對位移和轉角。這一層以每秒10次的頻率運行,比大模型快20倍,保證運動足夠平滑。

最底層是一個平台專屬的運動追蹤控制器,把中間層輸出的軌跡進一步轉化為每秒100次的電機指令,驅動機器人實際移動。這一層因機器人型號不同而有所差異,是整個系統里唯一需要針對不同平台定製的部分。

三層結構的分工邏輯類似於人開車:大腦(大模型)負責看地圖決定走哪條路,身體(擴散策略)負責踩油門和轉方向盤的具體幅度,汽車的電子系統(底層控制器)負責把方向盤角度轉換成輪胎實際轉動的弧度。每一層都專注於自己擅長的粒度,而不是讓一個系統包攬所有工作。

---

四、240萬條軌跡,350萬個場景——如何在不走出實驗室的情況下練就一身本領

訓練一個能導航的大模型,需要海量的真實數據——機器人在各種房間裡走過的軌跡、看到過的畫面、做出過的決策。但真實數據的採集極其昂貴:你需要把機器人搬進一間又一間真實房間,讓它反覆走,全程錄像,然後人工標註。這個過程慢、貴,而且難以規模化。

Mistral AI的解決方案是**完全在仿真環境中生成訓練數據**。他們搭建了一套高效的模擬管線,在35萬個虛擬場景(涵蓋辦公室、住宅、商業空間、室外環境等多種類型)里,自動生成了約240萬條專家導航軌跡。每條軌跡都配有自然語言指令、沿途的RGB圖像序列和對應的導航動作標註。

為了讓軌跡儘可能多樣,研究團隊用了一種叫"最遠點採樣"的策略——簡單說就是在可行走區域裡選出儘可能分散的起點和終點組合,確保軌跡長短各異,有的只需穿過一個房間,有的甚至要跨越多個樓層。

更重要的是,為了讓模型不依賴特定攝影機配置,研究者在生成數據時刻意對機器人的物理參數進行隨機化:機器人高度在0.4米到1.8米之間隨機變動,底盤半徑在0.15米到0.45米之間變化,攝影機安裝高度在機器人身高的70%到100%之間浮動,攝影機俯仰角在0度到25度之間隨機設置。這相當於讓同一個大腦在無數種"身體"里反覆練習,最終讓它對自己的具體身體形態不再有依賴感——只要有眼睛(攝影機),就能導航。

---

五、一個聰明的"壓縮技巧"——把訓練時間從幾個月壓縮到幾天

即使有了240萬條軌跡,訓練效率仍然是個大問題。在常規的訓練方式下,對於一條包含T個時間步的導航軌跡,模型需要針對每個時間步單獨處理一次完整的歷史——第一步看1幀,第二步看2幀,第三步看3幀……以此類推。一條100步的軌跡,需要處理的總幀數是1+2+3+…+100=5050幀,計算量與軌跡長度的平方成正比。面對RxR-CE這種動輒幾百步的長軌跡,這種方式的計算代價高到幾乎不可承受,據估計若按常規方式訓練,需要數月時間。

Mistral AI提出了一個他們稱為"前綴樹訓練"的解決方案。核心思路是:把一整條軌跡打包成一個單獨的訓練序列,格式是"指令 | 第0幀 | 第0步動作 | 第1幀 | 第1步動作 | … | 第N幀 | 第N步動作"。這樣每一幀只需被編碼一次,所有時間步的損失計算可以在一次前向傳播中同時完成,計算量從平方級直接降到線性級。

但這裡有個隱患:如果讓模型在訓練時看到歷史動作的真實標註值,它可能養成一種"作弊"習慣——通過參考之前每一步的正確答案來預測下一步,而不是真正從圖像視覺資訊中推斷。問題是,部署時根本沒有"之前每步的正確答案"可以參考,只有真實發生過的觀察幀。這種訓練和部署之間的分裂,會讓模型在實際使用中表現大打折扣。

為了防止這種作弊現象,研究團隊引入了基於"前綴樹"(prefix tree)結構的注意力掩碼機制。前綴樹是一種數據結構,可以把一組序列里公共的前綴合併成一個"主幹",每條序列獨特的後綴則成為獨立的"分支"。通過特定的注意力掩碼規則,模型在處理某個時間步的動作預測時,可以看到當前步之前的所有觀測幀(主幹),但看不到之前時間步的歷史動作標註(其他分支)。這就像一個學生在做每道題時可以看教材正文,但看不到其他同學的答案——必須靠自己的理解作答。

這套前綴樹訓練方案使訓練所需的token數量減少了22倍,把原本需要數月的訓練時間壓縮到了數天,同時學習信號的完整性完全沒有損失。這對於像RxR-CE這樣軌跡更長、指令更複雜的基準測試尤其關鍵。

---

六、學了規則,還要學"臨場發揮"——強化學習的最後一公里

監督訓練(SFT,即讓模型模仿專家示範)在建立基本導航能力方面非常有效,但它有一個天然局限:專家示範永遠是"最優路徑",裡面沒有迷路後如何調整方向的示範,沒有走錯一步後如何恢復的示範。模型學會的是"一切順利時應該怎麼走",而不是"出了差錯應該怎麼救場"。當模型在真實部署中遇到偏離訓練分布的狀態(比如走偏了、被障礙物擋住了),就容易一錯再錯、越走越遠。

為了解決這個問題,研究團隊在監督訓練之後,追加了一個在線強化學習階段,使用的算法叫CISPO(一種基於組相對優勢估計的策略梯度方法,可以理解為一種讓獎勵信號穩定、自我校準的強化學習變體)。在這個階段,模型真正進入虛擬仿真環境"實戰"——自己走,自己遇到錯誤,自己從錯誤中調整。

獎勵函數的設計也經過了仔細考量:獎勵值等於負的"距目標的測地線距離"(即繞開牆壁等障礙後的實際最短路徑距離),但距離超過2米時不再繼續懲罰,而是將懲罰值固定在-2。這個截斷的目的是:當機器人已經離目標很近時,不讓它為了在2米以內拼命壓縮那最後幾十厘米而做出奇怪的遊走動作,而是鼓勵它直接發出"停止"指令,宣告任務完成。

訓練數據的選擇也很講究。研究團隊先用監督訓練好的模型在仿真環境裡跑一遍所有任務,找出那些模型**失敗**的3.5萬個困難任務,然後在強化學習階段專門針對這些難題進行訓練。這就好比一個學生只在錯題集裡反覆練習,而不是把所有題目重新做一遍——把計算資源集中在最需要提升的地方。

此外,數據收集時將同一場景的多個任務打包在同一批次里,讓模型在連續幾次滾動中反覆面對相同的視覺環境,形成一種隱性的視覺課程——先在熟悉的房間裡不斷嘗試,逐漸建立對這個空間布局的理解,再遇到新環境時能遷移這種空間感知能力。

強化學習階段為R2R-CE的成功率帶來了約4個百分點的提升(從73.4%漲到77.4%),為RxR-CE帶來了約3.9個百分點的提升(從71.2%漲到75.1%)。

---

七、同一個大腦,兩副不同的身體——跨機器人部署的實際驗證

理論上的跨平台泛化能力,在論文中通過兩台外形差異顯著的真實機器人得到了驗證:一台是Galaxea R1(一種高度較高、具有類人形態的移動機器人),另一台是Hiwonder JetAuto(一種體型矮小、履帶式底盤的差速驅動小車)。兩台機器在高度、攝影機位置、底盤結構上都有很大差異。

關鍵之處在於:兩台機器使用**完全相同**的視覺語言模型權重和擴散策略模型權重,唯一的區別是最底層的運動控制器(負責把軌跡轉化為電機指令的那一層)根據各自平台做了適配。論文首頁展示的真實部署照片中,可以清晰看到兩台機器都能跟隨自然語言指令,在真實辦公室環境中穿越門洞、繞過家具、到達目標位置。

這個結果驗證了"指向式導航+物理參數隨機化訓練"策略的有效性:當模型在訓練階段就見過高低胖瘦各種虛擬機器人,當導航預測基於圖像像素而非具體物理尺寸時,同一套權重確實可以無縫遷移到外形迥異的真實機器人上,而不需要為每個新平台重新收集數據或重新訓練模型。

---

八、測試成績單——數字背後的含義

Robostral Navigate在兩個標準基準測試上的表現值得詳細解讀。

R2R-CE(Room-to-Room連續環境)是導航領域最主流的評測平台之一,要求智能體在從未見過的真實室內環境裡,跟隨之前未見過的自然語言指令從起點走到終點。論文使用了四個評價指標:導航誤差(NE,終點與目標的距離,越低越好)、成功率(SR,在目標3米以內停止的比例,越高越好)、Oracle成功率(OS,軌跡中任意時刻距目標3米以內的比例,越高越好)以及路徑加權成功率(SPL,在成功率基礎上根據路徑效率打折,路繞得越多扣分越多)。

在R2R-CE驗證集(未見環境)上,Robostral Navigate的成功率達到77.4%,SPL達到74.2%,導航誤差僅3.20米。此前最好的單攝影機方法(Qwen-RobotNav-4B)成功率為66.9%,差距達到10.5個百分點。最好的多傳感器方法(配備深度傳感器的Qwen-RobotNav-8B)成功率為72.1%,Robostral Navigate在只用單攝影機的情況下仍然高出5.3個百分點。

在已見環境(R2R-CE驗證集seen split)上,成功率達到79.4%,峰值性能甚至達到了80.46%,說明模型的泛化能力和在訓練場景上的記憶能力同樣出色。

RxR-CE(Room-Across-Room連續環境)是更具挑戰性的版本,指令更長、軌跡更複雜。在這個基準的英語子集上,Robostral Navigate取得了75.1%的成功率和68.7%的SPL,導航誤差為3.47米。與此前最好的單攝影機方法(Qwen-RobotNav-8B,成功率73.4%,SPL 63.5%)相比,成功率提升1.7個百分點,路徑效率提升5.2個百分點。SPL上的差距尤其值得關注,這意味著Robostral Navigate不僅更經常到達目標,而且走的路更短、更直接,幾乎沒有多餘的繞行。

特別引人關注的是,在RxR-CE上,Robostral Navigate的SPL(68.7%)甚至超過了使用深度傳感器的最強對手(65.7%),導航誤差也更小(3.47米對比3.58米),成功率(75.1%)與對方(76.5%)僅相差1.4個百分點。這意味著在路徑規劃的質量和效率上,單攝影機系統已經全面超越了配備額外傳感器的方案。

---

歸根結底,Robostral Navigate想要證明的一件事是:在機器人導航這件事上,傳感器的堆砌不是唯一的出路,聰明的算法設計、高效的訓練方案、以及恰當的強化學習,可以讓最簡單的硬體配置達到乃至超越複雜傳感器系統的性能水平。

這對普通人意味著什麼?短期內,這類技術最直接的應用場景是各種服務機器人和配送機器人的導航能力升級——它們不需要改造硬體,只需要換一套軟體,就能在從未見過的新環境裡自主找路。更長遠來看,如果一個導航大腦真的可以不加修改地遷移到任意平台,機器人行業的開發成本和部署門檻都會大幅下降,通用機器人的普及時間線可能因此提前。

當然,這項研究也有其局限性:目前的評測都在仿真或受控真實場景下完成,真實世界的複雜程度——擁擠的人群、移動的障礙、突然變化的光線——仍然是懸而未決的挑戰。研究者自己也把Robostral Navigate定位為"通用具身智能一隻攝影機領路機器人走遍陌生房間MistralAI用8B視覺語言模型刷新導航天花板體的第一步",而不是終點。

有興趣深入了解技術細節的讀者,可以通過arXiv編號2607.20785查閱完整論文。

---

**Q&A**

Q1:Robostral Navigate只用一個攝影機是怎麼判斷距離和方向的?

A:Robostral Navigate不直接測量距離,而是在當前攝影機畫面里標出目標位置的像素坐標,告訴機器人"朝圖像里那個點走",同時預測到達時的轉向角度。當目標不在視野內時,才切換為直接輸出相對位移量。這種做法依賴模型從大量仿真圖像中學到的視覺空間推理能力,而非物理測距傳感器。

Q2:前綴樹訓練方法為什麼能把訓練時間從幾個月壓縮到幾天?

A:傳統訓練方式對每個時間步單獨處理完整歷史,一條100步的軌跡需要處理約5050幀,計算量是軌跡長度的平方。前綴樹方案把整條軌跡打包成一個序列,每幀只編碼一次,所有時間步的損失在一次前向傳播中同時計算,計算量降到線性級,訓練token總量減少了22倍,因此速度大幅提升。

Q3:Robostral Navigate能在沒有訓練過的新環境裡工作嗎?

A:可以。論文的驗證測試都在模型從未見過的全新室內環境(R2R-CE和RxR-CE的"驗證未見"分集)里完成,成功率分別達到77.4%和75.1%。此外,模型還被部署到了與訓練平台形態完全不同的兩台真實機器人上,均能正常跟隨指令導航,驗證了其跨環境和跨平台的泛化能力。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新