宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

騰訊機器人X團隊打造「會思考也會想像」的機器人大腦——RxBrain

2026年07月28日 首頁 » 熱門科技

這項由騰訊機器人X團隊、富田實驗室與騰訊混元團隊聯合發布的研究,於2026年7月15日以預印本形式公開,論文編號為arXiv:2607.14187。感興趣的讀者可以通過該編號在arXiv平台查閱完整論文。

**研究概要**

教一個機器人完成任務,遠比教一個孩子學騎自行車難得多。孩子看幾次示範就能理解"要向前踏、要保持平衡",而機器人往往需要被明確告知每一個步驟,甚至需要提前"想像"自己完成任務之後周圍世界會變成什麼樣子。這種"既能規劃步驟、又能在腦海中預見結果"的能力,正是人類與目前大多數機器人之間最本質的差距之一。

騰訊這支聯合團隊提出了一個名為**Hy-Embodied-RxBrain**(簡稱RxBrain)的具身認知基礎模型,目標是讓機器人在制定行動計劃時,不僅能用語言描述"第一步做什麼、第二步做什麼",還能同時在"腦海中"生成每一步執行完成後世界應該是什麼樣子的畫面——就像一個有經驗的廚師,不僅知道菜譜上寫著"先把洋蔥炒軟",還能在動手之前就清晰地預見到鍋里金黃透明的洋蔥應該呈現出什麼狀態。

這項研究的核心突破在於:它是業界首次將語言推理與視覺想像真正耦合在同一個規劃序列中的具身認知模型,而非讓兩者分別工作後再拼合結果。

---

**一、為什麼機器人既要"說"也要"想"?**

現有的機器人智能系統大致分成兩個陣營。一類是視覺語言模型,它們擅長理解眼前的畫面、聽懂人類指令、分解任務步驟,能用語言告訴機器人"先拿起杯子,再把杯子放到托盤上"。這類模型的短板是,它們描述計劃時完全停留在語言層面,對於"拿起杯子之後世界應該長什麼樣"缺乏明確的視覺預見,就像一個從未下過廚房的人照著菜譜念步驟,卻沒見過食物完成時應有的樣子。

另一類是生成式世界模型,它們善於預測動作執行後的畫面,能生成"機器手臂伸過去抓住杯子後的影片片段"。但這類模型通常不擅長進行因果推理、理解約束條件或進行長程的邏輯規劃,更像是一台擅長渲染畫面的攝影機,卻沒有導演的腳本意識。

RxBrain的思路是:讓語言和視覺像樂隊裡的指揮和樂手一樣配合工作。語言負責告訴機器人整首曲子的結構——哪一段先演奏、哪裡要停頓、整體節奏是什麼;視覺想像則負責把每一段旋律"奏出來",讓抽象的樂譜變成實實在在的聲音。在RxBrain的規劃序列中,語言描述行動步驟、約束條件和決策邏輯,而視覺想像則為每一個步驟生成對應的"世界狀態圖"——執行完這步之後,眼前的場景應該是什麼樣子。兩者互為補充,缺一不可。

---

**二、RxBrain的"大腦結構"是怎麼搭建的?**

RxBrain建立在一種叫做**混合變換器架構**(Mixture-of-Transformers,簡稱MoT)的技術框架上。普通讀者可以把這個架構理解為一座分工明確的大型辦公樓:樓里有專門處理文字的部門、專門理解圖片的部門、專門生成圖片的部門,但這三個部門共享同一套會議室——也就是說,不同部門之間可以充分交流資訊,但各自的專業工作又不會相互干擾。

具體來說,RxBrain包含三類主要工作單元。語言變換器負責處理所有文字,包括理解人類指令和生成規劃步驟的文字描述;視覺變換器負責理解輸入的圖像和影片,理解和生成的視覺內容共享同一套"注意力機制"(可以理解為它們看同一套資訊,但用不同的方式處理),同時各自有獨立的前饋網路(相當於各自的專屬處理流水線);此外,還有一個專門負責"視覺生成"的模組,它的處理容量特意做得更大——中間層寬度從6144擴展到12288——因為憑空生成一張有意義的畫面比理解一張已有的畫面更具挑戰性。

整個模型共有62億個參數,其中語言理解和視覺理解各約15億,視覺生成模組約24億,其餘分布在共享模組和外圍組件中。視覺內容的生成採用了來自FLUX模型的凍結VAE(變分自動編碼器)作為圖像的編碼和解碼工具,可以理解為一個專業的圖像壓縮與還原機器,負責在模型內部表示和最終輸出圖像之間架橋。

為了讓模型在生成規劃序列時既能保持因果邏輯(先發生的影響後發生的),又能讓同一張圖片內部的資訊充分交流,RxBrain設計了一套混合注意力機制:處理文字時用因果注意力(只看之前的內容),處理圖片時在每張圖片內部用雙向注意力(圖片內所有位置互相參考),跨圖片之間仍保持因果順序。這就像一本故事書:同一頁內的插圖細節可以互相對照,但後面的頁面不能"劇透"前面的內容。

---

**三、RxBrain如何生成"文字+畫面"交織的計劃?**

RxBrain支持三種輸出模式,對應具身任務中的不同需求。

第一種是純文字生成模式,用於回答關於當前場景的問題或輸出語言形式的規劃步驟。機器人"看"到眼前的場景後,通過標準的逐詞生成方式輸出文字答案或行動指令。

第二種是多幀影片預測模式,用於預測執行某個動作後接下來四幀畫面會是什麼樣子。這四幀畫面並行生成(而非一幀一幀串行),大幅提升效率,同時幀間保持因果順序,也就是越後面的幀可以參考越早的幀,但不能"看到未來"。這就像同時製作四格漫畫的四個格子,每個格子的畫師都能看到前面格子已經畫好的內容,但不能偷看後面格子。

第三種是交錯生成模式,這也是RxBrain最核心的能力所在。在這種模式下,模型輸出的是一個語言與圖像交替出現的完整規劃序列:先生成第一步的文字描述,再生成對應的目標狀態圖像;然後把這張生成的圖像重新"看"一遍作為上下文輸入,再生成第二步的文字,再生成第二步的畫面……如此循環,直到任務完成。

關鍵的設計細節在於:在訓練時,模型看到的"上一步生成的圖像"不是直接拿來的原圖,而是經過了"生成→解碼→重新編碼"這一完整流程處理過的圖像。這麼做是為了讓訓練時和真正推理時的體驗儘量一致——因為在實際使用時,上一步的圖像確實是模型自己生成的,而不是來自真實世界的照片。這個細節減少了訓練和推理之間的"期望差距",讓交錯生成的質量更加穩定。

---

**四、用五萬小時影片訓練出"計劃感"**

要讓RxBrain學會這種語言加視覺的聯合規劃能力,需要大量帶有"每一步動作配對對應狀態變化畫面"的訓練數據。然而,現有的數據集幾乎沒有這種格式——大多數機器人數據只有動作指令,或只有連續影片,沒有把兩者精確對齊起來。

為此,研究團隊設計了一套全自動的數據構建流水線,把原始具身任務影片轉化為"文字+畫面"配對的聯合規劃訓練樣本。原始影片數據來自四大類來源:真實機器人操作數據(約17292小時)、UMI手持夾持器採集數據(約17506小時)、仿真環境數據(約1317小時)、以及第一人稱人類日常操作影片(約14062小時)。總計超過5萬小時,包含約2150萬個可用片段,通過約2861萬個候選片段篩選而來,通過率約75%。

這條流水線分三個階段。第一階段是時序片段標註:系統先對影片進行關鍵幀採樣——不是均勻採樣,而是優先選取畫面變化最明顯的時刻,就像一本菜譜只需要在每道工序最關鍵的時刻拍一張照片,而不是每秒都拍。採樣完成後,用一個多模態大語言模型對影片進行整體理解,提出候選動作步驟列表,每個步驟包含一個簡短名稱、詳細描述,以及在關鍵幀序列中對應的粗略起止位置。隨後系統在粗略範圍附近密集採樣,用模型精確定位每個步驟的真實開始幀和結束幀。

第二階段是質量驗證:對每一個標註出來的片段,系統自動檢查它是否符合高質量訓練樣本的標準。檢查項涵蓋三大類:語義質量(這個片段是否只包含一個清晰的原子動作?操作目標是否清晰可見?畫面是否有水印遮擋?文字描述是否準確匹配畫面?動作是否真實發生?兩幀錨點是否都可讀?)、視覺接地性(手或夾持器是否可見?機器手臂是否可見?目標物體是否有意外消失?)、以及一致性(兩幀是否在同一場景?相機視角是否穩定?畫面朝向是否正常?描述與視覺變化是否一致?手的變化是否在文字中有所體現?)。如果畫面變化有效但文字描述有誤,系統會自動修正文字而不是直接丟棄這個片段。最終,約75%的候選片段通過了質量驗證。

第三階段是片段結構化:把通過質量驗證的片段組織成四個層級的訓練任務。最基礎的L0層是單步預測,輸入一步的起始畫面和動作描述,預測這步結束時的畫面;L1層是步驟級聯合規劃,給定視覺上下文和目標條件,模型輸出一系列步驟文字及其對應的結束畫面;L2層是子目標規劃,把若干步驟合併為更高層次的子目標,每個子目標配有邊界畫面;L3層是最終狀態想像,只給初始畫面和任務描述,讓模型直接預測整個任務完成時的最終畫面。這四個層級從局部到全局,讓模型學會在不同粒度上進行聯合規劃。

---

**五、分兩階段訓練:先打基礎,再專攻具身**

RxBrain的訓練採用兩階段課程式策略,可以類比為先上通識課、再上專業課。

第一階段是聯合視覺語言預訓練,訓練數據由兩大部分混合而成:60%是大規模圖文對(來自LAION和COYO數據集,共約2億條),40%是多模態指令跟隨數據(來自LLaVA-OneVision和MAmmoTH,共約1.13億條)。這一階段的核心目標是讓模型同時學會理解圖像和生成圖像,在一個共享的表示空間中把語言、視覺感知和視覺生成統一起來,同時保留大語言模型原有的語言能力。圖像生成目標損失權重設置相對更高(λ=1.0),語言生成權重相對較低(λ=0.25),這是因為視覺生成能力需要從頭建立,而語言能力已有良好基礎。

第二階段是具身監督微調,從第一階段的檢查點繼續訓練,訓練數據混合了六類內容,總計約422份的混合比例:一般圖文對(T2I基礎數據和高質量圖文對,合計約25.9%)、通用多模態理解數據(34.6%)、具身多幀世界模型數據(16.2%)、具身交錯規劃數據(20.8%)。這一階段兩類損失權重相等(均為1.0),讓語言推理和視覺生成在具身任務上協同提升。

訓練時使用了最高368塊GPU(即46個8卡節點),全局批量大小7360;第二階段使用312塊GPU(39個節點),全局批量3120。兩階段均使用AdamW優化器、餘弦學習率調度和bf16精度,圖像生成解析度上限256像素,通過16倍下採樣的VAE進行潛變量操作。

---

**六、RxBrain-Bench:專門評測"聯合規劃"能力的新基準**

為了衡量模型是否真正掌握了"語言+視覺聯合規劃"的能力,研究團隊專門構建了一個新的評測基準:**RxBrain-Bench**。

這個基準分三個評測賽道。第一個賽道叫具身視覺問答(EVQA),評測模型能否從視覺觀察中理解具身場景並作出任務相關的決策。題目來自工業、零售和服務等真實商業場景,涵蓋高層規劃(把任務分解為可執行步驟)、模擬推進規劃(在多輪交互中根據中間狀態更新後續決策)、細粒度步驟推理(抓取點、運動軌跡、動作選擇、時序判斷、多視角觀察)、錯誤恢復(識別異常狀態並選擇正確應對方式)、以及任務完成判斷(判斷當前狀態是否滿足目標)。共1123道多選題加258道模擬規劃題,總計1381個評測項目。

第二個賽道叫世界狀態預測(WorldPred),評測模型在給定當前觀察和自然語言動作指令後,能否生成描述動作結果的短時序畫面(4幀)。評測標準包含五個維度:觀察連續性(生成的第一幀是否自然延續當前觀察)、動作正確性(生成的幀序列是否執行了正確的動作)、目標完成度(最終幀是否達到了任務暗示的目標狀態)、時序物理合理性(幀間運動是否流暢且物理上合理)、以及與真實軌跡的匹配度,最終加權得分為這五項的線性組合。

第三個賽道叫聯合規劃(JointPlan),也是RxBrain-Bench最核心的部分,評測模型能否在完全自回歸的閉環推演中進行語言加視覺的聯合規劃。模型在每一步都必須輸出自然語言子步驟描述和對應的目標畫面,然後以自己生成的畫面作為下一步的輸入繼續規劃,直到任務完成。評測標準包含六個維度:觀察理解、子任務規劃、目標圖像正確性、子任務與目標的一致性、完整鏈條的完成度、以及圖像相似度(用DINO特徵的餘弦相似度衡量生成畫面與真實目標畫面的接近程度),加權得分覆蓋這六個方面。

---

**七、評測結果:在多個維度上表現出色**

在通用圖像生成能力方面,RxBrain在GenEval基準上獲得82.4分,與專門針對圖像生成優化的BAGEL模型(82分)基本持平,明顯高於同樣具備生成能力的Cosmos-3-Nano模型(71.68分)。這說明RxBrain在擴展到具身任務的同時,並沒有犧牲其通用圖像生成能力。

在具身與空間理解方面,RxBrain在多個公開基準上處於前列。在CV-Bench上以88.59分排名第一,在EmbSpatial上以82.3分緊追Cosmos-3-Nano(82.1分)的第二位,在DA-2k深度感知理解上以83.4分排名第一。特別在多視角和三維理解領域,RxBrain的優勢最為突出:在3DRSBench上以54.1分排名第一,在MMSI-Bench多圖空間智能上以35.8分領先,在MindCube空間心理建模上以47.5分名列前茅,在SITE-Bench圖像空間理解上以54.9分居首。在機器人軌跡預測上(Share-Robot-Trajectory),RxBrain以51.13分排名第一,比此前最佳模型Cosmos-3-Nano的39.02分高出約12個百分點。在RoboSpatial-Home配置理解上以86.28分排名第一。不過,在需要精確指點定位(Pointing)和機器人抓取位置預測(Share-Robot-Affordance)方面,專門針對空間指向優化的RoboBrain2.5模型仍然更強。

在RxBrain-Bench-EVQA的自建評測中,RxBrain綜合得分為72.7分,低於Qwen3.5-4B的78.1分和Cosmos-3-Nano的76.7分,但在成功檢測(Success Detection,85.1分)和模擬規劃(Simulation Planning,51.6分)兩個維度上表現最佳,說明模型在判斷任務是否完成以及在多輪模擬中更新決策方面有獨特優勢。主要差距集中在精細空間定位、軌跡與時序推理以及錯誤恢復方面。

在世界狀態預測(WorldPred)評測中,RxBrain以0.62的綜合得分超越Cosmos-3-Nano(0.591)和Wan2.2-TI2V-5B(0.429)。觀察連續性得分0.67和動作正確性得分0.65是最強項,時序物理合理性0.53是最弱項,說明生成畫面的物理連貫性仍有提升空間。在不同子數據集上的表現從UMI的0.73到arctic的0.35不等,兩幀條件輸入的整體效果最佳。值得關注的是,RxBrain雖然並非專門的影片生成模型,卻超過了專為具身世界建模設計且在大量影片數據上預訓練的Cosmos-3-Nano,體現了統一模型架構的優勢。

在聯合規劃(JointPlan)評測中,RxBrain以0.68的綜合得分大幅領先所有基線:Cosmos-3-Nano智能體得分0.521,統一多模態模型BAGEL-7B-MoT得分0.503,模組化的Qwen-Agent得分0.431。具體來看,觀察理解得分0.83和子任務規劃得分0.78是最強項,目標圖像正確性0.52是最弱項,再次印證了語言推理能力強於視覺想像能力的規律。在不同規劃深度上,兩步規劃得分0.69,八步規劃得分降至0.55,體現了長程推演中誤差累積的挑戰。RxBrain在子任務規劃和鏈條完成度上的領先優勢最大,說明它在保持整體計劃一致性方面具有明顯優勢。

---

**八、從"大腦"到"手臂":擴展到真實機器人動作生成**

RxBrain不只是一個能規劃的"大腦",研究團隊還把它擴展成能控制機器人手臂實際運動的系統。

擴展的方式是在原有的MoT架構基礎上新增一個動作專屬分支,包含獨立的注意力投影層、前饋網路和層歸一化,但仍與語言、視覺和狀態的全局注意力共享資訊交流。這個動作分支的初始參數複製自視覺理解分支,相當於讓它從理解畫面的能力出發,重新學習如何把理解轉化為動作。

一個特別設計的"門控專家融合"機制讓動作分支能夠借用視覺生成分支中已經學到的預測性和規劃性知識。具體來說,動作模組的前饋網路輸出等於動作專屬前饋網路的結果加上一個可學習的通道門控權重乘以視覺生成前饋網路的結果。這個門控權重初始為零,意味著訓練開始時動作模組完全依靠自身,隨著訓練推進,門控權重逐漸學習到哪些視覺生成知識對動作預測有幫助,並選擇性地引入。這種設計讓動作模組不需要從零開始學習規劃性知識,而是站在視覺生成模組已有積累的肩膀上。

動作的表示方式是:對於雙臂機器人,每個機械手臂的末端執行器狀態包含三維位置、四元數姿態和夾持器開合量,共16維。本體感知狀態通過輕量級編碼器映射為單一狀態令牌,未來H步的動作塊通過流匹配(Flow Matching)在歸一化動作空間中生成,訓練目標是讓模型預測的速度場在去噪過程中準確指向真實動作方向。

在真實機器人實驗中,研究團隊選取了三個多階段家務操作任務進行評測,每個任務各進行100次真機試驗。在"擺設餐桌"任務中(需要從架子上取出盤子、叉子和刀並按正確位置擺放),RxBrain成功率97%,超過π0的82%和π0.5的90%。在"摺疊收納眼鏡"任務中(需要摺疊眼鏡腿並放入眼鏡盒),RxBrain成功率95%,超過π0的76%和π0.5的82%。在"撿拾垃圾"任務中(需要先開垃圾桶蓋再將廢紙放入),RxBrain成功率68%,超過π0的46%但略低於π0.5的74%。三個任務的平均成功率為87%,π0為68%,π0.5為82%。需要特別指出的是,這些結果是在沒有大規模動作數據預訓練的情況下取得的,說明具身規劃預訓練產生的世界知識確實能夠遷移到真實動作控制中。

---

**九、讓推理速度跟上機器人的手速**

在實驗室里表現優秀的模型,在真正控制機器人時還面臨一個重要挑戰:速度。如果模型每次預測動作都需要很長時間,機器人就會動得磕磕絆絆,就像一個總是猶豫半天才邁腿的人走路一樣。

研究團隊對實時部署進行了專項加速優化,並堅守一個底線:所有優化必須在數值上等價於原始模型,也就是說機器人的軌跡不能因為加速而發生任何可測量的變化。

原始模型每幀推理需要210毫秒,主要瓶頸出乎意料地不是矩陣乘法,而是混合變換器架構中的模態分發邏輯:每一層都要重新計算哪些令牌屬於語言、哪些屬於視覺、哪些屬於動作,這個操作在一次前向傳播中觸發了約1091次nonzero調用,累計占據174毫秒CPU時間,再加上索引操作的48毫秒和拷貝操作的21毫秒。

針對這個瓶頸,研究團隊實施了三項優化:預計算前綴鍵值緩存(觀察幀和指令文字的上下文在動作流匹配的多步去噪過程中是固定不變的,可以只計算一次並復用);僅對動作令牌進行快速解碼(有了緩存之後,每步去噪只需要處理16個動作令牌,而非989個前綴令牌加16個動作令牌);去同步化模態分發加CUDA圖捕獲(把每層的令牌路由索引預計算好,用gather和scatter替換布爾索引,消除GPU與CPU之間的反覆同步,最後用CUDA圖固定整個解碼步驟以消除核心啟動開銷)。三項優化組合後,推理延遲從210毫秒降至143毫秒,提速約1.47倍,同時位置誤差小於0.65毫米、姿態誤差小於0.73度,完全處於bf16精度的捨入誤差範圍內。

---

**研究的局限與未來方向**

研究團隊坦誠地指出了RxBrain目前存在的三個主要局限。第一,模型規模相對較小(62億參數),可能限制了它處理高度複雜推理、精細視覺想像和長程規劃的能力,擴大模型和數據規模是顯然的改進方向。第二,雖然RxBrain能跨多種具身場景泛化,但對於完全陌生的環境、機器人形態或任務領域,仍然需要額外的微調才能達到理想性能。第三,交錯生成涉及兩種不同的生成範式(文字的自回歸生成和圖像的流匹配生成),訓練和推理之間仍然存在一些差異,儘管通過VAE重建傳遞的視覺狀態構建策略已經有所緩解,但尚未引入強化學習或其他序列級優化方法來進一步對齊兩種模態的生成過程。

未來團隊計劃向兩個方向發力:一是擴大模型規模,預期更大的模型將在聯合規劃的連貫性、世界狀態預測的準確性和整體規劃能力上帶來系統性提升;二是增強自主性,讓模型更好地分解開放性任務、監控執行進度、修正規劃並以更自主的方式與環境交互。

---

說到底,RxBrain這項工作的意義在於它清晰地回答了一個問題:一個能真正勝任複雜任務的機器人大腦,需要的不僅僅是會說"第一步做什麼",也需要能在腦海中"看見"每一步完成後世界應該是什麼樣子,這兩種能力必須緊密耦合,而不是各自為政。RxBrain給出了一套初步但系統的實現方案——從模型架構、數據構建、訓練策略到評測體系——為具身認知基礎模型的研究開闢了一條有價值的路徑。

對這項研究感興趣的讀者可以通過arXiv編號2607.14187找到完整論文,也可以在Hugging Face上查找Tencent/Hy-Embodied-RxBrain-1.0獲取模型,在GitHub上查找Tencent-Hunyuan/Hy-Embodied-RxBrain-1.0獲取代碼。

---

**Q&A**

Q1:RxBrain和普通機器人規劃模型有什麼區別?

A:普通機器人規劃模型要麼只用語言描述步驟,要麼只生成畫面,兩者分開工作。RxBrain的特點是把語言步驟規劃和視覺狀態想像放在同一個序列里同時完成——每說出一個動作步驟,就同時生成那步執行後世界應該是什麼樣子的畫面,兩者互相驗證、互相依賴。

Q2:RxBrain真實機器人測試的成功率是多少?

A:在三個家務操作任務上,RxBrain平均成功率為87%:擺設餐桌97%,摺疊收納眼鏡95%,撿拾垃圾68%。對比基線π0平均68%和π0.5平均82%,RxBrain整體更優,且是在沒有大規模動作數據預訓練的條件下取得的。

Q3:RxBrain的訓練數據有多大規模?

A:研究團隊從真實機器人操作、手持夾持器採集、仿真環境和人類第一視角影片四類來源收集了超過5萬小時的具身任務影片,通過自動化流水線篩選出約2150萬個高質量訓練片段,通過率約75%。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新