宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

一群機器人,如何在誰也看不到全局的情況下,對未來達成共識

2026年08月17日 首頁 » 熱門科技

想像一下這個場景。

十幾台無人機在空中組成編隊,風一吹,隊形就會晃動。每一台無人機只能看到自己周圍幾個鄰居在幹什麼,誰都看不到整個編隊此刻是緊密聚集、還是正在散開、還是已經亂成一團。可是,如果每台無人機對"我們這個團隊接下來會變成什麼樣子"的判斷都不一樣,接下來的動作就會互相拖後腿:有的以為大家要收攏,猛地往中心擠;有的以為大家要散開,拼命往外飛。

這不是一個"感知不准"的問題,而是一個更麻煩的問題:每個人手裡的資訊都不完整,而且沒有一個"中央大腦"能把所有資訊匯總起來告訴大家標準答案。這篇來自ITMO大學的論文,標題叫《One Future, Every Robot》,《一個未來,每個機器人》,研究的正是這件事:能不能讓一群互相看不到全局、也不互相對答案的機器人,各自獨立地對"團隊的未來會是什麼樣"形成一致的判斷?

這個問題看起來簡單,做起來卻像一個悖論:既要大家想法一致,又不能讓大家互相抄答案。

問題到底難在哪

先說清楚這不是什麼問題。

這不是普通的"預測每個機器人自己下一步去哪"的軌跡預測問題,那種問題里每個機器人只需要關心自己。這也不是"訓練一個中央控制器去看整個戰場"的中心化問題,因為現實中的機器人群體往往沒有這樣一個上帝視角的中樞,通信頻寬有限,網路還可能隨時斷開。

真正的困境在於:每個機器人只能看到自己的16幀歷史觀測和鄰居傳來的一點點壓縮資訊,卻被要求對整個團隊未來的"聚集程度"、"連通性"、"任務完成度"這些只有站在上帝視角才看得清楚的指標,做出準確且彼此吻合的判斷。

打個比方,這就像讓十個人在完全不能交談、只能通過傳紙條給最近的鄰座人的情況下,各自獨立猜測"這個班級期末的平均分會是多少"。如果不能形成某種共同的理解方式,十個人猜出十個天差地別的數字,一點都不奇怪。

以往的研究其實分頭解決了這個問題的兩半。一半是"如何從局部資訊拼湊出全局結構",像Deep Sets、圖神經網路這類工作證明了局部交換的資訊確實能反映出群體的隱藏狀態。另一半是"如何用預測來提升多智能體的協作能力",比如MASIA用自監督的方式壓縮通信內容,還有各種"世界模型"嘗試把局部動態和全局聚合結合起來。

但這兩條線一直沒有真正交匯。

有沒有一種潛在的"目標狀態",能讓每個機器人獨立預測出來的東西,既代表整個群體作為一個集合的未來樣子,又不需要靠一致性損失函數強行拉齊,而且在通信拓撲變了、群體規模變大之後依然管用?這正是這篇論文要回答的問題。

JEPA一群機器人如何在誰也看不到全局的情況下對未來達成共識:預測意義,而不是預測像素

要理解這篇論文的解法,得先說說JEPA這個概念。

> JEPA*:全稱Joint-Embedding Predictive Architecture,聯合嵌入預測架構。它的核心思想是讓模型去預測未來狀態在一個抽象特徵空間裡的表示,而不是去逐像素、逐數值地重建原始數據。這個想法最早由Yann LeCun在2022年提出,後來被應用到圖像、影片等多種自監督學習場景。

為什麼要用JEPA而不是老老實實地重建原始數據?

設想你要向朋友描述明天的天氣。你可以說"明天下午三點,氣溫23.6度,風速每秒2.3米,雲層覆蓋率47%",這是一種極度精確但極其囉嗦的描述方式,任何一點誤差都會顯得"預測錯了"。你也可以說"明天下午多雲轉晴,微風",這種描述抓住了對生活真正有用的資訊,忽略了那些沒必要精確到小數點的細節。JEPA做的就是後一種事:它讓網路學會去預測"重要的東西",而放過那些瑣碎的、局部視角本來就沒法達成一致的細枝末節。

這篇論文給這個架構起了個新名字,叫CS-JEPA一群機器人如何在誰也看不到全局的情況下對未來達成共識

> CS-JEPA*:Collective-State JEPA,集體狀態聯合嵌入預測架構。它訓練每個機器人從自己的歷史觀測和鄰居傳來的消息里,預測出同一個固定寬度的"未來集體狀態",但完全不使用任何強迫大家答案一致的損失函數。

這裡有個關鍵設計,論文裡反覆強調:整個訓練過程里,從來沒有一個"讓大家答案趨同"的損失項。研究者故意把這個"一致性損失"的權重設為零。這是一次故意冒險的實驗:如果這個假設成立,如果讓不同的局部視角都去夠同一個目標,這些視角本身的含義就會自然對齊,那麼在零一致性權重下依然能看到答案趨同,就是最有說服力的證據。但如果這個假設是錯的,那麼各個機器人就應該各說各話,誰也說服不了誰。

一個不會隨群體變大而膨脹的目標

這裡有個很實際的工程問題:如果群體裡有10個機器人,目標應該是10份資訊;如果群體擴大到100個,難道目標也要變成100份?這樣模型的參數規模就會隨群體大小失控增長。

論文的解法是設計一種"固定寬度"的目標表示,無論群體有多大,輸出的維度永遠不變。

具體做法是:先用一個已經訓練好、之後會被凍結的"目標編碼器",把未來時刻每個活躍機器人的狀態都編碼成一個64維向量。然後用一種叫做"錨點"的機制,把這些向量匯總成固定數量的令牌:一個代表整體的全局令牌,加上一個4乘4的空間網格,每個網格點根據距離遠近加權匯總周圍機器人的資訊。這樣無論群體是10個還是108個機器人,最終輸出的都是17個65維的令牌,拼起來正好是1105維,寬度雷打不動。

這就像給一個班級拍集體照。不管班裡是30人還是300人,你都可以把照片固定裁剪成一張16宮格的構圖,每個格子記錄這個區域大概站了多少人、他們朝哪個方向看。哪怕後來班級擴招到三倍,這張構圖描述的"格式"依然不變,變的只是每個格子裡承載的實際內容。如果不這樣固定輸出寬度,模型每次換一個班級規模就要重新設計一遍,那所謂的"可擴展性"就無從談起。

每個機器人接收到的輸入資訊也有嚴格限制,只能看到自己過去16幀的自身狀態,包括位置、速度、任務方向,以及鄰居在過去16步里傳來的、上一時刻的循環記憶,一個64維的浮點向量,相當於每條邊每步傳輸256字節。這個數字被反覆強調,因為它劃定了一條硬邊界:機器人之間傳的不是"我認為未來是什麼"這樣的答案,而是"我現在腦子裡在想什麼"這樣的中間過程狀態。

論文裡還專門設計了一個"接收方錨點",一個訓練時才存在的小模組,用來預測該機器人自己未來的局部狀態,防止模型為了迎合那個宏大的集體目標,把每個機器人自身的動態特徵給忽略掉。這個模組在真正部署的時候會被整個丟棄,只在訓練階段發揮"穩定訓練"的作用。

> GRU*:門控循環單元,一種擅長處理序列資訊、能夠把歷史狀態壓縮傳遞下去的神經網路結構。在這篇論文裡,每個機器人用GRU把自己過去的觀測和鄰居傳來的記憶融合成一個當前的隱藏狀態。

關鍵的對照組:如果不用JEPA會怎樣

光講CS-JEPA自己表現多好是不夠有說服力的,因為你沒法排除"任何可靠的循環神經網路架構都會有這個效果"的可能性。

於是論文設計了一個幾乎和CS-JEPA一模一樣的對照組,叫Future-Recon,意思是"未來重建"。這個對照組用了完全相同的凍結編碼器、完全相同的通信機制、完全相同的預測器結構、完全相同的1105維輸出寬度,甚至連"接收方錨點"這個訓練技巧都原封不動地保留。唯一的區別是:CS-JEPA預測的是抽象的潛在特徵,而Future-Recon預測的是原始的位置、速度這些具體數值。

兩者的參數量也幾乎相同,CS-JEPA有139137個訓練參數,Future-Recon因為多了一個原始數據解碼器,多出9607個參數,達到148744個。部署時兩者用的參數量完全一致,都是123713個。

這個設計的用意很清楚:把所有可能造成差異的因素都控制住,只留下"預測目標是抽象特徵還是原始數值"這一個變量。如果不做這樣嚴格的對照,即使CS-JEPA表現更好,你也說不清這是"預測目標選對了"帶來的好處,還是"恰好這套架構更適合"的巧合。

結果:一致性和準確率同時提升

論文最核心的實驗結果,用一句話概括就是:CS-JEPA訓練出來的各個機器人,獨立做出的預測,彼此之間變得更加一致了,同時這些預測本身也變得更准了。

這個"同時"非常重要。

因為如果只看到一致性提升,你完全可以懷疑:會不會是所有機器人都學會了輸出同一個恆定的、沒有資訊量的答案?畢竟如果十個人永遠都回答"不知道",他們之間當然是完全一致的,但這種一致毫無意義。真正有說服力的證據必須是:一致性提高的同時,預測這個未來狀態的準確度也在提高。這就排除了"集體擺爛"這種可能。

論文做了一次全新的、獨立的復現實驗,訓練了12個全新的隨機種子,相當於把整個訓練過程重新做了12遍,每次用不同的隨機初始化,結果顯示在ID測試集、拓撲結構變化的測試集、群體規模擴大的測試集上,全部12個種子都毫無例外地顯示CS-JEPA比Future-Recon更一致也更準確。用統計學的語言說,這個結果的p值是0.000488,幾乎不可能是偶然。

具體數字上,相對於Future-Recon,CS-JEPA的集體狀態預測誤差在分布內測試集上降低了28.4%,而在拓撲結構或群體規模發生變化的場景下,降低幅度達到64.4%到75.6%。

這裡"拓撲結構變化"和"群體規模變化"是兩種不同的挑戰。前者指的是訓練時用的通信網路長得像小世界網路,這是一種既有局部聚簇又有少量遠距離連接的網路結構,而測試時換成了環形網路或互相k近鄰網路,形狀完全不同。後者指的是訓練時群體規模只有10到18個機器人,測試時卻要應付36、72甚至108個機器人,是訓練規模的六倍。

這就好比你訓練一個團隊協作直覺的時候,團隊一直是十來個人的小組,等真正上場比賽的時候,團隊突然膨脹成六十人的大部隊,而且原本熟悉的溝通結構也全變了,從小圈子互通消息變成了隨機連線。如果這套預測方式只是死記硬背了訓練時的場景,遇到這種巨變肯定會崩潰。但結果顯示,CS-JEPA不僅沒崩潰,反而在這種劇變場景下優勢更明顯了。這說明它學到的不是某個具體拓撲或規模下的表面規律,而是某種更本質的、可以遷移的東西。

下面這張表格是論文裡的核心證據,展示的是"重建方法誤差減去JEPA方法誤差",正數越大代表CS-JEPA優勢越明顯:

| 測試場景 | 準確率提升幅度 | 一致性提升幅度 |

|---|---|---|

| 分布內測試 | 0.001568 | 0.000981 |

| 環形拓撲(分布外) | **0.048385** | **0.076685** |

| 互相k近鄰拓撲(分布外) | 0.034180 | 0.045911 |

| 群體規模擴大(分布外) | 0.037714 | 0.061672 |

而且所有這些數字,在12個獨立訓練的種子裡全部是正數,沒有一個例外。

論文還專門畫了一條"標籤效率曲線"來展示另一個維度的證據。因為要讓機器人預測出的抽象特徵真正對應到"聚集程度""連通性""任務完成分數"這些人能理解的物理量,需要用一小部分帶標籤的數據訓練一個輕量級的探針,一個簡單的嶺回歸模型。

> 嶺回歸探針*:一種帶正則化項的簡單線性模型,這裡用來把凍結的抽象特徵"翻譯"成人類能理解的十個具體指標,比如群體的對齊程度、連通性、碰撞比例等。用"探針"這個詞是因為它只是用來檢驗特徵里是否含有某種資訊,本身不參與主體模型的訓練。

在只給6、12、24個帶標籤的完整回合數據的情況下,注意,這個數字非常小,相當於用極少量標註數據去校準,CS-JEPA的等權重四場景平均誤差分別是0.0175、0.0121、0.0103,而Future-Recon則是0.0626、0.0413、0.0287。差距在標籤最稀缺的時候反而最大,這正是"標籤效率"這個詞想表達的意思:好的表示應該能用很少的標註數據就把有用的資訊提取出來。

排除簡單答案:不是靠坐標抄近道

這裡有個值得警惕的陷阱。如果所有機器人共享同一套絕對坐標系,比如大家都知道"東邊是正方向",那麼"預測一致"很可能只是因為大家用了相同的參照系作弊,而不是真的學到了什麼深層規律。

論文專門設計了一個"平移不變性"的對照實驗,把絕對位置換成"相對於自己"的相對位置,把目標場也改成以群體中心為原點的坐標,同時把任務方向這個通道直接清零。這樣一來,唯一還共享的只有朝向和度量尺度,絕對位置這個"作弊工具"被拿掉了。

結果顯示,即便去掉了這個坐標抄近道的可能,CS-JEPA的優勢依然存在:準確率誤差從0.008852降到0.007248,下降18.1%;一致性誤差從0.005735降到0.002729,下降52.4%。而且依然是12個種子全部支持這個結論。

這就好比原本懷疑兩支球隊默契十足是因為他們提前對過暗號,於是把暗號拿掉重新比一次,結果發現默契程度基本沒變。這說明默契的來源不是暗號,而是某種更本質的東西,可能是對場上局勢的共同理解方式。

論文還做了一個更狠的交叉驗證實驗:把CS-JEPA依賴的那個"目標編碼器",也就是提前訓練好用來生成潛在特徵的模組,換成一個用原始數據重建方式訓練出來的編碼器。目的是排除"CS-JEPA表現好只是因為它站在了一個JEPA風格編碼器的肩膀上"這種可能性。

結果是:即使把底層編碼器換成"重建風格"訓練出來的,CS-JEPA式的預測目標依然比Future-Recon式的預測目標表現更好,而且優勢不減反增。8個獨立訓練的種子全部支持這一點,p值是0.0078125。這個結果相當有力地說明,真正起作用的不是編碼器本身的訓練方式,而是"預測抽象特徵而不是原始數值"這個選擇本身。

光預測得准還不夠,得對決策有用

一個預測哪怕再準確,如果不能幫機器人做出更好的決定,那它的價值也要打個問號。

論文接下來測試了這個抽象特徵表示能不能幫機器人評估"如果我做這個動作,會有什麼後果"。他們訓練了一個"動作條件"版本的模型,讓每個機器人給自己設想的四步行動方案評分,衡量的指標包括任務完成度、連通性維持情況、碰撞風險。

結果顯示,CS-JEPA在預測這些行動方案的實際價值上,誤差比Future-Recon低了45.46%,而且在沒見過的、規模是32個機器人的場景下依然保持50.62%的誤差降低。這說明這個抽象特徵不只是"看起來像是對的",它裡面真的編碼了對決策有用的資訊。

最後一步測試是真正意義上的"閉環"實驗:讓機器人真正拿著這套預測系統去控制真實的四旋翼無人機物理模擬,用的是Crazyflie這款真實存在的微型無人機的剛體動力學模型,包含空氣阻力等因素,在240赫茲的物理仿真頻率下運行。每個機器人獨立地在一個5乘5的"聚合程度-巡航速度"網格上評分,選出未來0.8秒的最佳方案,執行四步之後重新規劃,整個過程中依然沒有任何預測、評分或方案被匯總到一起。

在通信完全正常、20%丟包、單步延遲帶抖動、以及丟包延遲抖動疊加異步更新這幾種嚴苛條件下測試,CS-JEPA相對Future-Recon把綜合效用提升了5.3%,在16個種子裡有12個種子支持這個結論;相對完全不用學習預測、只靠固定規則飛行的基準方法,則是16個種子全部、毫無例外地支持CS-JEPA更優,p值小到0.000031。而且整個測試過程中,沒有一次碰撞或者近距離碰撞事故發生。

這項研究留下的邊界

論文自己也很坦誠地列出了目前的局限。

所有實驗都在仿真環境裡完成,還沒有真正搬到硬體上跑過。共享朝向和度量尺度這個假設依然保留著,還沒有測試過完全獨立局部坐標系的情況。用來訓練動作價值評估的"窮舉分支監督",也就是讓模型看遍所有可能的行動方案組合,這種做法只在訓練階段用得起,實際部署時不可能窮舉所有可能性。改善了價值評估的準確度,並不直接等同於降低了"選錯方案"的遺憾程度,這兩者是有區別的。

這些限制意味著,這篇論文證明的是"這個思路在受控條件下是成立的",而不是"這個思路已經可以直接裝到真實機器人上使用"。

寫在後面

讀這篇論文時最讓我意外的一點,是研究者對"一致性損失權重為零"這件事的執著。很多做多智能體系統的工作,第一反應都是設計一個顯式的懲罰項去逼迫智能體的輸出趨同,畢竟直接優化目標最省事。但這篇論文反其道而行之,故意不這麼做,把"一致性會不會自然出現"當成檢驗假設的核心手段。這種"故意不給捷徑,看看結果會不會自己長出來"的實驗設計思路,其實挺值得在別的領域借鑑的:與其強行拉齊結果,不如去問問,如果給對了共同的目標,一致性是不是本來就該自然湧現。

論文裡那個"直接監督對比"的診斷實驗也挺有意思。用帶標註數據直接監督訓練出來的模型,一致性反而比CS-JEPA更好,但準確率明顯更差。這說明"更一致"和"更準確"其實是可以拆開來分別優化的兩件事,CS-JEPA選擇了在兩者之間找一個更有實際價值的平衡點,而不是單純追求某一個指標好看。這提醒人一件事:評價一個系統好不好,不能只看一個數字,得看這個數字背後犧牲了什麼。

如果一個抽象的、誰也沒見過的"共同未來"真的能讓分散各處、互不通氣的個體在行動上更協調,那這件事的應用邊界恐怕遠不止無人機編隊。

Q&A

Q1:CS-JEPA是什麼?

A:CS-JEPA全稱Collective-State JEPA,集體狀態聯合嵌入預測架構,是一種讓分布式機器人群體在沒有中心節點、也不互相核對答案的情況下,各自獨立預測同一個"集體未來狀態"的訓練方法,訓練過程中完全不使用強迫結果一致的損失函數。

Q2:CS-JEPA和普通的重建式預測方法相比,優勢體現在哪裡?

A:相對於同等參數規模、只是把預測目標換成原始數值重建的Future-Recon方法,CS-JEPA在分布內測試集上誤差降低28.4%,在通信拓撲或群體規模發生較大變化的場景下誤差降低64.4%到75.6%,同時預測結果之間的一致性也顯著提升,12個獨立訓練種子全部支持這一結論。

Q3:CS-JEPA的效果會不會只是因為大家共享了絕對坐標系這種簡單技巧?

A:不會。論文專門做了去掉絕對坐標資訊、只保留相對位置的對照實驗,結果顯示CS-JEPA的優勢依然存在,準確率誤差降低18.1%,一致性誤差降低52.4%,說明優勢來源不是坐標系抄近道,而是預測抽象潛在特徵這個設計本身。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新