宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

ODEWorld:當AI學會用物理時間思考世界

2026年08月17日 首頁 » 熱門科技

你有沒有想過一個很奇怪的事情:我們生活的世界明明是連續的,時間一分一秒流淌,物體的運動沒有"幀"這個概念,但現在幾乎所有的AI影片生成模型和機器人決策系統,都在偷偷把時間切成一段一段的碎片來處理。

這聽起來像個技術細節,但其實是個挺大的問題。你去看那些生成影片的AI模型,不管是早期的擴散模型還是現在的各種"世界模型",它們的工作方式基本上都是這樣的:把影片看成一堆圖片幀的序列,然後一幀一幀地預測下一幀長什麼樣。機器人決策也是類似的邏輯,把連續的動作硬生生切成離散的時間步。

這就好比你想描述一條河流的運動,卻只能給它拍快照,拍一張、兩張、三張,然後試圖從這些靜止的畫面里拼湊出"流動"這件事。你當然可以拍得足夠密集來近似連續性,但代價是數據量爆炸,而且如果河流的流速突然變化,或者你想知道兩張照片之間某個瞬間水流具體是什麼樣子,你就沒辦法了,因為你壓根沒建模那個瞬間。

這篇來自清華大學智能產業研究院(AIR)和加州大學伯克利分校BAIR實驗室的論文,就是想徹底解決這個問題。他們提出了一套叫做**物理時間流(Physical-Time Flow,簡稱PT-FlowODEWorld當AI學會用物理時間思考世界)**的新範式,並在此基礎上構建了一個叫**ODEWorldODEWorld當AI學會用物理時間思考世界**的連續時間世界模型。核心思路聽起來很簡單:別再把時間切碎了,直接用一個連續的數學方程去描述事物是怎麼變化的。

當年的世界模型都卡在哪裡

要理解這篇論文解決了什麼問題,得先說說"世界模型"這個概念本身在幹什麼。

世界模型指的是一類AI系統,它試圖學會預測"如果現在這樣做,接下來會發生什麼"。這在機器人控制和影片生成里都極其關鍵:機器人需要預知自己的動作會帶來什麼後果,影片生成模型需要知道畫面接下來該怎麼演變。

近幾年,這個領域主要分成了兩條路子。第一條是直接在像素空間裡硬預測,把影片當成一堆圖片,訓練模型逐幀生成,代表性的方向包括Sora這類影片生成大模型。這類方法確實能生成很逼真的畫面,但計算成本高得嚇人,因為每一幀都是幾十萬甚至上百萬像素點的高維數據,模型得花大量精力去擬合背景紋理、光影這些和"物理動態"其實沒什麼關係的細節。

第二條路是"潛在世界模型"(latent world model),試圖先把圖像壓縮成一個低維的、更本質的表示,再在這個壓縮空間裡做預測,省去逐像素重建的開銷。這條路里最有代表性的是**JEPAODEWorld當AI學會用物理時間思考世界**

*JEPA:全稱Joint Embedding Predictive Architecture(聯合嵌入預測架構),核心思路是讓編碼器把圖像映射到一個特徵空間,再訓練一個預測器在這個特徵空間裡預測未來*

這個系列的方法,包括V-JEPA、V-JEPA 2等等。它們的思路是同時訓練一個編碼器和一個預測器,編碼器負責把圖像變成特徵,預測器負責在特徵空間裡預測下一步的特徵該是什麼樣。

但JEPA系列一直有個揮之不去的老大難問題,叫**表徵坍縮ODEWorld當AI學會用物理時間思考世界**

*表徵坍縮(representation collapse):指模型為了讓預測變得"簡單",把所有輸入都編碼成幾乎一樣的特徵向量,導致預測器"作弊式"地達到零誤差,但這個特徵空間其實什麼有用資訊都沒編碼*

說白了就是模型學會了偷懶。既然編碼器和預測器是聯合訓練的,如果編碼器把所有輸入都壓成同一個點,那預測器不管輸入是什麼都預測這個點,誤差自然是零,訓練損失完美收斂,但這個模型對世界一無所知。

這就像你讓一個學生做數學題,如果他發現只要把所有題目的答案都寫成"42"就能拿高分(因為出題老師批改不嚴),他大概率就不會真的去學怎麼解題了。表徵坍縮就是這種"鑽空子"式的失敗,模型在損失函數上表現完美,但學到的東西毫無意義。

為了防止這種偷懶,現有方法不得不加入各種正則化手段,比如V-JEPA 2用EMA(指數滑動平均)更新的目標編碼器,或者其他工作引入額外的多樣性約束。但這些補丁式的方案往往是拆東牆補西牆,為了防止坍縮而犧牲了模型本可以擁有的表達能力。

論文作者們觀察到,所有這些方法,不管是像素級的影片生成還是潛在空間的JEPA系列,本質上都還是在離散時間框架里打轉。它們沒有真正把"時間"當成一個連續變量來對待,而這恰恰是物理世界最基本的屬性。

PT-Flow:把動力學重新定義成一條速度場

那麼PT-Flow到底想做什麼?

它的核心想法是,與其把未來預測看成"猜下一幀長什麼樣",不如把它看成一個物理學裡經典的問題:給定初始狀態和一個描述系統如何變化的規律,求解未來任意時刻的狀態。

這個規律,數學上就是一個**常微分方程ODEWorld當AI學會用物理時間思考世界**

*常微分方程(Ordinary Differential Equation,簡稱ODE):描述某個量隨時間變化速率的方程,如果你知道某個時刻的狀態和它的變化速率(即速度),理論上可以通過對速度做時間積分,推算出任意時刻的狀態*

具體來說,論文設定一個壓縮後的潛在表示 zt,代表某個時刻 t 的狀態特徵。這裡的 t 不是第幾幀這種離散計數,而是從初始狀態算起、實實在在流逝的物理時間。模型學習的核心對象是一個速度場 vθ,它描述在潛在空間裡,狀態 zt 此刻正在以多快、朝哪個方向變化。

有了這個速度場,未來預測就變成了積分:從起點 z0 出發,沿著速度場一路"走"到時間 T,就得到了未來狀態 zT。這個過程可以用現成的數值積分工具(比如經典的四階龍格庫塔法,RK4)來完成,就像求解物理里的運動方程一樣。

這個思路和另一個近幾年很火的生成模型技術**流匹配(Flow Matching)**

*流匹配:一種生成模型訓練方法,通過學習一個從噪聲分布到數據分布的連續變換路徑(速度場),用ODE求解器生成樣本,被用於Stable Diffusion 3等模型*

在數學形式上很像,都是學一個速度場,都用ODE求解器來生成。但論文特別強調了兩者的本質區別:流匹配里的"時間"是一個人為構造的去噪進度,從純噪聲(t=0)走到真實數據(t=1),這個"時間"和現實世界的時鐘毫無關係。而PT-Flow里的"時間"就是貨真價實的物理時間,是影片裡兩幀之間真實流逝的那幾百毫秒。這個區別決定了PT-Flow可以支持很多流匹配做不到的事情,比如任意時間點的插值、甚至時間倒流。

要讓這套框架真正跑起來,還有兩個關鍵設計。

**動力學表徵解耦**

想解決的問題是這樣的:影片裡包含大量和"運動變化"毫不相關的資訊,比如桌子的木紋、牆壁的顏色、燈光的角度。如果強迫一個ODE去擬合這些靜態背景細節,就是在浪費模型的表達能力,而且這些靜態內容根本不滿足ODE該有的連續演化規律。

論文的做法是訓練一對編碼器和解碼器,都以初始狀態 s0 作為條件。編碼器 fdyn(st; s0) 只負責從當前狀態里提取"相對於初始狀態發生了哪些變化"這部分資訊,把這部分打包成一個乾淨的潛在表示 zt。解碼器 gdyn(zt; s0) 則反過來,拿著這個變化資訊加上原始的靜態背景 s0,重建出完整的當前狀態。

這就好比你要給朋友描述一部電影裡主角走過一條街的過程。你完全不需要每一幀都重新描述街道兩邊的建築、天空的顏色,這些從頭到尾沒變過。你只需要說"主角從路口走到了第三個門牌號",這句話本身就濃縮了變化的資訊,而街道背景這種靜態內容,你的朋友只要看第一幀就永遠記住了,不需要在每一句描述里重複交代。如果不做這個解耦,模型就得在每次預測里同時處理背景細節和動作變化,相當於每次說話都要把整條街重新描述一遍,既低效又容易把注意力耗散在無關緊要的地方。

**直接一階監督**

這是整篇論文裡我覺得最巧妙的一處設計。

監督速度場的傳統做法(也是JEPA系列的做法)是間接的:讓預測器預測出未來的潛在特徵,然後拿這個預測特徵去和真實的未來特徵做對比,算個誤差。這種方式的問題在於,編碼器和預測器是耦合在一起訓練的,編碼器完全可能為了讓這個誤差變小而作弊,把特徵編碼得極度簡單,這就是表徵坍縮的根源。

PT-Flow換了個思路。既然速度場描述的是潛在狀態對時間的導數(也就是變化率),那能不能直接算出"真實的變化率應該是多少",然後讓模型去擬合這個真實值,而不是去擬合"預測的未來狀態"?

論文用了一個數學工具叫**雅可比向量積**

*雅可比向量積(Jacobian-Vector Product,簡稱JVP):一種計算函數對輸入方向導數的技術,可以在不顯式構造完整雅可比矩陣的情況下,高效計算函數輸出關於輸入某個方向的變化率*

來實現這一點。簡單說,編碼器 fdyn 把原始狀態 st 映射成潛在表示 zt,這個映射關係是已知的、可微的。既然原始狀態的變化速率 st(可以直接從相鄰幀的差分里近似估算出來)是已知的,那麼通過鏈式法則,就能推出潛在表示的變化速率 zt,這個推導過程正是JVP在做的事情。

這樣一來,速度場的訓練目標就不再是"猜一個可能被作弊的未來特徵",而是"擬合一個由真實物理變化直接推導出來的速度值"。這個監督信號是硬邦邦的、無法被繞過的,編碼器沒辦法通過把特徵坍縮成一個常數來偷懶,因為一旦特徵是常數,它的變化率就是零,而真實的變化率顯然不是零,模型立刻就會在損失上暴露出來。

這就像考試從"寫論文讓老師主觀評分"變成了"做數學題,答案唯一確定"。前者存在討好評委、繞過真正學習的空間,後者答案是死的,你要麼真的算對了,要麼算錯了,沒有中間地帶可以耍花招。

論文還提到了一個有意思的細節:即便去掉這個監督信號里常用的**停止梯度**

*停止梯度(stop-gradient)操作:訓練技巧中一種阻止梯度流經某個分支的方法,常用於防止兩個相互依賴的網路陷入互相"合謀"的退化解,是SimSiam等自監督學習方法裡的經典設計*

技巧,PT-Flow依然能正常工作,這說明這套一階監督機制本身就自帶了防止退化的約束力,不需要額外補丁去防止模型偷懶。

ODEWorld的整體架構:把PT-Flow真正落地

有了PT-Flow這套理論框架,論文進一步把它實例化成一個完整可用的系統,也就是ODEWorld。

整個流水線的第一步,是用一個凍結的、預訓練好的**DINOv2**

*DINOv2:Meta AI發布的一種自監督視覺特徵提取模型,不需要人工標註數據就能學到高質量的圖像特徵表示,被廣泛用作各種下游視覺任務的骨幹網路*

編碼器,把原始的高維圖像觀測壓縮成一個特徵空間。這一步的好處是數值穩定性更好,直接在原始像素上估計速度會因為像素噪聲而抖動得很厲害。相應地,論文也訓練了一個專門的解碼器,把DINO特徵重新映射回圖像空間,用於最終生成影片畫面。

在DINO特徵空間之上,再疊加前面說的初始狀態條件編碼器和解碼器(用交叉注意力實現),提煉出高度緊湊的動力學潛在表示 zt。論文一個挺讓人意外的發現是,這個 zt 只需要一個token(也就是一個768維的向量)就足夠了,相比之下原始DINO特徵是16×16×768這麼大的一個張量。這說明影片裡真正和"動態"相關的資訊量,遠比原始像素資訊量小得多,絕大部分像素其實都是冗餘的靜態內容。

速度場本身則用一個極其輕量的三層MLP來實現,用**FiLM層**

*FiLM(Feature-wise Linear Modulation):一種神經網路調製技術,通過一個額外的輸入(這裡是時間資訊t)來動態調整網路中間層的縮放和偏移參數,從而讓同一個網路能根據不同條件產生不同行為*

把時間資訊注入網路。正因為這個速度場極其輕量,整個ODE積分過程的計算開銷也就變得非常小,這也是ODEWorld後面能實現"實時"級別推理速度的關鍵原因。

為了進一步提升數值穩定性,論文還做了幾個工程上的巧思。一個是把物理時間做了歸一化處理,讓訓練用的時間尺度大致落在0到1之間,避免不同任務時長差異導致的數值問題。另一個更細緻的設計是用**Savitzky-Golay濾波器**

*Savitzky-Golay濾波器:一種通過局部多項式擬合來平滑信號並估計導數的經典信號處理方法,相比簡單的高斯模糊或者直接差分,它能在平滑噪聲的同時更準確地保留信號本身的變化趨勢*

來估計真實的速度目標 st,而不是簡單粗暴地用相鄰兩幀相減除以時間間隔。這個細節看似不起眼,但論文的消融實驗證明它對最終效果有實打實的影響,原始數據里天然存在的抖動和噪聲,如果不做這層平滑處理,會直接污染整個訓練信號的質量。

潛在空間到底學到了什麼

理論說得再漂亮,也得看實際效果。論文裡有一組可視化實驗,我覺得特別能說明問題。

他們把ODEWorld學到的潛在空間和兩個對照組做對比:一個是原始的DINO特徵空間,另一個是一個"下一步預測"基線模型(一個典型的離散時間JEPA式模型)。通過PCA降維把軌跡畫在二維平面上(如論文圖2所示),結果非常直觀:ODEWorld學出來的軌跡明顯更加光滑,而DINO原始空間和離散預測基線的軌跡都充滿了鋸齒狀的抖動。

這個平滑性不是白來的好處,而是那套一階速度監督機制的直接結果,因為監督信號本身經過了Savitzky-Golay濾波處理,天然就帶有平滑的性質,模型學出來的潛在流形也就繼承了這種平滑。

但光平滑還不夠,如果為了追求平滑把所有語義資訊都抹掉了,那也沒有意義。論文特別指出,ODEWorld的潛在空間雖然更平滑,但整體的拓撲結構和原始DINO空間保持了高度相似,主成分和幾何結構都得到了保留。這意味著模型不是靠"過度正則化、把空間拉直"來偷懶式地實現平滑,而是真正學到了動態本身應有的連續性質,同時沒有丟失原本的語義豐富度。

這就好比給一段抖動的手機錄像做防抖處理。差的防抖算法會把畫面處理得死板僵硬,仿佛所有細節都被磨平了;好的防抖算法則是在去除手抖噪聲的同時,儘可能保留畫面原本該有的層次感和細節。ODEWorld想要的正是後者。

緊接著,論文還可視化了速度場本身(圖3),在PCA空間裡畫出一個網格,每個網格點上畫一個箭頭表示該處的瞬時速度。以一個"打開抽屜"的任務為例,可以清楚看到,當機器人手臂靠近把手時,速度場的箭頭長度(代表速度大小)明顯在變短,接近零;而當機器人開始真正拉動抽屜時,速度又重新增大。這說明模型不只是學到了"該往哪個方向走",還學到了"這個階段動作該有多快"這種更精細的時序資訊,這正是連續動力學建模比離散幀預測更有優勢的地方。

雙向預測和任意時間解析度:連續性帶來的額外饋贈

如果說前面講的都是ODEWorld"補齊"了離散模型的短板,那接下來這部分才是真正體現連續建模獨特價值的地方。

因為整個預測過程本質上是對一個常微分方程做積分,而ODE有一個數學上天然的性質:你可以正著積分,也可以反著積分。也就是說,只要把速度場的符號反過來(vτ 變成 –vτ),模型就能生成物理上合理的"倒放"影片。

論文的圖4展示了這個能力,機器人抓取物體的動作,反向積分後能生成一個看起來完全符合物理規律的倒放版本,而不是簡單粗暴地把正向生成的幀倒序排列。這個細節其實很重要,因為它驗證了模型學到的確實是某種底層的連續物理規律,而不是死記硬背了訓練集裡見過的正向模式。

這就好比你錄了一段扔球然後接住的影片,如果直接把影片倒放,你會看到球從手裡"跳出去"、再"飛"到空中落下的詭異畫面,這在物理上是不連貫的,因為原始的離散幀序列本身就沒有編碼任何"底層運動方程",倒放只是簡單的順序顛倒。但如果你真正理解了拋物運動的物理公式,你完全可以反向代入時間變量,算出一個物理上完全自洽的"倒放"軌跡,球會以合理的加速度和軌跡落回手中。ODEWorld做的正是後者:它學到的不是像素排列的順序規律,而是背後那條連續的速度場方程。如果不這樣設計,用離散的下一幀預測模型,你壓根沒辦法定義"反向預測"這個操作,因為模型從頭到尾都只學過"從幀A預測幀A+1"這一個方向。

除了雙向預測,連續時間建模還帶來了另一個實用能力,任意時間解析度生成。圖5展示了這一點:模型可以在任意想要的時間點(比如τ=0.03、0.06、0.09)生成對應的畫面,而不受訓練數據幀率的限制。更有意思的是,當訓練數據本身被人為降採樣(比如只保留原始幀率的三分之一)時,ODEWorld依然能夠生成中間缺失的、時間上連貫的幀,也就是所謂的時間超解析度能力。這對於處理現實中經常遇到的不規則採樣數據(傳感器掉幀、採集頻率不一致等)非常有實用價值,而離散模型在這種場景下基本無能為力,因為它們的架構設計本身就假定了輸入是等間隔的固定序列。

硬核數據對比:效果和速度雙贏

說了這麼多設計理念,最終還是得看真實的實驗數字。

論文在LIBERO(一個包含130個任務、6500條人類遠程操作演示的機器人仿真基準)和AgiBot-World(一個真實世界機器人操作數據集,約3萬條軌跡)上做了大量測試。

在影片生成質量對比上,論文選取了兩個有代表性的基線:**LDP**

*LDP(Latent Diffusion Planning):一種基於變分自編碼器潛在空間做規劃的方法,通過擴散模型在壓縮後的VAE特徵空間裡生成未來軌跡,再用解碼器還原成圖像*

和前面提到的**V-JEPA 2**

*V-JEPA 2:Meta發布的影片版JEPA模型,聯合訓練一個表示編碼器和一個潛在預測器,能夠支持影片理解、預測和規劃任務*

從下面的表格能看出結果的差距:

| 方法 | 短片段(16幀) PSNR↑ | 短片段 LPIPS↓ | 短片段延遲(秒)↓ | 長片段(64幀) PSNR↑ | 長片段 LPIPS↓ | 長片段延遲(秒)↓ |

|---|---|---|---|---|---|---|

| LDP | 16.33 | 0.489 | 1.104 | 16.27 | 0.461 | 3.953 |

| V-JEPA 2 | 17.60 | 0.157 | 0.123 | 16.47 | 0.166 | 0.619 |

| **ODEWorld** | **20.53** | **0.109** | **0.030** | **19.46** | **0.134** | **0.072** |

這裡PSNR是像素級的還原質量指標(越高越好),LPIPS是更貼近人眼感知的畫質差異指標(越低越好)。可以看到ODEWorld在兩項質量指標上都是最好的,而且在長達64幀的長視野預測里依然能保持高質量,沒有出現明顯的畫質衰減,這在離散幀預測模型里通常是個大難題,誤差會隨著預測步數累積滾雪球式地放大。

真正讓人印象深刻的是延遲數據。對於64幀的長片段生成,LDP需要將近4秒,V-JEPA 2需要0.619秒,而ODEWorld只需要0.072秒,比LDP快了近55倍,比V-JEPA 2快了約8.6倍。這個速度優勢直接來自前面提到的架構設計:動力學表徵被壓縮到極致緊湊的單token潛在空間,速度場又是個輕量的三層MLP,整個ODE積分過程的計算負擔被壓到了最低。

在機器人策略學習任務上,論文在LIBERO-LONG(一個專注長時序複合操作任務的子基準,包含10個需要多步驟連續完成的任務)上測試了三種不同的引導範式:用速度場直接引導、用單個子目標引導、用一串連續子目標引導。結果如下:

| 方法 | 平均成功率 |

|---|---|

| GLCBC(基礎行為克隆) | 78.0% |

| SuSIE | 76.3% |

| Seer | 78.6% |

| VPP | 81.0% |

| ODEWorld(速度引導) | 82.3% |

| ODEWorld(單子目標) | 82.6% |

| **ODEWorld(連續子目標)** | **83.6%** |

三種ODEWorld變體全部超過了所有基線方法,其中連續子目標引導範式效果最好。論文的解釋是,ODEWorld生成的軌跡在時間維度上足夠精準連貫,能提供密集且不偏離任務目標的引導信號,這對下游策略學習是實打實的幫助。

更有說服力的是真實機器人實驗。論文在一台雙臂協作的AgileX機器人上,用**X-VLA**

*X-VLA:一種可擴展的跨本體視覺語言動作模型,通過軟提示Transformer架構實現對不同機器人形態的統一策略學習*

作為策略骨幹,測試了蝦放入鍋、滑鼠打包、筆插入、雙臂物品重排這四個任務,結果顯示,加入ODEWorld生成的潛在子目標引導後,平均成功率從55%直接提升到了80%,提升幅度整整25個百分點。這個提升幅度放在真實機器人任務里是非常顯著的,說明ODEWorld提煉出的動力學表示確實能給策略學習提供有效的、可遷移到真實世界的規劃資訊。

消融實驗揭示的設計必要性

論文還做了一系列細緻的消融實驗,來驗證每個設計選擇是否真的必要,而不只是錦上添花。

去掉"動力學表徵解耦"這個設計後會發生什麼?論文的圖7顯示,學出來的潛在軌跡變得明顯抖動和不規則,而定量表格顯示,雖然PSNR略微升高了一點(20.65對比20.53),但LPIPS明顯變差(0.127對比0.109),推理速度也慢了將近4.6倍(幀率從33.67掉到7.30)。論文對這個PSNR反常升高做了解釋:PSNR這個指標本質上是基於均方誤差的像素級對比,對大面積的靜態背景特別敏感,如果模型不做解耦,反而會把大量精力花在忠實還原這些靜態背景上,從而拉高PSNR,但這掩蓋不了它在時序一致性和感知質量上的真實劣勢。這提醒我們一件事:單一指標有時候會講一個不完整的故事,得多個角度一起看才可靠。

去掉"一階速度監督",換成傳統的多步一致性損失會怎樣?結果更加戲劇化,短片段預測質量直接從PSNR 20.53暴跌到12.71,長片段甚至完全無法生成有意義的結果。論文分析認為,這是因為一致性損失把"重建"和"預測"這兩個目標強行耦合在了一起,而且由於ODEWorld的目標本質上是"擬合某一個可行的ODE"而非"擬合唯一確定的物理方程",這個任務本身存在一定的欠定性,強行耦合的目標反而讓優化陷入了困境。這個消融結果算是相當有說服力地證明了,直接一階監督不是錦上添花的優化技巧,而是這套架構能跑通的關鍵前提。

另外幾組消融也挺有意思:換成不同的視覺骨幹網路(LIV、SigLIP 2),效果差距都不大,說明這套框架對特徵提取器的選擇有一定的魯棒性;把潛在token數量從1個增加到4個,效果幾乎沒有提升,進一步印證了單token已經足夠承載動態資訊這個判斷;針對語言指令這種更常見的目標條件形式,論文訓練了一個輕量的目標圖像預測器來把語言轉換成視覺目標,測試顯示用預測出的目標圖像和用真實目標圖像的效果幾乎一致,說明這套框架完全可以自然地擴展到語言指導的場景,不需要依賴昂貴的目標圖像輸入。

論文還專門用**RankMe**

*RankMe:一種通過計算特徵表示矩陣的有效秩來衡量自監督表示質量的方法,有效秩越高,說明特徵空間的維度利用越充分,越不容易發生表徵坍縮*

這個指標去量化驗證了表徵坍縮問題確實被規避了。數據顯示,ODEWorld的768維潛在表示在不同規劃時長下有效秩都維持在400以上,明顯高於V-JEPA 2(203.7)和DINOv2原始特徵(376.1)。這算是給"PT-Flow天然規避表徵坍縮"這個說法找到了一個可以量化的證據。

局限性:論文沒有迴避的地方

值得一提的是,論文自己也坦誠列出了幾個尚未解決的局限。

首先是訓練規模的問題,相比動輒用數百萬甚至更大規模影片數據訓練的大型影片生成模型,ODEWorld目前只在兩個機器人數據集上訓練,規模確實偏小,這主要是算力資源的限制,作者也表示未來可以考慮擴大模型和數據規模。

其次,DINOv2這個骨幹網路本身是為單幀圖像設計的,沒有專門考慮時序一致性,這可能導致提取的特徵本身帶有一定噪聲。論文用Savitzky-Golay濾波器做了一定程度的補救,但這終究是個"打補丁"式的方案,未來如果換成天然帶時序一致性設計的編碼器,或者在訓練過程中聯合微調DINO本身,效果可能會更好。

最後,當前版本的ODEWorld主要聚焦在影片生成層面,還沒有把動作條件直接整合進這套框架里。這意味著它目前更多是作為一個"世界理解和規劃引擎",為下游策略學習提供子目標引導,而不是一個端到端直接輸出動作的完整系統。論文提到未來可以考慮把動作條件注入到預訓練好的ODEWorld中,進一步釋放它在控制任務上的潛力。

寫在後面

讀完這篇論文,最讓我意外的一點其實是那個"單個token就夠了"的發現。

我們總覺得要描述一段影片裡的動態變化,應該需要很多資訊才夠,畢竟畫面里有那麼多物體、那麼多細節在同時變化。但ODEWorld的實驗結果說明,真正承載"運動本質"的資訊量,可能遠比我們直覺認為的要小得多。一個768維的向量,就足以概括機器人手臂從A點移動到B點這整個過程里所有值得關注的動態資訊。

這讓我想起一個不完全對應但精神上相通的類比:物理學裡描述一個物體的運動,其實只需要幾個變量,位置、速度、加速度,你不需要記錄它經過的每一粒塵埃、每一道反光。ODEWorld某種程度上是在用深度學習的方式,重新發現了這個"少即是多"的規律,而且是在沒有任何顯式物理先驗的情況下,純靠數據驅動學出來的。

還有一點值得琢磨的是,論文裡那個反向預測的實驗其實提出了一個挺深的問題:如果一個模型真的理解了某個過程的動力學規律,它應該天然具備"倒著推演"的能力,就像你如果真懂牛頓力學,給你末態你也能算出初態。這某種程度上可以當作檢驗一個AI系統是不是真的"理解"了某個物理過程,還是只是在記憶訓練數據里見過的模式的一個判據。這個思路會不會能推廣到其他領域,比如讓語言模型也具備某種"可逆推理"的能力,檢驗它是不是真懂了某個邏輯鏈條,還是只是背下了一個固定的答案模式?這個問題我目前沒有答案,但覺得值得繼續想下去。

Q&A

Q1:ODEWorld是什麼,它和普通的影片生成AI有什麼不同?

A:ODEWorld是清華AIR和UC伯克利BAIR聯合提出的一種連續時間世界模型,核心區別在於它不把時間切成一幀一幀的離散片段,而是學習一個連續的潛在速度場,用常微分方程描述狀態如何隨物理時間演變,未來預測因此變成了數學上的積分運算,而不是逐幀猜測。

Q2:PT-Flow是怎麼解決表徵坍縮這個老問題的?

A:PT-Flow採用直接一階監督策略,通過雅可比向量積把真實狀態的變化速率直接投影到潛在空間,得到一個硬性的、無法被繞過的速度監督信號,編碼器沒辦法靠把特徵坍縮成常數來偷懶,因為常數的變化率永遠是零,這和真實的動態變化速率對不上,從而從根本上規避了傳統JEPA架構容易出現的表徵坍縮問題。

Q3:ODEWorld在實際機器人任務上表現怎麼樣?

A:在LIBERO-LONG長時序任務基準上,ODEWorld引導的策略平均成功率達到83.6%,超過了多個主流基線方法;在真實世界的雙臂機器人實驗中,加入ODEWorld生成的潛在子目標引導後,四個操作任務的平均成功率從55%提升到了80%,同時它的推理延遲也遠低於對比模型,長影片生成速度比部分基線快了50多倍。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新