這項由北京大學領導的研究成果以預印本形式發布於arXiv,編號為arXiv:2608.01127,發布時間為2026年8月4日。研究團隊開源了完整的代碼、訓練好的模型權重以及所有實現細節,希望將這項技術的門檻降低到普通研究者都能參與的水平。
當你玩電子遊戲時,遊戲引擎會根據你按下的每一個按鍵,實時計算出下一幀畫面應該是什麼樣子。角色走到牆邊會被擋住,扔出去的物體會按照物理規律飛行,光線會隨著時間變化而改變。這種"根據當前狀態和你的操作預測接下來會發生什麼"的能力,正是所謂影片世界模型
的核心。北京大學的研究團隊把這個問題搬到了AI領域,並且想辦法讓這件事變得人人可做——這就是MiniWorld(迷你世界
)項目的由來。
一、當AI需要學會"看見未來"
要理解影片世界模型到底是什麼,可以用一個很直觀的場景來說明。假設你是一個機器人管家,你的主人給了你一張廚房的照片,然後告訴你"向前走兩步,然後向左轉"。一個普通的影片生成AI可以生成一段看起來流暢漂亮的廚房影片,但它不一定真的理解"向左轉之後,原本在你右邊的冰箱應該出現在你左邊"這件事。而影片世界模型要做的,恰恰是這種對空間、物理規律和動作結果的真實理解。
普通影片生成模型關注的是畫面好不好看、動作流不流暢,而影片世界模型關注的是世界規律是不是對的。這個區別就像畫一幅漂亮的風景畫和真正理解地理地貌之間的差距。前者只要視覺效果好就行,後者要求你真正懂得山是怎麼形成的、河流為什麼這樣流淌。
近年來,谷歌DeepMind的Genie 3、英偉達
的Cosmos、以及國內多家機構推出的Matrix-Game、MAGI-1、SkyReels-V2等系統,都展示了大規模影片世界模型的驚人潛力。這些系統可以用於機器人訓練、自動駕駛仿真、交互式遊戲場景生成等領域,前景十分廣闊。
然而,這些系統有一個共同的問題:它們太貴了。大多數方法的思路是拿一個已經預訓練好的大型影片生成模型,然後通過各種複雜的後期調整把它改造成具有世界模型能力的系統。這個過程不僅需要強大的計算資源,還面臨一個根本性的矛盾——這些預訓練模型在學習時是"雙向看"的,也就是說它們在處理一段影片時可以同時看到過去和未來的幀;但實際使用時,世界模型需要"單向流",只能看到過去,然後預測未來。這種訓練和使用之間的不一致,就像一個學生平時做題時可以翻答案,考試時卻不能翻,結果考出來的成績自然打折扣。
北京大學的團隊決定走一條不同的路:從零開始訓練,完全按照"只看過去、預測未來"的方式設計整個系統,讓訓練和使用完全一致,同時把計算成本壓縮到一台配有八塊GPU的伺服器就能在幾天內完成訓練。
二、像搭積木一樣構建AI的時間感知
MiniWorld的核心架構可以用"積木式時間隧道"來理解。把一段影片想像成一列火車,每節車廂是若干幀畫面的組合,叫做"塊"(chunk)。MiniWorld處理影片的方式是:在同一節車廂內,所有幀可以互相參考、雙向交流;但跨越車廂時,資訊只能從前面的車廂流向後面的車廂,不能反向。這就叫做"塊狀因果注意力"。
這種設計非常聰明。在一小段時間內,畫面的各個部分確實可以互相影響——比如一個揮動的手臂,手腕和手指的運動是緊密關聯的,讓它們相互參考能產生更自然的效果。但對於跨越較長時間的預測,必須保持嚴格的單向流動,這樣才能在真實使用時像流水一樣不斷向前生成,而不需要等所有未來幀都準備好才能開始。
支撐整個系統的數學基礎叫做"整流流"(Rectified Flow),這是一種生成AI常用的技術,屬於更廣泛的"流匹配"(Flow Matching)框架。用一個簡單的類比來說明:你有一罐純淨的沙子(代表目標影片幀),也有一罐被攪亂的沙子(代表隨機噪聲)。整流流要做的,就是學會一條從亂沙到淨沙的最直最短的路徑。在生成圖像時,從一罐亂沙出發,沿著這條路徑走,就能得到乾淨的影片幀。所有的訓練和推理都在一個預先訓練好的影片VAE(可以理解為一種影片壓縮編解碼器)的"潛在空間"中進行,這樣可以大大減少計算量,因為你操作的是壓縮後的緊湊表示,而不是原始的高解析度像素。
動作資訊是這個系統里另一個關鍵角色。對於機器人操作任務,每一幀影片都對應一個7維的動作向量,描述機械臂末端在三維空間中如何移動以及夾爪的狀態。對於相機移動任務,則是用數學方式描述相機的位置和朝向。MiniWorld將這些動作資訊通過一個專門設計的"動作編碼器"轉化為兩種信號:一種是"語義嵌入",告訴模型"現在發生了什麼樣的動作";另一種是"調製向量",直接微調模型內部每一層的計算方式。這種"雙軌並行"的設計,使得動作條件能夠既從全局層面、又從每個細節層面影響生成結果,比簡單地把動作資訊塞進輸入層要有效得多。
為了讓這種影響在不同層之間既靈活又高效,研究團隊還引入了一種叫做"AdaLN-LoRA"的技術。通俗來說,模型的所有層共用一套基礎的調製邏輯,但每一層可以在此基礎上學習一個輕量級的個性化微調。打個比方,這就像一家連鎖餐廳:總部提供統一的基礎配方,每家門店可以根據當地口味做少量調整,但不需要每家門店都從頭研發一套完整的配方體系。這樣既保證了一致性,又保留了靈活性,而且額外的參數開銷非常小。
三、給時間加上"越往後越模糊"的噪聲規則
MiniWorld在訓練方式上借鑑了一種叫做"擴散強制"(Diffusion Forcing)的思路,並在此基礎上做了重要改進。理解這個部分,需要先明白一個問題:在訓練時,模型同時看到一段影片的多個塊,每個塊被加了不同程度的噪聲。但噪聲怎麼分配,大有講究。
研究團隊制定了一條核心規則:沿著時間方向,噪聲只能越來越多,不能越來越少。用數學符號表示就是τ? ≤ τ? ≤ ... ≤ τ?,其中τ=0表示完全乾淨的數據,τ=1表示完全是隨機噪聲。這條"單調遞增"的約束,直接反映了現實世界的認知規律:過去發生的事情已經確定,未來發生的事情越來越不確定。已經生成的影片塊是"乾淨"的,還沒生成的塊處於"充滿可能性的模糊狀態"。
這條規則帶來了兩個好處。第一,它大大縮小了模型需要應對的"噪聲組合方式"的數量,讓訓練更穩定、收斂更快。第二,它讓訓練時的狀態和實際推理時的狀態更加吻合,減少了"練習時和考試時狀態不一樣"的問題。
為了讓噪聲分配更加科學,研究團隊設計了一種叫做"面向塊的概率傳播調度器"(CoPP,Chunk-oriented Probability Propagation)的方法。它的工作方式是:先隨機選一個"錨定塊",從一個特定的概率分布中給它分配一個噪聲級別;然後向兩側擴展,保證整體滿足單調遞增的約束,同時讓每個塊的噪聲級別都有機會覆蓋從低到高的整個範圍。這樣,模型既能看到"從接近乾淨到接近純噪聲"的各種狀態轉變,又不會讓某些噪聲組合被過度採樣而另一些被忽視。
此外,MiniWorld還支持兩種上下文模式的混合訓練。一種是"圖像轉影片"模式:只有第一幀是乾淨的,第一個塊里其餘的幀都被加了噪聲,相當於給模型一張起始圖片,讓它生成後續影片。另一種是"影片轉影片"模式:第一個完整的塊都是乾淨的,相當於給模型一小段起始影片,讓它繼續生成後續內容。訓練時隨機混合這兩種模式,使得同一個模型在推理時不需要任何改動就能支持這兩種生成場景。
四、分兩階段"打怪升級"的訓練策略
即便有了上面這些設計,如何高效地訓練出能處理長影片的模型,仍然是一個工程難題。MiniWorld採用了一種兩階段的訓練策略,可以用"先練短跑、再練馬拉松"來形容。
第一階段,模型在21幀和46幀的短影片片段上訓練,使用較大的批次大小(64)和較高的學習率(1×10⁻³),讓模型快速而高效地學會局部的動作-狀態轉換關係。短影片計算量小,可以用更多樣本覆蓋更廣泛的場景,讓模型打好基礎。
第二階段,模型在125幀直至253幀的長序列上繼續訓練,批次大小縮小到8,學習率從0緩慢預熱到2×10⁻³。這個階段不改變訓練目標,只是把影片拉長,讓模型見識到更長的因果鏈條:一個動作在很久之後會造成什麼影響,過去的歷史資訊如何跨越更長的時間發揮作用。
第二階段還引入了一個叫做"時間步偏移"的技巧:對噪聲級別的採樣分布做一個非線性變換τ = sτ/(1+(s-1)τ),其中s是一個根據影片序列長度自動確定的參數。這個變換會重新分配噪聲級別的採樣密度,讓模型在面對更長序列時,能更多地關注那些對大規模模型特別重要的中等噪聲級別,從而提升優化效果。這項技術在Stability AI的SD3等大型圖像生成模型中被驗證有效,MiniWorld將其遷移到了長影片生成場景。
模型規模方面,MiniWorld提供了從0.12B(1.2億參數)到3B(30億參數)的五個版本,分別是MiniWorld-B、MiniWorld-L、MiniWorld-0.5B、MiniWorld-1B和MiniWorld-3B。它們共用完全相同的架構設計和訓練接口,只在層數、隱藏維度和注意力頭數量上有所差異。主要實驗結果使用MiniWorld-1B(28層,隱藏維度1536,12個注意力頭,共約10億參數)完成。
五、讓AI像流水一樣持續生成影片
訓練完成之後,如何在實際使用時高效地生成長達數百幀的影片,是另一個關鍵挑戰。MiniWorld的推理系統可以用"流水線工廠"來理解。
工廠的核心思路是:把已經生成好的影片塊"鎖定",放入一個"滾動KV緩存
"中永久保留其關鍵資訊;同時,工廠的生產車間(活躍去噪窗口)只處理最近的若干個正在生成中的塊。隨著生產不斷向前推進,新的塊進入車間,完成的塊退出車間並存入緩存,車間的大小始終保持不變,計算量也因此保持穩定,無論最終要生成多長的影片。
這套機制的重要組成部分之一是"流水線式異步去噪"。在同一個時刻,活躍窗口內可以有多個處於不同噪聲級別的塊同時被處理:最靠近歷史的塊已經幾乎乾淨,最靠近未來的塊還充滿噪聲。它們各自以不同的步伐向"乾淨"的方向前進,就像流水線上不同工序同時運作,而不是一個工序全部完成才開始下一個。這樣做的好處是吞吐量大幅提升,第一個生成塊的延遲也顯著降低。
另一個精妙的設計是"RoPE重新偏移"。模型內部用一種叫做旋轉位置編碼(RoPE)的技術來感知時間位置,就像給每一幀影片打上時間戳。隨著影片不斷向前生成,時間戳的數字會越來越大,超過模型在訓練時見過的範圍,就可能出現"從未見過這個時間戳"的問題。MiniWorld的解決方案是:每當緩存里最老的塊被丟棄,就把所有保留下來的歷史塊的時間戳整體向前挪,讓滑動窗口重新從"第0幀"開始計數。由於RoPE只影響鍵(Key)不影響值(Value),只需更新鍵的編碼即可,操作高效且不破壞塊之間的相對時間關係。初始的那一幀"錨點"則永遠固定在第0位,不參與這個重新編號的過程。
六、在機器人和室內場景兩個舞台上的表現
研究團隊在兩個真實世界的數據集上測試了MiniWorld的能力,這兩個數據集分別代表了截然不同的"世界規則"。
第一個是DROID數據集,裡面記錄了大量機器人在真實環境中操作物體的影片,每一幀都對應機械臂的7維動作向量。這是典型的"給我看動作,預測會發生什麼"的場景,考驗模型對物理交互的理解。影片被縮放到240×320像素,編碼後的潛在表示使用Wan2.2 VAE,該VAE在時間維度壓縮4倍、空間維度壓縮16倍,並使用48個潛在通道。
第二個是RealEstate10K數據集,裡面是大量室內場景的影片,每一幀都標註了精確的相機位置和朝向。這個數據集沒有機器人,沒有物體交互,考驗的是模型對相機運動的理解和三維空間一致性。相機參數通過按照NeRF約定轉換成每像素的射線方向,再用15個正弦頻率帶編碼,每幀產生180通道的空間條件資訊,四幀合併後得到與每個潛在幀對齊的720通道條件。
評測的基準是一個"雙向短影片基線":用一個傳統的雙向影片生成模型,在固定長度的29幀滑動窗口內做預測,每次預測完就向後滑動。這代表了當前最主流的、改造預訓練模型的做法。評測指標覆蓋了畫面外觀質量、動態程度、幾何一致性、VLM語言模型評分的功能性質量以及幀級保真度等多個維度,每個大類下面還有多個細分指標。所有結果以基線為1進行歸一化,誤差類指標取倒數使得"越大越好"的判斷方向統一。
在DROID上,MiniWorld-1B進行253幀流式推理的結果令人印象深刻。軌跡準確性(衡量機械臂運動是否符合輸入動作)提升了249%,深度準確性(衡量三維幾何重建的準確性)提升了238%,LPIPS感知相似度指標(數值越低越好,這裡取倒數顯示)提升了216%,SSIM結構相似度提升了125%。外觀類指標提升了26%到82%,VLM語言模型評判分數提升了63%到78%。這些數字背後的含義是:MiniWorld不只是讓每一幀看起來更好看,而是真正理解了機器人的動作會帶來什麼樣的幾何變化,保持了更長時間的時空一致性。
在RealEstate10K上,提升幅度相對溫和,但同樣覆蓋多個維度:光度平滑性提升89%,深度準確性提升55%,主體一致性提升50%,背景一致性提升46%,透視性提升46%,PSNR峰值信噪比提升34%,SSIM提升19%,LPIPS提升27%。這說明同一套流式架構,從有物理交互的機器人操控場景,遷移到純相機運動的室內場景,都能帶來穩定可靠的提升,而不是只在某個特定數據集上有效。
七、通過一系列對照實驗驗證設計選擇
研究團隊對推理階段的多個關鍵參數進行了系統性的消融實驗,即"其他條件不變、只改一個因素"的對照測試,逐一驗證每個設計選擇的必要性。
關於分類器自由引導(CFG)的作用:開啟CFG後,平均指標提升約5.5%,外觀類提升9.9%,動態類提升11.8%,而幀級保真度幾乎不變。這說明CFG主要作用是提升視覺質量的"精緻感",對精確還原具體幀內容的影響有限。它像是一個畫面質感的旋鈕,可以根據需求靈活調整。
關於生成影片長度的影響:把生成影片從253幀延長到381幀,外觀類和動態類指標分別保持在94%和96%,說明模型基本保持了穩定;但幾何、VLM質量和幀級保真度指標下降更明顯。這表明隨著生成時間的拉長,累積誤差在幾何精度和整體感知質量方面的影響要大於對畫面外觀和運動流暢性的影響。
關於在線去噪窗口大小的影響:把活躍窗口從32塊縮減到8塊並搭配滾動KV緩存,各類指標幾乎沒有變化——外觀略有提升,動態穩定,幾何、VLM和保真度在完整窗口的幾個百分點以內波動。這個結果證明了滾動KV緩存的核心價值:只要把已完成的塊正確緩存起來,小窗口可以達到大窗口的效果,同時計算量大幅降低。
關於KV緩存大小的影響:在固定64幀推理長度、8個活躍塊和1個錨點幀的條件下,把緩存從24塊減到12塊幾乎看不出差別,減到6塊也只有個位數百分比的變化。外觀和動態類指標始終在24塊參考值的1%以內。這說明在這個推理長度下,模型並不需要保留很長的歷史來維持質量,只需要足夠的近期上下文即可。
關於錨點幀數量的影響:在24塊KV緩存的條件下,從0個錨點變為1個或2個錨點,外觀和動態指標略有下降,VLM質量和語義一致性類指標略有提升,軌跡準確性則隨錨點增多略有下降。綜合來看,錨點的作用更接近"全局語境的穩定器",而不是提升質量的主要來源。真正帶來顯著提升的,是滾動KV緩存流式推理機制本身。
在擴展性方面,研究團隊在RealEstate10K上對比了0.5B、1B和3B三個規模的模型,所有指標隨模型規模單調遞增。到了3B規模,相比0.5B,動態程度提升22%、深度準確性提升18%、圖像質量提升14%、光流分數提升12%。動態和幾何方面的提升幅度大於外觀,說明擴大模型規模主要強化的是運動建模和三維一致性能力。
在推理效率方面,測試結果非常直觀。使用32塊完整窗口推理時,整體輸出幀率為3.31幀/秒,第一塊的生成延遲高達74秒;切換到8塊活躍窗口加滾動KV緩存後,輸出幀率提升到7.29幀/秒(提升2.20倍),第一塊延遲降至4.86秒(降低15.2倍)。這個提升完全來自DiT計算量的減少:DiT吞吐從0.41塊/秒提升到0.91塊/秒,而VAE吞吐在兩種設置下都維持在約15.2塊/秒。換句話說,VAE編解碼從來不是瓶頸,DiT的注意力計算才是,而滾動KV緩存正好解決了這個問題。
歸根結底,MiniWorld想說明的是:做一個能穩定運行、訓練和推理自洽、計算代價合理的影片世界模型,並不一定需要頂級機構才有的超算集群和私有數據集。一套清晰的設計思路加上嚴格的工程實現,就可以在學術預算內實現有競爭力的結果。這個框架不是要取代那些大規模商業系統,而是想成為研究者們可以方便使用、自由改造的實驗平台,讓更多人可以研究那些真正有趣的科學問題:AI怎樣建立長期記憶?如何減少越來越長的生成序列中誤差的積累?怎樣讓訓練目標和推理過程更緊密地對齊?當這些問題不再被巨大的計算門檻擋在門外,研究的進展或許會快很多。研究團隊已將完整代碼、模型權重和實現細節全部開源,感興趣的讀者可以通過arXiv編號2608.01127找到這篇論文,進一步探索這個方向。
Q&A
Q1:MiniWorld影片世界模型和普通影片生成模型有什麼區別?
A:普通影片生成模型主要關注畫面是否好看、動作是否流暢,但不真正理解物理規律和動作後果。MiniWorld這類影片世界模型則需要真正理解"向左轉之後冰箱會從右邊移到左邊"這樣的空間邏輯,能根據機器人動作或相機移動預測出符合真實物理規律的未來畫面,主要用於機器人訓練、自動駕駛仿真等需要理解世界動態的場景。
Q2:MiniWorld訓練需要多少算力?
A:MiniWorld的一個核心目標就是降低計算門檻。根據論文介紹,完整的MiniWorld模型(包括0.5B到1B參數規模)可以在一台配備8塊GPU的單機伺服器上,在數天內完成從零開始的全流程訓練。這與那些需要數百乃至數千塊GPU的大型商業世界模型系統相比,成本差距極大,普通高校或中小研究團隊具備可行性。
Q3:MiniWorld的滾動KV緩存是怎麼讓長影片生成變快的?
A:傳統方法生成長影片時,每生成一個新的片段都需要重新處理所有歷史幀,計算量隨影片長度線性增長。MiniWorld的滾動KV緩存把已完成的影片塊的關鍵資訊儲存起來,新塊只需參考緩存中的摘要資訊,不需要重新計算歷史。活躍處理窗口的大小固定不變,無論影片多長,計算量都保持穩定。實測顯示,這使輸出幀率從3.31提升到7.29幀/秒,第一塊生成延遲從74秒降至4.86秒。






