宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

World in World:一段影片,怎麼變成一整個可以自由探索的世界

2026年10月01日 首頁 » 熱門科技

你有沒有想過,一段普通的手機拍攝影片,其實藏著一整個沒被看到的世界?

鑲嵌在畫面之外的街角、人物背後的建築側面、鏡頭沒掃到的天空角落,這些內容明明存在,卻被攝像機的取景框永遠鎖死了。你只能看導演給你的那個角度,除此之外什麼都看不見。

這篇論文要解決的,就是這個"鎖死"的問題。研究團隊來自西湖大學AGI LabWorldinWorld一段影片怎麼變成一整個可以自由探索的世界,他們做了一個叫World in WorldWorldinWorld一段影片怎麼變成一整個可以自由探索的世界(簡稱WiW)的系統,核心目標是:給你一段錄好的影片,讓你可以像玩遊戲一樣,自由挪動攝像機,從任何角度重新"觀看"這段已經發生過的事件,同時畫面里的人物動作、場景變化,都要跟原影片保持一致。

這事聽起來簡單,實際做起來極其棘手。

先搞清楚,這件事難在哪

要理解這個問題的難度,得先明白當前的影片世界模型WorldinWorld一段影片怎麼變成一整個可以自由探索的世界是怎麼工作的。

影片世界模型:一種能夠根據用戶操作(比如移動攝像機方向)不斷生成後續畫面的AI系統,區別於傳統那種"給個文字就吐出一段固定影片"的生成模型,它是持續互動的,你動一下,它就跟著生成新的畫面

問題是,這些世界模型大多是在"憑空造世界"的場景下訓練的:你給一張初始圖片,它就自己往後生成,內容是模型腦子裡想出來的,不需要跟任何真實錄像對齊。但現在我們要做的完全不同,我們手裡有一段真實拍攝的影片,裡面的人物動作、事件走向都是確定的,新生成的畫面必須和這段"歷史"保持同步,不能瞎編。

這就好比你在看一場籃球比賽的直播回放,導播突然想換個機位重新播放剛才那個三分球,新畫面里球員的跑動軌跡、投籃時機必須跟剛才發生的完全一致,不能因為換了機位就讓球員凌空轉了個圈。這個"必須跟真實事件對齊"的約束,是普通世界模型完全沒考慮過的。

研究者列出了四個必須同時滿足的要求。生成的畫面得跟原影片的事件進度保持同步;得把原影片裡觀察到的內容擺在新視角該在的位置上;攝像機大幅度轉動後,會露出原影片完全沒拍到的區域,這些區域得靠AI合理"編"出來,不能穿模;鏡頭如果轉回之前已經"生成過"的角度,應該能認出這是同一個地方,不能每次都生成不一樣的內容。

在這篇論文出現之前,行業里的做法基本是給每一種控制需求單獨訓練一個模組。想要攝像機控制?訓一個攝像機條件模組。想要參考源影片重新拍攝?再訓一個專門吃影片輸入的分支。這種做法有個明顯的弱點:每加一種新的控制方式,就得重新訓練,模型越堆越複雜,還互相不兼容。

這篇論文選的路完全不同,他們決定不去改模型本身,而是想辦法"餵"給模型它本來就認識的東西。

凍住的大腦,如何被餵進新資訊

WiW最核心的洞察,其實是發現了一個被忽略的細節。

因果影片模型WorldinWorld一段影片怎麼變成一整個可以自由探索的世界:一類按時間順序、自回歸地生成影片幀的AI模型,生成當前畫面時只能參考之前已經生成好的內容,類似於人寫文章時只能參考前面寫過的段落

自注意力機制WorldinWorld一段影片怎麼變成一整個可以自由探索的世界:Transformer架構里讓模型判斷"當前要生成的內容應該重點參考輸入里的哪一部分"的核心計算模組

研究者觀察到,這類因果影片模型在生成當前畫面的時候,會通過自注意力機制去讀取"乾淨的歷史畫面",也就是模型之前已經生成完、確定不會再修改的那些幀,外加最初給它的那張起始畫面。這個讀取通道原本就是模型天生自帶的,訓練的時候就在用。

那麼一個很自然的想法冒出來了:如果我們能把各種控制資訊,比如攝像機想要的新視角、幾何形狀、更早之前生成過的畫面,全部偽裝成模型已經熟悉的"乾淨歷史畫面"格式,那模型不就能直接用它原生的注意力機制去讀取這些新資訊了嗎?完全不用改模型的參數,不用加新的訓練模組。

這就像一個不會說英語的老翻譯員,你沒法教他新語言,但你發現他特別擅長讀中文文檔。於是你不去逼他學英語,而是把所有外語資料先翻譯成中文格式,塞進他熟悉的文件夾里,讓他用自己最熟練的方式去處理。翻譯成本你付了,但翻譯員本身一點都不用改。如果不這麼做,會怎樣?你就得從頭訓練一個新的翻譯員來處理每一種新語言,而且訓練一次可能要花幾周甚至幾個月的算力和數據。

基於這個思路,WiW把整個問題拆成了三塊:怎麼造出有用的視覺證據,怎麼讓模型準確找到證據里相關的位置,以及怎麼控制每份證據說話的音量大小。

四種證據,各管一段

WiW一共設計了四種不同類型的"證據",每一種解決一個特定的痛點。

第一種是源影片觀察,也就是原始拍攝的畫面本身,提供最基礎的外觀參考。但問題是,這些畫面停留在原來的攝像機視角,換了新視角之後,畫面里的內容該出現在螢幕的哪個位置,源影片自己是不知道的。

為了解決這個"位置"問題,團隊引入了目標視角場景投影。他們先用DepthCrafterWorldinWorld一段影片怎麼變成一整個可以自由探索的世界這個深度估計模型算出源影片每一幀的深度資訊,然後把畫面像素在三維空間裡重新投影到目標攝像機看到的角度上。

DepthCrafter:一個能從普通影片裡估算出每一幀畫面中每個像素到攝像機的距離(深度)的AI模型,相當於給平面影片加上了立體感的"尺子"

這一步就像把一張平面地圖折成立體沙盤,然後從沙盤的另一個角度去看原本畫在紙上的城市布局,這樣你就能大致知道換個角度看,哪棟樓該出現在畫面左邊、哪棟該藏在山後面。不做這一步會發生什麼?畫面會出現明顯的錯位和漂移,物體該在左邊的卻跑到右邊去了,因為模型光靠"外觀相似"去猜測位置,遇到攝像機大幅轉動或者畫面里有重複紋理的時候,很容易猜錯。

第二種證據針對一個更棘手的問題:如果攝像機轉動幅度特別大,露出了源影片完全沒拍到的區域,比如人物的背面,這時候光靠投影沒用,因為源影片壓根沒這部分資訊。

這時候引入了渲染幾何證據。以人物為例,團隊用LHM++WorldinWorld一段影片怎麼變成一整個可以自由探索的世界從影片裡清晰、沒被遮擋的畫面重建出一個三維人體模型,再用SMPL-XWorldinWorld一段影片怎麼變成一整個可以自由探索的世界參數驅動這個模型,按照原影片裡人物的動作逐幀擺姿勢,然後從目標攝像機的角度渲染出來。

LHM++:一種能從單張或少量圖像里重建出完整三維人體模型的AI技術,即便某些角度沒拍到,也能合理推測出來

SMPL-X:一套描述人體姿態和形狀的參數化數學模型,相當於給三維人體裝了一套可以精確調節姿勢的骨架控制器

這就像給一個只露過正面的演員做一個三維等身模型,然後根據他剛才走路的動作數據,讓這個模型轉到背面重新演一遍剛才那段動作,即便觀眾沒見過他的背面長什麼樣,靠身材比例和動作規律,也能補出一個說得過去的背影。如果沒有這一步,攝像機大幅度轉動露出的新區域就只能靠模型瞎猜,很容易生成出跟人物實際體型、姿勢完全不搭的詭異畫面。

第三種證據解決的是"記憶力"問題。

因果模型的滾動緩存只能記住最近的一小段歷史,也就是那"18個潛在幀狀態槽位",具體分配是6個源錨點、8個近期歷史、4個當前處理塊。這意味著如果攝像機轉了個圈,過一會兒又轉回原來的位置,那個位置對應的畫面早就被擠出緩存,模型壓根不記得了。

為了解決這個"失憶"問題,團隊維護了一個貫穿整個生成過程的歷史檔案庫,每當一幀被擠出滾動緩存之前,就把它的關鍵特徵存檔,記錄下對應的攝像機角度和時間點。等鏡頭轉回來的時候,系統會從檔案庫里挑出跟當前視角最匹配、覆蓋面最廣、又不重複的一批歷史記錄,重新餵給模型看。

這就跟你回老家探親一樣,你離開家鄉去外地上學幾年,腦子裡對老家的記憶會慢慢模糊,但你手機相冊里存的老照片沒丟,某天回去想起某個巷口的樣子,翻翻相冊就能喚醒記憶里那條巷子該是什麼模樣。如果沒有這個檔案庫,每次鏡頭重新掃回一個之前去過的地方,畫面就會跟第一次去的時候長得不一樣,整個場景在時間線上就"漂"了,觀眾會明顯察覺到穿幫。

找對地方,喊對音量

光是把這四種證據擺在模型面前還不夠,模型得知道該去哪找對應的資訊,以及每種證據說話的聲音該開多大。

第一個問題靠的是相關性引導的注意力路由。

在攝像機大幅轉動或者畫面里有大片相似紋理(比如一整片草地或者磚牆)的情況下,模型單純靠"外觀相似"去匹配位置很容易認錯。這個模組的解法是提前追蹤源影片裡一批帶有持久身份標記的點,結合幾何和攝像機資訊,明確告訴模型"當前這個查詢位置,對應源影片裡的這個具體點",在計算注意力分數的時候直接加一個額外的權重加成。

這就像在超市找一件商品,如果貨架上擺滿了長得幾乎一樣的罐頭(外觀相似導致的模糊),你光靠眼睛掃很容易拿錯。但如果你手裡有張導購圖,標出了"番茄罐頭在3號貨架第2層第5個位置",你就能精確定位到那一個,而不是憑感覺從一堆相似的裡面隨便挑。沒有這套路由機制,會發生什麼?實驗數據顯示,去掉這個模組之後旋轉誤差從1.78度上升到1.78左右浮動不大,但結合其他證據一起去掉時誤差明顯放大,說明這套機制確實在細節層面幫模型避免了"認錯人"的情況。

第二個問題靠的是證據感知的注意力分類器自由引導WorldinWorld一段影片怎麼變成一整個可以自由探索的世界,簡稱EWAWorldinWorld一段影片怎麼變成一整個可以自由探索的世界。

分類器自由引導:一種在AI圖像/影片生成里常用的技巧,通過對比"有條件引導"和"無條件"兩種生成結果的差異,人為放大條件資訊的影響力,讓生成結果更貼合用戶的要求

傳統CFG是整體調節的,但WiW面對的是四種不同的證據同時存在,每種證據的可信程度還會隨著畫面區域、生成階段的不同而變化。如果所有證據都用同樣的強度去"喊話",模型很難判斷到底該更相信哪一個,可能會互相打架,甚至把原本自然流暢的生成結果搞亂。

EWA的做法是,對每一種證據單獨計算它在注意力層裡帶來的響應,跟模型完全不看這份證據時的"原生反應"做對比,只放大證據帶來的那部分額外貢獻,而不去重複放大模型本身已經很自信的那部分。而且這整個計算是復用同一次去噪推理過程中的已有結果,不需要額外跑一遍完整的模型,所以不增加計算成本。

這有點像一群參謀在給將軍提建議,將軍自己心裡已經有個大致判斷(原生反應),幾個參謀各自根據自己掌握的情報(不同證據)補充意見,但補充的應該是將軍沒想到的那部分,而不是把將軍已經想好的話重複喊三遍來顯得更響。如果每個參謀都把自己的意見強行按統一音量喊出來,將軍最後可能會被吵到不知道該聽誰的,畫面質量就會失真變形。

數據說話,效果到底怎麼樣

研究團隊在DAVIS和OpenVid-1M兩個公開數據集上做了對比實驗,對手包括ReCamMaster、TrajectoryCrafter、WorldForge、InSpatio-World、UniWorld-View、CameraAnything,這些都是當前領域裡做攝像機控制影片重渲染的代表性方法。

評測維度覆蓋了美學質量、圖像質量、時間閃爍、動作流暢度、主體一致性、背景一致性、動態程度這七個VBench維度,外加攝像機軌跡誤差(平移誤差和旋轉誤差)和圖像保真度指標(PSNR、SSIM、LPIPS)。

結果顯示,WiW在七項VBench維度的平均得分上拿到85.192分,是所有對比方法裡最高的,第二名UniWorld-View是84.295分。旋轉誤差方面WiW做到2.8326度,是所有方法裡最低的,第二名CameraAnything是3.1868度。平移誤差方面WiW是0.068622,跟表現較好的UniWorld-View的0.068705基本持平,但明顯優於ReCamMaster的0.124289。圖像質量上PSNR達到23.1511,同樣是所有方法裡最高,比排名第二的UniWorld-View(22.4735)高出接近0.7個點。

消融實驗部分也很有說服力。研究者專門測試了去掉"目標視角投影"這一步會怎樣,結果是災難性的:旋轉誤差從完整方法的1.7823度直接飆到6.1158度,漲了3.4倍多;平移誤差從0.053291漲到0.581847,漲了將近11倍。這說明,如果沒有這個把源影片內容投影到目標視角的步驟,光靠模型自己去猜測內容該擺在哪,攝像機控制的準確性會嚴重崩塌。

除了攝像機重渲染之外,團隊還展示了這套框架能幹的其他事情,包括子彈時間效果(凍結某一幀背景,讓特定物體繼續運動)、影片穩定(把手抖的影片穩成平滑運鏢)、影片編輯(比如把畫面里的牛換成斑馬),還有一個特別有意思的"跨模型通信"實驗:讓兩個獨立運行的模型實例互相傳遞生成過程中緩存的關鍵資訊,讓一個模型的生成結果能記住另一個模型生成過的內容。這些應用全部用的是同一套凍結不動的模型骨架,靠證據接口這一層來實現,沒有為任何一個應用單獨訓練。

寫在後面

讀到這篇論文最讓我停下來想的一點,是它對"控制"這個詞的重新定義。

我們通常以為給AI模型加新功能就得改模型、加參數、重新訓練,這幾乎是深度學習圈子裡的默認假設。但WiW提出的思路是反過來的:先搞清楚模型原生就擅長讀什麼格式的資訊,然後想辦法把新需求"翻譯"成那個格式,而不是逼模型去學新東西。這個思路上的轉變,某種程度上跟軟體工程里"適配器模式"是同一個哲學,只是發生在了AI模型的注意力機制這個層面上。

另一個讓我印象深刻的細節是那個"18個潛在幀狀態槽位"的具體分配(6個源錨點、8個近期歷史、4個當前處理塊)。這個數字組合看起來很工程化,但它其實揭示了一個真相:因果影片模型的"記憶容量"是極其有限且固定的,這也是為什麼長時間的鏡頭重訪必須靠外部檔案庫來補救,模型自己天生就"記不住"太久之前的事。這讓我想到人腦的短期工作記憶容量也差不多是這麼個數量級,都是有限的槽位,超出了就得靠外部輔助(比如筆記、照片)來補充。

論文裡還有個沒細說但值得追問的地方:這套系統目前依賴的深度估計、人體重建這些前置模型(DepthCrafter、LHM++)本身如果出錯,會不會把錯誤的幾何資訊當成"可靠證據"餵給主模型,反而帶偏生成結果?論文裡提到用幾何可靠性和遮擋關係來過濾不可靠的投影區域,但這終究是個"證據鏈"式的系統,每一環的誤差都可能往下傳遞。這個問題在實際應用場景(比如動作複雜、遮擋嚴重的影片)里可能會被放大,值得後續工作繼續驗證。

Q&A

Q1:World in World是用來做什麼的?

A:World in World(WiW)是一套無需訓練的推理時接口,能讓用戶對一段已經拍好的影片指定新的攝像機路徑,重新生成從新視角看到的畫面,同時保持畫面里人物動作和事件進展跟原影片一致。

Q2:World in World跟以前的攝像機控制影片生成方法有什麼不同?

A:以前的方法通常需要為不同類型的控制(比如攝像機、幾何、歷史記憶)單獨訓練專用模組,而WiW把所有控制資訊統一轉換成模型原生自注意力機制就能讀取的"乾淨視覺狀態",完全不需要改動模型參數,也不用額外訓練。

Q3:World in World在實驗中表現怎麼樣?

A:在DAVIS和OpenVid-1M數據集上,WiW的VBench綜合得分達到85.192,旋轉誤差2.8326度,圖像質量PSNR達23.1511,均優於ReCamMaster、UniWorld-View、CameraAnything等對比方法。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新