宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

用一段影片,換出一個可以自由走動的世界

2026年08月14日 首頁 » 熱門科技

你有沒有試過這樣的場景:刷到一段朋友隨手拍的旅行影片,鏡頭晃晃悠悠地掃過一座古鎮的石板路,你突然特別想知道,如果鏡頭往左邊多拍一點、往前再走十步,會看到什麼。可惜影片已經拍完了,那個"如果"永遠沒有答案。

這聽起來是個挺私人的遺憾,但放大到整個行業里,它就是一個價值巨大的技術難題:怎麼從一段只拍了一個視角的影片裡,憑空"生長"出其他視角的畫面?

這個問題不是沒人解決過。傳統的三維重建技術,比如神經輻射場

**NeRF**:一種用神經網路表示三維場景的技術,輸入多個視角的照片,就能學會從任意新視角渲染出逼真畫面

和三維高斯潑濺

**3DGS(3D Gaussian Splatting)**:用大量三維空間中的"高斯球"來表示場景,渲染速度比NeRF快很多,是目前主流的三維重建方案之一

一直是這個領域的主力選手。但它們有一個幾乎無法繞開的軟肋:它們靠"看過的東西"來重建,你給它十張從不同角度拍攝同一個物體的照片,它才能補全出中間那些沒拍到的視角。可現實中,大多數人拍影片只會拿著手機往一個方向走,根本不會繞著場景轉一圈。用這種"單一路徑"的影片去餵給NeRF或3DGS,重建出來的畫面往往慘不忍睹,遮擋的地方會出現詭異的空洞和拉伸,稍微換個大角度看,整個場景就"塌"了。

這幾年冒出來的生成式方法試圖繞開這個坑。既然重建不出來,那就用擴散模型

**擴散模型(Diffusion Model)**:一類通過"從噪聲中逐步還原圖像"來生成內容的AI模型,是目前圖像和影片生成領域的主流技術路線

去"畫"出新視角的畫面,反正模型見過千千萬萬張圖片和影片,腦子裡有足夠多的先驗知識去猜測沒拍到的地方長什麼樣。這個思路確實讓數據依賴大大降低了,但新的麻煩也隨之而來:這些方法大多把相機姿態當成一個模糊的"提示詞"扔給模型,模型自己去理解這個提示詞意味著鏡頭該往哪轉、轉多少。這就好比你給一個從沒學過精確製圖的畫家口頭描述"往右轉45度",他畫出來的透視關係八成會走樣。當視角變化很小的時候還湊合,一旦是那種大幅度的、跨越式的視角跳躍,也就是論文裡說的"大基線用一段影片換出一個可以自由走動的世界"

**大基線(Large-Baseline)**:指源視角和目標視角之間的相機位置、角度差異很大,是新視角生成中難度最高的場景

場景,生成出來的畫面就會出現結構扭曲、物體變形這些一眼假的問題。

北京大學和Rabbitpre AI的研究者們,就是衝著這個"大基線"難題去的。他們提出的方法叫UniWorld-View,核心思路挺直白:既然純生成式方法缺乏精確的幾何指導,純重建方法又扛不住稀疏輸入,那就把兩者的優點捏在一起,用顯式的三維幾何資訊去"管住"生成模型,讓它既有自由發揮的能力,又不會天馬行空地瞎畫。

影片變身立體世界:點雲是怎麼來的

要理解UniWorld-View怎麼工作,得先搞清楚它第一步在做什麼事。

給它一段影片(哪怕只有一張圖片也行),系統會先用現成的幾何估計模型,去猜測影片裡每一幀的深度資訊,也就是畫面里每個像素點離攝像機有多遠。同時它還會估算出拍攝時相機的運動軌跡和內部參數。有了這些資訊,就可以把一張平面的照片,重新"撐"成三維空間裡的一堆點,這堆點就叫

**點雲(Point Cloud)**:由大量三維坐標點組成的集合,用來表示物體或場景的空間形狀,是三維視覺里最基礎的數據結構之一

有了點雲之後,你就可以把攝像機架在任何你想要的新位置,把這堆點重新投影到二維畫面上,看看從這個新角度看過去,場景大概長什麼樣。這個過程叫做渲染。

這裡就出現了論文裡反覆強調的那個大坑:如果你只是簡單粗暴地把點雲往新視角上一投,結果往往慘不忍睹。

想像你在拍一張人像照片,人站在樹前面。如果只是把這張照片對應的深度資訊機械地投影到一個側面視角,本該被人遮住的那部分樹幹,因為深度資訊不夠精細,很可能被錯誤地"拉伸"成人物的一部分,紋理直接糊在一起,前景和背景像被打了個死結一樣黏連在了一起。論文裡管這個現象叫"前景背景撕裂"。視角變化越大,這種撕裂就越嚴重,因為原始照片裡根本沒有記錄被遮擋區域到底長什麼樣,模型只能靠猜,猜錯了就是一團糟。

三次投影,把遮擋關係理清楚

面對這個撕裂問題,研究者設計了一個挺巧妙的解法,叫

**三重反投影用一段影片換出一個可以自由走動的世界(Triple-Reprojection)**:通過來回三次投影計算,判斷哪些點在目標視角下其實是被遮擋的,從而生成準確的遮擋掩碼

具體是怎麼操作的?先把原始影片的畫面投影到點雲上,再把點雲渲染到你想要的目標視角,這是第一次投影,得到一張中間畫面。接著,把這張中間畫面反過來再變成一個點雲,再投影回原始視角,這是第二次和第三次投影。整個過程繞了一圈,最後再回到起點。

這一圈繞回來的意義在哪?如果某個像素點經過這麼一圈折騰之後,仍然能準確地落回原來的位置,說明這個點是"可靠的",它在目標視角下確實是可見的,沒有被遮擋邏輯搞亂。反過來,如果這個點在這一圈折騰里對不上號了,那就說明它在目標視角下的可見性是有問題的,應該被標記為不可靠,不能用來生成條件畫面。

這就好比你在一個陌生城市迷路了,想驗證某條路線是不是可靠。你從A點走到B點,再假裝完全忘記來時的路,重新按同樣的邏輯從B點走回A點,如果你精確地走回了原來的起點,說明這條路徑的邏輯是自洽的,可以信任。如果走岔了,說明中間某一步的判斷出了問題。三重反投影乾的就是這個事:用一個"能不能走回原點"的檢驗,去篩掉那些看似投影成功、實則邏輯混亂的偽造像素。如果不做這一步檢驗,模型拿到的幾何提示里混雜著大量自相矛盾的資訊,前景背景亂粘一團,後續的生成模型只會被這些錯誤資訊帶偏,畫出更離譜的結果。

除了處理遮擋關係,研究者還注意到另一個問題:點雲里有些點其實是"背對"著新相機的,比如一個球體背面朝向觀察者的那部分表面,正常情況下你壓根不該看到它,但點雲投影有時候會把它錯誤地暴露出來。為了解決這個,團隊引入了

**法線(Normal)**:三維表面上垂直於該表面的一條方向向量,用來描述這個點的表面朝向

基於法線的過濾方法:對點雲里的每一個點,計算它的表面朝向和相機觀察方向之間的夾角,如果這個點的正面根本沒有朝向相機,那就直接把它剔除掉,不讓它參與最終渲染。這就像你去參觀一座雕像,如果雕像的背面正對著你,你不可能透視看到它的正面細節,硬要在渲染里保留這部分資訊只會造出一堆憑空捏造的假象。

把遮擋檢驗和法線過濾這兩道工序疊加在一起,就構成了論文的核心創新,叫

**遮擋感知點雲渲染用一段影片換出一個可以自由走動的世界(Occlusion-aware Point Cloud Rendering)**:結合三重反投影和法線過濾兩種機制,生成沒有幾何歧義的渲染畫面,作為擴散模型的可靠輸入條件

這套流程走完之後,得到的渲染畫面和有效性掩碼,才真正稱得上"乾淨",可以放心交給後面的生成模型去處理。

兩條腿走路:幾何資訊和源影片一起餵給模型

有了乾淨的幾何條件還不夠,接下來要解決的是內容生成的問題:怎麼讓模型根據這些幾何提示,畫出真實、連貫、和原影片風格一致的畫面?

這裡研究者選擇了一個叫

**VACE用一段影片換出一個可以自由走動的世界**:一個基於WAN2.1-14B大模型微調而來的影片編輯框架,天生擅長處理帶掩碼的影片編輯任務

的強大影片生成骨架作為基礎。VACE本來就很擅長處理"這裡有個洞,幫我補上"這類帶掩碼的編輯任務,這和遮擋感知渲染出來的畫面(有些區域可靠、有些區域是空洞)剛好是同一種問題結構,所以順理成章地拿來復用。

但光有VACE還不夠,因為大基線視角合成本身有個天生的矛盾:幾何渲染出來的畫面空間位置是準的,但內容是殘缺的;而原始影片裡的內容是完整的、細節豐富的,但它和目標視角在空間上是錯位的。這兩種資訊各有短板,誰也替代不了誰。

為了同時利用好這兩種資訊,團隊設計了一套

**雙流條件影片擴散模型(Dual-stream Conditional Video Diffusion Model)**:同時接收點雲渲染畫面和源影片作為兩路獨立的條件輸入,分別負責空間結構約束和外觀細節補充

架構里的其中一條流,負責把點雲渲染的畫面和掩碼,通過VACE自帶的Context Blocks送進模型主幹,用來死死"釘住"目標視角的空間結構,確保生成結果嚴格符合指定的相機軌跡,不會跑偏。

另一條流則叫做

**Ref-DiT(Reference-conditioned DiT)**:一種插在擴散模型主幹層之間的參考注入模組,通過交叉注意力機制,讓生成中的畫面向原始影片"借用"外觀細節

它的工作方式是讓正在生成的目標視角特徵當作"提問者",去原始影片的特徵里檢索相關的外觀資訊當作"答案",就像你在寫一篇報告時,手頭雖然只有一份不完全對得上主題的參考資料,但你可以從裡面挑出有用的段落,拼湊補充到你真正要寫的內容里。

這個設計的價值在哪?如果只依賴點雲渲染,那些點雲本身固有的偽影和幾何複雜區域的紋理退化,會原樣傳遞到最終畫面里,畫質註定打折扣;如果只依賴原始影片做參考,模型又沒法處理空間錯位的問題,沒法把參考畫面"對齊"到目標視角上。兩條流各司其職,一個管"往哪畫",一個管"畫成什麼樣",缺一不可。這就像裝修房子,一個人負責按圖紙打好承重結構,另一個人負責按你喜歡的風格挑選裝修材料鋪進去,兩人各管各的,結構不會歪,風格也不會跑偏。

數據從哪來:自監督和真實多視角混著練

訓練這樣一個模型需要大量數據,理想狀態下應該有海量的、同步拍攝的多視角影片,但現實中這種數據集普遍規模小、真實感差、場景種類也不夠豐富。

研究者想了一個挺聰明的辦法處理這個數據荒問題。對於海量的單目影片(就是普通人隨手拍的那種影片),他們復用了前面提到的三重反投影機制,做了一個自監督的數據構造流程:給原影片加上一個隨機的視角變換,生成一個帶有幾何偽影的中間畫面,再用逆變換投影回原始視角,這樣就人為地"製造"出了一批帶有典型大基線渲染缺陷、但又能和原始畫面對齊的訓練樣本。團隊從OpenVid-1M數據集裡,用這套方法造出了10萬對訓練樣本。

對於靜態場景但相機運動範圍大的數據(比如DL3DV和RealEstate10K這兩個數據集),研究者則用VGGT重建出全局點雲和相機姿態,從同一個影片序列里挑兩段有重疊內容的片段,一段當輸入源,另一段當目標真值,再把源片段的點雲投影到目標片段的相機軌跡上,生成對齊的幾何條件。這樣又造出了10萬組靜態多視角訓練樣本。

**VGGT(Visual Geometry Grounded Transformer)**:一種視覺幾何基礎模型,能夠從影片序列同時重建全局點雲並估計相機姿態

整個訓練分成兩個階段進行,第一階段專門訓練模型處理不完美幾何渲染的能力,用動態數據訓練Context Blocks,把DiT主幹和參考分支都凍結住;第二階段專門訓練Ref-DiT層學會怎麼從參考影片裡"補細節",這次換成用靜態多視角數據訓練,把已經訓好的Context Blocks和主幹都凍結住。這種分階段、各管一段的訓練策略,讓模型不至於兩個任務互相干擾、學得含糊。

從影片生成到四維重建:給動態場景補全一整個世界

UniWorld-View不光能生成單張新視角畫面,它還能做更大的事情:把一段單目影片,變成一整套多視角同步影片,進而重建出一個可以隨意穿梭的動態三維場景,也就是

**4DGS用一段影片換出一個可以自由走動的世界(4D Gaussian Splatting)**:在3DGS基礎上加入時間維度,用來表示隨時間變化的動態三維場景

要做到這一點,第一個難題是動態場景里的前景和背景經常互相遮擋。比如一個人在走廊里走動,人物身後的牆面會被人物本身反覆遮擋又露出。研究者的解法是先把前景和背景拆開處理:用圖像摳圖技術識別出第一幀的前景主體,再用SAM2

**SAM2(Segment Anything Model 2)**:Meta提出的一種通用圖像和影片分割模型,能夠根據少量提示點,追蹤並分割出目標物體在整段影片中的輪廓

把這個前景主體在整段影片裡的輪廓都追蹤出來,然後用影片修復模型把前景摳掉之後留下的背景空洞給補全,得到一段乾淨、時序一致的背景影片。

背景補全好了之後,還得給前景和背景分別估計深度,再按掩碼把兩者拼合成一張完整的深度圖。這裡有個細節挺值得說一下:背景深度用Stream3R處理,效果穩,但前景動態物體的深度用同一個模型處理時,細節往往不夠精細;於是團隊又單獨用VideoDepthAnything提取更精細的前景深度,再通過一套帶動量的對齊算法,把這個精細深度的尺度校正到和背景深度一致的坐標系裡。這種"背景求穩、前景求細,再對齊拼合"的思路,處理的正是深度估計里普遍存在的"一個模型顧不好兩頭"的矛盾。

有了完整的動態點雲,接下來要生成多組同步的多視角影片。這裡研究者又發現了一個隱藏的坑:如果按照常規思路,讓相機視角隨著時間推移逐漸偏移(也就是所謂的"漸進式視角生成"),會導致相機的空間移動和時間推移死死綁在一起,最終整個四維空間裡各個視角的覆蓋密度極不均勻,有的地方拍了很多遍,有的地方幾乎沒拍到,這對後續的4DGS重建是致命的。

為此團隊設計了一個兩階段生成策略。第一階段,先把動態點雲"凍住"在初始時刻,針對預先設定好的一批固定相機位置生成靜態新視角畫面,這些畫面捕捉到的是場景的整體空間結構,充當後續生成的"錨點"。第二階段,針對每個固定相機位置分別生成一段完整的動態影片,影片的第一幀直接用第一階段生成的靜態錨點畫面替換,從而保證背景在各個視角、各個時間點上都是一致的。

對於前景物體的自遮擋問題(比如人轉身的時候,背面此前沒被看到過),團隊採用了一種逐步生成、逐步更新遮擋關係的疊代策略,確保不同視角生成出來的自遮擋區域內容是彼此吻合的,不會出現同一個人物背面在兩個視角下長得不一樣的荒謬情況。

最後,把原始單目影片和這一整套生成出來的多視角影片合在一起,用來優化最終的4DGS表示,得到一個具備真實幾何結構和外觀細節的沉浸式動態場景。

實驗結果:數字說話

理論講得再漂亮,最終還是要看效果。研究團隊在兩套基準上做了系統評測。

第一套是WorldScore基準,用來評估模型在給定初始幀、文本提示和相機軌跡的情況下,生成後續場景的能力。

| 方法 | WorldScore-靜態 | 相機控制 | 物體控制 | 內容對齊 | 3D一致性 | 光度一致性 |

|---|---|---|---|---|---|---|

| WorldScape-0.2 | 85.13 | 94.32 | 87.65 | 78.13 | 86.51 | 90.02 |

| World Dreamer | 84.52 | 91.62 | 86.29 | 79.08 | 89.54 | 90.31 |

| EonWorld | 81.08 | 79.51 | 61.00 | 82.12 | **92.76** | 89.18 |

| **UniWorld-View** | **85.53** | **97.72** | **88.98** | **86.61** | 91.63 | **94.11** |

從表里能看出,UniWorld-View拿下了WorldScore-Static的最高分85.53,同時在相機控制、物體控制、內容對齊這三項可控性指標上全部拿到第一,相機控制分數97.72明顯甩開第二名好幾個百分點。這說明這套遮擋感知渲染加雙流條件的組合拳,確實在"讓模型精確聽懂相機想去哪"這件事上做得更到位。

第二套是零樣本新視角合成基準,覆蓋了RealEstate10K、CO3D和DL3DV三個不同規模的真實數據集,對比對象是See3D、GEN3C、Uni3C和SEVA這幾個近期代表性方法。

| 方法 | RealEstate10K PSNR | CO3D PSNR | DL3DV PSNR |

|---|---|---|---|

| See3D | 16.46 | 16.22 | 13.42 |

| GEN3C | 21.46 | 19.11 | 14.72 |

| Uni3C | 21.54 | 19.03 | 15.41 |

| SEVA | 17.01 | 17.58 | 14.30 |

| **UniWorld-View** | **21.73** | **19.996** | **15.82** |

**PSNR**:峰值信噪比,一種衡量圖像重建質量的指標,數值越高說明生成圖像和真實圖像越接近

三個數據集上UniWorld-View的PSNR和SSIM

**SSIM**:結構相似性指標,衡量兩張圖像在結構層面的相似程度,同樣是數值越高越好

都拿到了最高分,說明它在跨場景、跨數據集的泛化能力上表現穩定。雖然GEN3C和Uni3C在RealEstate10K的LPIPS

**LPIPS**:一種基於深度特徵的感知相似度指標,數值越低說明生成圖像在人眼感知上和真實圖像越接近

上略勝一籌,但綜合來看,UniWorld-View在像素精度、結構相似性和感知質量之間取得了更均衡的表現。

從論文展示的定性對比圖里也能直觀看出差別:面對大視角變化的場景,其他方法普遍出現物體邊界扭曲、幾何結構不合理、新暴露區域紋理模糊的問題,而UniWorld-View生成的畫面在物體輪廓和場景結構上明顯更完整、更清晰。這背後正是因為遮擋感知渲染提前把那些會誤導模型的模糊投影資訊清理掉了,模型拿到的是"乾淨的地圖"而不是"塗改過的地圖",自然畫得更准。

寫在後面

讀完這篇論文,最讓我印象深刻的其實不是那個雙流架構,而是三重反投影這個設計。它解決問題的方式很樸素:不是靠更強的網路去"學會"分辨遮擋,而是靠一個純幾何的、可以精確計算的檢驗步驟,把不可靠的資訊在源頭篩掉。這提醒我一件事,很多時候深度學習領域裡看似需要"用更大模型硬學"的問題,其實換個角度用傳統幾何方法預處理一下,反而更乾淨、更可控。

另一個值得琢磨的細節是那個"凍結初始幀再生成動態影片"的兩階段策略。它解決的其實是一個很容易被忽略的隱藏問題:把空間和時間兩個維度綁在一起會導致採樣不均勻。這種"先固定一個維度,再處理另一個維度"的思路,在很多多變量優化問題里都值得借鑑,不只是三維視覺。

這篇論文裡沒有充分展開的一個問題是,當動態前景物體本身發生劇烈形變(比如快速運動的動物、飛濺的液體)時,法線過濾和三重反投影是否還能可靠工作?論文的實驗場景大多偏向剛性或半剛性的物體運動,這個方法在極端非剛性變形場景下的表現,可能是個值得繼續追問的方向。

Q&A

Q1:UniWorld-View是什麼?

A:UniWorld-View是北京大學和Rabbitpre AI團隊提出的一個統一框架,專門用來解決從單目影片或圖片生成大幅度視角變化的新視角畫面的問題,核心是把顯式的三維點雲幾何資訊和影片擴散模型結合起來,既能精確控制相機軌跡,又能生成高質量、幾何一致的畫面。

Q2:UniWorld-View解決了什麼核心難題?

A:傳統的重建方法(如NeRF、3DGS)在輸入視角稀疏、拍攝軌跡單一時會嚴重退化,而已有的生成式方法雖然降低了數據依賴,但往往把相機姿態當模糊提示處理,缺乏精確的幾何約束,導致大幅度視角變化時容易出現物體扭曲、遮擋混亂等問題。UniWorld-View通過遮擋感知點雲渲染技術解決了這個矛盾。

Q3:UniWorld-View的效果怎麼樣,有實際測試數據嗎?

A:在WorldScore基準上,UniWorld-View拿到了靜態場景生成的最高分85.53,並在相機控制、物體控制、內容對齊三項可控性指標上全部排名第一。在RealEstate10K、CO3D、DL3DV三個真實數據集的零樣本新視角合成測試中,它的PSNR和SSIM指標也均超過了See3D、GEN3C、Uni3C、SEVA等對比方法。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新