這項由Insta360研究院聯合中國科學院自動化研究所、清華大學、武漢大學及美國加州大學默塞德分校共同完成的研究,以預印本形式於2026年7月10日發布在arXiv平台,論文編號為arXiv:2607.09661。研究的核心成果是一個名為PanoWorld的系統,它解決了一個長期困擾AI影片生成領域的難題:如何讓機器生成的全景影片,在攝像機大幅移動之後,仍然像真實拍攝一樣保持場景的物理一致性。
普通人或許不太了解"全景影片生成"是什麼,但你一定體驗過它帶來的痛點。當你戴上VR頭顯漫遊一座虛擬城市,或者在無人機模擬器里駕駛飛行器穿越山谷,轉彎之後景色突然"破碎"了,物體位置對不上,光影突然變了,甚至憑空出現了不該有的東西——這就是當前AI全景影片生成的最大短板。PanoWorld研究團隊要解決的,正是這個讓虛擬世界"穿幫"的根本問題。
一、全景影片為什麼比普通影片難得多
普通手機拍出來的影片,就像從一扇窗戶往外看,視野範圍有限。而全景影片,則像是把你的頭顱變成了一個透明水晶球,周圍360度的景象全都被收錄進來,上下左右無死角。這種記錄方式在技術上叫做"等矩形投影",英文縮寫是ERP。
把球面上的圖像"壓平"成一張矩形圖,就像剝橘子皮再把它鋪平一樣,不可避免地會產生形變,尤其是頂部和底部會被拉伸得很厲害。這種形變給AI帶來了巨大的學習困難,因為普通AI都是在"窗戶視角"的普通圖片上訓練的,它對這種球面壓平後的奇怪形狀根本不熟悉。
更麻煩的是"長時記憶"問題。當無人機飛行了很長一段距離之後,AI如何記住"剛才飛過的那棟樓長什麼樣",並在攝像機轉回來的時候保持一致?這就像你蒙眼轉了好幾圈之後,仍然要準確指出身後那棟樓的位置和外觀——人類靠空間感,AI則需要一套精密的"記憶檢索"機制。現有方法大多借用普通攝像機的那套邏輯來處理這個問題,結果在全景影片裡經常出現"記憶錯位",轉個彎回來,之前的場景面目全非。
PanoWorld的出發點,是從全景圖像本身的一個特殊性質入手,找到了一把解開這個難題的鑰匙。
二、旋轉不過是換了件外衣:PanoWorld的核心洞見
研究團隊注意到,全景圖像有一個非常獨特的性質——旋轉等變性。用一個生活化的類比來理解這件事:把地球儀轉一圈,上面的地圖內容沒有變,只是你看到的區域移動了。全景圖也是如此,當攝像機發生旋轉時,圖像中的內容其實沒有真正改變,只是"流動"到了圖像的另一個位置,形變的模式也相應地移動了。
這個發現意義重大。它意味著,攝像機的旋轉運動,完全可以通過一個數學變換(對圖像做個坐標變換)來處理,根本不需要AI去"理解"它。真正需要AI費心學習的,只有攝像機的平移運動——也就是在三維空間裡真實地向前、向後、向上、向下移動。因為平移會改變近處和遠處物體之間的相對位置關係,產生所謂的"視差"效果,這才是需要AI真正去建模的複雜現象。
於是,研究團隊為PanoWorld設計了一個叫做"運動解耦"的機制:在訓練和推理過程中,旋轉運動被從軌跡里剝離出來,作為一個純粹的幾何變換直接處理,而AI只需要專注於平移運動的建模。這就像讓一個畫家只專心研究透視和光影變化,而不用操心畫布本身是否被旋轉了——因為旋轉可以單獨處理,不影響作畫本身的難度。
圍繞這一核心洞見,PanoWorld包含了兩個具體的技術模組,分別處理"當前動作建模"和"長時記憶"這兩個問題。
三、密集全景射線條件化:告訴AI每一束光從哪裡來
第一個模組叫做DPRC,中文可以理解為"密集全景射線條件化"。為了讓讀者理解這個模組在做什麼,不妨把攝像機想像成一個站在圓球中心的人,球的每個方向都有一束光從那個方向射入眼睛。全景攝像機捕捉的,就是來自所有方向的這些光線攜帶的顏色和亮度資訊。
當攝像機在空間中移動時,這些光線的"起源方向"和"攜帶資訊"都會發生變化。一棵近處的樹,向右平移之後,它就會從視野左邊移到右邊;而遠處的山,幾乎不會動。這種近處動、遠處不動的差異,就是人類感知三維世界深度的重要線索,也叫視差。
DPRC的核心操作是:對全景圖中的每一個像素點,都計算出對應的那束"光線"的方向,以及當攝像機按照指定軌跡移動時,這束光線與攝像機位移之間的精確幾何關係。具體來說,對於圖像上坐標為(i, j)的像素,研究團隊通過球面坐標公式計算出對應的仰角θ和方位角φ,進而得到一個三維單位向量rcam,代表這束光線的方向。然後,對於每一束光線,以該光線方向為Z軸,構建一個局部的三維坐標系,並在這個坐標系裡描述攝像機的平移向量。這個局部化的平移描述,讓AI能夠精確感知"攝像機的移動對這一方向的視覺內容造成了什麼影響"。
這些幾何資訊通過一種叫做"投影位置編碼"的方式,注入到AI模型的內部,像一張精密地圖一樣,引導AI在生成每一幀圖像時,都能正確地"知道"光線應該從哪個方向打來、應該看到什麼。這種方式比傳統的光流方法更精確,因為它直接對應了全景圖像的球面幾何原理,而不是用平面圖的邏輯去近似處理。
四、幾何感知記憶增強:讓AI像有"位置感"的人一樣記住曾經見過的景色
第二個模組叫做GMA,可以理解為"幾何感知記憶增強"。這個模組解決的是長時記憶問題:當無人機飛出去很遠再飛回來,AI怎麼"記住"之前看到的場景?
GMA的工作方式,類似於一種有"方向感"的照片存檔系統。每當AI處理一幀圖像,這幀圖像對應的視覺特徵就會被存入一個"記憶庫",同時記錄下當時攝像機的位置和每個方向的光線資訊。當AI需要生成新的一幀時,它會用當前位置和方向的光線資訊去檢索記憶庫,找到"曾經從相近方向看到的內容",作為參考。
這裡有個精妙的設計:記憶庫里的內容和當前查詢,都用同一套"光線坐標系"來描述。這意味著,當攝像機再次朝著某個方向飛行,或者從某個角度望向遠處的地標時,記憶檢索是基於三維空間的幾何對應關係,而不是基於圖像像素的表面相似性。就好比一個有方向感的人,不是靠"這個畫面看起來像我之前拍的照片"來認路,而是靠"我現在面朝北方、距離那棟樓大約兩公里"來喚起對應的記憶。
為了防止記憶檢索出錯——比如檢索到根本看不見的方向的記憶——GMA還設計了一個"置信度引導的門控機制"。簡單來說,AI會計算每一條"記憶線索"的可靠程度:如果當前視角和記憶中的視角重疊度很高(幾何上高度吻合),就給這條記憶較高的權重;如果幾乎沒有重疊,就忽略它,避免引入錯誤的視覺內容。最終生成的每一幀,都是把當前AI自己的判斷和高置信度歷史記憶按權重融合的結果,保證了場景的物理一致性。
五、三階段訓練:像教練一樣循序漸進地培養AI能力
PanoWorld的兩個模組不是同時訓練的,而是按照一個精心設計的三階段流程,逐步培養起來的。這個安排,類似於培養一個運動員:先打基本功,再學核心技術,最後整合提升。
第一階段,研究團隊用LoRA微調技術(一種輕量級的AI模型調整方法)對底層影片生成模型進行全景適配訓練。LoRA就像給一個在普通照片上訓練的畫家上一堂"球面幾何速成課",讓他理解全景圖特有的極點形變和左右邊界連續性問題。為了讓這堂課特別有針對性,訓練時採用了一種"緯度感知重建損失"——越靠近圖像頂部和底部(對應球面的南北極),這些形變最嚴重的區域,訓練時給予更高的關注權重。
第二階段,凍結第一階段學到的視覺基礎,專門訓練DPRC動作模組。這一階段被細分為三個子步驟:先用最簡單的直線運動數據入門,讓AI建立"平移會產生視差"的基本感知,同時通過對圖像和軌跡做90度、180度旋轉的數據增強,強迫AI學會應對各種方向的平移;接著用全部真實世界數據繼續訓練,適應複雜的飛行動態;最後用精確合成數據進行精細打磨,提升軌跡控制的精度。
第三階段,凍結前兩個階段的全部參數,只訓練GMA記憶模組。這一階段同樣分兩步:先用較短的幀對訓練基礎的空間重建能力,再用161幀的長序列訓練完整的記憶驅動生成能力。
六、World360數據集:給AI準備的"真實世界飛行訓練場"
現有的全景影片數據集大多是室內場景或街道平面視角,場景變化相對單調,光照條件也比較穩定,根本撐不起需要在高空、多高度、複雜天氣下運行的全景世界模型。研究團隊因此專門構建了World360數據集。
這個數據集包含12萬條高質量序列。其中7萬條來自真實世界,由特製的全景無人機(Anti-Gravity系列)在公園、道路、人工湖、建築群等多種戶外環境中實際飛行採集,涵蓋了各種複雜的六自由度飛行軌跡。另外5萬條來自高保真仿真,由AirSim360平台在8個不同的戶外虛擬場景中生成,提供了精確無誤的相機位姿和深度資訊標註。
為了保證數據質量,研究團隊設計了一套細緻的數據處理流水線。真實數據在採集後要經歷時間對齊(把59.94幀/秒的全景攝像機和200Hz的慣性導航系統數據精確同步)、旋轉解耦(把攝像機的自轉從影片中剝離出來)、姿態噪聲抑制(用卡爾曼濾波器去除飛行時的抖動和GPS漂移)、空間均勻重採樣(把按時間等間隔採樣改為按飛行距離等間隔採樣,每0.05米一幀,消除懸停時的冗餘幀)等多道工序,最終切割成81幀或161幀的訓練片段。
數據還配備了文本描述。研究團隊用Qwen3-VL視覺語言模型對每條影片提取環境描述(嚴格要求不描述攝像機運動,只描述場景環境),並按長度區分為"簡潔版"和"詳細版"兩種,供模型訓練時隨機切換使用。此外,所有數據都經過了多維度的照明質量過濾:過暗(平均亮度低於30)、對比度過低(標準差低於20)、過曝(超過40%像素強度超過250)的片段都會被剔除,確保AI學到的是物理上合理的光照規律。
相比之下,現有的其他全景數據集,如360-1M雖然有超過百萬條,但幾乎都是街道平面視角,沒有高度變化,也沒有精確的位姿標註。World360是目前已知唯一同時具備真實多高度航拍、精確位姿、深度資訊和高質量文本標註的全景世界模型數據集。
七、實驗結果:數字背後的真實表現
研究團隊從World360中抽取了90條涵蓋前進、後退、側移、上升、下降、弧形飛行、環形飛行等多種軌跡類型的評測序列,與三個最先進的對比方法——Imagine360、Matrix-3D和OmniRoam——進行了全面比較。
在視覺質量方面,PanoWorld在分布保真度指標FID上達到了27.64,而Matrix-3D為34.63、OmniRoam為60.77、Imagine360更是高達81.18(FID越低越好)。專門針對全景圖極點區域的FIDpole指標,PanoWorld為47.21,而Matrix-3D為67.88,OmniRoam為85.25。這意味著PanoWorld在全景圖最難處理的"頭頂"和"腳下"區域,也能保持較好的結構完整性。在時間對齊指標FAED上,PanoWorld以2.63大幅領先於Matrix-3D的3.39和OmniRoam的3.36。
在軌跡控制精度方面,研究團隊採用了PSNR(峰值信噪比)指標來衡量生成影片與真實飛行影片之間的相似度——這個值越高,說明AI生成的內容越接近真實飛行看到的樣子。在影片第20至25幀窗口內,PanoWorld的PSNR為22.83,Matrix-3D為20.47,OmniRoam為18.51。更重要的是,在影片末段(第75至80幀),PanoWorld依然保持在20.92,而Matrix-3D降到了18.02,OmniRoam更是滑落至17.02。這說明隨著飛行時間延長,PanoWorld的場景一致性遠比對手穩定。
研究團隊還用了一個叫做ViPE的工具,從生成的影片中反推出攝像機軌跡,再與真實軌跡對比。從對比圖中可以直觀地看出,PanoWorld重建出的飛行軌跡與真實軌跡高度吻合,而Matrix-3D和OmniRoam的軌跡都出現了明顯的偏離和漂移。定性比較結果同樣印證了這一點:在上升運動場景中,Matrix-3D的畫面出現了明顯的模糊和"空洞"(場景結構崩塌);在垂直飛行場景中,由於OmniRoam是在固定高度數據上訓練的,它根本無法正確響應上下移動的指令,畫面出現了嚴重的重影和偽影;而PanoWorld在弧形、上升、後退等各種複雜運動中,都保持了清晰的場景結構和正確的透視關係。
消融實驗(即通過逐一去掉模組來驗證每個模組的貢獻)進一步證實了GMA記憶模組的價值。去掉GMA之後,PSNR在第20到25幀窗口從22.83下降到21.92,在末段從20.92下降到19.85;而如果用隨機記憶代替GMA(即不管幾何關係隨機檢索歷史幀),PSNR更是暴跌到15.51。這說明GMA的幾何對齊記憶檢索機制,對於維持長程一致性至關重要,隨機記憶不僅沒有幫助,反而會主動破壞場景結構。
八、實時生成擴展:8秒出一段161幀全景影片
PanoWorld的完整模型生成一段81幀的全景影片需要約4分48秒,這在工業應用場景中還是偏慢。研究團隊因此做了一個"實時化"的擴展版本,利用一種叫做Causal Forcing(因果強制)的技術,把完整模型壓縮成一個輕量級的快速生成器。
Causal Forcing的核心思想是"師生蒸餾":用訓練好的完整模型作為"老師",通過讓"學生模型"模仿老師的輸出分布,讓學生在只需4步推理的情況下就能達到與老師相近的生成質量(老師需要數十步甚至更多)。具體實現時,研究團隊把影片的21個潛在幀拆分成1幀乾淨的條件幀加上4組×5幀的生成塊,每次只生成5幀,滾動向前推進,就像一列火車一節一節地往前走。
通過進一步的"滾動強制推理"擴展,這個實時模型還能生成161幀的長影片(約5.37秒鐘的畫面)。整個生成過程在單張NVIDIA H20顯卡上只需8秒,相比完整模型的4分48秒提速約36倍,相比Matrix-3D的16.5分鐘提速超過120倍,相比OmniRoam的31分鐘提速約230倍。實時化版本的畫質損失非常有限,FID從27.64小幅升至28.07,PSNR從22.83略降到21.93,在實際使用中幾乎感知不到區別。
九、局限與未來:誠實面對還沒解決的問題
研究團隊在論文中坦誠地指出了PanoWorld目前的兩個主要局限。
第一個問題出在"第一幀直接複製"的設計上。為了省去對初始幀的生成時間,PanoWorld直接把用戶提供的真實照片作為第一幀拼進生成序列,但從第二幀開始就完全由AI生成。真實照片和AI生成圖像之間存在一個難以消除的"風格鴻溝"——真實照片往往細節更豐富、噪聲結構更自然,而AI生成的幀則有自己的視覺風格。這個接縫會在影片開頭造成一個輕微的"質量跳變",並隨著時間累積,影響長序列的整體一致性。
第二個問題是對初始幀的過度依賴。整個場景的"世界觀"由第一幀確立,如果後續飛行軌跡延伸到了初始幀完全無法預判的全新區域(比如突然飛到一座完全不同風格的城市上空),AI的表現就會變得不穩定。
針對這兩個問題,研究團隊提出了兩個未來研究方向:一是開發輕量級的"邊界精修模組",平滑真實幀和AI生成幀之間的過渡;二是設計"動態記憶管理機制",讓AI在飛行過程中不斷把新生成的高置信度幀更新進記憶庫,並主動遺忘過時的舊內容,從而支持在更大規模的開放世界中持續探索。
說到底,PanoWorld做的事情,是用一個非常巧妙的角度重新審視了全景影片生成的核心難題。旋轉不是問題,因為它只是一種幾何變換;真正的問題是平移產生的視差,以及長時飛行後如何保持場景記憶。把一個複雜的整體問題分解成幾個可以分別擊破的子問題,再用"光線幾何"這根統一的線索把所有模組串聯起來——這種思路讓PanoWorld在幾乎所有評測指標上都明顯超過了現有方法,尤其是在長程一致性這個最難的維度上優勢最為突出。
當然,目前這個系統還沒有完美解決所有問題,第一幀的質量跳變和超長距離飛行的場景漂移依然存在。但從整體來看,它代表了全景世界模型領域一個清晰的前進方向:不是強行把普通攝像機的那套方法套用在全景圖上,而是從球面圖像本身的幾何性質出發,重新設計每一個環節。對於正在快速發展的VR、無人機模擬、具身智能
等應用場景來說,這種物理一致的全景世界生成能力,很可能成為下一代沉浸式體驗的重要基礎設施。有興趣深入了解技術細節的讀者,可以通過arXiv編號2607.09661查閱完整論文。
Q&A
Q1:PanoWorld生成的全景影片和普通AI影片生成有什麼區別?
A:PanoWorld專門針對360度全景影片設計,核心區別有兩點。第一,它能在攝像機大幅移動後保持場景的物理一致性,不會出現轉個彎場景就"破碎"的問題。第二,它理解球面幾何,會正確處理全景圖特有的極點形變問題,而不是把普通平面影片的處理邏輯強行套用在全景圖上。
Q2:World360數據集和現有全景數據集最大的區別是什麼?
A:現有大型全景數據集(比如360-1M)雖然數量龐大,但幾乎都是街道平面視角拍攝的,高度變化很小,也沒有精確的攝像機位置標註。World360是目前已知唯一同時包含真實多高度無人機航拍、精確六自由度位姿標註、深度資訊和文本描述的全景數據集,並且經過了嚴格的曝光質量過濾,更適合訓練需要應對複雜空中場景的全景世界模型。
Q3:PanoWorld實時化版本的速度提升是怎麼實現的?
A:實時化版本使用了"Causal Forcing"技術,本質是師生壓縮:讓完整模型作為老師,訓練一個只需4步推理的輕量學生模型來模仿老師的輸出。生成時採用滾動窗口方式,每次只生成5幀,循環推進,單張H20顯卡8秒即可生成161幀全景影片,相比原始完整模型提速約36倍,畫質損失非常有限。






