這項由香港科技大學與華為諾亞方舟實驗室、香港城市大學聯合開展的研究,以預印本形式於2026年7月13日發布在arXiv平台,論文編號為arXiv:2607.10995。研究成果命名為AsySplat,聚焦於如何讓電腦更高效地從一組照片中"腦補"出完整的三維場景。
設想你手頭有32張從不同角度拍攝的同一個房間的照片,現在你希望讓電腦根據這些照片,生成出你站在任意其他角度時應該看到的畫面——這就是所謂的"新視角合成"。這項技術在虛擬現實、數字孿生、影視製作、自動駕駛地圖構建等領域都有廣泛應用,可以說是讓電腦真正"理解"三維世界的一把關鍵鑰匙。
然而,要讓電腦做到這件事並不容易。主流的做法是把照片切成一小塊一小塊的圖像碎片,然後讓神經網路反覆處理這些碎片之間的關係,推斷出每一處場景的三維結構和外觀。問題在於,照片越清晰、數量越多,這些碎片就越多,計算量就會爆炸式增長。一張960P的高清照片已經包含大量細節,32張疊加在一起,電腦需要處理的資訊量讓很多現有方法望而卻步。
研究團隊發現,現有方法在這件事上存在嚴重的"資源浪費"——他們把有限的計算力平等地分配給了本不需要同等精力的兩件事,導致整個系統臃腫而低效。AsySplat的核心貢獻,就是找到了這種浪費的根源,並提出了一套"因材施教"的解決方案。
一、為什麼現有方法在"大材小用"
要理解AsySplat的創新,先得明白它要解決的具體問題出在哪裡。
現有的主流方法,包括AsySplat主要對標的LongLRM,採用的是一種"一刀切"的處理方式:把所有照片切成儘可能細小的圖像碎片,然後讓網路層層疊加地處理所有碎片之間的關係。為了保留足夠的畫面細節,碎片必須切得很小;碎片越小,數量就越多;碎片越多,處理它們之間關係的計算量就越大——這是個近乎無解的死循環。
更關鍵的問題在於,這套方法把所有的計算資源同等地投入到了兩件性質截然不同的任務上:一是弄清楚場景的三維結構(也就是"這裡是牆、那裡是桌子、東西離我多遠"這類幾何資訊),二是決定每個位置的外觀細節(也就是"這塊牆是什麼顏色、這張桌子的紋理是什麼樣的"這類外觀資訊)。把資源平等分配給這兩件事,聽起來很公平,但實際上是一種巨大的浪費,因為這兩件事的難度根本不在同一個水平線上。
研究團隊通過仔細觀察發現了兩個關鍵事實。第一個事實是:三維重建要做得很精確,並不是高質量渲染的必要條件。3D高斯潑濺技術的工作原理有點像用無數個彩色氣泡填滿空間,最終的畫面效果來自這些氣泡疊加融合的結果,而不是要求每個氣泡都精確地貼在真實的物體表面上。就像一幅印象派畫作,近看是零散的色塊,遠看卻栩栩如生——只要氣泡的位置和顏色大致對了,渲染出來的新視角就足夠逼真。這意味著,在三維重建這一步,我們不需要追求極致的精度,"夠用就好"。
第二個事實是:外觀資訊其實比幾何資訊容易處理得多。一旦我們大致知道了場景的三維結構,要給每個位置塗上正確的顏色,本質上只是一個"對號入座"的工作——把原始照片中對應位置的顏色資訊搬過來就行,不需要在不同視角的照片之間做複雜的比對和匹配。這就好比,你已經拼出了一幅拼圖的大致輪廓,那麼往上面塗顏色就是相對簡單的工序了。
正是這兩個觀察,催生了AsySplat的核心設計理念:既然兩件事的難度不同、精度需求不同,為什麼要用同樣的資源去處理它們?
二、不對稱的智慧:把對的錢花在對的地方
AsySplat的解決方案可以用一個廚房的比喻來理解。假設你要準備一頓大餐,廚房裡有兩位廚師:一位負責處理食材(切菜、備料、控制火候),另一位負責最後的擺盤裝飾。處理食材的工作複雜、費時,需要有經驗的主廚;而擺盤雖然需要精細,但有了好食材,一個熟練的幫廚就能勝任。AsySplat做的事情,就是把廚房資源合理分配給這兩位廚師,而不是讓兩個同等級別的大廚都去做同樣繁重的工作。
具體來說,AsySplat將整個處理流程拆分成兩條並行的"流水線"。
第一條叫做"幾何分支",專門負責推斷三維結構。這條流水線使用較大的圖像碎片——碎片大,意味著每張照片被切成的塊數少,總碎片數量就少,處理起來計算量大大降低。由於前面提到的第一個觀察(幾何不需要極致精確),用這種"粗粒度"的碎片來重建三維結構完全夠用。但是,由於多視角三維重建本身是件很難的事——需要在不同角度的照片之間找到對應關係,就像把來自不同方向拍的照片中的同一個點對應起來——這個任務本身就需要強大的網路能力。因此,AsySplat把模型中90%的參數都集中到了幾何分支,讓這條流水線擁有最強的"大腦"來解決這個難題。
第二條叫做"外觀分支",專門負責推斷顏色和紋理等外觀資訊。這條流水線使用較小的圖像碎片——碎片小,意味著能保留更多細節,而高質量渲染確實需要這些細節。但正因為前面提到的第二個觀察(外觀資訊的推斷只需要處理單張照片內部的資訊,不需要在不同視角之間做複雜匹配),這條流水線不需要處理所有視角碎片之間的關係,只在每張照片內部處理就夠了。這讓外觀分支的計算量不會隨著照片數量增加而爆炸。同時,由於任務本身相對簡單,外觀分支只需要全部參數的10%,使用的網路也更輕量。
兩條流水線並非各自為政,它們之間有三次"雙向交流"的機會,研究團隊稱之為"雙邊連接模組"。在每個處理階段結束時,幾何分支會把當前推斷出的深度資訊傳給外觀分支,告訴它"這裡的東西離我們有多遠";而外觀分支則把細節資訊傳給幾何分支,幫助它更好地理解場景。這種雙向資訊交流的設計,讓兩條流水線各取所長、互相補充。
從整體結構來看,幾何分支經歷三個層次遞進的處理階段,網路的"寬度"(也就是處理資訊的通道數量)在三個階段中分別設置為192、512和896,逐級增加,以便在後期進行更精細的幾何推斷。外觀分支同樣經歷三個階段,但通道數始終保持在256,設計更為簡潔均勻。最終,兩條流水線的輸出通過一個簡單的融合操作合併,然後預測出每個位置的三維高斯參數,完成整個場景的重建。
三、一個讓訓練不那麼痛苦的小發明
即便有了不對稱架構的幫助,幾何分支內部依然面臨一個棘手的問題:要做好跨視角的三維匹配,就需要大量的"注意力層"(一種能讓每個圖像碎片"看到"所有其他碎片的網路機制),而注意力層的計算量隨著碎片數量呈平方增長——碎片數翻倍,計算量就要變成原來的四倍。
研究團隊最初的設計是在幾何分支中混合使用兩種機制:一種叫做Mamba的高效序列處理工具(計算量隨碎片數量線性增長,比注意力層友好得多),以及前面提到的注意力層。但他們發現,過度依賴Mamba會損害三維重建的質量。這並不奇怪——Mamba擅長處理有順序關係的資訊(比如文字序列),但三維匹配需要在空間上任意兩點之間直接建立聯繫,Mamba在這方面的能力不如注意力層直接。
因此,研究團隊決定在幾何分支中保留更多的注意力層。但這樣做的代價是訓練時間大幅增加。為了解決這個矛盾,他們設計了一個"稀疏注意力模組"。
這個模組的工作原理有點像一種聰明的"抽樣檢查"策略。假設你要檢查一幅巨大的地圖上所有地點之間的關聯,如果逐一檢查每兩個地點的關係,工作量會大到無法完成。稀疏注意力模組的做法是:先把地圖劃分成一個均勻的網格,然後從每個網格中抽取一個代表點,只檢查這些代表點之間的關係。但在此之前,先用卷積操作(一種能匯聚局部資訊的工具)讓每個代表點充分"了解"它周圍鄰居的情況,這樣每個代表點就不只是代表自己,而是代表了它所在區域的綜合資訊。
這個設計讓需要進行注意力計算的序列長度大幅縮短,訓練時間因此顯著減少。以最高解析度的訓練階段為例,這一模組讓每次疊代的時間從10.5秒降到了6秒,縮短了將近40%。同時,由於卷積步驟確保了每個代表點攜帶了足夠豐富的上下文資訊,這種"精簡"並沒有明顯犧牲模型性能。
四、實驗結果:數字背後的故事
研究團隊在多個數據集上對AsySplat進行了全面測試,結果從多個維度展示了這套不對稱架構的實際效果。
在與傳統優化方法(也就是針對每個新場景從頭花時間優化的方法)的對比上,AsySplat展現出了驚人的速度優勢。傳統的3D高斯潑濺方法需要對每個場景優化30000次疊代,大約耗時13分鐘,才能得到PSNR(圖像質量指標,數值越高越好)約為23.6的結果。AsySplat只需不到1秒,就能得到PSNR為24.0的結果——在速度上快了將近800倍,質量上還略勝一籌。如果再給AsySplat10次快速的後優化(整個過程只需18秒),PSNR可以進一步提升到25.2,超過了另一個精心設計的優化方法Scaffold-GS的24.8。
與它最直接的競爭對手LongLRM相比,AsySplat的表現更加全面而均衡。在訓練效率上,AsySplat的參數量從142M降到了98M(減少了約30%),在最高解析度階段的每次疊代時間從8.5秒縮短到6秒(減少了約30%),GPU內存占用從52G降到48G。累計整個訓練過程,AsySplat大約需要54小時,而LongLRM需要76小時。
在推理(也就是實際使用時)的效率上,AsySplat的計算量從20.2萬億次浮點運算(TFLOPs)降到16.2萬億次,GPU內存從26G降到22G,預測出的高斯數量從800萬個減少到400萬個。高斯數量減少的意義在於,後續的快速優化階段變得更快——從LongLRM的50秒縮短到AsySplat的18秒,快了將近兩倍。
在零樣本泛化能力(也就是在訓練時從未見過的場景類型上的表現)方面,AsySplat表現出了明顯的優勢。在Tanks&Temples數據集上,AsySplat在不做任何優化的情況下就全面優於LongLRM。在MipNeRF-360數據集上,AsySplat的PSNR比LongLRM高出約0.7。在深度混合(Deep Blending)數據集上,AsySplat在各項條件下均優於LongLRM,其中在給定相同時間預算的條件下,AsySplat的PSNR比LongLRM高出將近1.0。最為顯著的差異出現在合成場景數據集Replica上:在不做任何優化的情況下,AsySplat的PSNR(27.46)就已經超過LongLRM做了10次優化後的結果(28.37接近,但要注意LongLRM優化了10次而AsySplat是0次);而當兩者都做10次優化時,AsySplat(30.83)比LongLRM(28.37)高出了超過2.5個PSNR——這是一個相當顯著的差距。
研究團隊還額外測試了AsySplat在稀疏視角場景下的表現——也就是只給兩張照片來重建場景的極端情況。在RealEstate10K數據集的這項測試中,AsySplat的PSNR(28.27)超過了參數量比它大三倍多的DepthSplat(27.47,354M參數)和GS-LRM(28.10,300M參數),再次印證了不對稱架構帶來的參數效率提升。
五、拆解設計:每個決策都有它的道理
研究團隊並沒有滿足於展示整體結果,他們還做了大量細緻的拆解實驗,逐一驗證每個設計決策的必要性。這些實驗在256×256的低解析度下進行,以節省時間,但已經足以說明問題。
關於最終如何把幾何分支和外觀分支的資訊合併來預測三維高斯參數,團隊驗證了"兩者都需要"的結論。如果只用幾何分支的粗粒度資訊來預測,PSNR會下降約0.7;如果只用外觀分支的細粒度資訊,由於缺乏來自幾何分支的深度資訊指導,效果同樣不理想。只有把兩者融合,才能達到最好的效果。
關於雙邊連接模組中的雙向資訊交流,實驗表明兩個方向的交叉注意力都不可或缺。單獨去掉任何一個方向(無論是幾何到外觀的方向,還是外觀到幾何的方向),都會導致性能下降。
關於不對稱設計本身的合理性,研究團隊設計了一個三方對比實驗。第一種是單分支設計,使用細粒度碎片處理所有資訊(包括幾何和外觀),計算量最大(6104 GFLOPs);第二種是雙分支設計,但兩個分支都使用相同的細粒度碎片(pc=pf=8),計算量依然較大(5892 GFLOPs);第三種是AsySplat的不對稱雙分支設計,幾何分支用粗粒度碎片(pc=16),外觀分支用細粒度碎片(pf=8),計算量大幅降低(2033 GFLOPs)。從渲染質量來看,三種設計的PSNR相同(19.24、19.24、19.24),但從幾何精度來看,雙分支設計確實比不對稱設計更精確(AbsRel分別為0.44和0.55)——這直接驗證了研究的第一個核心觀察:更高的幾何精度並不帶來更好的渲染質量。不對稱設計用大約三分之一的計算量實現了相同的渲染質量,印證了整個方法的核心邏輯。
關於幾何分支中Mamba和注意力層的比例,團隊通過系統實驗發現存在一個"甜蜜點"。當每個階段8層網路中有6層是注意力層、2層是Mamba時(2m6a),模型在渲染質量和幾何精度上均表現最佳;隨著Mamba層比例增加,性能單調下降;純Mamba的配置(8m0a)表現最差。這些實驗同時報告了深度估計精度,數據顯示Mamba比例越高,深度估計越不準確,這說明Mamba在多視角匹配任務上確實存在天然的局限性。
關於參數在幾何分支和外觀分支之間的分配比例,團隊測試了從90%/10%到50%/50%的多種方案。結果表明,90%的參數給幾何分支、10%給外觀分支時性能最好;隨著外觀分支比例增加(即幾何分支比例降低),模型性能特別是在零樣本場景上的泛化能力明顯下降。這背後的邏輯是:幾何重建是一件本質上困難的任務,即便不需要極致精度,網路也需要足夠的容量來隱式地完成跨視角匹配——這一點容不得吝嗇。
關於稀疏注意力模組中的卷積步驟,實驗證明這一步驟至關重要。去掉卷積塊後,模型性能下降超過1.0 PSNR,說明在進行稀疏注意力計算之前,必須先讓每個代表點充分匯聚周圍的局部資訊,否則"抽樣檢查"的代表性就會嚴重不足。
為了進一步證明"緊湊的AsySplat"之所以有效,不是因為參數少的模型本來就夠用,團隊還與幾個參數量相近的LongLRM變體進行了對比。無論是把LongLRM削減到18層(103M參數),還是減小特徵維度(99M參數),還是引入與AsySplat相同的層次化參數設計(102M參數),這些變體的性能都明顯低於AsySplat(98M參數)。這說明,緊湊模型取得好性能並非偶然,而是不對稱架構帶來的參數效率提升在發揮作用。
歸根結底,AsySplat證明的是一件聽起來簡單但在實踐中需要大量工程智慧才能落地的事情:當你真正理解不同任務的難度和需求,把資源精準地投放到最需要的地方,你就能用更少的資源做到同樣甚至更好的事情。這個道理說起來人人都懂,但在複雜的神經網路設計中真正實現它,需要的不只是直覺,更需要大量嚴謹的實驗驗證和設計疊代。
研究團隊也坦誠地指出了這項工作目前的局限性。AsySplat在感知質量指標LPIPS上仍然落後於傳統優化方法——這是大多數前饋式通用三維重建模型的通病,因為它們無法像傳統方法那樣根據渲染誤差動態增加高斯數量來修補細節薄弱的區域。研究團隊認為,將AsySplat節省下來的參數預算用於引入這種動態緻密化機制,是一個值得探索的未來方向。
從更大的視角來看,AsySplat所代表的"按任務難度和需求分配計算資源"的設計哲學,或許會為整個電腦視覺領域的模型設計提供一種新的思路——與其追求更大、更深、更均勻的網路,不如先想清楚每個子任務真正需要什麼,然後有的放矢地設計。
Q&A
Q1:AsySplat比傳統3D高斯潑濺方法快多少?
A:AsySplat處理一個場景只需不到1秒,而傳統3D高斯潑濺方法需要大約13分鐘,速度差距將近800倍。更重要的是,AsySplat不做任何優化時的畫質(PSNR 24.0)已經略好於傳統方法優化30000次後的結果(PSNR 23.6)。
Q2:AsySplat的兩條處理流水線分別負責什麼,為什麼不能合成一條?
A:幾何分支負責推斷場景的三維結構(物體的位置和深度),使用粗粒度圖像碎片和大量網路參數;外觀分支負責推斷顏色紋理等細節,使用細粒度碎片但參數量只有前者的約十分之一。之所以要分開,是因為這兩項任務的難度和精度需求差異懸殊——合在一條流水線里處理,要麼浪費了大量計算資源,要麼無法兼顧兩者的不同需求。
Q3:AsySplat為什麼在從未見過的場景上表現反而更好?
A:這很可能與不對稱架構帶來的參數效率提升有關。由於每組參數都專注於特定任務(幾何推斷或外觀建模),而不是籠統地處理所有資訊,模型學到的特徵更具泛化性,而不是過擬合到訓練數據的特定外觀上。在合成場景Replica數據集上,經過10次優化後AsySplat的PSNR比LongLRM高出超過2.5,進一步說明其內部表徵質量更高。






