這項由台灣陽明交通大學多位研究人員聯合完成的研究,發表於2026年7月的SIGGRAPH Conference Papers(會議時間為2026年7月19日至23日,在美國洛杉磯舉行),論文編號為DOI 10.1145/3799902.3811151,arXiv編號2607.08770。感興趣的讀者可通過上述編號查閱完整原文。
手機拍影片時,如果拍攝對象動得太快——比如飛速旋轉的風扇葉片、高速行駛的賽車——畫面往往會變得模糊一片,這是因為普通相機有個天然的短板:它每隔固定時間才"咔噠"一聲拍一幀,動得太快的東西就會留下殘影。科學家們因此發明了一種"事件相機",它不按固定節拍拍照,而是像人眼神經一樣,只要某個像素點的亮度發生了變化,就立刻記錄下來,精度可以達到百萬分之一秒。這種相機在高速運動、強光弱光交替的場景下表現出色,是無人機導航、高速機器人視覺等領域的理想傳感器。
然而,事件相機有一個令人頭疼的問題:它輸出的不是普通照片或影片,而是一串稀疏的"亮度變化信號",和人類習慣看到的畫面格格不入,現有的大多數電腦視覺算法根本看不懂這些數據。如何把這些零散的信號還原成人眼可以欣賞的高質量影片,一直是這個領域的核心挑戰。更難的是,不同任務對這些信號的處理方式也不一樣——有時候我們只有事件信號,想從頭重建畫面;有時候我們有起始幀,想預測接下來會發生什麼;還有時候我們有開頭和結尾兩幀,想補出中間過渡的畫面。過去這三件事往往需要三套不同的系統來分別處理,既麻煩又低效。
台灣陽明交通大學的這支研究團隊提出了一個名為LongE2V的方法,核心思路是藉助已經在海量影片數據上訓練好的"影片擴散模型"——一種能夠憑藉豐富的視覺經驗生成和補全影片的AI系統——來同時解決上面三個問題,並專門設計了一系列配套機制,讓生成的影片在極長序列下也能保持穩定、不漂移、不出現鬼影。
一、從模糊到清晰:現有方法為什麼總差那麼一口氣
要理解這項研究解決了什麼,先得知道之前的方法卡在哪裡。
過去最主流的做法是用"回歸模型"來處理事件相機數據。所謂回歸,可以這樣理解:假設你要猜一個人的身高,你把所有可能的身高都投票給一個最穩妥的中間值,結果雖然不會太離譜,但也很難非常準確。把這個邏輯用到影片重建上,模型會傾向於生成一個"取悅大多數可能情況"的畫面,也就是說,它會把細節磨平,生成一張看起來差不多但其實哪裡都不夠清晰的模糊圖像。就像讓一個畫師憑記憶臨摹一幅他沒見過幾次的畫,他畫出來的往往是一個模糊的輪廓,而不是精確的細節。這種現象在學術上叫"回歸均值",是導致E2VID等經典方法畫面模糊的根本原因。
近年來,擴散模型在圖像和影片生成領域大放異彩,它的原理更像是一位有豐富繪畫經驗的藝術家:在大量真實圖像的薰陶下,它學會了"什麼樣的畫面是真實、合理、細節豐富的",所以在補全或重建圖像時,它會主動填充合理的細節,而不是簡單取個平均值。把擴散模型用於事件相機影片重建,理論上可以突破模糊的瓶頸。
但問題隨之而來。當需要處理的不是短短幾幀,而是成百上千幀的長序列時,擴散模型會出現嚴重的"時間漂移"現象。可以用一個比喻來理解:假設你在玩一個接龍遊戲,每次都用上一個人說的最後一個詞接下去,起初還好,但隨著接龍越來越長,每個人的小偏差都會被累積放大,最終說出來的話和開頭已經完全風馬牛不相及。擴散模型在長影片生成中也是如此——它用自己生成的上一段作為下一段的參考,每一段的小誤差都會在下一段被繼承甚至放大,久而久之顏色偏了、結構亂了、人物飄移了,這就是所謂的"錯誤累積與時間漂移"。
另外,在影片幀插值(補中間幀)這個任務上,已有方法在大幅度運動場景下容易出現"鬼影"——同一個運動物體在畫面里出現了兩個半透明的輪廓,像是照片曝光過度時的重影,嚴重影響視覺效果。
LongE2V正是為了同時解決這三個問題而誕生的。
二、借力打力:用現成的"影片大腦"處理事件相機信號
這支研究團隊的核心策略,是不從零開始訓練一個全新的AI,而是站在巨人的肩膀上。他們選擇了CogVideoX這個已經在大規模影片數據上訓練好的影片擴散模型,作為自己系統的"大腦底座"。
這個底座的價值在於:它已經從海量真實影片中學到了"現實世界的視覺規律"——物體在運動時應該是什麼樣子、光影是怎麼變化的、細節應該如何分布。有了這個基礎,研究團隊只需要再用相對少量的事件相機數據進行"微調",就能讓這個大腦理解事件信號的語言,而不需要從頭餵給它數以億計的訓練樣本。這就像一個已經會說英語和法語的人學西班牙語,比一個從零開始學外語的人要快得多、學得也好得多。
在技術實現上,事件相機產生的信號首先被整理成一種叫"事件體素"的格式——把一段時間內的亮度變化信號按時間分成若干層,疊成一個三維數據塊。研究團隊把這個數據塊設置成三層,恰好可以像普通RGB三通道圖像一樣被標準的圖像編碼器處理,這個小巧思省去了專門設計新編碼器的麻煩。
在模型的輸入端,系統同時接收三類資訊:當前時間窗口的事件體素、一幀"起始參考幀"(告訴模型現在世界長什麼樣),以及前一段影片作為"歷史上下文"(告訴模型剛才發生了什麼)。這三類資訊經過各自的編碼處理後,在特徵空間中拼接在一起,送入擴散模型進行影片生成。為了讓擴散模型能處理多出來的事件通道,團隊對模型的第一個投影層進行了擴展,並用LoRA(一種高效的低秩微調技術,相當於只調整模型中少數幾個"旋鈕"而不是全部重新擰一遍)來微調主幹網路,大大降低了訓練成本。
三個不同任務共用同一套權重,通過改變輸入條件來切換:純事件信號輸入就是影片重建,加上起始幀就是影片預測,同時給出起始幀和結束幀就是幀插值。這種"一套系統、三種用途"的設計是LongE2V在靈活性上的重要優勢。
三、防止"跑偏":讓長影片保持穩定的兩把鑰匙
解決了單段影片的質量問題之後,更大的挑戰出現了:如何讓幾百幀乃至幾千幀的長影片保持始終如一的穩定?
研究團隊為此設計了兩套機制,可以把它們理解為"糾偏系統"的兩個組成部分。
第一套機制叫"自回歸展開訓練"。這個名字聽起來複雜,背後的道理卻很樸素。在訓練階段,模型最初是餵給它"完美的、真實的"前一段影片作為歷史上下文,這當然沒問題。但在實際使用時,哪裡來的"完美的前一段"?前一段本身就是模型自己生成的,多少會有些誤差。如果模型只見過完美的歷史,突然要面對自己生成的不完美歷史,就會手足無措,錯誤會迅速放大。
於是,訓練團隊在模型基本學會基礎技能之後,引入了一個"自我對抗"的訓練階段:先用模型對訓練集生成一遍預測結果,然後把這些有誤差的生成結果當作歷史上下文,繼續訓練模型。這個過程重複進行三輪,每一輪模型都在適應自己可能犯的錯誤,慢慢地學會在"不完美的歷史"下依然生成穩定的結果。這就像一個廚師,起初只用最好的食材練手,後來刻意用賣相普通的食材反覆練習,最終無論食材好壞都能做出美味的菜餚。
第二套機制叫"自適應上下文切換"。即便有了自回歸訓練的加持,錯誤依然可能在極長序列中緩慢累積。這套機制的作用是動態判斷:當前生成的這一段,是否真的還在借鑑歷史上下文?如果歷史上下文已經和當前內容"脫節"了(模型注意力幾乎不再看歷史了),那就主動觸發一次"上下文更新"——用剛生成的這段替換掉過時的歷史,重新校準。
具體判斷方法是:在擴散模型內部,每個注意力層都有一個"注意力權重矩陣",記錄著當前幀在生成時有多依賴歷史上下文幀。研究團隊計算出所有層、所有注意力頭上,當前幀對歷史幀的平均注意力權重。當這個數值低於0.05時,說明歷史上下文已經失去了參考價值,系統就丟棄當前生成結果,更新歷史上下文,然後重新生成。這就像一個導航系統,不是每隔固定時間就重新規劃路線,而是在發現"當前地圖和實際道路不符了"的時候才觸發重新規劃,既避免了過度更新帶來的不連貫,也防止了長時間不更新導致的偏航。
四、補幀的精妙:解決"正放和倒放"之間的時間錯位
幀插值任務有一個獨特之處——給了開頭幀和結尾幀,要補出中間的過渡。一種自然的思路是:從開頭往後生成一遍(正向分支),再從結尾往前生成一遍(反向分支),然後把兩遍的結果融合起來,取長補短。
但這裡藏著一個不易察覺的技術陷阱。
擴散模型內部會把影片幀編碼成一種壓縮的"潛在表示"(可以理解為影片的"濃縮精華"版本),而這個編碼過程是有時間結構的——它按順序壓縮幀,前後幀之間存在依賴關係,就像用特定方式摺疊好的紙,順序不能亂。如果想把反向分支的結果拿來和正向分支對齊,直接在"濃縮精華"層面做時間翻轉,得到的結果和先把影片翻轉再重新壓縮的結果是不一樣的。換句話說,在壓縮空間裡翻轉,和在原始畫面空間裡翻轉,不是同一件事——這個不等式是導致兩個分支產生錯位的根本原因。
為了解決這個問題,研究團隊提出了"重編碼對齊"方案:不要在壓縮空間裡直接翻轉,而是先把壓縮後的結果解碼回真實畫面,在真實畫面層面做時間翻轉,然後再重新壓縮。雖然多了解碼和重壓縮兩步,但這樣得到的翻轉結果和直接翻轉影片再壓縮是等價的,兩個分支之間的時間對齊就此保證。
不過,解碼和重新壓縮的過程本身會造成一定的資訊損失——就像把一張照片從JPEG解壓再重新壓縮,每次都會損失一點細節。為了彌補這個損失,研究團隊又提出了"交叉殘差修正"方案:分別計算正向和反向分支在壓縮前後的"差值"(即損失掉的細節資訊),然後把正向分支的差值"注入"到反向分支對齊後的結果里,同時把反向分支的差值注入到正向分支里。這樣,兩個分支互相幫對方補回在重壓縮時丟失的細節,還順帶增強了兩個分支在時間上的一致性——因為互相交換了細節資訊,兩個分支對同一時刻的理解會更加接近。最終,兩個經過修正的分支通過加權混合(靠近起始幀時更信任正向分支,靠近結束幀時更信任反向分支)融合成最終的插值結果。
五、讓模型適應不同相機:事件體素密度增強
事件相機有各種不同的解析度和型號,不同相機在同樣的運動場景下產生的事件數據密度可能差異很大。如果模型只見過某種固定密度的事件數據,換一台相機就可能表現大幅下滑。
為了增強泛化能力,研究團隊設計了一種"密度增強"策略:在訓練時,隨機對事件體素進行縮放(縮放比例在合理範圍內隨機選取),然後隨機裁剪出目標尺寸。這樣,模型在訓練過程中見過各種不同密度的事件數據,對密度的變化就不那麼敏感了。同時,為了保證事件數據和影片幀之間的空間對齊,對事件體素的縮放和裁剪操作會同步施加到對應的影片幀上,確保兩者始終一一對應。此外,在歸一化處理時,參照了FireNet的方法,只基於非零值的統計量進行歸一化,以保留事件數據天然的稀疏性特徵。
六、實驗結果:在三個任務上全面超越前輩
研究團隊在多個真實世界數據集上對LongE2V進行了全面評測。訓練數據僅使用了BS-ERGB數據集的訓練集,共7636幀,規模相當小;但測試則覆蓋了ECD、MVSEC、HQF三個完全不同的數據集,序列長度從約300幀到2740幀不等,充分考驗了模型的泛化能力和長期穩定性。
在影片重建任務上,LongE2V在全部三個數據集上均取得了最佳的LPIPS指標(這個指標衡量的是人類對圖像質量的感知,分數越低越好)。與回歸類方法相比,LongE2V重建出的畫面細節更豐富、紋理更清晰,不再是那種"哪裡都差不多但哪裡都不清楚"的模糊感。在PSNR(峰值信噪比)和SSIM(結構相似性)指標上,LongE2V也與最強的回歸類基線(HyperE2VID)持平甚至超越。
在影片預測任務上,與唯一的擴散模型類對手VDM-EVFI相比,LongE2V的優勢非常顯著。以ECD數據集為例,PSNR從20.33提升到24.40,SSIM從0.614提升到0.771,LPIPS從0.244降低到0.110,三項指標全線大幅領先。更直觀的是,在處理HQF這類長達2430幀的超長序列時,VDM-EVFI的畫面會出現明顯的顏色漂移和結構崩塌,而LongE2V始終保持穩定的視覺質量。
在幀插值任務上,LongE2V沒有進行任何專門的微調,直接用重建和預測任務訓練好的權重,在零樣本的條件下與專門為幀插值設計並經過有監督訓練的CBMNet-Large和TLXNet+進行比較。結果是:在BS-ERGB測試集上,LongE2V的LPIPS(0.124)顯著優於CBMNet-Large(0.170)和TLXNet+(0.226);在HQF數據集上,LongE2V的全部三項指標均為最佳(PSNR 25.39,SSIM 0.800,LPIPS 0.105)。在處理大幅運動的真實場景時,CBMNet-Large出現了嚴重的鬼影和顏色錯誤,TLXNet+則結構崩塌,而LongE2V在零樣本條件下依然給出了清晰、連貫的插值結果,甚至連畫面中的文字細節都能清晰辨認。
七、額外能力與局限性
在訓練時以20%的概率引入文本提示之後,LongE2V獲得了一項額外能力:文本引導的事件影片著色。事件相機本身只記錄亮度變化,生成的重建影片是灰度的;但當用戶提供一段文字描述(比如"這個場景中央是一個五彩繽紛的積木結構……"),模型能夠在保持事件數據決定的結構和運動的前提下,按照文字的描述給畫面上色,實現灰度事件影片到彩色影片的自動轉換。通過XT切片(即把影片某一行像素在時間軸上的變化展開成一張圖)可以驗證,上色後的影片在時間上是連貫的,不會出現顏色一幀一幀地亂跳。
在速度方面,LongE2V每秒處理約0.28幀(即生成一幀需要約3.6秒),明顯慢於E2VID等非擴散類方法(每幀約0.0024秒),但比同類擴散模型VDM-EVFI(每幀約5.4秒)快了約1.5倍。這種速度差距在當前階段對實時應用還有限制,但研究團隊也指出加速推理是下一步的重要方向。
在局限性方面,當事件流非常稀疏或質量很差時,模型也會力不從心,重建出來的畫面質量明顯下滑。另外,事件相機本身存在一種叫"熱像素"的噪聲——某些像素點因為硬體缺陷會不斷觸發錯誤事件,LongE2V對這種噪聲比較敏感,有時會把噪聲當成真實信號保留甚至放大到重建畫面中。這兩點是當前版本尚未完全解決的問題。
說到底,這項研究最有意思的地方在於:它沒有試圖從零發明一套全新的AI,而是聰明地把一個已經"見多識廣"的影片生成模型,改造成了能聽懂事件相機語言的視覺專家。通過三套精心設計的配套機制——自回歸展開訓練、自適應上下文切換、重編碼對齊加交叉殘差修正——把擴散模型在長影片和精確插值上的短板補了起來。更難得的是,整套系統訓練數據量極小(不到八千幀),卻能泛化到多個完全不同的測試集,在三個任務上都打敗了專門針對各自任務設計的對手。
對於普通人來說,這項技術的潛在影響可能體現在這樣一些場景:無人機在夜間或強光環境下拍攝的事件相機數據,可以被還原成人類可讀的高清影片;高速運動的體育畫面可以被精確補幀,不再有鬼影;安防攝影機在極端光線條件下採集的事件數據,可以被轉化為結構清晰的監控畫面。當然,距離這些應用真正落地,還需要解決推理速度慢的問題,以及對噪聲魯棒性不足的問題。
下一步,研究團隊計劃探索加速推理的方法,以及更高效的長期記憶機制,讓系統在處理更長的影片序列時依然能夠保持穩定。
---
Q&A
Q1:事件相機和普通相機有什麼根本區別?
A:普通相機按固定節拍拍照,每隔固定時間輸出一整幀圖像;事件相機則不拍整幀,而是在每個像素點亮度發生變化時立刻記錄這個變化事件,精度可達百萬分之一秒。事件相機在高速運動和強光弱光交替場景下不會產生運動模糊,但輸出的是稀疏的變化信號,而不是人眼可直接看懂的圖像,需要後續算法重建成影片。
Q2:LongE2V為什麼可以用同一套權重做影片重建、影片預測和幀插值三件事?
A:LongE2V把這三個任務都統一成"基於事件信號的條件影片生成",通過改變輸入條件來區分任務:只有事件信號就做重建,加上起始幀就做預測,同時給起始幀和結束幀就做幀插值。由於底層都是同一個擴散模型在處理事件條件,權重可以共享,無需為每個任務單獨訓練一套系統。
Q3:LongE2V的幀插值為什麼是零樣本,效果卻比專門訓練的方法還好?
A:LongE2V在訓練時只針對重建和預測任務,從未用幀插值數據專門訓練。它能做幀插值,依靠的是"重編碼對齊"和"交叉殘差修正"兩套推理時的技巧,以及底層擴散模型本身從大量影片數據中學到的豐富視覺先驗。對比方法雖然專門訓練了幀插值,但在大幅運動和真實噪聲下容易產生鬼影和結構崩塌,而LongE2V的生成式方法在這些困難場景下反而更穩健。






