這項由北京大學、香港科技大學、北京航空航天大學、福州大學等多家機構聯合完成的研究,發表於2026年神經資訊處理系統頂級會議(NeurIPS 2026),論文編號為arXiv:2607.15278v1,發布於2026年7月16日。有興趣深入了解的讀者可通過該編號在arXiv平台查詢完整論文。
一、先想清楚再動筆,還是邊畫邊看?
你有沒有見過那種下棋高手,每走一步之前都會在腦子裡推演好幾步後續棋局,然後才落子?與此相反,還有一種人下棋喜歡"走一步看一步",全憑直覺,結果往往在關鍵岔路口做出錯誤決定,後悔莫及。
這兩種下棋風格,恰恰對應了當前影片生成AI領域的兩種主流技術路線,而研究團隊正是從這個根本矛盾出發,提出了他們的新方案。
今天AI影片模型的能力已經相當驚人。它們不僅能生成逼真的影片畫面,還開始嘗試"解題"——比如在影片裡演示如何走出一個迷宮,如何移動漢諾塔的圓盤,如何用一筆畫完一個圖形。這類任務不只是"好看",而是要求AI在一幀一幀的畫面里保持嚴密的邏輯一致性,每一步都不能走錯,否則整個解題過程就會崩潰。
問題來了:現有的影片AI在這件事上表現得並不令人滿意。背後的原因,研究團隊用一個極其清晰的框架做了拆解。
目前有兩大類影片生成方式。第一類叫做"雙向擴散",可以理解為這類AI在生成影片時,會把整段影片同時放在眼前反覆修改,前面的幀可以根據後面的資訊來調整,整體協調性很好,邏輯推理能力也強。但這種方式的代價是極高的計算成本——每次修改都要把整段影片重新過一遍,速度非常慢,完全不適合實時流式輸出。第二類叫做"流式自回歸擴散",這類AI生成影片就像打字一樣,從左到右一幀一幀輸出,已經生成的幀不會再改變。這種方式速度快、延遲低,適合實時應用,但致命的弱點在於:一旦某一幀出現了錯誤判斷,後續所有幀都只能在這個錯誤的基礎上繼續生成,無法回頭修正,就像在一張白紙上寫字,寫錯了卻沒有橡皮擦。
研究團隊把這對矛盾稱為"核心張力":要麼推理能力強但速度慢,要麼速度快但邏輯容易前後矛盾。他們的目標,就是同時擁有這兩種優點。
二、像建築師一樣先畫草圖,再精修細節
解決這個矛盾的核心思路,研究團隊借用了建築設計里一個人人都熟悉的流程。建築師不會一上來就直接畫出每扇窗戶的螺絲釘位置,而是先畫一張粗略的整體布局草圖,確認方向沒問題,再畫各樓層的平面圖,最後才到具體的施工圖紙。每一層圖紙都在上一層的基礎上增加細節,隨時可以在不影響整體方向的前提下做局部調整。
這個框架就是HDR(Hierarchical Denoising for Visual Reasoning,層次化去噪視覺推理)的核心設計理念。
具體來說,HDR把影片的內容組織成一棵"樹形結構"。樹的頂端是最粗略的層次,只有極少數幾個"節點",每個節點代表整段影片的高層次摘要,就像建築師的總體布局草圖,畫面模糊但方向明確。往樹的下方走,節點數量越來越多,每個節點代表的時間段越來越短,內容越來越具體,直到最底層的葉節點,才對應真正要輸出的影片幀,就像最終的施工圖紙,清晰精確。
在生成影片時,HDR從樹的頂端開始往下走。頂層節點先被生成,但故意保留一定程度的"模糊性"——用專業術語說是保持在較高的噪聲水平,用建築類比來說就是草圖還沒畫定,可以隨時改。這種模糊性是刻意設計的,因為它意味著模型還沒有把某個全局計劃"鎖死",仍然有餘地進行全局推理和調整。等到頂層的全局方向大體確定下來,再傳遞給下一層,下一層在此基礎上細化,再往下一層繼續細化,最終在底層生成清晰的影片幀並流式輸出給用戶。
這個過程有一個關鍵的設計細節:每一層被"去噪"(即從模糊變清晰)的程度是不一樣的。粗糙的高層節點只做少量去噪,保持一定程度的不確定性,可以同時維持多種可能的全局方案;精細的底層節點則做充分去噪,把高層確定下來的方向落實成具體的畫面細節。研究團隊把這套設計稱為"匹配層次的去噪預算",並用資訊熵的數學概念推導出了每一層應該分配多少去噪步驟。對於他們實驗中使用的六層結構,計算出來的各層去噪步驟分別是5、8、13、20、32、50步,越到底層步驟越多,越精細。
三、只看必要的資訊:稀疏層次注意力機制
解決了"先謀後動"的生成順序問題,還有另一個技術挑戰需要攻克:計算效率。
在雙向擴散模型里,每個影片幀對應的計算節點都要和其他所有幀的節點互相"看一遍",這在技術上叫做"全注意力"。幀數越多,需要互相查看的次數就以平方速度暴增,計算量極大。
HDR為此專門設計了一套叫做SHAP(Sparse Hierarchical Attention Pattern,稀疏層次注意力模式)的機制。其核心思想是:不是每個節點都需要看所有其他節點,只需要看少數幾個關鍵鄰居就夠了。
具體來說,樹形結構里的每個節點只需要關注三類資訊:同一層里緊挨著自己的前一個節點(保持同層的時序連貫性)、自己在上一層的"父節點"(獲取更粗粒度的全局方向)、以及父節點旁邊的兄弟節點(獲取鄰近粗粒度區段的邊界資訊)。此外,所有節點都可以看到影片的第一幀(作為整個生成過程的初始條件)。
這種設計讓每個節點只需要查看固定數量的其他節點,無論影片有多長,這個固定數量都不會變。於是整個計算量從平方級別降低到了線性級別——影片長度翻倍,計算量也只是翻倍,而不是變成四倍。同時,這種樹形的稀疏注意力機制還天然支持跨層級的資訊共享:粗糙層生成後,其對應的計算緩存(KV緩存)可以直接被精細層復用,不需要重新計算,進一步提升了效率。
四、六項考驗:從迷宮到漢諾塔的嚴苛測試
為了公平評估新方法,研究團隊專門構建了一套全新的測試基準,因為現有的影片推理測試大多不適合評估這種需要長序列邏輯一致性的任務。
這套測試包含六項任務,每項都有鮮明的特點。迷宮導航要求AI生成一段影片,展示一個小球從迷宮入口出發,按照正確路徑到達終點,任何穿牆或走錯路都會被判定失敗。漢諾塔要求AI正確演示這個經典益智遊戲的解法,每次移動圓盤都必須符合規則。一筆畫要求AI生成一段影片,展示如何不重複地用一條連續線條覆蓋給定圖形的所有格子。滑塊拼圖即俗稱的"華容道",要求AI演示正確的移動序列。推箱子(Sokoban)是另一個經典的邏輯推理遊戲。倒水遊戲要求AI演示如何將各種顏色的液體在試管之間轉移,最終讓每支試管都只含一種顏色。
測試集包含370個評測影片,每項任務都按照難度分級,而且刻意包含了"超出分布"(OOD)的案例——就是訓練時從未見過的特殊情況,用來測試模型是否真的學會了規則,還是只是在死記硬背。
評分使用兩個維度:成功率衡量任務是否被完整正確地完成,平均進度衡量完成了多少比例的中間步驟,後者可以反映模型的中間推理是否保持邏輯一致性,即使最終沒有完全成功。
五、數字背後的故事:HDR表現如何?
測試結果給出了清晰的對比圖景。
與速度最快的流式自回歸基準方法CausalForcing相比,HDR的總體成功率從34.22分提升到了60.29分,相對提升幅度高達76.2%。平均進度從76.00提升到了89.56,說明即便偶爾在最後一步出錯,HDR的中間推理過程也明顯更為連貫和正確。
六項具體任務中,進步最為顯著的是迷宮導航,成功率從12分飆升至78分。漢諾塔從45分升至58.75分,Sokoban從40分升至78.33分,一筆畫從48.33分升至70分。滑塊拼圖和倒水遊戲的提升相對溫和,但也均有改善。
與使用全局注意力機制的雙向擴散基準相比,HDR在不使用全局注意力的前提下,總體成功率(60.29)已經與雙向擴散(60.00)基本持平,甚至略高,而推理速度則相差懸殊——每生成一個影片片段,HDR只需要0.70秒,而雙向擴散需要37.92秒,整整快了54.2倍。另一個流式基準CausalForcing的速度是0.72秒,與HDR幾乎相同,說明HDR在提升推理能力的同時,沒有犧牲速度優勢。
從定性案例中可以更直觀地看到差異。在迷宮任務里,CausalForcing到達一個分叉路口後,會立刻選擇一條路並把這個選擇"鎖定",如果選錯了,後續幀只能繼續在錯誤的路上走下去,最終無法到達終點。HDR面對同樣的分叉路口,先在高層次的粗糙表示里做全局規劃,確認正確路徑後,再在精細層次生成具體的移動畫面,因此能夠做出正確的選擇。類似的對比在一筆畫任務中也清晰可見:CausalForcing會漏掉某些格子導致路徑不完整,而HDR通過層次化規劃確保了全覆蓋。
六、抗壓能力:減少數據和計算預算時的表現
研究團隊還設計了兩組"壓力測試",專門考察HDR在資源受限條件下的魯棒性。
第一組測試減少了去噪步驟數量。在正常情況下使用50步去噪,當步驟減少到1步(極端情況)時,雙向擴散的成功率從60.00驟降至17.78,CausalForcing從34.22降至11.25,而HDR從60.29降至34.72,保留了57.6%的完整性能,遠高於另外兩者的29.6%和32.9%。高層次的粗糙節點即使在極少步驟的情況下仍然能提供有效的全局方向指引,這是HDR抗壓能力的來源。
第二組測試減少了訓練數據量。當訓練數據只剩下全部數據的2%時,雙向擴散的成功率只剩下31.18分,僅保留了52%的完整性能。HDR在同樣條件下保留了82.9%的完整性能,成功率達到50分。研究團隊認為,這說明層次化的結構為模型提供了一種"歸納偏置",幫助模型更有效地從少量數據中學習可遷移的推理規則,而不是死記硬背訓練樣本。
七、從虛擬到現實:機器人實驗室里的挑戰
為了驗證HDR不只是在合成數據上好用,研究團隊還做了一個物理世界的機器人實驗。
實驗場景是讓一個機械臂控制一個毛絨玩具,把它從迷宮的入口移動到出口,迷宮由玩具積木搭建而成。這個場景充滿了現實世界的複雜性:積木擺放不夠規整、光線條件多變、物體識別可能有偏差、攝影機視角存在遮擋。研究團隊先用3000個虛擬迷宮影片做預訓練,然後只用50個真實機器人影片做微調,生成的影片再由一個"逆動力學模型"轉換為機械臂的實際操作指令。
測試設置按照難度分為簡單、中等、困難三個級別,還專門設計了一個"超出分布"級別,在這個級別里積木被斜放或疊放,形成和訓練時完全不同的不規則迷宮形態。
在簡單級別,HDR成功率達到80/100,CausalForcing也是80/100,兩者打平。在中等級別,HDR達到60/100,超過CausalForcing。在困難級別,CausalForcing得0分,HDR也只有0分,說明這個難度對兩者都是巨大挑戰。在最具挑戰性的不規則積木關卡,HDR拿到了20/80,而CausalForcing同樣得0分。這組結果說明HDR確實能夠把它在虛擬環境中學到的層次化推理能力,遷移到真實物理場景中去。
八、層次越深,思考越深:各層作用的分析
研究團隊還對層次數量做了系統分析,從只有1層(等同於普通流式自回歸)到完整的6層逐步增加。結果顯示,隨著層次數量的增加,模型表現呈現出穩定的提升趨勢。1層時成功率34.22,2層升至38.38,3層升至40.12,4層升至59.15,5層升至60.31,6層達到60.29(與5層非常接近)。平均進度同樣從76.00穩步升至89.56。這說明每一個額外的層次都在貢獻真實的推理價值,而不是其中某一個層次起了全部作用。
此外,研究團隊還測試了不同去噪分配策略的效果。除了他們推導出的熵匹配策略(5、8、13、20、32、50步)之外,他們還測試了"所有層均使用50步"的策略、"前五層各用5步最後一層用50步"的策略,以及指數增長策略(2、4、8、16、32、50步)。熵匹配策略在總體平均進度上表現最佳,在成功率上也名列前茅,與理論預期一致:過度去噪高層節點會過早鎖定全局計劃,削弱層次化推理的靈活性。
九、機器人技能泛化:RoboDojo模擬平台上的測試
研究團隊還進一步把HDR的思路拓展到了機器人具身操作領域,創建了HDR-WAM(世界動作模型)變體,在RoboDojo模擬平台上進行了測試。這個平台包含42個機器人交互任務,涵蓋泛化能力、精度、長時程規劃、記憶能力和開放場景五個維度。
HDR-WAM在沒有使用任何機器人專屬預訓練數據的情況下,整體得分達到5.47,平均成功率3.00%,超越了同樣沒有使用機器人預訓練的AHA-WAM(4.82/2.39%)和Fast-WAM(3.48/2.03%),在無預訓練類方法中排名第一。特別值得關注的是長時程任務維度,HDR-WAM得分9.85,成功率4.75%,在所有方法(包括有預訓練數據的方法)中排名第一。這正好呼應了HDR的設計初衷:層次化結構天然擅長維護跨越很長時間段的任務邏輯一致性。
HDR-WAM的具體實現方式是把整個任務影片分成兩個視角:一個"全局視角",從整段任務影片中均勻採樣9幀,作為任務進度的稀疏錨點;一個"局部視角",從當前時刻出發,取最近的9幀加上4幀未來里程碑幀,形成局部動作執行窗口。兩個視角的資訊通過精心設計的注意力掩碼協同工作:影片流負責預測未來畫面,動作流負責預測可執行的具體動作,兩者既共享視覺上下文,又保持各自的計算獨立性。
十、殘餘錯誤的本質:哪裡還沒做到位?
研究團隊在論文中坦誠地呈現了HDR的失敗案例,並對其模式做了歸納。
一個典型的迷宮失敗案例里,HDR成功路由到達了目標走廊,中間推理完全正確(平均進度滿分1.0),但在最後幾幀,迷宮牆壁消失了,導致最終幀的迷宮結構是錯誤的,被評判為失敗。類似的現象也出現在Sokoban和倒水任務中:推理邏輯基本正確,但在接近尾聲時出現了視覺上的"狀態漂移"——箱子的牆壁突然消失,或者兩種顏色的液體合併成了一種顏色。
研究團隊把這類錯誤定性為"後期狀態一致性漂移",與那種從一開始就走錯方向的"規劃失敗"有本質區別。高層次節點通常已經正確編碼了預期的任務結構,精細層次也基本按照這個結構生成了畫面,但在需要精確保持幾何細節、物體身份或終止狀態的最後階段,模型的精確控制力還不夠穩定。對此,研究團隊提出的改進方向是引入約束感知的精細化機制,或者在生成末尾幀時加入輕量級的驗證步驟。
說到底,HDR做的事情可以用一句話概括:給AI影片生成加上了"先謀後動"的能力。它不是簡單地讓AI變快,也不是單純地讓AI更聰明,而是找到了一種結構,讓"快"和"聰明"可以同時存在。
這對普通人意味著什麼?當你和AI互動,希望它幫你演示一道複雜的數學題的解題步驟,或者展示一個棋局的最優走法,或者規劃一段有多個約束條件的旅行路線,這類需要"多步驟邏輯一致"的任務,未來可以通過影片生成的方式得到更可靠的呈現。在機器人領域,這項技術的意義更為直接:機器人需要實時響應、快速動作,同時又不能在複雜任務中"走一步看一步"導致後續失誤,HDR正是為這種需求量身定製的解決方案。
當然,論文也誠實地指出,HDR目前仍然在某些困難任務(如滑塊拼圖、倒水遊戲的高難度關卡)上表現不夠理想,且在物理機器人的困難級別測試中成功率仍為零。通往真正的通用物理世界模型,這項研究是一個有意思的起點,但距離終點顯然還有很長的路要走。
對這項研究感興趣的讀者,可以通過arXiv編號2607.15278查閱完整論文,項目演示頁面也包含了大量可視化案例。
---
Q&A
Q1:HDR影片生成和普通AI影片生成有什麼區別?
A:普通流式AI影片生成是從左到右一幀一幀輸出,一旦某幀出錯就無法糾正。HDR在正式輸出前會先建立一個從粗到細的層次結構,先在模糊的高層次節點裡做全局規劃,確認整體方向後再逐層細化,最終才輸出清晰幀,相當於先有草稿再有定稿,避免了早期錯誤的連鎖傳導。
Q2:HDR處理影片比雙向擴散模型快多少?
A:在流式輸出階段,HDR每生成一個影片片段只需0.70秒,而雙向擴散需要37.92秒,HDR快了約54倍。這是因為HDR採用稀疏層次注意力機制,每個節點只需關注少數幾個鄰居節點,而雙向擴散需要讓每一幀都和所有其他幀互相計算,計算量隨幀數平方增長。
Q3:HDR用少量數據訓練效果會不會變差很多?
A:相比雙向擴散,HDR對數據量減少的抵抗力更強。當訓練數據減少到只剩2%時,雙向擴散的成功率保留了52%,HDR保留了82.9%。研究團隊認為這是因為層次化樹形結構提供了一種有效的歸納偏置,幫助模型從少量數據中學習可遷移的推理規則,而不是死記訓練樣本。






