這項由南洋理工大學、Riemann Dynamics與惠靈頓學院聯合開展的研究,以預印本形式發布於2026年7月,論文編號為arXiv:2607.26811,研究方向聚焦於實時自動回歸
影片生成領域中的知識蒸餾問題。
如果你曾經用過AI生成影片的工具,你大概體驗過那種奇特的魔法感——只需輸入一段文字描述,系統就能輸出一段流暢的動態畫面。但這背後有一個讓工程師們頭疼已久的問題:高質量AI影片模型運行起來又慢又貴,根本無法做到實時生成。研究者們的解決思路是"蒸餾"——就好比把一位經驗豐富的廚師(大模型)的廚藝,提煉成一本精簡食譜,讓一位年輕廚師(小模型)也能用少得多的步驟做出差不多水準的菜餚。
這套"蒸餾"流程在學界已有一些成熟做法,但研究團隊注意到一個被大家忽視的奇怪現象:有時候給學生換一位資歷較淺的老師,反而比換一位資歷更深的老師教出更好的學生。這不符合直覺,卻在實驗中反覆出現。研究團隊沿著這條線索深挖,最終發現了整個培訓流程中隱藏的根本性錯誤,並提出了一套名為DistillAlign的修正方案。
一、蒸餾流水線的運作方式:從雙向擴散到逐幀生成
在理解研究發現之前,需要先了解現有的影片生成蒸餾流程是怎麼運作的。現有的高質量影片模型大多採用"雙向擴散"的方式工作——它可以在生成影片的任意時刻、往任意方向參考資訊,就像一個畫家可以隨時看整幅畫布來調整筆觸。這種方式生成質量很高,但速度極慢,無法做到實時輸出。
研究者們希望把這種雙向模型"蒸餾"成一種"單向、逐幀"的生成器——就像一個只能從左往右寫字、不能回頭修改的人,但速度極快,可以實現實時輸出。這類單向生成器被稱為"自回歸模型",是構建世界模型和實時交互影片的關鍵技術。
現有的蒸餾流水線通常分為兩到三個階段。以論文中重點分析的Causal Forcing流水線為例,第一階段是讓小模型學習一個大模型的逐幀生成風格;第二階段是用"一致性蒸餾"(Consistency Distillation,簡稱CD)把這個學生壓縮成只需少數幾步就能生成圖像的模型;第三階段是用"分布匹配蒸餾"(Distribution Matching Distillation,簡稱DMD)做最後的精細打磨。每個階段都有各自的"目標老師",而問題恰恰出在這三個階段的老師是否匹配上。
用一個更具體的比喻:如果你在培訓一名廚師學做法式料理,第一階段讓他跟著一位中餐大廚練刀工;第二階段讓他快速記住中式食譜的要點;但第三階段突然換成法式料理大廚來考核,這位學生就會遇到麻煩——他之前積累的大量中式料理"感覺",在面對法式考核時反而成了負擔。
二、被忽視的關鍵問題:不同階段的老師其實在教不同的東西
研究團隊發現,現有方法幾乎無一例外地把"初始化階段"和"DMD精煉階段"割裂開來,用不同的目標分布分別訓練,卻用統一的視覺評分(如VBench)來判斷階段性成果的好壞。這裡隱藏著一個根本性誤判。
為了驗證這個直覺,研究團隊做了一個精巧的"換老師實驗"。他們採用了兩套數據:一套來自Wan-14B(一個參數量140億的大模型),另一套來自Wan-1.3B(一個參數量13億的小模型)。在Causal Forcing流水線中,他們系統性地交叉組合初始化階段和DMD階段所用的老師,形成四種組合方式。
結果相當耐人尋味。當初始化和DMD用同一套數據時(無論是都用14B還是都用1.3B),最終效果都好於混搭的情況。更關鍵的是,"初始化用14B數據、DMD用1.3B老師"的組合,反而比"初始化用1.3B數據、DMD用14B老師"的組合表現更好——儘管後者看起來在每個階段都用了更強的資源。這說明最終效果並不由老師的"檔次"決定,而是由兩個階段的目標是否一致決定。
這個發現挑戰了領域內一個長期存在的隱性假設:只要每個階段用更好的數據或更強的老師,最終效果自然更好。事實上,"配對關係"比"絕對質量"更重要。
三、用一把"分布尺子"看清被VBench掩蓋的真相
光靠VBench評分無法揭示問題所在,因為兩個視覺分數相近的模型,可能在"覆蓋老師的哪些場景"這件事上差異極大。為此,研究團隊提出了一套專門測量"分布覆蓋程度"的評估方案,稱為"教師歸一化分布評估協議"。
其核心思路可以這樣理解:把所有待比較的模型生成的影片,都先經過一道統一的"標準化處理"——用同一個強大的老師對這些影片先做一次輕微的重噪聲處理再重新還原,就像把不同廚師做的菜都先經過一道標準化擺盤處理,讓外觀變得統一,從而更好地比較菜餚本身的"食材多樣性",而不是被擺盤的精緻程度所干擾。
經過這道處理之後,研究團隊把所有影片的特徵提取出來,放到一個共享的特徵空間中,然後用兩個指標來衡量學生模型與目標老師的關係。第一個叫"精確率"(Precision):學生生成的影片,有多少落在了老師影片分布的"領地"範圍內——也就是說學生是否只在老師擅長的區域內生成。第二個叫"覆蓋率"(Coverage):老師影片分布的所有區域,學生能觸及多少——也就是說學生是否能覆蓋老師擅長領域的全貌。
用廚藝的比喻來說,精確率高意味著學生做的每道菜都在老師的"專業範圍"內,不會做奇怪的菜。覆蓋率高則意味著老師會做的各種風格——清淡的、濃郁的、精緻的、家常的——學生都能涉獵,而不是只會做老師最拿手的那一兩道招牌菜。
這套評估體系的一個關鍵發現是:ODE蒸餾初始化的模型雖然影片畫面很模糊,但它覆蓋了老師分布的很多角落;而用Causal DMD做初始化的模型影片看起來更清晰,VBench分數更高,但它只覆蓋了老師最擅長的少數幾個區域。後續的DMD精煉階段恰恰無法彌補覆蓋率的不足,因為DMD的天性就是在現有覆蓋範圍內做"銳化",而不是"拓展"。所以覆蓋率更廣的初始化,往往能在最終精煉後得到更好的成果。
四、五條流水線的橫向比較:同一目標,不同路徑,差異懸殊
為了全面了解不同初始化方式對最終效果的影響,研究團隊構建了五條平行的蒸餾流水線,全部使用Wan-14B作為DMD老師,全部使用從Wan-14B採樣的蒸餾數據作為初始化目標。這五條流水線分別是:直接用雙向模型做初始化、用自回歸擴散做初始化、用自回歸擴散加Causal DMD做初始化、用ODE蒸餾做初始化,以及用自回歸擴散加Causal CD做初始化。
最後一條流水線(Causal CD初始化)正是現行Causal Forcing流水線所採用的方式。對比結果清晰地呈現了一個規律:在VBench最終得分上,大多數方法相差不大,肉眼看起來差不多好;但在覆蓋率和多樣性上,差異相當顯著。Causal DMD初始化的模型VBench初始分最高,但它最終獲得的覆蓋率反而低於ODE和Causal CD初始化的模型。而Causal CD初始化的模型雖然在初始化階段畫面更模糊、分數更低,但它覆蓋率最高,最終經過DMD精煉後也獲得了最廣的多樣性。
研究團隊還通過視覺方式驗證了這一點:在同一提示詞下用16個不同隨機種子生成影片,覆蓋率更高的流水線產出的影片在場景構圖、運動模式、色彩風格等方面都更加豐富多元;而覆蓋率低的流水線,16個影片看起來像是同一個模板的輕微變體。
五、DMD的"晚期病症":即使起點對了,路走長了也會跑偏
研究團隊注意到另一個現象:即便初始化階段和DMD階段的目標分布已經對齊,如果DMD訓練做得太久,效果依然會下滑。具體表現是:VBench分數先升後降,而多樣性分數則從頭到尾持續下降,從未回升。
這可以用一個直觀的比喻來理解。DMD的訓練邏輯是"反向KL散度最小化"——它傾向於讓學生模型把注意力聚焦在老師最高概率的區域,就像一個原本會做多種料理風格的廚師,被老師的評價反饋引導著越來越專注於那道評價最高的招牌菜,最終幾乎不再嘗試其他風格。剛開始這樣做是好的,菜的質量確實提升了;但訓練得太久,這位廚師就只剩下一道拿手菜,其他所有曾經擅長的風格都逐漸生疏。
研究團隊用一個可視化實驗展示了這種"漂移"現象。他們把所有影片特徵投影到一個共享的二維空間(利用V-JEPA2特徵提取器和PCA降維),用等高線圖表示老師和學生的分布範圍。訓練初期,學生分布和老師分布大致重合;隨著DMD訓練步數增加,學生分布的橢圓形輪廓逐漸向老師分布的高密度中心區域收縮,越來越小,越來越集中,與老師的邊緣區域逐漸脫離。這就是"分布漂移"。
六、聯合蒸餾:同時用兩種力量拉住學生
針對這兩個問題——初始化和精煉目標不一致、DMD長期訓練導致分布坍縮——研究團隊提出了一個相對簡潔的解決方案:聯合蒸餾(Joint Distillation)。
核心思路是在DMD訓練階段加入一個CD損失
項作為"錨點",讓最終的訓練目標變成兩部分的加權組合:DMD負責把學生推向老師的高質量區域(精益求精),CD負責確保學生不要完全放棄對老師其他區域的覆蓋(保持全面)。兩種力量的比例由一個權重係數λ來控制。
回到廚藝比喻:DMD就像一位嚴苛的米其林評委,只認可最精緻、評分最高的那道菜;CD則像一位注重全面發展的導師,提醒學生"你的法式燴菜也要保持水準,別荒廢了"。聯合訓練就是讓這兩位指導老師同時在場,在保持精進的同時防止偏廢。
研究團隊對這個權重λ做了細緻的消融實驗。λ設得很大時,CD的力量占主導,覆蓋率最高,但精確率和VBench分數略有下降;λ設得很小或為零時,DMD獨占主導,精確率和初期VBench分數較高,但覆蓋率和多樣性持續下滑;最優平衡點出現在λ=0.01時,此時VBench、精確率、覆蓋率三項指標同時達到最佳或接近最佳水平。在弱設置(1.3B老師)和強設置(14B老師)下,這個結論保持一致。
從訓練步數的對比數據來看,聯合蒸餾方式的VBench分數在整個2500步訓練過程中始終高於或持平於純DMD;而純DMD的覆蓋率從第0步的0.66持續下滑到第2500步的0.53,聯合蒸餾則始終維持在0.66到0.69之間。這意味著引入CD錨點確實有效阻止了分布漂移,而不是用質量換來的覆蓋率。
七、最終成績單:1.3B老師訓出的學生,勝過14B老師教出的對手
研究團隊在標準的VBench文字轉影片評測協議下,將DistillAlign與多個開源基準進行了對比。參與比較的方法包括LTX Video、Wan2.1-T2V-1.3B原始模型、SkyReels-DF、CausVid、Self-Forcing和Causal Forcing。
在最終VBench總分上,DistillAlign的"強版本"(使用14B老師)以84.83分居於所有方法之首,超過Causal Forcing的84.38分和Self-Forcing的84.21分。更能說明問題的是"弱版本"的表現:只使用1.3B老師的DistillAlign,以84.54分超越了所有使用14B老師的對比方法。
在覆蓋率上,DistillAlign的強版本達到0.69,弱版本達到0.59,而Causal Forcing僅有0.29,Self-Forcing為0.53,CausVid僅有0.21。在多樣性(以Vendi分數衡量)上,DistillAlign強版本為1.304,弱版本為1.305,均高於Causal Forcing的1.250和Self-Forcing的1.269。
作為對照,未蒸餾的雙向原始模型Wan2.1-T2V-1.3B擁有最高的多樣性分數1.334,這是所有蒸餾方法無法輕易觸及的天花板。但DistillAlign已經是蒸餾方法中最接近這個天花板的存在。
從定性的影片樣本比較來看,DistillAlign生成的影片在物體細節保持、運動連貫性和跨幀一致性上表現更好,同時避免了僅用CD初始化時常見的模糊感,也避免了過度強化DMD時帶來的千篇一律感。在相同提示詞、不同隨機種子下,DistillAlign的輸出展現出更豐富的場景變化、色彩風格和運動模式。
說到底,這項研究的核心貢獻是把一個"常識性錯誤"從AI影片蒸餾流程中揪了出來,並配上了切實可行的修複方案。長期以來,研究者們默認"用更好的老師,或者讓每個階段的學生儘可能分高"就等於最終效果更好。DistillAlign的工作告訴我們,流水線中各階段之間的"分布是否配對"才是更根本的約束。
這對普通人意味著什麼?如果你關心AI影片生成工具的質量和多樣性,那麼這項研究指向的方向是:未來你在同一個提示詞下反覆生成,得到的影片會更加各不相同、更有創意,而不是每次都像從同一個模板里變出來的。與此同時,弱模型也能被訓練得更好用,這對降低算力成本、普及實時影片生成有直接價值。
這項研究目前還停留在技術驗證層面,實際落地進用戶產品還需要時間,但它明確指出了一條更少被探索、卻更有效的路徑。感興趣的讀者可以通過arXiv編號2607.26811查閱完整論文,項目主頁同樣提供了更多視覺對比樣本。
---
Q&A
Q1:DistillAlign是什麼,它和普通AI影片生成有什麼區別?
A:DistillAlign是一套針對AI影片蒸餾流程的改進方案,核心是讓訓練流水線中不同階段的"目標分布"保持一致,並在最後的精煉階段同時加入覆蓋約束和質量精煉約束。它不是一個全新的影片生成模型,而是一套讓已有的自回歸影片蒸餾方法變得更好的訓練策略,最終效果是生成的影片質量更高、多樣性更強。
Q2:為什麼用更弱的1.3B老師,反而能比用14B老師訓出更好的學生?
A:因為訓練效果取決於初始化階段和精煉階段的目標分布是否匹配,而不僅僅取決於老師的參數量大小。當初始化階段學的是1.3B老師的分布,DMD精煉階段也用同一個1.3B老師做目標,兩個階段方向一致,學生能從初始化覆蓋的基礎上做有效精煉;而若兩個階段老師不同,精煉階段就相當於在空白地方打磨,效果反而變差。
Q3:聯合蒸餾中的CD損失是怎麼防止模型"只會做一道菜"的?
A:DMD訓練會不斷把模型推向老師概率最高的區域,久而久之模型只剩下少數高質量模式,多樣性持續下降。CD損失(一致性蒸餾損失)的作用是充當一個"分布錨點
",在每一步訓練中提醒模型不能偏離老師的整體分布太遠,需要維持對老師各個區域的覆蓋能力。兩個約束共同作用,使模型既能精益求精又不至於以偏概全。






