你有沒有想過,一個能生成好萊塢級畫面的AI,可能連"這個杯子五分鐘前在桌上"這種小學生都懂的常識都記不住?
這不是段子,這是2024年AI影片生成領域一個真實存在、卻長期被忽略的大問題。
想像這樣一個場景:影片裡,一個人從口袋裡掏出手機拍照,鏡頭晃了一下切到別處,幾秒鐘後再切回來,手機變成了另一個型號,甚至顏色都換了。這種事情,在當下最先進的自回歸影片擴散模型
上,天天都在發生。
**這篇來自斯坦福、MIT、北大、伯克利和字節跳動聯合團隊的論文,把這個問題起了個名字,叫"長期記憶缺失
",並且給出了一套叫Ring Forcing
(環形強制)的解決方案。**
先搞清楚問題出在哪
要理解這個問題為什麼這麼棘手,得先明白影片生成模型是怎麼"想"的。
自回歸影片擴散模型
:一種逐段生成影片的AI技術。它不是一次性把整個影片畫出來,而是像寫連續劇一樣,看著前面已經生成的畫面,往後續寫下一段。這種方式能讓影片無限延長,但代價是,模型必須依靠"記憶"前面發生的內容來保證連貫。
問題就出在這個"記憶"上。論文作者做了一個直擊痛點的實驗:一個人舉著相機拍照,然後鏡頭短暫移開1秒鐘,再切回來,之前最強的模型(作者稱為SOTA,也就是State-of-the-Art,當前最先進技術)生成的畫面里,這個人的臉完全變了。僅僅1秒鐘。
這不是模型"看不到"過去的資訊,因為1秒鐘的上下文完全在它的處理範圍內。真正的原因更微妙:模型壓根沒學會怎麼去"用"這些資訊。
論文把這歸結為一個訓練數據的系統性偏差。你去看現在網上收集的影片訓練數據,絕大多數都是"線性敘事",攝像機跟著一個東西一路拍下去,很少有什麼東西消失了又重新出現的情況。模型在這種數據上泡的時間長了,就學會了一種"近視眼"式的生成邏輯,只盯著眼前一兩幀畫面來推斷下一幀,對"三十秒前發生了什麼"這種問題完全沒有興趣去回答,因為在訓練時從來沒被逼著回答過。
這就好比你從小到大做的數學題全都是"1+1=2"這種送分題,你當然可以做得又快又准,但真到考試出現一道需要綜合前面三道題條件的應用題時,你根本沒有解題的肌肉記憶,哪怕卷子上把前面三道題的條件都印在你眼前,你也想不起來要回頭看。不是看不見,是壓根沒形成"回頭看"這個動作的習慣。如果一直不改變訓練方式,無論給模型看多長的歷史畫面,它都只會禮貌地忽略掉大部分內容。
這個問題被論文拆解成兩個維度:物體恆常性
(object permanence,指精確復現物體重新出現時外觀的能力)和記憶容量(能處理多長歷史、能從多遠的過去提取有效資訊)。
作者特別強調了一點,這兩者缺一不可。只有物體恆常性但記憶容量太小,等於你記性很好但腦子只能裝五分鐘內的事;只有超長的記憶容量但沒有恆常性,等於你腦子裡塞滿了資訊但完全不會調取,兩種情況都無法支撐"分鐘級"的連貫影片生成。
如何逼模型學會"回憶"
既然問題出在訓練數據的偏差上,解決思路自然也要從訓練數據本身下手。
Ring Forcing的核心創意,是把一段影片和它的倒放版本首尾相接,組成一個閉環。
具體是怎麼操作的?假設你有一段原始影片V,從第一幀一直放到最後一幀。現在把這段影片倒過來放一遍,得到反向影片V_rev,然後把V和V_rev接在一起,變成一個環狀序列V_ring。因為倒放影片的第一幀就是原影片的最後一幀,所以這個環在視覺上是完全連續的,看起來就像一條首尾相連的絲帶。
這時候關鍵的一步來了:從這個環里挑出一段作為"目標片段"(也就是模型需要生成的部分),你會發現,這段目標片段的倒放版本,會作為"未來"重新出現在這個環的另一處,也就是被安排進了模型能看到的歷史資訊里。
論文管這個叫"未來變成了歷史"。聽起來有點玄乎,其實說白了就是:我把答案偷偷藏進了試卷前面的材料里,逼你必須往前翻資料才能做對題目。
這樣一來,長程檢索這件事,就從一個"可做可不做"的選修課,變成了一個"不做就交白卷"的必修課。模型要想把損失函數降下去,唯一的辦法就是學會去翻歷史,把那段藏起來的"隱藏答案"找出來。
這就像老師改變了考試出題方式。以前的考卷,每道題都是獨立的,你只要看眼前這道題就能作答,久而久之你養成了"只看當前題目"的習慣。現在老師故意把某道題的答案,提前寫在了試卷第一頁看似無關的一段材料里,如果你不回頭翻材料,這道題你根本不可能做對。這種"逼迫性"的考核方式,才能真正訓練出"回頭翻資料"這個能力,而不是靠自覺。如果沒有這個設計,你永遠只能靠模型自己"頓悟"去學會檢索,而現實是,絕大多數模型根本不會自己頓悟。
但這個設計有一個明顯的漏洞需要堵上。因為反向影片緊跟在目標片段後面拼接,環上"藏答案的那部分"的開頭一幀,其實和目標片段的最後一幀長得幾乎一模一樣(畢竟只是時間上緊挨著的兩幀)。
如果不處理這個漏洞,模型完全可以偷懶:不用去翻遠處那段"隱藏答案",只需要瞄一眼歷史資訊最前面那一幀,抄一下它的樣子就行了,壓根不需要理解和檢索更遠的資訊。
為了堵住這個偷懶的口子,論文引入了隨機頭部裁剪
(Random Head Crop):隨機切掉歷史資訊開頭的一部分內容,但保留住藏在後面的那段"隱藏答案",這樣模型就沒法靠抄近道矇混過關了。
光是逼著模型死記硬背歷史資訊還不夠,因為現實中的影片生成不能永遠是"背答案"模式,很多時候攝像機往前走,看到的是全新的、沒在歷史裡出現過的場景,這時候模型需要有創造性地續寫下去,而不是死板地強行往回套。
為了平衡"嚴格遵循歷史"和"自由創作"這兩種能力,論文加入了環形上下文丟棄
(Ring Context Drop)機制:訓練時以一定概率(默認40%)隨機把整個"藏答案"的歷史資訊完全丟掉,只留下正常的原始歷史,這樣模型有時候被逼著必須精確回憶,有時候又被放開手腳自由發揮,兩種技能都練到。
固定長度里塞進一分鐘的記憶
解決了"願不願意回憶"的問題,接下來要面對一個更硬核的工程難題:一分鐘的影片資訊量太大了,直接塞給模型處理,計算量會爆炸。
這是因為AI處理影片用的注意力機制
(attention),它的計算複雜度是隨著序列長度呈平方級增長的。歷史越長,計算代價漲得越猛,這幾乎是一個物理定律級別的限制。
於是行業里出現了一個兩難困境:想讓模型看得更遠,就得增加處理的資訊量,算力扛不住;想讓算力可控,就得壓縮歷史資訊,結果模型能看到的範圍又變短了。這個蹺蹺板效應,長期卡住了長影片生成技術的脖子。
Ring Forcing給出的方案,是利用擴散模型本身的一個特性:它在生成過程的高噪聲階段主要決定畫面的整體結構和大致動作,而在低噪聲階段則專注雕琢局部的紋理和細節。
基於這個觀察,論文設計了一個時間步組合
(Timestep Composition)策略:高噪聲時段用一路信號,低噪聲時段用另一路信號,讓兩路信號在不同階段各司其職。
具體來說,高噪聲階段(也就是模型還在琢磨大方向的時候),使用一個時間上採樣密度高、但空間和局部細節壓縮得比較狠的"全局流",保證時間維度的連貫性;低噪聲階段(模型在精修細節的時候),換成一個空間細節保留得多、但時間上採樣稀疏的"細節流",並且用一種循環位移(cyclic shift)的技巧,讓每次採樣都能覆蓋到歷史中不同的時間點,避免某些細節被壓縮掉後再也撈不回來。
這個設計其實很像人類看老照片相冊的方式。假設你要在一分鐘內回憶過去一整年發生的事,你不可能把每一天的所有細節都在腦子裡過一遍,那資訊量太大了。更現實的做法是,先快速翻一遍所有照片,抓住整體的時間線和大事件(這是全局流在做的事),然後針對其中幾張你格外在意的照片,停下來仔細端詳細節,比如照片裡那件衣服的花紋(這是細節流在做的事)。如果你只做前一半,你會記得大概發生了什麼但記不清任何具體樣子;如果你只做後一半,你會對個別細節記憶深刻但完全理不清事件順序。論文的實驗數據印證了這一點:只用全局流重建的畫面結構SSIM分數是0.745,只用細節流是0.679,而兩路結合起來能達到更高,驗證了這種"分工合作"確實比單打獨鬥更有效。
在這套壓縮方案下,論文實測把等效的歷史長度從原本4.4秒硬生生拉長到了140.8秒,而且計算開銷和顯存占用跟原始模型的5.4秒生成設置幾乎一模一樣,這意味著這套方法可以無縫部署到任何能跑得動原版Wan模型
的硬體上,不需要額外的算力投入。
給壓縮後的資訊找准"門牌號"
壓縮歷史資訊之後,還有一個容易被忽略但很關鍵的細節:模型怎麼知道這些被壓縮過的資訊,原本是在時間軸和空間上的哪個位置?
這裡要提一下RoPE
:全稱Rotary Positional Embedding,旋轉位置編碼,是一種讓AI模型理解序列中每個元素相對位置關係的技術,被廣泛用在Transformer架構里。
原始模型在預訓練時,學到的是一套關於"相對時空結構"的先驗知識,比如它知道相鄰的兩幀之間大概應該差多少,某個空間位置的像素點跟另一個位置有什麼樣的相對關係。這些先驗知識是模型在沒接觸過壓縮這回事的情況下,通過海量數據積累出來的寶貴經驗。
如果直接按壓縮後的離散索引(比如"這是第3個壓縮塊")來編碼位置資訊,模型之前學到的那套關於原始物理時空的直覺就完全用不上了,等於逼著模型在一個陌生的坐標系裡重新摸索,白白浪費了預訓練積累的經驗。
論文的解決辦法是稀疏RoPE(Sparse RoPE):不用壓縮後的離散序號,而是把每個壓縮後的token反推回它在原始連續時空坐標系裡對應的物理位置,讓模型覺得自己看到的還是熟悉的那套坐標系,只是資訊被稀疏採樣了而已。
這就好比你請了一位老嚮導帶你重新走一條路,但這條路因為施工被臨時改道,只留下幾個關鍵路口能通行。如果你告訴嚮導"從入口數第三個路口拐彎",他會一臉茫然,因為他腦子裡存的是這條路原本的完整地圖和真實的地標位置。但如果你告訴他"在原來那個郵局門口拐彎",哪怕路已經改道了,他立刻就能憑著記憶里的老地圖找到方向。這就是把壓縮後的坐標映射回原始物理坐標的意義所在,讓模型能繼續調用它在預訓練階段積累的那套關於真實世界結構的直覺,而不是逼它在一個全新的、陌生的抽象坐標系裡從零學起。
實驗數據證實了這個設計的價值:使用標準索引式RoPE訓練出來的模型,重建質量的PSNR只有19.05,換成稀疏RoPE之後直接跳到24.22,SSIM從0.58提升到0.71,這不是一個小的量級差距。
數字說話:到底強在哪
論文構建了一個專門的測試基準,叫A-D-R基準,全稱是"出現-消失-重現"(Appear-Disappear-Reappear)。測試邏輯很直接:讓一個物體先出現5秒,然後消失一段時間(間隔從0秒一路測到60秒),最後重新出現5秒,看看模型有沒有把物體的身份認對。
結果相當直白。在0秒間隔(也就是控制組,全程沒有消失)的情況下,各家模型表現都還不錯,Ring Forcing的紋理一致性分數是0.742,跟表現最好的LongCat(0.737)差不多。但只要間隔拉到1秒,差距就徹底拉開了:LongLive掉到0.181,LongCat掉到0.236,FramePack掉到0.252,而Ring Forcing依然保持在0.723的高位。
這意味著什麼?意味著僅僅一秒鐘的消失,就足以讓當時最先進的三個模型集體"翻臉不認人",把重新出現的物體錯認成完全不同的東西,而Ring Forcing幾乎沒有受到影響。
更值得說道的是,其他基線模型在5秒間隔之後的數據就直接消失了,因為論文說明這是"appear"這段片段已經完全超出了它們的最大上下文窗口"
,它們連處理這個長度的歷史都做不到,談何檢索。而Ring Forcing一路測到了60秒間隔,紋理一致性依然維持在0.396,幾何一致性0.582,語義一致性0.793。
Gap(消失時長)| 模型 | 紋理一致性 | 幾何一致性 | 語義一致性
0秒 | LongLive | 0.578 | 0.896 | 0.886
0秒 | LongCat | 0.737 | 0.950 | **0.925**
0秒 | FramePack | 0.605 | 0.949 | 0.913
0秒 | **Ring Forcing** | **0.742** | **0.997** | 0.918
1秒 | LongLive | 0.181 | 0.297 | 0.707
1秒 | LongCat | 0.236 | 0.368 | 0.712
1秒 | FramePack | 0.252 | 0.287 | 0.692
1秒 | **Ring Forcing** | **0.723** | **0.839** | **0.823**
5秒 | LongLive | 0.290 | 0.303 | 0.730
5秒 | LongCat | 0.203 | 0.328 | 0.722
5秒 | FramePack | 0.250 | 0.264 | 0.701
5秒 | **Ring Forcing** | **0.515** | **0.761** | **0.831**
60秒 | **Ring Forcing** | 0.396 | 0.582 | 0.793
論文還觀察到一個特別有意思的副作用:那些依賴"死記住第一幀"這種笨辦法來維持一致性的模型(比如LongLive),付出的代價是畫面動態性大幅下降,因為它們把注意力全焊死在開頭那一幀上,導致後續生成的內容變得呆板、重複。而Ring Forcing因為學會了真正意義上的"檢索"而不是"死盯",反而在保持一致性的同時,動態性得分(Dynamics)從LongLive的1.615、LongCat的1.493一路漲到2.617,畫面動作更加豐富自然。
這打破了一個業內長期以來默認的假設:一致性和多樣性是天然對立的,要一致就得犧牲靈活。Ring Forcing的實驗數據說明,這兩者其實是可以兼得的,只要方法對了。
在更貼近日常使用場景的一分鐘通用影片生成測試里,Ring Forcing在美學質量(5.822分)、自然度(3.922分)、指令遵循度(25.471分)上都拿到了對比模型里的最高分,人類評分的整體質量評價也拿到了4.22分,是所有對比模型里最高的。
模型 | 美學質量 | 動態性 | 自然度 | 一致性(人評) | 整體質量(人評)
LongLive | 5.622 | 1.056 | 3.031 | 4.12 | 2.25
LongCat | 5.808 | 2.196 | 3.875 | 3.59 | 4.19
FramePack | 5.728 | 1.790 | 3.656 | 3.71 | 4.04
**Ring Forcing** | **5.822** | **2.261** | **3.922** | **4.35** | **4.22**
這條技術路線接下來要走向哪裡
Ring Forcing自己也很坦誠地列出了沒解決的問題。
因為整個生成過程本質上是自回歸的,也就是一步一步續寫下去的,微小的誤差會隨著時間推移不斷累積,哪怕物體身份問題被大幅壓制了,極長時間跨度下的細微失真依然可能出現。
論文用環形數據構造這種巧妙但終究是"代理任務"的方式來逼模型學檢索,面對真實世界裡多個長得很像的物體互相交叉遮擋這種極端複雜場景,現有方法的精細檢索能力可能還不夠用。
目前採用的固定壓縮比率雖然保證了顯存開銷和原模型完全一致,但這種"一刀切"式的壓縮,對極小物體或者快速一閃而過的動作,多少會丟失一些高頻細節。論文認為未來一個有前途的方向,是讓壓縮比率能根據畫面內容的複雜程度動態調整,重要的主體保留高解析度,靜態背景可以壓縮得更狠一些。
寫在後面
讀完這篇論文,最讓我感到意外的,其實不是Ring Forcing這個方法本身有多精妙,而是它揭示的那個根本矛盾:模型能"看到"歷史資訊,和模型"願意用"歷史資訊,是兩件完全不同的事。
這個區分乍一聽有點反常識。我們總覺得,只要把足夠多的上下文塞給一個足夠大的模型,它自然就會學會怎麼用。但這篇論文用一個1秒鐘消失就能讓SOTA模型集體崩潰的實驗,狠狠打了這個假設的臉。真正決定模型行為的,從來不是它"能看到多少",而是訓練過程有沒有真正逼它去用這些資訊。
這讓我想起一個更普遍的問題:很多AI系統的能力短板,表面看是"容量不夠",實際上根本原因是"訓練時從沒被要求過"。這個邏輯放到別的領域一樣成立,一個學生做題永遠只做基礎題,你不能指望考試出現綜合題時他突然開竅。
另一個值得單獨拎出來說的細節是,論文裡那個"未來變成歷史"的構造方式,本質上是一種非常聰明的自監督標籤生成技巧,不需要額外的人工標註,只靠對已有影片做一次倒放和拼接,就憑空造出了一個"必須檢索才能做對"的訓練信號。這種"用數據結構本身逼出監督信號"的思路,在數據標註成本越來越高的今天,值得被更多技術領域借鑑。
論文提到的下一步方向,內容自適應的動態壓縮,聽起來簡單,做起來其實涉及一個很難的判斷問題:怎麼讓模型自己知道"這個物體值得多花點算力去記住,那片背景可以隨便壓縮"?這本質上是要模型對資訊的重要性做出實時判斷,而這件事,恰恰是人類視覺認知系統天天都在無意識地做的事情。
如果影片生成模型有一天真的學會了像人一樣,憑直覺判斷哪些細節值得牢牢記住,哪些可以模糊帶過,那時候我們討論的可能就不只是"物體會不會變臉"這麼簡單的問題了。
Q&A
Q1:Ring Forcing是什麼?
A:Ring Forcing是斯坦福、MIT、北大等團隊聯合提出的自回歸影片擴散框架,通過環形結構訓練和壓縮技術,讓AI生成的長影片具備精準的長期記憶,物體消失重現後不會變身份。
Q2:Ring Forcing如何解決物體消失後變樣的問題?
A:它把影片和倒放版本首尾拼接成環,把目標片段的答案偷偷藏進歷史資訊里,逼模型必須學會檢索遠處的歷史內容才能生成正確畫面,而不是只看眼前一兩幀。
Q3:Ring Forcing需要額外的算力和顯存嗎?
A:不需要。通過壓縮和時間步組合策略,Ring Forcing能把140.8秒的歷史資訊壓縮到和原模型5.4秒生成設置相同的計算開銷,可以直接部署在支持原版Wan模型的硬體上。






