你有沒有想過這樣一件事:你在直播打遊戲,彈幕突然洗版說"換個電馭叛客風格試試",你嘴上答應了,但遊戲畫面能立刻變成電馭叛客嗎?
當然不能。現實里你只能繼續用原來的畫風打完這局。但如果這是一段正在被AI實時生成的影片呢?如果觀眾的這句彈幕能立刻讓接下來的畫面風格開始轉變,而且這種轉變還能一直持續下去,直到下一條彈幕說"換成水墨風"?
這聽起來像是科幻電影的設定,但2026年這篇來自浙江大學和阿里巴巴團隊的論文,正是在解決這個問題。他們給這個任務起了個名字,叫無限影片編輯
(Infinite Video Editing)。這篇論文提出的方法叫InfinityEdit,我們今天就來聊聊這背後的門道。
先說清楚一件事,你可能覺得"影片編輯"這個詞已經很成熟了,市面上一堆AI工具都能改影片風格。但這裡有個關鍵的錯位,幾乎所有現有方法解決的都是另一個問題。
現有的影片編輯,壓根不是給直播用的
目前主流的指令式影片編輯方法,比如InsViE、Ditto、OpenVE這些工作,遵循的是一種叫"原位編輯
"(in-place editing)的範式。
原位編輯:給定一段已經拍好、長度固定的源影片,模型對這段影片進行逐幀重寫,輸出的編輯結果和源影片時長完全一樣,時間軸也完全對齊。你可以理解成,它是在"改寫一份已經寫完的文檔",而不是"繼續寫一份還沒寫完的文檔"。
這套邏輯對付一段已經錄製好的短影片完全沒問題。你有一段5秒的影片,想把風格從寫實改成動畫,模型把這5秒逐幀改一遍,輸出還是5秒,時間對得上,邏輯很順。
但問題來了:如果這個影片是正在直播的、還沒結束的、未來還會不斷生成新內容的呢?
比如你在看一場正在進行的實況遊戲直播,或者一個AI正在源源不斷地生成一段長影片的鏡頭運動畫面。這時候你說"把風格換成美式漫畫",你要編輯的其實不是已經播完的那一段,而是還沒發生的、即將到來的畫面。這些幀此刻根本不存在,模型無法對著一堆不存在的像素做逐幀重寫。
這就是論文裡反覆強調的一個核心矛盾:編輯指令針對的是尚未生成的未來內容,而不是已經錄製好的靜態素材。
論文把這種全新的任務定義為無限影片編輯:給定一段前序影片片段和一條編輯指令,模型要生成的是緊接著這段前序影片之後的、滿足編輯要求的新片段。而且這個過程會反覆發生,編輯指令會像連續的彈幕一樣一條接一條到來,模型要一直跟著編輯下去,理論上沒有盡頭。
這個定義讀起來簡單,但真正做起來會遇到兩個特別棘手的難題,作者花了大量篇幅講清楚這兩點。
難題一:編輯出來的東西得是"接著講故事",不能是"另起一段"
第一個難題叫忠實延續(faithful continuation)。
這裡有個特別反直覺的地方。你可能覺得,既然是編輯,那不就是把某個東西改一改嗎?改風格、改鏡頭,邏輯應該跟原位編輯差不多才對。但無限影片編輯難就難在,輸出的新片段和輸入片段之間根本沒有幀對幀的對應關係。你不能說"新影片的第10幀對應舊影片的第10幀,把它改一改",因為新影片的每一幀都是全新生成的,壓根不存在這種對應。
模型必須做的事情是:從前面那段影片的結尾自然地往下"生長"出新內容,同時讓這段新內容符合編輯要求。
而更麻煩的是,哪些東西該保留、哪些該改變,這個標準會隨著編輯類型的不同而完全不同。舉個例子,如果編輯指令是"換成漫畫風格",那麼畫面里角色的動作、鏡頭的運動軌跡應該保持不變,只有畫面的視覺質感應該變。但如果編輯指令是"鏡頭往上移",那麼角色長什麼樣、場景是什麼應該保持不變,只有鏡頭的視角應該變。
這就好比你請一個作家幫你續寫小說的下一章,同時提出一個要求:"把故事的語氣從懸疑改成幽默"。這時候,故事裡的人物、地點、情節走向應該保持不變,只是敘述的語氣變了。但如果你的要求是"把主角的視角改成配角的視角",那這次該保持不變的是故事內容和語氣,改變的是敘述立場。同樣是"接著往下寫",但每次該守住的邊界完全不一樣。如果作家不理解這個區別,亂套一個統一模板去續寫,輕則違和,重則整個故事直接崩掉。
難題二:編輯久了會不會"越改越走樣"
第二個難題叫累積編輯下的穩定性(stability under repeated editing)。
這個問題的根源在於一個殘酷的現實:每一次生成出來的編輯結果,會變成下一次編輯的輸入歷史。
自回歸生成:一種生成方式,模型把已經生成好的內容當作"歷史"餵給自己,用來預測接下來該生成什麼,一步接一步地往前滾動生成,而不是一次性生成全部內容。
這個機制本身沒問題,問題在於錯誤會累積。如果第一次編輯生成的畫面有一點點瑕疵,比如某個物體的邊緣有點模糊,這個瑕疵會被當作"乾淨的歷史"餵給第二次編輯,第二次編輯的輸出可能會把這個瑕疵放大一點,然後這個放大後的瑕疵又變成第三次編輯的歷史……
這就好比傳話遊戲,第一個人說的話本來是準確的,但每傳一次都會有一點點失真,傳了十個人之後,原話可能已經面目全非了。區別在於,這裡不只是資訊在失真,畫質本身也在跟著失真,而且編輯指令還在不斷往裡面加新的變化。論文裡用實驗數據證實了這個擔憂不是空穴來風:在他們的對比實驗中,好幾個基線方法的"美學質量"分數會隨著編輯輪次增加而持續下降,掉了0.02到0.04分,而InfinityEdit幾乎紋絲不動,波動接近於零。
搞清楚了這兩個難題之後,再回頭看論文的方法設計,很多選擇就變得有理有據了。
InfinityEdit怎麼解決這兩個難題:凍住大腦,只訓練一個"點火器"
先說結論式的設計思路:這篇論文沒有從頭訓練一個全新的模型,而是找了一個已經很擅長"無限生成長影片"的現成模型,把它整個凍住不動,只在旁邊加裝一個很小的、可訓練的"編輯適配器
"(edit adapter)。
這個被凍住的基礎模型叫Helios,是一個140億參數規模的自回歸影片擴散變換器(簡單理解,就是一個專門用來一段一段生成長影片的AI模型),它有個蒸餾版叫Helios-Distilled,能做到少步數、近乎實時的推理。Helios的核心本領是能一段一段地(論文裡叫"chunk",也就是"塊")連續生成很長的影片而不崩潰,它靠的是把歷史幀壓縮成一個多尺度的記憶結構,再加上一個固定的錨點幀來防止畫面越漂越遠。
但是Helios本身完全不懂什麼叫"編輯指令",它只會悶頭往下續寫,你換個提示詞它頂多是把新提示詞當成新的場景描述來生成,它理解不了"這是對當前內容的一次修改"這種語義。
為什麼不乾脆全量微調整個Helios模型,讓它自己學會編輯?論文裡給出了理由,全量微調成本太高,而且很可能會把Helios原本訓練出來的、"生成長影片不崩潰"這個寶貴能力給帶偏。這就好比你請了一位已經練就一手好廚藝、能連續做出十道菜不失水準的大廚,現在你想讓他多學一道新菜。你有兩個選擇:一是把他送回廚師學校重新培訓整套廚藝體系,風險是他原來那手絕活可能會被打亂;二是給他配一個專門的小助手,負責在他做菜過程中隨時遞上一小撮新調料,大廚該怎麼顛勺、怎麼控火完全不用變。論文選的是後者,凍住大廚的全部本領,只訓練那個小助手。
這個小助手就是編輯適配器,它由三個注意力模組組成,缺一不可。
編輯點火適配器(Edit-Ignition Adapter):本論文提出的核心組件,一個輕量級的、可插拔的模組,負責把編輯指令"點燃"進正在生成的影片畫面里,同時保持基礎模型原本的生成能力不被破壞。
### 歷史交叉注意力:讓新畫面知道"我是從哪兒接上的"
第一個模組叫歷史交叉注意力(History Cross-Attention),作用是讓正在生成的新片段能"回頭看"輸入的歷史幀,從而知道自己應該從哪個內容基礎上繼續。
交叉注意力(Cross-Attention):一種讓模型在生成內容時,主動去"查詢"另一份資訊(比如歷史幀或文字指令)的機制,可以理解成模型一邊生成一邊不斷回頭核對參考資料。
具體來說,這個模組只讓新片段最前面幾幀去查詢歷史幀的資訊,而不是讓整段新內容全都去查。這樣做的好處是省計算量,而且前幾幀吸收到的歷史資訊,會在接下來的模組裡自然傳遞給後面的幀。這就好比接力賽跑,你不需要讓全體隊員都先跑去摸一下起跑線才出發,只要第一棒的選手準確接住了接力棒,後面的隊員只需要跟著往前跑就行。
### 時序因果自注意力:資訊只能往前傳,不能往後串
第二個模組叫時序因果自注意力(Temporal Causal Self-Attention),它的任務是把第一個模組吸收到的歷史資訊,沿著時間軸,從早的幀傳遞到晚的幀。
這裡有個關鍵限制,叫因果(causal),意思是後面的幀可以參考前面的幀,但前面的幀不能反過來受後面幀的影響。
因果掩碼(Causal Mask):一種數學上的"資訊閥門",強制規定資訊只能從過去流向未來,不能讓模型在生成第5幀時"偷看"還沒生成的第10幀。
如果不設這個限制會怎樣?那新片段的第一幀就有可能被後面還沒生成的第100幀"倒著影響",這在邏輯上是荒謬的,因為生成是按時間順序一幀一幀發生的,你不可能讓還不存在的未來幀影響已經生成的過去幀。這就像你寫日記,今天的日記內容不能被明天還沒發生的事情所左右,日記必須嚴格按照發生的先後順序往前寫,寫完今天的才能寫明天的,絕不能反過來。
### 編輯交叉注意力:把那句"換個風格"真正塞進畫面里
第三個模組叫編輯交叉注意力(Edit Cross-Attention),這才是真正讓編輯指令發揮作用的地方。當前正在生成的每一個畫面塊,都會主動去查詢這條編輯指令的語義資訊,然後把查到的結果加回到自己身上。
這三個模組被打包成一個適配器塊,插在Helios每一層變換器的後面。而且這些適配器塊在訓練一開始,會被設置成"零初始化",也就是剛開始訓練時它們完全不改變任何東西,輸出等於什麼都沒做。隨著訓練推進,它們才慢慢學會怎樣在原有畫面基礎上加一點"編輯殘差"。
零初始化(Zero Initialization):把新加入模組的輸出權重初始設為零,讓這個模組在訓練剛開始時相當於"什麼都不做",之後再慢慢學會施加恰當的影響,這樣可以避免新模組一上來就把原模型的能力破壞掉。
這個設計思路其實很聰明,好比你想給一台運轉正常的老機器加裝一個新功能按鈕,但你又怕這個新按鈕不小心碰到會打亂機器原有的運轉邏輯。解決辦法是,先把這個新按鈕焊死在"不生效"的位置上,然後一點一點地、小心翼翼地調試它,直到確認按下去只會增加想要的新功能,而不會干擾原來任何一個齒輪的轉動。
光有架構不夠,數據從哪兒來
看到這裡你可能會問,這套三段式的注意力機制聽起來挺合理,但模型總得靠訓練數據學會這些東西吧?現實里根本不存在現成的"前序片段+編輯指令+編輯後延續片段"這種三元組數據集。
論文團隊於是自己動手設計了一整套數據採集流程。
第一步是生成編輯指令。他們從一個叫VAP(Video-As-Prompt)的相關工作里借來了一批基礎的編輯類型作為模板,但這些類型都是抽象的短語,比如"風格轉變",不能直接拿來用。團隊先把源影片按照主要實體(比如人物、風景)分組,再給每組影片配上合適的編輯類型,然後用Gemini 3 Flash(谷歌的一個多模態大語言模型)把簡單的編輯類型擴展成具體、詳細的編輯指令。
第二步是生成對應的目標影片,這一步最考驗設計巧思。因為編輯類型不同,處理方式也完全不同。對於風格類編輯,比如把畫面變成美式漫畫風,團隊先用一個叫Qwen-Image-Edit-2511的圖像編輯模型,把源影片最後一幀直接改成新風格的圖片,再用這張改過的圖片作為起點,生成後續影片。而對於鏡頭運動類編輯,比如"往上移",源影片的最後一幀則原封不動保留,因為鏡頭運動不應該在銜接處就突兀地改變畫面內容,只應該改變視角。
圖像到影片生成(Image-to-Video,簡稱I2V):一種AI生成方式,輸入一張靜態圖片,模型據此生成一段動態影片,論文裡用的是Wan2.2-I2V-A14B這個模型來完成這一步。
第三步是數據後處理,團隊請了20名人工標註員,從四個維度給生成的三元組評分:編輯是否準確對齊了指令、編輯內容是否和原影片保持連貫、生成內容是否合理(有沒有奇怪的人物多長了只手之類的問題)、以及原始素材本身的畫質好不好。只有高質量的三元組才會被留下來訓練模型。
推理階段:只在"點火"那一刻用適配器,剩下的交給凍住的大腦
訓練好了適配器,接下來是怎麼用它。這裡有個特別值得說的設計,叫"先點火,後延續"(ignite-then-continue)策略。
具體來說,當一條編輯指令到來時,適配器只會被激活一次,用來生成緊接著這條指令的第一個影片塊,這個過程叫作點火(ignition)。一旦這第一個編輯過的塊生成出來,適配器就立刻關閉,後面所有的塊全部交還給原本凍住的Helios模型去自動續寫,而Helios續寫的依據,正是剛才那個已經帶有編輯效果的歷史塊。
為什麼要這樣設計,而不是讓適配器一直保持開啟狀態,持續參與每一個塊的生成?
答案藏在Helios的工作機制里。Helios每生成一個新塊,都是拿"最近生成好的歷史內容"作為參照來續寫下一個塊的。既然第一個編輯過的塊已經進入了歷史窗口,那麼後面的續寫自然會"繼承"這個編輯效果,就像滾雪球一樣往下滾。既然編輯效果已經通過第一塊傳遞下去了,就沒必要每一塊都勞煩適配器出馬,這樣既省了計算量,又讓Helios原本擅長的"長影片不崩潰"的能力得以完整保留,不會被適配器的持續介入打亂節奏。
這就好比點篝火,你只需要用打火機點燃第一簇火苗,之後火焰會自己順著木柴蔓延下去,你不需要一直拿著打火機跟著火苗到處點。如果你非要一直拿著打火機跟著燒,反而可能把整堆柴火的燃燒節奏搞亂。
除了這個"點火後放手"的策略,論文還提到了兩個配套的細節設計。
一個是低噪聲採樣補細節。擴散模型生成圖像有個特點,噪聲越低的階段越是在打磨精細的畫面細節。有些編輯指令關注的恰恰是這些細節層面的變化,為了確保這些細節能被準確表達,團隊在點火那一步額外加了一個接近零噪聲的去噪步驟,讓適配器能對著接近成品的畫面再精細打磨一遍。
另一個是歷史窗口滑動和錨點重置。Helios靠一個滑動窗口來管理歷史記憶,只保留最近的一段內容,超出窗口的舊內容會被丟棄,這樣才能保證內存開銷不會隨著影片越來越長而無限膨脹。同時Helios還有一個錨點幀(anchor frame),相當於一個"參照物",防止生成內容隨著時間推移越漂越遠、逐漸失控。InfinityEdit的做法是,每次點火生成出新的編輯內容後,就把這個錨點幀重置
成新編輯內容的第一幀。這樣一來,後續的續寫會以"新編輯後的樣子"為基準,而不是繼續用最初源影片的樣子當基準,避免了內容慢慢"漂移"回原來的樣貌。
錨點幀重置:每次編輯發生後,把用來防止畫面漂移的參照幀更新成剛編輯完的畫面,這樣後續生成才會以"編輯之後的世界"為準,而不是一直惦記著"編輯之前的世界"。
如果不重置錨點會怎樣?續寫過程會一直參照最初那個沒被編輯過的畫面,久而久之,新生成的內容很可能悄悄地往回漂,慢慢淡化掉編輯效果,甚至完全遺忘掉編輯指令曾經發生過。這就好比你把一個房間刷成了藍色,但你桌上一直擺著一張房間原來是白色時拍的照片當參考。時間長了,你在做後續裝修決策時可能會不自覺地朝著"白色房間"的印象去調整,結果房間的顏色慢慢又漂回了白色附近。而把參照物換成刷完藍色之後拍的新照片,後續的每一個決策才會真正以"藍色房間"為基準。
訓練細節里的巧思:怎麼讓適配器既學會編輯,又不崩潰
除了架構和推理策略,論文在訓練環節還埋了幾個不太顯眼但很關鍵的設計。
第一個是歷史腐蝕
(History Corruption)。訓練的時候,模型看到的歷史幀永遠是"乾淨"的真實數據,但實際推理的時候,模型看到的歷史卻是自己上一輪生成出來的、可能帶瑕疵的畫面。這種訓練和推理之間的落差,學術上叫曝光偏差(exposure bias),是自回歸生成模型的老大難問題。InfinityEdit的做法是,訓練時故意往歷史幀里摻一點噪聲,讓模型提前"見識"過不完美的歷史輸入是什麼樣子,這樣它到了推理階段面對自己生成的、帶瑕疵的歷史時,才不會手足無措。
這有點像給運動員做適應性訓練。如果你只在風和日麗的室內場館訓練,到了真正比賽那天遇上大風大雨,運動員大概率會發揮失常。但如果平時訓練就故意安排一些風雨天氣下的模擬訓練,運動員遇到惡劣天氣時反而能從容應對。
第二個是混合高斯噪聲採樣。原本Helios用的是一種"金字塔式"的去噪調度,噪聲越高對應越粗糙的畫面布局,噪聲越低對應越精細的畫面細節,這套調度對生成任務很合適,因為生成天然就是從粗糙到精細。但編輯任務不一樣,編輯可能針對視角、可能針對整體外觀、也可能針對細枝末節,不應該被綁死在某個固定的噪聲階段。所以團隊重新設計了一個專門的高斯混合分布,讓訓練時採樣到的噪聲值更集中在推理時會真正用到的那幾個點上。
第三個是兩階段課程學習。第一階段讓模型均勻地學習各種噪聲水平下的編輯能力,確保基礎打得紮實;第二階段則把訓練重心往中低噪聲區間偏移,同時給塊里越靠後的幀分配越高的損失權重,因為這些幀離最初的歷史錨點更遠,也更容易在漫長的生成鏈條里丟失質量。這種由淺入深、由寬泛到精細的訓練安排,本質上和人類學一門新技能的過程有點像,先把各個基本動作都摸一遍,再針對薄弱環節反覆打磨。
實驗結果說了什麼
說了這麼多設計思路,最終還是要看實際效果站不站得住腳。論文因為這是一個全新任務,現成的評測基準根本不存在,所以團隊自己搭了一個基準,從UltraVideo數據集裡挑了200個源影片,覆蓋人物、風景等五大類實體,每個影片配上三條連續的編輯指令,一共覆蓋15種編輯類型,分成實體變換、風格化、鏡頭運動、動作遷移四大類。
對比的基線方法分成三類:純粹的原始Helios骨幹網路(不加任何適配器,直接替換提示詞)、原位編輯代表方法(Lucy-Edit、SANA-Streaming)、以及提示詞切換類方法(Anchor-Forcing、Infinity-RoPE)。
VBench:一套通用的、不需要人工參與的影片生成質量自動評測工具集,能從多個維度給生成的影片評分,比如鏡頭運動準確度、動作流暢度、畫面閃爍程度等。
先看VBench客觀指標的結果:
| 方法類別 | 方法 | 鏡頭運動準確度 ↑ | 動作平滑度 ↑ | 時序閃爍抑制 ↑ |
|---|---|---|---|---|
| 純骨幹網路 | Helios-Base | 0.5494 | **0.9869** | 0.9641 |
| 原位編輯 | Lucy-Edit | 0.5062 | 0.9808 | 0.9616 |
| 原位編輯 | SANA-Streaming | 0.5432 | 0.9858 | 0.9631 |
| 提示詞切換 | Anchor-Forcing | 0.4815 | 0.9775 | 0.9536 |
| 提示詞切換 | Infinity-RoPE | 0.3580 | 0.9671 | 0.9344 |
| 本文方法 | InfinityEdit | **0.7654** | 0.9833 | **0.9660** |
InfinityEdit在鏡頭運動準確度上大幅領先第二名,差距達到0.22分,說明它對方向性鏡頭編輯(比如"往上移"、"拉遠鏡頭")的控制力明顯更強。而在時序閃爍抑制上,它評測的是第三輪編輯之後的表現,也就是最容易出現累積誤差的地方,InfinityEdit依然拿到了最好成績,說明它在編輯鏈條走得很遠之後依然沒有明顯崩壞。
再看更綜合的VLM評判(用Gemini-3.5-Flash充當裁判,從四個維度給1到5分評分):
| 方法類別 | 方法 | 編輯忠實度 ↑ | 視覺質量 ↑ | 內容保留度 ↑ | 跨輪連貫性 ↑ |
|---|---|---|---|---|---|
| 純骨幹網路 | Helios-Base | 2.637 | 2.850 | 2.790 | 2.885 |
| 原位編輯 | Lucy-Edit | 2.863 | 2.723 | 2.665 | 2.560 |
| 原位編輯 | SANA-Streaming | 3.303 | 3.093 | 3.060 | 3.030 |
| 提示詞切換 | Anchor-Forcing | 2.545 | 2.620 | 1.830 | 3.480 |
| 提示詞切換 | Infinity-RoPE | 2.658 | 2.675 | 1.865 | 3.265 |
| 本文方法 | InfinityEdit | **3.828** | **3.765** | **3.815** | **3.840** |
這張表特別能說明問題。原位編輯類方法(Lucy-Edit、SANA-Streaming)在跨輪連貫性上得分偏低,因為它們本質上是每次都重新對著歷史幀做逐幀重寫,而不是真正朝未來延續,三段編輯之間容易顯得脫節。而提示詞切換類方法則表現出恰恰相反的毛病,它們的連貫性得分反而挺高(因為它們本來就是自回歸續寫的),但內容保留度低得可憐,只有1.8分左右,這是因為這類方法壓根不接受源影片作為輸入,完全從切換後的新提示詞憑空生成,自然無法保留源影片原本的內容。
InfinityEdit則是唯一一個在保留度和連貫性上同時拿到高分的方法,這恰好證明了它設計的核心思路:既紮根於源影片的內容,又能真正向前延續成一條連貫的流。
論文還追蹤了編輯輪次增加時的穩定性表現,用美學質量分數畫了一條曲線。結果顯示,幾個基線方法的美學質量在三輪編輯之後普遍下降了0.02到0.04分,而InfinityEdit幾乎沒有波動。另外團隊還專門統計了編輯忠實度在三輪之間的標準差,InfinityEdit的標準差只有0.023,是所有方法裡最低的,而像Anchor-Forcing這類方法標準差高達0.715,說明它們的表現在輪次之間起伏非常劇烈,很不穩定。
論文最後還展示了一個超長影片編輯的案例,把每個編輯段落拉長,讓整段影片總長超過1000幀。結果顯示InfinityEdit在這麼長的跨度里依然保持穩定,而且前面編輯加上去的屬性(比如第二輪把角色變成了某個卡通形象)在第三輪編輯(鏡頭上移)之後依然被完整保留,沒有被沖刷掉。這說明這套方法不僅僅是能編輯,還真正具備長期記憶編輯效果的能力。
寫在後面
讀完這篇論文,最讓我意外的一點是,團隊沒有選擇去訓練一個全新的、更強大的編輯模型,而是選擇把已有的強模型徹底凍住,只訓練一個非常小的旁掛模組。這背後其實是一種務實的工程哲學:與其從零重建一套本領,不如精準地找到"缺的那一小塊",然後只補那一小塊。
另一個讓我反覆琢磨的細節是,論文裡提到原位編輯方法在多輪編輯之後,"美學質量"和"編輯忠實度"看起來居然是上升的,但這其實是個假象,因為它們每一輪都在對前一輪已經被改過的內容重新編輯,內容早就偏離源影片越來越遠,變成了一張越描越松的畫布,後面的編輯指令自然更容易被"完成"。這提醒我們看任何隨時間遞增的指標時,都得多問一句:這個上升是真的變好了,還是評判標準本身已經悄悄跑偏了。
論文裡提到的未來方向也挺實在,比如加入圖片或影片作為參考素材,而不只靠文字描述編輯意圖,還有編輯發生那一刻的過渡感有點生硬,這些都是留白,也是這個方向接下來真正值得琢磨的地方。
如果直播平台真的有一天用上了這種技術,彈幕說"換個風格"就能讓畫面平滑地開始轉變,這會不會重新定義我們對"直播"這兩個字的想像?
Q&A
Q1:InfinityEdit是什麼?
A:InfinityEdit是浙江大學和阿里巴巴團隊提出的一種輕量級編輯適配器,用來給正在流式生成的長影片加裝"無限編輯"能力。它把一個叫Helios的現成影片生成大模型完全凍住不訓練,只訓練一個包含歷史交叉注意力、時序因果自注意力、編輯交叉注意力三個模組的小型適配器,讓模型能在影片不斷生成的過程中,隨時響應新的編輯指令並讓效果持續延續下去。
Q2:無限影片編輯和普通影片編輯有什麼區別?
A:普通的影片編輯(原位編輯)是對一段已經拍完、時長固定的影片逐幀重寫,輸出和輸入時長完全對齊。無限影片編輯針對的是還在不斷生成、沒有結束的影片流,模型要生成的是接在當前內容後面、還沒出現過的新片段,同時要滿足編輯要求,而且這個過程會隨著新指令不斷到來反覆進行,理論上沒有終點。
Q3:InfinityEdit是怎麼保證編輯很多次之後畫質不崩壞的?
A:主要靠三個設計:訓練時故意往歷史幀里摻入噪聲讓模型提前適應不完美輸入(歷史腐蝕)、推理時只在編輯指令到來的那一刻短暫啟用適配器隨後交還給凍住的原模型繼續生成、以及每次編輯後把防止畫面漂移的錨點幀重置成最新編輯內容。實驗顯示InfinityEdit三輪編輯下來的美學質量分數幾乎不變,編輯忠實度的波動幅度也是所有對比方法裡最小的。






