2023年之前,如果你想做一個數字人說話的影片,流程大概是這樣的:先拍一段人物影片,再用算法把嘴型對上新的音頻,畫面里的人還是那個人,只是嘴巴被"偷梁換柱"了。
這套流程有個前提,你必須先有一段影片素材。
2025年,Captions公司發布的Mirage打破了這個前提。
給它一段音頻,它直接生成一整段說話的影片,連影片素材都不需要。這句話聽起來平平無奇,但你把它拆開想一想,會發現這其實是個挺離譜的要求:聲音里根本沒有"臉長什麼樣""嘴怎麼動""眼神往哪看"這些資訊,憑什麼能從一段波形反推出一張會說話的臉?
這就是Mirage要解決的核心問題。
核心問題:聲音里到底藏著多少視覺資訊
在Mirage之前,這個領域已經卷了好幾年。
2020年的Wav2Lip
Wav2Lip:一種早期的音頻驅動唇形同步方法,輸入一段人物影片和一段新音頻,把嘴型改成和新音頻匹配。
已經能做到嘴型基本對得上,但代價是畫面僵硬,人物只能是"半身像+固定背景",稍微一動就露餡。之後幾年裡,SadTalker、EMO、VASA-1這些工作陸續把效果往前推,表情更自然了,頭部能小幅度轉動了,但有個共同的限制一直沒突破:它們都需要一張參考圖像或一段參考影片作為起點,本質上還是在"改造"已有的畫面,而不是"無中生有"。
這就好比你請一個模仿秀演員,給他一張照片和一段錄音,他能把嘴型對上,眼神學得像。但如果你什麼照片都不給,只給他一段聲音,讓他憑空演出一個人的整張臉和全身動作,這個難度完全不是一個量級。
Mirage要做的就是後面這件更難的事。
從聲音到畫面:跨模態注意力機制
Mirage的核心架構是一個基於擴散模型的生成系統。
擴散模型:一種生成模型,工作原理是先把一張清晰圖像逐步加噪聲直到變成純噪聲,再訓練一個網路學會反過來一步步去噪,從噪聲中還原出清晰畫面。生成新內容時,就是從一堆隨機噪聲出發,讓網路按學到的規律去噪,最後"去"出一張新圖。
問題來了,去噪的過程要往哪個方向走,總得有個指揮。在文生圖里,這個指揮是文字描述。在Mirage里,這個指揮變成了音頻本身。
具體做法是引入跨模態注意力機制。
跨模態注意力:一種讓模型在生成圖像時,主動去"參考"另一種模態數據(比如音頻)特徵的機制。生成影片的每一幀時,模型會去看當前時刻的音頻特徵長什麼樣,然後據此調整生成的嘴型、表情和頭部動作。
這裡有個細節值得說清楚,音頻不是被當成一個整體扔給模型的,而是按時間切成一段一段,和影片的每一幀精確對齊。哪一秒的音強高了,嘴巴張得就大一點,哪一秒有停頓,嘴唇就自然閉合。
這個機制像什麼呢?
它有點像同聲傳譯現場的口型配音演員。演員事先完全不知道說話人下一句要說什麼,但他必須一邊聽一邊配,聲音落在哪個音節,嘴型就要精確卡在哪個音節上,晚半拍觀眾都會覺得彆扭。如果沒有這種逐幀對齊的機制,模型生成的嘴型就會變成"大概齊"式的模糊擺動,像小時候看過的粗糙配音動畫,聲音和嘴巴各演各的,一眼就能看出假。
時序一致性:不讓人"抽風"
光有音畫對齊還不夠,影片是連續的很多幀,前一幀生成的臉和後一幀生成的臉,得是同一張臉。
這就涉及到時序一致性問題。
時序一致性:指生成的影片在時間維度上保持連貫,人物的身份特徵、背景環境、動作軌跡不會突然跳變或抖動。
擴散模型天生的問題是,它對每一幀的生成都帶有一定隨機性,如果不加約束,逐幀獨立生成的結果會像老式數位相機連拍出來的照片,張張都不錯,拼在一起播放卻像鬼畜。Mirage的做法是讓模型在生成當前幀時同時參考前後相鄰幀的資訊,把單幀生成變成一個帶記憶的連續過程。
這就好比拍一部定格動畫。
如果動畫師每拍一張照片都完全憑感覺擺放人偶,不參考上一張的姿勢,那播放出來的動畫裡,人偶會一會兒在左邊一會兒在右邊,觀眾看到的是抖動和跳躍,而不是流暢的走路動作。定格動畫師之所以每拍一張都要對照上一張微調幾毫米,就是為了保證連續播放時動作是順滑的。Mirage在生成層面做的是同一件事,只是把"人工對照"換成了模型內部的時序建模。
從半身到全身:生成範圍的擴展
前面提到的Wav2Lip等方法大多局限在人臉和半身,原因很直接,臉部區域小、動作幅度有限,建模難度相對可控。一旦要生成全身,手勢、身體姿態、衣服褶皺的運動都要跟著聲音的情緒和節奏走,複雜度直接上一個台階。
Mirage在這一點上往前邁了一步,它的生成範圍不再局限於面部特寫,而是覆蓋了包含肢體動作的更完整的畫面。這意味著模型不僅要學會音頻和嘴型的對應關係,還要學會音頻的情緒強弱和肢體動作幅度之間的隱含聯繫,聲音激動的時候手勢會更大,聲音平緩的時候身體姿態會更鬆弛。
這種全身生成能力解決的是一個實際問題,過去做數字人影片,半身像用在直播場景還湊合,一旦用在正式的宣傳片或者虛擬主播場景,觀眾會本能地注意到畫面為什麼永遠是固定構圖、上半身以下全靠猜。全身可動的生成結果,才更接近真實拍攝的觀感。
數據說話:和已有方法比到底強在哪
下面這張對比表格,呈現的是Mirage類方法與幾種代表性前作在關鍵指標上的表現差異。
| 方法 | 是否需要參考影片 | 唇形同步精度(LSE-D,越低越好) | 影片質量(FID,越低越好) | 生成範圍 |
|---|---|---|---|---|
| Wav2Lip(2020) | 需要 | 較高 | 一般 | 僅嘴部區域 |
| SadTalker(2023) | 需要 | 中等 | 較好 | 面部+輕微頭動 |
| EMO(2024) | 需要 | 較低 | 好 | 面部表情豐富 |
| VASA-1(2024) | 需要 | 較低 | 好 | 面部+頭部姿態 |
| Mirage(2025) | 不需要 | **最低** | **最好** | **全身可動** |
這張表格里最關鍵的一列其實不是那幾個指標數字,而是最左邊那一欄,是否需要參考影片。
這一欄的差異意味著,前面幾種方法解決的是改造已有素材的問題,Mirage解決的是從零生成的問題,這是兩類不同難度的任務,而Mirage是在更難的任務設定下,依然在音畫同步和畫面質量上做到了不遜色甚至更優的水平。
這件事的分量不亞於當年從圖生圖跨越到文生圖。圖生圖時代,大家已經把改圖做得很精細了,直到文生圖出現,大家才意識到原來可以完全跳過原圖這一步。Mirage在音頻驅動影片生成這個細分領域裡,走的是同樣的跨越路徑。
後續影響:這條路上還有誰在跑
Mirage發布之後,這個方向明顯熱鬧了起來。
同一時期,快手的Loopy在2024年就已經在探索去掉顯式的頭部姿態控制信號,讓模型完全從音頻里自己學出自然的頭部運動,這和Mirage減少外部輸入依賴的思路是一致的。微軟的VASA-1則把重點放在實時性上,嘗試把生成速度壓縮到接近實時對話的響應速度,這是Mirage目前還沒有完全解決的問題,畢竟全身生成加擴散模型的組合,計算量本身就不小。
可以預見的是,接下來這個賽道會往兩個方向繼續分化,一個是往更快的實時方向卷,另一個是往更長時長、更複雜場景的方向卷,比如多人同框對話、複雜背景下的全身生成。這兩個方向Mirage目前都還有明顯的提升空間。
寫在後面
看完這類工作,最觸動我的其實不是效果多逼真,而是一個很樸素的事實,聲音里包含的資訊量,可能比我們直覺認為的要多得多。
我們平時覺得"聽聲音"和"看畫面"是兩件獨立的事,但Mirage這類模型的存在說明,一段音頻里其實隱含了大量關於說話人狀態的資訊,情緒強弱、語速節奏、停頓位置,這些都能被模型學出來並映射成對應的畫面動作。這讓我想到盲人用回聲定位判斷周圍環境的能力,資訊從來不是只存在於它最直觀的那個感官通道里,只是我們平時懶得去挖。
Mirage還沒解決的問題是長時間生成的穩定性,幾十秒內的效果不錯,但如果要生成幾分鐘的連續影片,身份漂移和動作重複的問題會不會重新冒出來,這個我很好奇,也沒在公開資料里看到明確答案。
Q&A
Q1:Mirage是什麼?
A:Mirage是由Captions公司開發的AI影片生成模型,它的核心能力是僅通過音頻就能生成完全匹配的說話影片,不需要預先準備參考影片素材。
Q2:Mirage和Wav2Lip、SadTalker這類方法有什麼區別?
A:Wav2Lip、SadTalker等方法都需要先有一段參考影片或圖像,再用音頻去改造嘴型和表情。Mirage不需要參考影片,直接從音頻生成包含全身動作的完整影片,任務難度和技術路線都不一樣。
Q3:Mirage會不會取代真人影片製作?
A:目前不會完全取代,但會大大改變影片製作方式,尤其是在數字人、虛擬主播這類不需要真實拍攝場景的應用中影響明顯。






