宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

當AI導演需要同時「記住」三張參考圖:南京大學等機構聯合發布的影片生成評測新標準

2026年07月28日 首頁 » 熱門科技

這項由南京大學、北京大學、清華大學、新加坡國立大學、香港科技大學(廣州校區)以及快手旗下Kling團隊聯合開展的研究,於2026年7月15日以預印本形式發布在arXiv平台,編號為arXiv:2607.14189v1,研究方向歸屬於電腦視覺(cs.CV)領域。有興趣深入了解的讀者可通過該編號在arXiv網站檢索完整論文。

假設你是一位電影導演,正在籌備一段廣告短片。你給了助理三樣東西:一張男主角的照片、一張女主角的照片,還有一雙你希望他們穿的限量款球鞋的圖片。然後你說:"幫我拍一段他們在沙漠公路邊的二人世界,兩個人都開口說話,鞋子的特寫要清楚,背景音得有沙漠的風聲。"

這個要求聽起來不難,對人類攝影師來說只是日常工作。但對今天的AI影片生成系統來說,這件事比表面看起來複雜得多。它不僅要同時"記住"三張參考圖各自的樣子,還要搞清楚哪張圖是人、哪張圖是物品、人物該說什麼、聲音該從哪裡來、鞋子該出現在誰的腳上——任何一個環節出錯,整段影片就會顯得荒唐可笑。

更關鍵的是,現有的評測體系根本沒法準確衡量AI在這類任務上到底表現得好不好。正是為了填補這個空白,來自上述多所頂尖高校和企業的研究團隊,構建了一套名為MultiRef-Compass的全新評測基準,專門用來診斷和衡量AI在"多參考圖轉音頻影片生成"這一複雜任務上的真實能力。

一、為什麼"多張參考圖"會讓AI這麼頭疼

先來理解一下這個問題的本質。當你給AI一張圖,讓它生成一段影片,這個任務雖然不簡單,但AI至少只需要專注於一件事:讓影片裡的主角和那張圖裡的形象保持一致。這就像讓一個演員模仿一位名人的樣子表演,只需要記住一個人的特徵就夠了。

但當你給了AI三張圖,情況就完全不一樣了。AI首先得弄清楚這三張圖之間的關係。假設你給了同一個人從三個不同角度拍的照片——正面、側面、背面——AI需要意識到"這其實是同一個人,不是三個不同的人",然後把這三張照片裡的資訊綜合起來,在影片中生成一個前後一致的單一人物形象。這個問題叫做"身份分裂":如果AI不夠聰明,它可能會把三個視角的圖理解成三個不同的角色,影片裡就突然出現了莫名其妙的三個人。

而當三張圖分別代表不同的事物時,又出現了新的挑戰。比如男主角、女主角、球鞋,這三者都是獨立的個體,AI需要把每個參考圖準確地"綁定"到影片中對應的角色和物品上,不能把鞋子穿到女主角腳上,不能把男主角的聲線給女主角,不能把台詞說反了。這類錯誤叫做"屬性漏出"或者"綁定錯誤"。

還有第三個更微妙的問題:就算AI認出了每個參考圖裡的樣子,它在生成影片時也可能偷懶——直接把參考圖粘貼進去,就像把一張照片剪下來貼到另一張畫上。這種影片看起來就像是劣質的合成拼圖,人物和背景之間沒有自然的光影過渡,顯得格格不入。這個問題叫做"複製粘貼偽影"。

理解了這三層挑戰,就能明白為什麼研究團隊覺得現有的評測工具不夠用。那些已有的評測基準,要麼只測試用文字描述生成影片的效果,要麼只給一張參考圖看保不保真,要麼只管影片畫面不管音頻——沒有一個系統能把多張參考圖、多模態生成、音影片聯動這些要求同時考察清楚。

二、MultiRef-Compass是如何設計出來的

構建這套評測基準,研究團隊做的第一件事是搭建一個可以復用的素材庫,就像廚師在開始烹飪之前先把食材分門別類地整理好。

素材庫分成幾大類。人物素材包主要來自於兩個途徑:一是從已有的免版權影片裡截取不同角度的幀圖,二是用AI圖像生成工具,從一張主圖出發生成三到六張不同視角、不同表情、不同姿勢的輔助圖。無論哪種途徑,都經過人工逐一核查,確保同一個包里的圖片確實是同一個人,且面容清晰、質量過關。物品素材包涵蓋了生活中常見的各類物件,從衣服配飾到食物玩具,應有盡有。場景素材包則收錄了城市、自然、室內等多種環境背景。此外還有影片素材包和音頻素材包,為更高難度的測試提供動態參考和聲音參考。

整理好素材之後,研究團隊把這些素材按照不同的組合方式,搭建出三個核心測試板塊,外加一個進階挑戰板塊。

第一個板塊專門考察"同一個人、多個角度"的情況。測試材料是同一個人物的多張不同視角圖片,生成系統需要把這些圖理解成同一個人,並在影片中呈現出自然、連貫的形象。一旦系統誤判,影片裡就會出現莫名其妙的分身現象。

第二個板塊考察異質性組合,即把人物、物品、場景的圖片混搭在一起。系統要理解每張圖各自的角色,把它們正確地放置到對應的位置——人物出現在對應的角色位置,物品被正確使用,場景成為恰當的環境背景,而不是讓這些元素互相混淆。

第三個板塊是最複雜的:多個人物同時出現,每個人都來自不同的參考圖,他們之間還有互動和對話。系統不僅要認出每個人,還要準確分配各自的動作、台詞和聲音來源。

第四個進階板塊在前三個基礎上,增加了影片和音頻作為參考輸入,測試系統能否同時參考動態影像和聲音樣本來生成內容。

每一組素材的組合都會配上一段文字提示,這段文字不是隨便寫的,而是通過結構化的方式生成的,分別描述了視覺要求、音頻要求、對話內容和時間順序,最後整合成一段完整的生成指令。提示的平均長度約為600個漢字,大約一篇短博文的篇幅。生成之後還經過人工審核,剔除不合理或有潛在安全風險的內容。

整個數據集共包含350個測試樣本,其中300個分布在三個核心板塊,50個屬於進階挑戰板塊。七成樣本使用真實人物和場景,三成使用卡通風格。六成樣本要求生成音效或環境音,三成要求背景音樂,七成要求人物開口說話,四成有服裝外觀方面的約束,三成要求多鏡頭結構。

三、怎麼給生成結果評分

設計出數據集之後,研究團隊面臨的下一個挑戰是:如何評測這些生成的影片?這件事比聽起來難得多。人類一眼就能看出一段影片裡人物"看起來不像本人"或者"聲音對不上口型",但要讓機器以客觀、可重複的方式做出同樣的判斷,需要相當精密的工具。

評測框架被分成四個維度,就像從四個不同方向給一段影片做體檢。

第一個維度叫做基礎質量,考察的是最基本的視聽技術指標,相當於體檢里的血壓和體重。視覺技術質量用一個名為DOVER++的工具來評分,專門檢測畫面里有沒有明顯的低質量問題。音頻技術質量用Meta公司的Audiobox工具來評估,檢查聲音是否清晰、自然、有無明顯噪聲。解剖質量則關注影片裡的人物形體是否合理——手腳比例對不對、關節能不能正常彎曲、人物和背景的融合有沒有違和感,這部分由AI語言模型擔任評委,依據一份核查清單逐項判斷。

第二個維度叫做參考一致性,這是整套評測體系最具創新性的部分。它分成三個子指標:實體保真度、細節保留度和綁定準確度。

實體保真度是用來衡量生成影片裡的人物、物品、場景,和參考圖裡的樣子有多像。具體實現方式是這樣的:系統會從生成的影片裡均勻抽取幀圖,然後用目標檢測工具(YOLO-World)找到影片幀里的人物和物品區域,截取出來和參考圖進行相似度比對。真實人物用人臉識別系統(ElasticFace)加上整體外形比較(SigLIP),卡通人物則用專門的動漫人臉檢測器和DINOv2圖像特徵進行比對。場景的比較直接用全幀圖像的整體相似度。

這裡有一個聰明的設計值得著重介紹。純粹的相似度分數有個天然漏洞:如果生成系統直接把參考圖"貼"進影片,相似度分數反而會很高,但這樣的影片顯然是作弊的。為了識別這種作弊行為,研究團隊引入了一個叫做"粘貼自然度係數"的修正機制,讓AI語言模型判斷影片中的人物是否和場景自然融合,還是像剪貼畫一樣突兀。這個係數會等比例地放大或縮小最終分數:融合自然,係數接近1,分數基本不變;像貼紙一樣突兀,係數大幅下降,最終分數隨之縮水。

細節保留度關注的是參考圖里那些容易被忽略的細節,比如特定的配飾圖案、髮型、衣服上的扣子或者鞋帶。這些細節不一定通過相似度計算能捕捉到,所以用AI語言模型根據一份細化清單來逐項核查。綁定準確度則專門檢查有沒有出現"張冠李戴"的錯誤,比如對話台詞被分配給了錯誤的人物,或者動作被執行者和實際角色對不上。

第三個維度叫做音影片一致性,核心問題是:聲音和畫面配不配得上?這裡包含四個子指標。口型同步度檢測說話的人的嘴唇動作和聲音是否同步,用到了一個叫做LatentSync的專業工具,但在使用前會先經過AI過濾,剔除那些臉部不夠清晰穩定、不適合做口型檢測的影片,避免誤判。事件音效匹配度檢查聲音和畫面里發生的事情是否對應——有人踩在木地板上就應該有木板聲,玻璃杯碰撞就應該有叮噹聲。聲源準確度檢查聲音是否從正確的人物身上發出,特別是在多人對話場景下,不能張口的人發出聲音。音色相似度是專門為進階測試板塊設計的,當提供了聲音參考樣本時,檢測生成的語音是否和參考音色接近,用說話人識別模型(ECAPA-TDNN)提取聲紋特徵後進行餘弦相似度計算。

第四個維度叫做指令遵循,考察的是生成系統有沒有按照文字提示的要求去做。視覺任務遵循檢查場景設置、動作、服裝等可見要求是否都滿足了。音頻任務遵循檢查要求的音效和背景音樂有沒有生成。台詞內容準確度檢查人物說出來的話是不是和提示里寫的一致,語言對不對。時間順序遵循檢查多個事件或多個鏡頭的出現順序有沒有按照提示里寫的順序來。

在評分機制上,自動化工具和AI語言模型各司其職。AI語言模型打出的分數使用1到5分的均值意見分制度(MOS),和用戶體驗評測中常用的評分方式一致,1分代表極差,5分代表優秀。

研究團隊還引入了一個叫做"二次審查"的機制,專門用來糾正AI評委自身的不一致問題。由於AI語言模型在獨立評測每段影片時,可能對同一個標準理解得寬嚴不一,二次審查階段會把同一道評測題目下所有模型的初始評分和理由並排擺出來,橫向比較,發現明顯的前後矛盾或評判偏差後進行修正。二次審查只修正清晰的判斷錯誤,不改變評測維度,也不重新定義指標,最終目的是提高評分的可靠性和可追溯性。

四、八款AI系統上場比拼,結果如何

研究團隊在這套評測基準上測試了八款代表性的AI系統,其中六款是只能通過官方接口或平台使用的商業系統,包括Seedance 2.0、Kling 3.0、HappyHouse 1.1、Gemini-Omni、Wan 2.7和Vidu Q3-Mix;另外兩款是開源系統,分別是Wan2.1-VACE和SkyReels-V3。開源系統因為沒有原生的音頻生成能力,音頻相關的指標不參與評分。

在基礎質量方面,Gemini-Omni在視覺技術質量上得分最高,HappyHouse 1.1的音頻技術質量領先,而Seedance 2.0在解剖質量——也就是人體結構自然程度——上表現最好。不過Seedance 2.0在處理真實人物時偶爾會出現面部區域異常,研究團隊推測這與該系統更嚴格的內容安全過濾機制有關。

參考一致性方面出現了一個有意思的分化現象。Kling 3.0在實體保真度的自動化相似度分數上拿了最高分,說明它生成的影片在視覺外觀上與參考圖最接近。但Seedance 2.0在綁定準確度和細節保留度上更勝一籌,表明它在"把對的東西放到對的位置"以及"記住參考圖裡的細節"這兩件事上做得更好。這兩套指標並不完全一致,說明高相似度分數並不等於真正做到了精準還原參考圖的所有要素,二者測量的是參考保真度的不同側面。

自動化相似度評分和AI語言模型評分之間的差距,在SkyReels-V3的案例中體現得最為典型。這款開源系統被捕捉到了一個經典的"作弊"行為:它直接把參考圖粘貼進了生成的影片裡,導致相似度分數虛高。但在引入粘貼自然度修正係數之後,它的排名從第五名直接跌到了最後一名。與此同時,這款系統還出現了明顯的身份分裂問題——把同一個人物的不同角度圖誤判為不同的人,影片裡因此出現了不該存在的多重身份。Vidu Q3-Mix則因為視覺融合更自然,在修正之後排名反而上升了一位。

音影片一致性方面,Gemini-Omni的口型同步得分最高,但這裡有一個需要了解的背景:Gemini-Omni傾向於生成正面、穩定、幾乎不動的說話臉,而這類影片恰好對口型檢測工具最友好。那些人物頭部動作較多、視角變化豐富的系統,雖然影片看起來更生動,卻因此在口型同步測試中處於不利位置。這個現象揭示了當前口型檢測工具的局限性,未來的評測方法需要更能應對動態人臉的技術。Seedance 2.0在事件音效匹配度上領先,HappyHouse 1.1在聲源準確度上得分最高,說明這兩項能力並非同一件事——能把音效和畫面對上,不代表能把聲音準確地歸屬到正確的說話者。

指令遵循方面,沒有哪款系統在所有子項上都占優勢。Seedance 2.0在視覺任務方面更強,Kling 3.0在音頻任務和台詞準確度上更突出,Wan 2.7在時間順序遵循上表現更好。這說明當前AI系統在指令理解方面呈現出模態專一化的傾向,並不能全面均衡地應對多類型的指令要求。

從整體來看,Seedance 2.0在四個維度的綜合排名中位居第一,這得益於它在各個維度上相對均衡的表現,沒有特別突出的短板。Gemini-Omni緊隨其後,在基礎質量和音影片一致性上有明顯優勢。Kling 3.0和HappyHouse 1.1各有所長,分別在參考一致性和指令遵循上有突出表現。

兩款開源系統與商業系統之間的差距明顯,在參考一致性和指令遵循這兩個維度上落差尤其大。特別是在需要理解多張參考圖之間關係並進行準確綁定的任務上,開源系統目前還有較長的路要走。

研究團隊還對評測結果進行了人類偏好對齊驗證,邀請了四位人工標註員對同一組影片做偏好評比,結果顯示多參考指南針的評分與人類偏好之間的皮爾遜相關係數在0.90到0.96之間,表明這套自動化評測系統的判斷與人類的直覺判斷高度一致。

五、從測試結果里能看到什麼規律

除了整體排名,這套評測框架還揭示了一些更細膩的規律,這些規律對理解當前AI影片生成技術的真實水平很有參考價值。

在參考圖複雜度和保真度之間的關係上,測試數據顯示出清晰的遞減規律。第一板塊(同一人物多視角)的平均實體保真度最高,達到0.693;第二板塊(異質性組合)下降到0.589;第三板塊(多人物綁定)進一步降到0.575。下降的主要原因在於人物一致性的難度隨著參考圖複雜度的提升而急劇增加,物品和場景的保真度在三個板塊之間相對穩定,反而是人臉和人體的保真度在複雜場景下受到的衝擊最大。

在台詞準確度上,研究團隊把中英文分開統計,發現了明顯的語言差異。英文整體準確率為87.8%,中文為88.0%,兩者相當。但在單個系統層面,差異就大了。Kling 3.0中文準確率達到97.6%,英文為90.6%;HappyHouse 1.1中文準確率高達100%,英文稍低;Gemini-Omni則恰好相反,英文準確率高達98.1%,但中文只有76.7%,常見錯誤包括語義漂移、關鍵詞被替換、或者直接用英文替代了中文。這個結果直觀地反映了不同系統的語言優勢區間,對用戶選擇工具有實際參考價值。

在指令遵循的子項拆解上,視覺任務遵循又被細分為行動遵循、穿著遵循、基礎場景設置和細節遵循四個子項。商業系統在基礎場景設置和細節遵循上表現相對穩定,但在行動遵循和穿著遵循上出現了較大的系統間差距。開源系統在所有子項上都普遍偏低,尤其在行動遵循和穿著遵循上完成度明顯不足。這說明視覺任務遵循不應被當作一個單一的能力來衡量,一個系統的高平均分背後可能隱藏著某些具體要求上的嚴重欠缺。

評測穩定性方面,研究團隊從三個核心板塊隨機抽取了60個樣本,把整套依賴AI語言模型的評測流程重複跑了五次,結果顯示所有指標的相對標準差都低於1%,逐條目的平均絕對誤差也保持在很小的範圍內。這意味著測試結果不是偶然的,換一天跑同樣的測試,結論大概率不會改變。

說到底,MultiRef-Compass這項研究的核心價值並不在於給某個AI系統頒獎或者排黑榜,而在於它搭建了一個讓研究者和開發者能夠精準診斷問題所在的工具。就像醫院的體檢報告不只告訴你"身體不好",而是精確到"左心室射血分數偏低"——MultiRef-Compass不只說"這個AI生成的影片質量差",而是能指出"它的問題在於多人物場景下的身份綁定錯誤,以及中文台詞的完整度不足"。

這對整個領域的發展是有實質意義的。當你知道自己的弱項在哪,才能有針對性地改進。同樣,對於那些正在決定採用哪款AI影片生成工具的內容創作者或企業來說,這套評測框架給出的分維度診斷,遠比一個綜合評分更有參考價值——畢竟,你的工作究竟更需要精準的形象保真度、還是更需要可靠的多角色對話生成,答案因人而異。

歸根結底,AI影片生成正在快速進入一個需要"同時記住很多事"的新階段。單張圖、單指令、純畫面的時代已經過去,用戶正在期待AI能像真正的助理一樣,一邊記住多張參考圖里每個細節,一邊把聲音、畫面、動作協調成一個渾然一體的作品。MultiRef-Compass告訴我們,現在最好的商業系統已經能在某些方面做到這一點,但沒有任何一款系統能在所有方面同時做到,這個領域還有相當大的進步空間。如果你對這個領域感興趣,不妨思考一個問題:當AI能夠完美地處理十張參考圖並生成完全一致的長影片時,我們的內容創作方式會發生什麼樣的變化?完整論文可通過arXiv編號arXiv:2607.14189v1獲取。

Q&A

Q1:MultiRef-Compass評測基準和以前的AI影片評測有什麼不同?

A:以往的評測基準要麼只測試文字轉影片的效果,要麼只用一張參考圖測試外觀保真度,要麼只關注畫面不管聲音。MultiRef-Compass是首個同時要求多張參考圖輸入、覆蓋音頻和影片生成、還專門檢測多角色綁定準確度的綜合評測框架,能揭示出之前評測體系完全覆蓋不到的AI能力短板。

Q2:AI影片生成為什麼容易出現"把參考圖直接貼進影片"的問題,這有什麼危害?

A:一些AI系統為了讓生成結果和參考圖相似,會走捷徑,直接把參考圖的像素資訊複製進影片畫面,而不是真正理解參考圖然後重新生成一個自然的形象。這樣的影片畫面里人物和背景會有明顯的割裂感,像是剪貼畫貼在照片上。更大的問題是這會誤導評測:相似度分數很高,但影片根本不能用。MultiRef-Compass引入的粘貼自然度修正機制專門識別並懲罰這種行為。

Q3:Gemini-Omni口型同步得分最高,是不是說它生成的說話影片最真實?

A:不完全是。Gemini-Omni傾向於生成臉部正對鏡頭、幾乎不動的說話畫面,這類靜態正面臉對口型檢測工具最友好,得分自然高。但"臉不動"和"影片真實自然"並不是一回事。其他系統生成的人物可能頭部有自然晃動、視角有變化,這反而讓口型檢測工具測不準,導致得分偏低。這個發現本身也說明,當前口型同步評測工具還需要進一步改進,才能公平衡量動態說話人的真實表現。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新