宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

{影片有畫面了,聲音也有了,但AI評分卻說這倆都很好:一個用人類偏好訓練出來的「評委」,如何讓影片生成模型不再自欺欺人}

2026年09月01日 首頁 » 熱門科技

你有沒有想過這樣一個場景:你讓AI生成一段影片,畫面里有個人在講話,聲音也配上了,看起來還挺像那麼回事。可你越看越覺得不對勁,這個人的嘴型和說出來的話根本對不上,聲音的情緒和畫面里的表情也是兩副心思。可如果你去問那些專門用來評分的AI評測工具,它們卻告訴你:畫質很好,音質也不錯,同步性也過關。

這不是段子,這是2026年前後影片生成領域正在真實發生的事。

一群來自復旦大學和相關機構的研究者們發現了這個問題的根子,他們做的這件事,說白了就是想造一個更懂人心的評委。這篇論文的名字叫VA-Judger影片有畫面了聲音也有了但AI評分卻說這倆都很好一個用人類偏好訓練出來的評委如何讓影片生成模型不再自欺,它想解決的問題看似很小,給AI生成的影片音頻評分,但往深了挖,其實牽涉到整個生成式AI訓練的一個核心矛盾。

核心問題:評分標準和人的感受,早就走岔路了

先說說現在的AI是怎麼學會生成影片配音頻的。

這類模型統稱為聯合影片音頻生成模型影片有畫面了聲音也有了但AI評分卻說這倆都很好一個用人類偏好訓練出來的評委如何讓影片生成模型不再自欺

聯合影片音頻生成模型:一種可以同時生成畫面和聲音的AI模型,不像早期的影片生成只管畫面,音頻另外配,這類模型要讓聲音和畫面從生成的那一刻就是一體的

這些模型訓練到一定階段後,光靠原始的訓練數據已經不夠了,研究者們希望用強化學習影片有畫面了聲音也有了但AI評分卻說這倆都很好一個用人類偏好訓練出來的評委如何讓影片生成模型不再自欺進一步打磨模型的表現,讓它更貼近人的喜好。這就帶來一個繞不開的問題:強化學習需要一個評分的老師,告訴模型這次生成得好不好,好在哪,差在哪。這個評分的老師,學術上叫獎勵模型影片有畫面了聲音也有了但AI評分卻說這倆都很好一個用人類偏好訓練出來的評委如何讓影片生成模型不再自欺

強化學習:一種訓練方法,讓AI通過不斷嘗試、根據反饋調整自己的行為,反饋通常來自一個評分機制,分高就多學,分低就少學

現在業內的做法是,把評分這件事拆成好幾個專門的小考官。一個專門看畫面好不好看,一個專門聽聲音干不乾淨,一個專門測聲音和畫面對不上嘴的程度有多嚴重,最後把這幾個分數加在一起。聽起來挺合理,分工明確嘛。

但論文裡舉了個特別典型的例子。論文開頭那張圖裡,兩段影片描述的是同一個客廳場景,Video 1和Video 2放在一起對比。所有的自動化專家指標一致判定Video 1更好,可是當研究者們真正用人類的眼睛和耳朵去看這兩段影片時,幾乎所有人都覺得Video 2更勝一籌,因為Video 2里的對話更貼合文本要求的引用內容,人物的口型和肢體動作也更自然,聲音清晰不失真。而Video 1呢,聲音是扭曲的,雖然畫面質量兩者打平,但整體的完整性和可理解性差了一大截。

自動化指標全部站在了人類判斷的對立面。這不是偶然,論文裡給出的量化數據顯示,這些獨立評測指標預測人類偏好的準確率普遍徘徊在50%到57%之間,也就是說,和瞎猜掰影片有畫面了聲音也有了但AI評分卻說這倆都很好一個用人類偏好訓練出來的評委如何讓影片生成模型不再自欺硬幣的水平相差不大。表現最好的VideoAlign影片有畫面了聲音也有了但AI評分卻說這倆都很好一個用人類偏好訓練出來的評委如何讓影片生成模型不再自欺指標,在簡單樣本上還能有62.39%的準確率,可一旦碰到沒見過的模型生成的樣本,直接掉到48.35%,比隨機猜測還差。

這個準確率意味著什麼。假設你有100對影片音頻樣本讓VA-Judger和某個專家指標分別去判斷哪個更好,專家指標能答對的次數還不到六成,而這個指標本來是被設計出來專門幹這件事的。這就好比雇了一個專職品酒師,結果他給紅酒打的分和普通消費者的口味相關性只有一半略高一點,這樣的品酒師你敢信嗎。

問題出在哪兒。論文分析得很清楚,每個單一指標只盯著自己那一塊看,完全沒有跨模態的整體視角。

舉個例子,VideoAlign這個指標專門評估畫面質量、動作和文本對齊,它壓根不接收音頻輸入,你讓它去判斷音畫協調,它根本沒這個能力,就像讓一個耳背的人去評判一場演講的語氣抑揚頓挫,他能看到講者的表情動作,但完全聽不到聲音里的情緒波動,這種評判天生就是殘缺的。

AudioBox影片有畫面了聲音也有了但AI評分卻說這倆都很好一個用人類偏好訓練出來的評委如何讓影片生成模型不再自欺這類音頻質量指標則反過來,它只關心生成出來的音頻聽起來干不乾淨、悅不悅耳,但從來不去核對這段音頻跟畫面里發生的事情是否匹配,一段配樂哪怕做得很精緻,如果畫面里明明是安靜的深夜場景卻配上了喧鬧的市集背景音,AudioBox照樣能打出高分,因為它壓根不知道畫面里發生了什麼。

CLIP Score影片有畫面了聲音也有了但AI評分卻說這倆都很好一個用人類偏好訓練出來的評委如何讓影片生成模型不再自欺和ImageBind影片有畫面了聲音也有了但AI評分卻說這倆都很好一個用人類偏好訓練出來的評委如何讓影片生成模型不再自欺這類做跨模態相似度的指標,則容易被表面的語義相關性糊弄過去。它們衡量的是整體向量空間裡的相似程度,這種全局的相似性經常會忽略掉局部的生成瑕疵,比如某個物體突然消失又出現,或者聲音出現的時間點和畫面動作對不上,這些細節層面的破綻,往粗放的相似度里一平均,很容易就被抹平了。

如果繼續沿用這套拆分評分的思路去訓練模型會怎樣。答案已經寫在了這篇論文引用的另一項工作OmniNFT影片有畫面了聲音也有了但AI評分卻說這倆都很好一個用人類偏好訓練出來的評委如何讓影片生成模型不再自欺里,這是目前唯一一個把強化學習用在聯合影片音頻生成上的方法,它的做法正是組合多個專家指標當獎勵。論文的實驗結果顯示,用OmniNFT訓練出來的模型,確實能在某些被優化的指標上表現出色,比如聲音和畫面的時間同步性DeSync這個指標提升明顯,但當真正找人來做整體好壞判斷的時候,OmniNFT得到的人類偏好票數只有27.63%,遠遠落後於用VA-Judger訓練出來的模型的62.30%。

這就是典型的獎勵作弊影片有畫面了聲音也有了但AI評分卻說這倆都很好一個用人類偏好訓練出來的評委如何讓影片生成模型不再自欺現象

獎勵作弊:指模型學會了鑽營評分規則的漏洞,在被用來評分的那幾個具體指標上表現得越來越好,但整體質量和用戶的真實體驗卻沒有同步提升,甚至可能更差

模型很聰明,它會找到讓每個專家指標都打出高分的捷徑,卻不代表它真的理解了什麼叫一段好的、連貫的、有說服力的影片音頻內容。這就像一個學生發現了每門課的評分漏洞,數學課只考選擇題他就死磕蒙題技巧,作文課字數夠了就能過線,他每門課分數都不低,但你要說他真的學明白了知識,恐怕未必。

VA-Judger要解決的,正是這個從碎片化評分到整體判斷的鴻溝。

第一步:先攢一批人真正用心看過的數據

想讓AI學會像人一樣評分,第一件事是得有人類真實的偏好數據。這事說起來簡單,做起來極其費勁。

研究者們沒有偷懶去用現成的AI批量造一批文本描述當訓練素材,而是從YouTube、B站、電影、電視劇里搜集了10173段真實的影片音頻片段,把它們剪成5到10秒的短片段,歸到六個大類里,多人對話、旁白敘述、音樂、影視氛圍、環境事件和訪談。

為什麼非要從真實世界的影片裡提取素材,而不是讓大語言模型直接編一些場景描述出來。這裡有個很關鍵的道理:真實拍攝的影片裡,聲音和畫面之間的關係是自然生長出來的,人說話時嘴型跟聲音天然對應,物體碰撞的聲音跟畫面里的動作時間點是同步的,這種真實存在的跨模態聯動,是編出來的文字很難湊出來的。

這就好比你想教一個學徒廚師怎麼判斷菜好不好吃,你給他看真實顧客吃飯時的反應影片,比你給他念一份寫好的評價文案要可靠得多,真實反應里那種皺眉、點頭、放慢咀嚼的細節,是編不出來的,而這些恰恰是判斷好壞最重要的資訊。如果不這樣做,訓練出來的評委學到的只是文字描述里那些套路化的好詞好句,遇到真實世界裡那些意料之外的音畫搭配,它就會判斷失靈。

拿到這些真實影片後,研究者用Qwen3.5-Omni這個多模態模型給每段影片打上詳細的字幕描述,但這些字幕帶著密密麻麻的時間戳標記,格式太複雜,不適合直接拿去餵給影片生成模型當提示詞,於是又用另一個語言模型把這些描述重新改寫成連貫自然、適合直接生成用的文本提示,最終得到了10083條有效的文本提示。

接下來是最考驗設計功力的一步:怎麼配對比較樣本。

研究者們發現,如果所有的對比樣本都是差距明顯的一眼能分出高下的那種,模型學不到細膩的判斷能力,而如果全都是勢均力敵、差距極其微妙的樣本,模型連基本的評分格式和判斷邏輯都學不紮實,會陷入混亂。

於是他們把配對樣本分成了兩個池子。容易組包含4.4K對樣本,主要是拿質量明顯偏弱的OVI模型和質量明顯更強的LTX-2模型生成的結果去對比,多人對話和旁白類的場景里還額外加入了DaVinci-MagiHuman這個在人物語音生成上表現出色的模型作對照。這些樣本差距足夠大,一眼能看出優劣。

困難組則包含9.8K對樣本,大多是同一個模型、同一個提示詞,只是換了不同的隨機種子生成出來的兩個版本,這種情況下差距極其細微,需要仔細盯著畫面和聲音的每個細節才能分辨優劣。

這種從易到難的訓練順序,學術上叫課程學習

課程學習:一種模擬人類學習規律的訓練策略,先讓模型接觸簡單明確的樣本掌握基本框架,再逐步過渡到複雜模糊的樣本磨練細節判斷能力,就像學騎自行車先在平地練平衡,再去爬坡挑戰

如果反過來,一開始就把最難分辨的樣本扔給模型,它可能連基本的輸出格式都學不明白,就像讓一個剛學騎車的孩子直接去爬陡坡,摔得四腳朝天不說,還容易對騎車這件事徹底失去信心。

第二步:三階段訓練,讓AI學會像人一樣有條理地評分

有了數據,接下來就是怎麼把一個通用的多模態大模型,一步步教成一個懂行的評委。研究者選擇的底座是Qwen3-Omni

Qwen3-Omni:一個能同時理解文字、圖像、音頻等多種資訊的開源多模態大模型,具備處理跨模態任務的基礎能力,這裡被拿來當作VA-Judger的起點,再經過針對性訓練變成專門的評審模型

整個訓練過程分了三個階段,每一步都在解決前一步留下的具體問題。

第一階段是簡單樣本冷啟動。這個階段的目標不是讓模型判斷得多准,而是先教它按照固定的格式來輸出答案。研究者要求模型對每一段影片,從五個維度分別評分,分別是提示詞匹配度、音畫一致性、音頻質量、影片質量,還有內容完整性,每個維度打1到10分並給出理由,最後匯總成總分,給出最終結論。

這個五維度評分格式本身就是一種巧妙的設計。它強迫模型不能籠統地說這個影片好或不好,而是必須逐項拆解,像不像題目要求的、聲音畫面搭不搭、聲音乾淨不乾淨、畫面清不清晰、整體完不完整。這種拆解迫使模型在思考過程中把複雜的判斷問題分解成若干可操作的小問題,這跟人類專家評審一份複雜材料時的做法是一樣的,誰會一上來就直接給個總分,都是先拆開各個維度過一遍再綜合。

這個階段的標註答案由谷歌的Gemini 3.1 Pro生成,研究者做了一個200對樣本的小規模試驗,發現Gemini在簡單樣本上和人類判斷的一致率能達到80%,用它來生成訓練用的標註答案是划算的,省去了大規模人工標註的成本。

第二階段是困難樣本的人工校準。這個階段變得非常謹慎,因為同樣是那200對樣本的試驗里,Gemini在困難樣本上和人類的一致率只有60%,意味著有四成的判斷可能是錯的。既然VA-Judger的最終目的是要貼近真實的人類主觀感受,那這個階段絕對不能再依賴AI自己的判斷,必須換成真正的人來標註。

標註員會看每一對困難樣本,選出更好的那一個,同時指出是哪些維度支撐了這個判斷。但問題來了,人工標註只能給出最終的選擇結論和理由方向,沒法生成那種完整的、帶詳細分析過程的訓練文本。這時候研究者用了一個很聰明的折中辦法,叫做拒絕採樣

拒絕採樣:讓AI針對同一個問題生成多個候選答案,然後用某個標準去篩選,只保留符合標準的答案,不符合的直接丟棄,這裡的標準就是AI生成的最終結論是否和人工標註的結論一致

具體做法是,讓Gemini繼續生成帶完整分析過程的判斷文本,但這一次只保留那些最終結論和人類標註員一致的答案,凡是Gemini自己判斷錯了的,全部扔掉不要。這樣一來,既保留了詳細分析過程這種訓練所需要的格式,又確保了最終結論是被人類驗證過的,最後篩出了4.5K條可信的訓練樣本。

這一步的設計邏輯其實很樸素:借用AI的表達能力,但校準判斷的準確性用人。這就好比一個新入職的產品經理寫周報,文筆和邏輯框架可以先照著模板套,但最終這個決策對不對,還是得老闆來點頭,你不能因為報告寫得漂亮就認為決策一定是對的,格式和內容的正確性是兩件事,要分開把關。

第三階段是維度化的強化學習,這也是整篇論文技術含量最高的一步。前兩個階段本質上都是模仿學習,讓模型去照抄標準答案的風格和結論。但模仿學習有個致命的缺陷,論文裡說得很直白:模型完全可能學會一套看起來很像樣的分析文字,五個維度評分一項不落地寫出來,但最後給出的結論跟這些評分內容根本不搭邊,甚至完全矛盾。這種情況下,如果只用最終結論對不對來評分,模型很容易蒙對答案卻學不到真正紮實的判斷邏輯。

為了堵住這個漏洞,研究者設計了維度化GRPO

GRPO:一種強化學習優化算法,讓模型對同一個問題生成多個不同的候選回答,比較這些回答獲得的獎勵高低,從而調整模型未來傾向於生成獎勵更高的那種回答

這裡的關鍵創新是獎勵的構成方式。獎勵不再只看最終結論對不對,而是拆成兩部分同時驗證。第一部分叫答案獎勵,檢驗模型選出的更好的那個影片是否和人類標註一致。第二部分叫維度獎勵,檢驗模型在人類標註員指出的關鍵維度上,給出的分數排序是不是也支持這個最終結論。

比如人類標註員說這對樣本里Video 2更好,理由是畫面質量和完整性這兩個維度更強,那麼模型不僅要答對Video 2更好,還得在畫面質量和完整性這兩項上,也給Video 2打出更高的分數,如果模型答對了結論但評分自相矛盾,比如說完整性這項反而給了Video 1更高的分,那這次回答只能拿到一半的獎勵。

這個設計逼著模型不能靠猜矇混過關,必須讓思考過程和結論真正對得上號。就像考試改卷子,一道數學大題只寫了最終答案,哪怕答案碰巧對了,老師往往還是不放心,得看看解題步驟是不是真的推得出這個結果,如果步驟是亂寫的,說明學生大概率是背了答案或者瞎矇的,這種情況下不該給滿分。

VA-Judger的這套設計正是把這種改卷子的嚴謹性搬進了機器學習的獎勵機制里。

三階段訓練效果對比表格里的數字很有說服力。在整體準確率上,只用思維鏈但沒經過訓練的基礎版Qwen3-Omni Instruct CoT只有57.83%,經過簡單樣本冷啟動之後提升到62.35%,再加上困難樣本的人工校準提升到65.91%,最後完成維度化強化學習後達到68.43%,整整比起點提升了10.6個百分點。這個提升幅度看起來不算天文數字,但要知道這10個點,恰恰是從和瞎猜差不多的水平,走向了明顯能靠得住的判斷能力,尤其是在跑分難度最大的困難樣本和陌生模型樣本上,進步幅度更加明顯,之前提到的自動化指標在陌生模型上的判斷經常還不如瞎猜,而VA-Judger在同樣的場景下能保持63.4%的準確率。

拿VA-Judger當獎勵去訓練生成模型,效果到底怎樣

光是能準確判斷優劣,還不是這項研究的終點。研究者們真正想驗證的是,如果拿VA-Judger當獎勵信號去反過來訓練影片生成模型,能不能真正把生成質量提上去。

他們選了LTX-2這個開源的聯合影片音頻生成模型當底座,沿用了OmniNFT原有的強化學習訓練框架,但把裡面那五個獨立的專家獎勵,全部替換成了VA-Judger給出的評分。具體的操作是,針對每個提示詞,讓老版本的模型生成8個候選的影片音頻結果,兩兩組合形成28對比較,VA-Judger對每一對都按照五個維度評分,把每個候選樣本在所有比較里的得分求平均,音頻質量維度的得分單獨作為音頻分支的獎勵,影片質量維度單獨作為影片分支的獎勵,其餘三個維度合併成一個跨模態共享獎勵,同時反饋給影片和音頻兩條分支。

結果是相當直接的。在JavisBench評測集隨機抽取的200個提示詞上,加了VA-Judger訓練的LTX-2模型,在13個官方指標里拿到了11項最好成績,影片質量從2.248漲到3.942,動作質量從0.697漲到1.183,音頻質量從4.767漲到5.610,整體的聯合評分JavisScore從0.074一路漲到0.230,幾乎是原來的三倍多。

而對比組OmniNFT,雖然在同步性指標DeSync上表現也不錯,但整體的JavisScore只有0.122,還不到VA-Judger訓練結果的一半。

數字層面的對比可能還不夠直觀,研究者又做了一場實打實的人類評測。找來20位視力聽力正常的成年參與者,針對同樣的200個提示詞,讓基礎版LTX-2、OmniNFT訓練版和VA-Judger訓練版各自生成一段影片音頻,三段放在一起做三選一,結果VA-Judger訓練版拿下了62.30%的人類偏好票,OmniNFT只拿到27.63%,基礎版LTX-2最慘,只有10.08%。

這意味著,同一個提示詞給三個模型分別生成一遍,普通人看完三段影片後,超過六成的時候會覺得VA-Judger訓練出來的那一版最好,這已經不是統計上勉強領先的水平,是壓倒性的多數人一致認同。

論文裡還舉了兩個具體的畫面案例。一個是描述一隻兔子啃食草地,忽然被聲音驚動,後腳跳一下,然後飛奔離開的場景。LTX-2的原始版本沒能表現出兔子被驚動後跳躍逃跑的過程,OmniNFT訓練版則出現了不該出現的落葉畫面而且兔子還是沒跑走,只有VA-Judger訓練出來的版本,把啃草的小動作、靜止的瞬間、還有最後跳躍逃跑這一整套動作,完整地表達出來了。

另一個例子是描述一架宇宙飛船降落,三條支撐腿緩緩收攏的畫面。LTX-2版本里飛船只有兩條腿,OmniNFT版本變成四條腿,而且都沒有表現出收攏這個動作,只有VA-Judger訓練版本,完整還原了三條腿、著陸動作這些細節要求。

這兩個案例都指向同一個問題:目前的生成模型,即使已經用強化學習優化過,仍然容易在具體的時間性動作要求上出錯,比如動作的先後順序、數量的準確性,而這些恰恰是那種碎片化的自動評分指標很難精確捕捉到的,VA-Judger因為是從人類實際觀感出發訓練出來的,反而能在這類細節上給出更準確的引導信號。

回到最初提到的那個矛盾:自動化指標各自為戰導致的判斷失靈,正是被VA-Judger這套三階段訓練加維度化強化學習的思路給部分解決了。它沒有試圖去發明一套更精細的公式指標,而是選擇直接學習人的判斷,再把這種判斷拆解成結構化的、可驗證的推理過程,這個思路上的轉變,或許比技術細節本身更值得留意。

寫在後面

看完這篇論文,最讓我意外的一點是,那些被廣泛使用的評測指標,居然普遍連六成的準確率都夠不著。這不是說這些指標設計得不夠精巧,而是它們從根本上就沒打算去理解跨模態的整體關係,VideoAlign就是不看音頻,AudioBox就是不管畫面語境,這是設計之初就劃定的邊界,不是bug,是feature的局限。

另一個值得琢磨的細節是維度獎勵的設計。很多強化學習方案滿足於只驗證最終結論對不對,VA-Judger多加了一層校驗思考過程內部是否自洽,這種設計思路其實可以推廣到很多讓AI輸出推理過程的場景里,寫代碼、做數學題、寫分析報告,都可能面臨同樣的問題:答案蒙對了,但推理是編的。

論文裡沒有細講的一點是,這套人工標註體系的成本到底有多高,困難樣本組的9.8K對比較全靠人工標註,這個工作量放在實際團隊執行層面,估計不輕鬆。這也是這類研究一直繞不開的瓶頸,想要評委足夠懂人心,就得先餵給它足夠多真實的人心判斷,而這件事目前還沒有太好的捷徑。

Q&A

Q1:VA-Judger是什麼?

A:VA-Judger是一個專門用來給AI生成的影片音頻內容評分的評審模型,它通過學習人類真實的偏好判斷,能夠綜合評估畫面質量、聲音質量、音畫同步性以及跨模態語義一致性,判斷哪一段生成內容更符合人的觀感,最終目的是給影片生成模型的強化學習訓練提供更貼近人類真實感受的獎勵信號。

Q2:VA-Judger和現有的自動化評測指標比,優勢在哪?

A:現有的自動化指標比如VideoAlign、AudioBox往往只專注單一模態,無法綜合判斷跨模態的協調性,實測預測人類偏好的準確率普遍只有50%到57%左右。VA-Judger通過三階段訓練,結合真實人工標註數據,整體判斷準確率能達到68.43%,在陌生模型生成的樣本上表現依然穩定。

Q3:用VA-Judger訓練出來的影片生成模型效果如何?

A:研究者用VA-Judger作為獎勵信號,重新訓練了LTX-2這個開源影片音頻生成模型,結果在13項官方評測指標里拿下11項最優,人類評測中該模型獲得62.30%的偏好票數,遠超對比方法OmniNFT的27.63%和原始LTX-2的10.08%。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新