宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

AI影片對話進考場,它能不能聽懂你的表情和語氣

2026年10月05日 首頁 » 熱門科技

你有沒有想過一個問題:你跟手機里的AI助手說話的時候,它到底"看見"了什麼?

大部分時候,答案是什麼都沒看見。你說的話先被轉成文字,AI再根據文字回答你。你皺著眉頭、指著桌上的某個東西、語氣裡帶著焦慮,這些資訊在轉文字的那一步就丟光了。AI收到的只是一串乾巴巴的字,像是你打電話時信號很差,對方只能聽清關鍵詞,語氣、表情、周圍環境全部消失。

這就是為什麼Alibaba Token HubAI影片對話進考場它能不能聽懂你的表情和語氣聯合香港中文大學、上海交通大學等機構的研究者們,要做一件聽起來簡單、做起來極難的事:讓AI模型直接看影片、聽音頻,不經過文字轉寫,直接給出回答。他們把這件事命名為**OmniVChatAI影片對話進考場它能不能聽懂你的表情和語氣**(全模態影片對話),並且圍繞它搭了一整套數據生成、評測、訓練的系統。

這篇論文最讓我意外的地方是,他們發現做這件事最大的攔路虎不是模型不夠聰明,而是壓根沒有數據可以餵。

一個找不到練習題的學生

想像一下,你要培養一個能讀懂別人臉色的孩子,但市面上根本沒有教材。真人對著攝影機說話、帶著環境噪音、帶著口頭禪、帶著猶豫和停頓的錄像,這種東西極其稀缺。願意把自己生活片段錄下來公開給研究用的人本來就不多,而且現實中的對話場景五花八門,從地鐵站到健身房到廚房,覆蓋不全根本沒法訓練。

更麻煩的是評分這件事。如果你問AI"2+2等於幾",答案對不對一眼就能判斷。可如果用戶對著鏡頭說"這個桌子上的杯子是什麼顏色的",AI的回答可以有無數種合理的說法方式,你沒法用關鍵詞匹配去評分,這就像給一篇作文評分,你不能只數它用了幾個"好"字。

研究者們的解法有點像是"用魔法打敗魔法"。既然現實錄像太少,那就用AI生成的方式去造一批"假"的對話場景,讓它們逼真到能當作真實數據來訓練和測試。這個思路聽起來有點冒險,但恰好趕上了這兩年影片生成技術突飛猛進的窗口期,Sora、Veo這類模型已經能生成足夠逼真、帶同步音頻的短影片了。

四個"演員"搭台唱戲

研究團隊搭建的這套數據生成系統叫**OmniVChat-StudioAI影片對話進考場它能不能聽懂你的表情和語氣**,核心思路是讓四個角色分工合作,像一個小型劇組一樣把對話場景"拍"出來。

**Director(導演)**:負責所有文字相關的工作,包括寫劇本、審核台詞、寫參考答案和評分標準。

**Renderer(渲染器)**:把導演寫好的劇本變成真正的影片和音頻。

**Reviewer(審片員)**:看渲染出來的影片,寫字幕描述,檢查有沒有穿幫或者畫面問題,必要時回答導演的追問。

**Validator(驗證器)**:一個死板但可靠的角色,專門核對劇本有沒有違反預設規則,比如台詞長度是否符合正常語速、有沒有出現不該出現的詞。

這套系統最巧妙的地方在於,導演從來不直接看影片,它只能通過審片員的文字描述來判斷影片拍得對不對。這個設計一開始看起來有點繞,但仔細想想背後是有道理的:如果導演能直接看影片,它可能會不自覺地把自己寫劇本時腦子裡想的畫面,腦補成影片裡真實出現的畫面,就像你寫小說時會把角色腦補得比實際描寫更豐滿一樣。把"看"和"判斷"這兩件事交給兩個獨立的角色,能避免這種自欺欺人。

如果不這樣分工會怎樣?想像一個編劇同時兼任剪輯師和質檢員,他很容易對著一段有瑕疵的素材說"這個地方我知道該演什麼,就這樣過了吧",因為他腦子裡那個理想版本已經把破綻自動補上了。分開之後,審片員只能誠實報告鏡頭裡真正拍到的東西,哪怕跟劇本不完全一致,最後的答案也必須基於審片員看到的真實畫面來寫,而不是劇本里設想的畫面。

這套系統能處理單輪對話,也能處理多輪對話。多輪的場景更複雜,因為後面的對話需要記得前面發生過什麼,比如用戶之前給AI看過一個物件,隔了幾輪之後又問起來,AI得記得那個東西長什麼樣。為了讓不同輪次之間的人物、場景保持一致,系統會給已經拍好的片段、提取出的音頻、最後一幀畫面都分配一個編號,後面的鏡頭需要用到之前的素材時,直接引用這個編號,而不是把所有歷史片段都塞給渲染器。

這個設計像什麼呢?有點像你搬家收納東西的時候,不會把過去十年的所有照片都攤在桌上翻找,而是提前貼好標籤放進對應的盒子裡,需要哪張直接抽出來。如果每次生成新鏡頭都要把之前所有片段全部重新參考一遍,不僅浪費資源,還容易把某個用不上的舊細節意外帶進新畫面里,反而製造穿幫。

整個系統前後經過2800次實際運行驗證,最終產出了一整套音影片對話數據,每條數據里都包含一份參考答案和一份評分細則。

評分表也是分層的

光有數據還不夠,怎麼給AI的回答評分是另一個大難題。研究者設計了一套叫**分層評分標準AI影片對話進考場它能不能聽懂你的表情和語氣**(tiered rubric)的機制。

這套機制的核心思路是把一個好答案拆解成幾個層級,最底層是最基本的要求,往上是加分項,而且必須一層一層往上過關才能拿到上一層的分數。

舉個論文裡的例子。用戶對著鏡頭問:"這個杯子上是什麼圖案?"影片裡能看到一個印著紅色馴鹿剪影的白色馬克杯。評分表的第零層是"回答用的是英語",這層不加分,但如果答錯了語言,整個回答直接判零分。第一層是"回答識別出圖案是馴鹿",這是最基本的對錯。第二層有兩條,一條是"提到圖案是紅色的",一條是"提到這是剪影風格",這兩條獨立評分,答對一條就得一分。第三層是"用自然輕鬆的語氣回應節日氣氛",這層只有在第二層兩條都答對之後才能拿分。

這個設計為什麼這麼繞?因為它想同時解決兩個問題:既要保證AI回答的基本事實不能錯,又不想讓AI靠堆砌細節來"碰運氣"拿高分。如果只是簡單地數命中了幾個關鍵詞,AI完全可以把能想到的形容詞全塞進回答里蒙對幾個,但這套分層機制強迫AI必須先答對最核心的事實,才有資格在細節上加分,答案質量和答案的組織邏輯都被納入考核。

這就像考試改卷子,如果一道大題第一步就算錯了,後面哪怕步驟寫得再工整,也很難拿到後續步驟分,因為整個推導的地基已經塌了。你不會因為字跡漂亮就給一個算錯的答案打高分。

基於這套評分體系,研究者搭建了正式的評測基準,叫**OmniVChat-BenchAI影片對話進考場它能不能聽懂你的表情和語氣**。它包含2800條數據,覆蓋5大能力類別、17個細分子類、22種場景領域,從養娃聊天到旅遊觀光到醫療健康,儘量把日常對話可能出現的情境都裝進去。這5大能力類別分別考察AI能不能判斷對話連接是否正常(比如用戶暫停時該不該插嘴)、能不能把語音內容和畫面里的物體或人對上號(比如用戶說"那個杯子"時到底指哪個)、能不能正確表達自己的身份邊界(比如不會假裝自己能幫用戶擰開一個瓶蓋)、回答是否基於真實看到聽到的證據而不是瞎編、以及能不能讀懂用戶的情緒。

訓練AI學會"簡明扼要"而不是"滔滔不絕"

光會評分還不夠,研究團隊還想辦法讓AI通過強化學習真正變得更好,這套訓練方案叫**OmniVChat-RLAI影片對話進考場它能不能聽懂你的表情和語氣**。

這裡有個很實際的痛點:如果只用前面說的分層評分作為唯一的獎勵信號去訓練AI,AI很容易學出一個投機取巧的策略,就是把能想到的所有相關資訊全部堆進回答里,反正說得越多命中評分點的概率越大。這跟人考試時遇到不確定的簡答題,索性把知道的都寫上去,指望閱卷老師能從中找到幾個得分點,是一個道理。

為了防止AI變成一個話癆,研究者在獎勵函數裡加了兩個額外的信號。

**Reply EfficiencyAI影片對話進考場它能不能聽懂你的表情和語氣(回復效率)**:衡量AI用了多少字換來了多少分,字數越少、得分越高,效率分越高。

**Style(風格)**:讓另一個AI模型檢查回答是不是符合口語對話該有的樣子,比如像朋友聊天而不是照本宣科念說明書,遇到角色扮演請求時能不能自然接住又不會把設定和現實搞混,長句子是不是讀出來順口。

這套組合拳收到了非常直觀的效果。訓練進行到大概900多步的時候,模型每回答一次的平均字數從91.5個詞驟降到36.6個詞,效率指標從每千詞3.37分的命中率提升到17.18分,整整漲了五倍多。研究團隊還專門做了對照實驗,如果把效率獎勵拿掉,AI的回答會重新膨脹回99個詞左右,效率分掉回7.12,證明這個約束是真正在起作用,不是巧合。

這背後有一個更值得琢磨的取捨:去掉效率獎勵之後,模型在純粹的正確率評分上反而漲得更高,從0.652漲到0.697。這說明簡潔和詳盡本身就是一對互相拉扯的目標,你想要更全面就得多說,想要更精煉就得捨棄一些細節。研究者選擇了犧牲一點點滿分率,換來回答更接近真人對話時那種"說人話"的感覺,因為現實中沒有人希望AI助手回答一句話像是在念產品說明書。

這套系統用的強化學習算法叫**GSPOAI影片對話進考場它能不能聽懂你的表情和語氣**(組序列策略優化),基本思路是讓模型針對同一個問題生成多條候選回答,取這些回答獎勵的平均值作為基準線,高於平均的回答被鼓勵,低於平均的被抑制。

合成數據到底靠不可靠

到這裡必然會冒出一個疑問:用AI生成的假對話訓練出來的模型,真的能在現實世界裡管用嗎?會不會是在自娛自樂,閉門造車訓出來的東西一到真實場景就露餡?

為了回答這個問題,研究團隊專門招募了真人演員,讓他們對著自己的手機錄製360段真實對話,覆蓋12個單輪對話子類,構成了一個叫**OmniVChat-Bench-HumanAI影片對話進考場它能不能聽懂你的表情和語氣**的驗證集。這些錄像完全沒有劇本,演員只是照著一份用大白話寫的場景指南自由發揮。

結果很有說服力。用完全合成的數據訓練模型,在合成測試集上的分數從0.465漲到0.652,而完全沒有見過、由真人錄製的測試集上,分數也從0.402同步漲到了0.632,漲幅幾乎一致。研究者還專門統計了訓練過程中每二十步一次的曲線,發現合成數據集和真人數據集上的分數走勢高度同步,長間隔(比如每一百步取一次平均)的變化相關係數達到0.9以上。

這就像你在健身房用器械練出來的力量,拿到真實生活中搬箱子、擰瓶蓋時確實能派上用場,而不是練了個中看不中用的花架子。如果合成數據和真實場景的分布相差太遠,那用合成數據訓練出來的能力就沒法遷移到真人身上,分數曲線也不會同步上漲,而現在兩條曲線幾乎手拉手往上走,這說明合成數據造出來的場景確實抓住了真實對話的一些本質特徵,不是無的放矢。

不過研究者也很坦誠地指出了這個結論的邊界。單個訓練步驟之間,合成集和真人集的分數變化其實相關性很弱,只有把跨度拉長到一百步左右去看整體趨勢,同步性才明顯起來。這提醒我們不能拿短期的單點波動去下結論,得看長期趨勢。

和市面上其他模型比一比

研究團隊還把訓練完的模型拿去和市面上十幾個已發布的系統做了橫向對比,包括GeminiAI影片對話進考場它能不能聽懂你的表情和語氣系列、Doubao、Qwen系列等。

結果挺有意思。在完全合成的OmniVChat-Bench上,Gemini-3.5-Flash拿到了最高的綜合分0.667。但換到真人錄製的測試集上,領先的變成了Gemini-3.7-Flash,拿到0.575分。這說明同一個模型在合成場景和真實場景里的相對排名會發生變化,不能只看一套測試就下定論。

而經過OmniVChat-RL訓練的模型,雖然在綜合正確率上沒有拿到絕對第一,但在效率指標上以18.38分的成績遠超所有對比模型(第二名Gemini-3.7-Flash只有16.96分),在風格得分上更是以0.992的成績碾壓式領先(第二名Gemini-3.1-Pro是0.871)。這說明這套訓練方法確實精準命中了它想要優化的目標:讓回答又准又短又自然。

這裡有個值得琢磨的地方:原始未經訓練的Qwen3-Omni-Instruct基線模型,綜合分只有0.465,經過這套針對性訓練之後躍升到0.652,漲幅接近0.2,這個提升幅度在同類研究里相當可觀,說明數據合成加針對性獎勵設計的組合確實能實實在在地改進模型能力,不是紙上談兵。

寫在後面

讀完這篇論文,我印象最深的其實不是那套多智能體數據生成系統有多精巧,而是那個分層評分表里藏著的一個小心思:第零層判斷語言對不對,答錯直接歸零,不給任何部分分。

這個設計乍看有點不近人情,一個回答哪怕內容全對,只是說錯了語言,就要被判零分?但仔細想想這恰恰反映了對話這件事最樸素的底線。你跟一個人說中文,對方回你一串流利的英語,哪怕內容分毫不差,這次對話本質上也是失敗的,因為溝通的第一要務從來不是內容正確,而是能不能被對方聽懂。研究者把這條規則做成一個不給分但能一票否決的門檻,某種程度上是在提醒我們,AI對話系統真正要優化的,從來不只是"答對了沒有",而是"這次交流有沒有真的發生"。

還有一個細節讓我反覆回味,就是那個"去掉效率獎勵後正確率反而更高"的實驗結果。這說明簡潔和全面本來就是天然對立的兩個目標,任何試圖同時討好兩者的系統,最終都得做出取捨。這跟我們平時寫東西、說話是一個道理,想說得面面俱到,就很難說得乾脆利落,反過來也一樣。這篇論文沒有迴避這個矛盾,而是老老實實把兩種版本的實驗數據都擺出來給讀者看,這種坦誠本身也值得說一說。

這套系統目前只覆蓋了單輪對話的真人驗證,多輪對話和真正實時的低延遲交互還沒有被現實數據檢驗過。一個能記住你三輪之前說過什麼、還能讀懂你現在皺眉是因為生氣還是因為沒聽清的AI,到底還要跨過多少道坎才能真正走進日常生活,這大概是留給下一篇論文的問題。

Q&A

Q1:OmniVChat和普通的語音助手有什麼區別?

A:普通語音助手通常先把你說的話轉成文字再理解,這個過程會丟失語氣、表情、環境等資訊。OmniVChat要求AI模型直接同時接收音頻和影片,不經過文字轉寫,從而保留更豐富的多模態線索。

Q2:OmniVChat-Bench的評測數據是真實錄製的還是AI生成的?

A:主要評測集OmniVChat-Bench是用多智能體系統OmniVChat-Studio合成生成的,包含2800條數據。研究者另外招募真人錄製了360段真實對話作為驗證集OmniVChat-Bench-Human,用來檢驗合成數據訓練出的能力能否遷移到真實場景。

Q3:用強化學習訓練後,AI的回答有什麼變化?

A:經過OmniVChat-RL訓練後,模型回答的平均字數從91.5個詞降到36.6個詞,變得更簡潔,同時正確率評分從0.465漲到0.652,回答風格也更自然口語化,風格得分達到0.992。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新