宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

南京大學領銜研發:AI如何真正「看懂」影片裡的每一個關鍵瞬間?

2026年07月30日 首頁 » 熱門科技

這項由南京大學、上海人工智慧實驗室、上海交通大學、浙江大學、中國科學技術大學和復旦大學聯合開展的研究,於2026年7月以技術報告形式發布,論文編號為arXiv:2607.17423v1,有興趣深入了解的讀者可以通過該編號查詢完整論文。

你有沒有遇到過這樣的煩惱:明明記得那部紀錄片裡有一段特別精彩的畫面,卻要把整個影片從頭拖到尾一幀一幀地找?或者問AI"影片裡有沒有出現貓",它能告訴你"有",卻沒法告訴你"在第3分27秒到第3分45秒"?這個看似細小的缺陷,其實是當今AI影片理解領域一個根本性的短板——AI能讀懂影片裡"發生了什麼",卻不太能精確告訴你"它發生在哪個時間段"。

南京大學的研究團隊把這個能力稱為"影片時間定位",並以此為核心,開發出了一套名為TimeLens2的系統。這套系統的核心雄心是:用一個統一的模型,在各種長短不一、內容各異的影片裡,精準找到任何你感興趣的時間段——無論那段內容只出現了一次,還是零零散散地出現了好幾次,無論影片只有幾十秒,還是長達一個多小時。

要理解這項研究的價值,可以把AI影片理解比作一個偵探。之前的AI偵探已經能看完一整個案件現場,然後告訴你"這裡發生了一起謀殺案"。但如果你想知道"兇手的手套放在哪個抽屜里、從幾點到幾點被放在那裡",它就束手無策了。TimeLens2要做的,就是培養出一批能精準指出"證據在第幾分第幾秒"的頂級偵探。

---

一、案件背景:為什麼"找時間段"這麼難?

在深入了解這套系統的具體工作方式之前,有必要先理解這個問題究竟難在哪裡。

表面上看,"在影片裡找到某個時間段"似乎是個簡單任務。實際上,這裡藏著三層相互交織的困難。

第一層困難來自標註數據本身的可靠性。研究團隊把這個問題稱為"標註質量問題"。當人類標註員面對一段一小時的影片,被要求找出"所有出現紅色汽車的時間段"時,他們很容易犯以下幾種錯誤:把不同時間出現的兩輛相似紅色汽車搞混、漏掉某次出現、把開始時間標早了幾秒或結束時間標晚了幾秒。影片越長,這些錯誤就越多。更麻煩的是,影片裡大多數內容都是無關的"干擾項",真正相關的內容可能只占整個影片的一小部分。這就像讓偵探在一個裝滿無關文件的巨大檔案室里,僅憑記憶一次性找出所有關鍵證據。

第二層困難來自目標本身的形態。有些證據只出現一次,有些卻斷斷續續出現好幾次。比如"攪拌紅色醬汁的所有片段",可能在影片的第2分鐘、第8分鐘、第15分鐘都各有一段。傳統的AI方法通常只會找出一個連續的時間段,沒辦法優雅地處理這種"多處出現、各自獨立"的情況。

第三層困難來自訓練AI的方式本身。即便有了高質量的標註數據,用什麼標準來"評分"、指導AI改進,依然是個棘手問題。常用的評分標準叫做"時間重疊度"(tIoU),它衡量AI預測的時間段和正確答案有多大面積重疊。但這個指標有個致命缺陷:只要AI的預測和正確答案沒有任何重疊,不管AI預測的位置是差了1秒還是差了10分鐘,得分都是一樣的零分。這就像評判一個偵探,只要他沒找到兇器,不管他找的地方是離兇器藏匿處一步之遙還是相差十萬八千里,都被認定為"完全失敗"——這顯然不公平,也無法給偵探任何有效的方向性指引。

這三層困難共同構成了TimeLens2需要解決的核心挑戰。

---

二、建立案件檔案庫:93,000個高質量訓練樣本是怎麼來的

任何偵探學校的核心資產都是案例庫。TimeLens2的案例庫叫做TimeLens2-93K,包含23,793段影片和93,232個標註好的"查詢-時間段"對,其中還有12,091個包含多個不連續時間段的複雜案例。

為了讓這個案例庫足夠多樣,研究團隊從YouTube收集了34,867段影片,涵蓋娛樂、教育、體育、新聞、科技、遊戲、旅行、汽車、音樂、日常生活等15個領域。更重要的是,這些影片在時長上經過了刻意的分層設計:一分鐘以內的有10,000段,一到十分鐘的有10,000段,十到三十分鐘的有10,000段,三十到六十分鐘的有3,096段,超過一小時的有1,771段。這樣的分層確保了訓練數據覆蓋各種"搜索難度"——在30秒的影片裡找目標和在一小時的影片裡找目標,對AI來說是完全不同量級的挑戰。

然而,僅僅收集影片還遠遠不夠。關鍵在於,如何為每一段影片生成可靠的標註。研究團隊設計了一條六步流水線,這條流水線的核心思想是:把"一次性做出全部判斷"這個高風險動作,拆解成"一系列逐步聚焦、相互驗證"的低風險決策。

第一步是給每段影片建立"分層時間索引"。團隊使用一種叫做PySceneDetect的工具,根據影片內容的變化,把影片切分成20到60秒的小片段,然後用大型視覺語言模型(具體來說是Qwen3-VL-235B,一個極其強大的AI模型)為整段影片生成一個全局描述,同時為每個小片段生成一個局部描述。全局描述負責把握"這個影片整體在講什麼",局部描述則精確記錄"這個片段里發生了什麼具體動作或變化"。這就像偵探在研究案件時,既要有整個案件的概覽,又要有每個現場細節的詳細記錄。

第二步是"自動生成查詢和粗略候選區間"。研究團隊用另一個強大的AI(Kimi-K2.5)讀取所有這些描述,自動生成有意義的查詢語句,同時初步圈定哪些時間段可能和這個查詢相關。這些初步圈定的時間段叫做"粗略候選區間",它們繼承了影片描述里的時間資訊,為後續的精確定位提供了起點。值得注意的是,這些候選區間還不是最終答案——它們只是縮小了搜索範圍。

第三步是"雙偵探獨立偵查"。這是整個流水線最有趣的環節。研究團隊部署了兩個完全獨立的AI模型——Qwen3-VL-30B-A3B和TimeLens-8B——讓它們各自獨立地觀看影片中的相關片段,並給出自己認為正確的時間段標註。這兩個AI的"思維方式"不同(用專業術語說是"歸納偏置"不同),就像兩個來自不同背景的偵探,他們會用不同的方式分析同一個案件。每個AI都可以給出一個或多個時間段,也可以給出"空集"(意味著它認為這個影片片段里根本沒有相關內容)。

第四步是"雙偵探協商取證"。兩個AI給出各自的答案後,系統會計算兩份答案的"時間重疊度"。如果重疊度超過0.9(也就是說兩個AI的答案高度一致,相差不超過10%),這個案例才被認為是"可靠的",被保留下來,並以Qwen模型的答案作為標準答案。這個設計背後的邏輯是:如果兩個思維方式不同的偵探得出了幾乎相同的結論,這個結論很可能是正確的;如果兩人意見分歧很大,說明這個案例本身存在歧義,不應該被用來訓練AI。

僅僅時間上一致還不夠,研究團隊還在第四步中加入了"語義驗證"。他們用另一個AI模型(Qwen3-VL-Embedding)把被保留的影片片段和對應的查詢語句都轉換成數學向量,然後計算兩者的相似度。如果相似度低於0.5,意味著即便兩個偵探找到了同一個地方,這個地方也和案件本身關係不大,這個案例同樣會被排除。這道關卡篩掉了"兩個AI碰巧都找錯了同一個地方"的情況。

經過這兩道關卡,原本百萬級別的候選標註被大幅壓縮——從最初的近百萬條,經過時間共識篩選後剩下約17萬條,再經過語義驗證後剩下約9.3萬條。規模是縮小了,但質量卻大幅提升。

第五步是"邊界精修"。經過前面的驗證,研究團隊已經確認了"哪些時間段是有效的",但時間段的精確起止點往往還不夠準確。於是,他們對每個時間段的邊界,各向前後延伸3秒,讓強大的Qwen3-VL-235B模型仔細觀察這6秒的"過渡區域",精確找出真正的開始點和結束點。對於那些相鄰時間段之間只有不到1秒間隔的情況,系統會把它們合併,認為這種微小的間隔不過是眨眼之間的遮擋或者邊界標註的小誤差,而非真正獨立的兩段。

這套六步流水線的精妙之處在於,它把"一個人面對整個影片做出一次判斷"變成了"多個獨立系統在局部範圍內做出相互驗證的判斷"。每一步都只處理自己擅長的子問題,每一步的錯誤都會被下一步的驗證機制捕捉並修正。最終留下來的9.3萬條標註,是經過層層篩選的高置信度證據。

---

三、訓練偵探學校:如何讓AI真正學會"時間搜索"

有了高質量的案例庫,接下來是如何利用這些案例訓練出出色的AI偵探。研究團隊採用了兩階段的訓練策略。

第一階段是"通讀案例,習得能力"。研究團隊把Qwen3-VL系列基礎模型(一種強大的視覺語言AI,分別有20億、40億、80億參數三個版本,參數可以粗略理解為AI的"腦細胞數量")放在完整的長影片上進行訓練,讓它同時學習TimeLens2-93K的數據、已有的TimeLens-100K數據集,以及Ego4D-NLQ的第一人稱視角影片數據。

這一階段有一個重要的設計細節:格式多樣化訓練。同一個查詢和同一段目標時間,會被用27種不同的提問方式和28種不同的回答格式來呈現。比如,同樣是"找到攪拌醬汁的時間段",有時候會問"這個動作發生在什麼時候?",有時候會問"請定位影片中攪拌醬汁的所有片段",有時候用JSON格式回答,有時候用自然語言回答,有時候用分秒格式,有時候用純秒數格式……總計形成了756種不同的"問答界面組合"。

這種設計的目的是讓AI學會的不是"如何回答某種特定格式的問題",而是"如何理解影片裡的時間線索本身"。就像一個真正優秀的偵探,不管別人是用中文、英文還是手勢比劃來問他,他都能準確指出證據在哪裡——因為他真正掌握的是案件本身,而不是如何應對特定的問句形式。

第一階段的效果是讓AI具備了"在長影片裡搜索證據"的基本能力。但研究團隊發現,僅憑這個訓練,AI給出的時間段往往還不夠精準——就像一個偵探已經能找到正確的房間,卻還沒精確到正確的抽屜。

於是進入第二階段:用強化學習做精細校準。強化學習可以理解為"通過不斷嘗試和評分來改進"——AI猜一個答案,系統打個分,AI根據得分調整策略,再猜,再評分,如此循環。具體使用的技術叫GRPO,在這個過程中,系統會為每個問題生成多個候選答案,通過比較不同答案的得分來指導AI改進。

為了讓強化學習更有效率,研究團隊還引入了"難樣本優先"策略:在進入強化學習訓練之前,先用第一階段訓練好的模型,對訓練數據里的每個問題跑8次測試,看看平均得分。得分越低的問題,說明AI在這類問題上越薄弱,在後續訓練中就給予越高的權重。這就像一個偵探學校,不把時間平均花在所有案例上,而是重點針對學員最容易出錯的案件類型進行專項訓練。

---

四、發明新的評分標準:用"搬運距離"來衡量預測質量

這套訓練系統的另一個核心創新是評分方式的設計。前面提到,傳統的時間重疊度(tIoU)評分有個根本缺陷:只要沒有重疊,不管差多遠都得零分。研究團隊為此專門設計了一種新的評分方式,叫做"時間Wasserstein獎勵"(RTW)。

要理解這個評分方式的直覺,可以用沙堆搬運來類比。假設正確答案是"把沙堆放在某個位置",AI給出的答案是"把沙堆放在另一個位置"。時間Wasserstein獎勵衡量的是:把AI放置的沙堆搬運到正確位置,需要搬運多遠的距離?距離越短,說明AI的答案越接近正確,得分越高;距離越遠,說明AI的答案偏差越大,得分越低。

這個"搬運距離"的計算方式有一個巧妙之處:它不管AI把沙堆分成了幾堆(也就是不管AI給出了幾個時間段),只關心所有沙堆合在一起後,整體的"重心"和"覆蓋範圍"與正確答案有多接近。這解決了一個傳統方法會遇到的棘手問題:當AI把一個時間段拆成兩段預測時,傳統的"一對一匹配"評分方式就會出問題,但Wasserstein距離完全不受這種"分法不同"的影響。

用一個具體例子來說:正確答案是"第3到第7秒",AI-A預測的是"第8到第12秒"(差了1秒才挨上),AI-B預測的是"第50到第55秒"(差了43秒)。傳統的tIoU會給兩個AI都打0分,因為都沒有重疊。但Wasserstein距離會告訴系統:AI-A只需要把沙堆搬動1秒的位移就能到達正確位置,而AI-B需要搬動43秒的位移——AI-A明顯更接近正確答案,應該得到更高的分數和更積極的鼓勵。

實際的評分公式由三部分組成。第一部分是時間重疊度(RtIoU),衡量"已經猜中了多少";第二部分是時間Wasserstein獎勵(RTW),衡量"沒猜中的部分離正確答案有多遠";第三部分是一個懲罰項(–1invalid),如果AI給出的答案完全不是有效的時間段格式(比如說了廢話或者給出了非法數值),直接扣分。三部分相加就是最終分數。

研究團隊還進行了一項值得關注的對比實驗:他們測試了表示時間段的四種不同"沙堆形態"——用區間內所有時刻均勻分布來表示(均勻支撐)、只用起止兩個端點來表示(端點原子)、用鐘形曲線從中心向兩側擴展來表示(中心高斯)、以及在邊界處放置鐘形曲線來表示(邊界高斯)。實驗結果表明,均勻支撐的效果最為穩定——因為它完整保留了時間段的"在哪裡"和"有多長"兩個資訊,與最終評估指標的數學性質高度吻合,而其他三種方式都只保留了部分資訊,容易在某些測試任務上表現好、另一些任務上表現差。

---

五、實戰測試:七個不同類型的"偵查場景"

為了全面檢驗TimeLens2的實戰能力,研究團隊在七個不同類型的基準測試上進行了評估,每個測試代表一種不同的"偵查場景"。

第一個場景是短影片室內動作定位,對應的測試集叫Charades-STA的TimeLens重標註版本。這類影片通常只有幾十秒到幾分鐘,查詢的是具體的室內動作,比如"一個人打開了門"。

第二個場景是事件級別定位,對應ActivityNet Captions的TimeLens重標註版本。這類測試關注的是比單個動作更宏觀的事件,比如"一場大浪打到了衝浪者身上並造成了衝擊"。

第三個場景是精彩時刻與亮點檢測,對應QVHighlights的TimeLens重標註版本。這類測試不僅要找到時間段,還要識別影片中"最精彩的部分",查詢可能是"兩個女性一起騎水上摩托艇"。

第四個場景是長影片多段定位,對應VUE-TR測試集。這裡的影片更長,而且同一個查詢對應的時間段可能分散在影片的多個不連續位置,比如"找到所有攪拌紅色濃醬的時刻"。

第五個場景是長影片用戶風格定位,對應VUE-TR-V2測試集。這類查詢帶有更主觀的色彩,比如"給我看所有航拍鏡頭"——這要求AI不僅理解查詢的字面意思,還要理解"航拍鏡頭"這個風格概念對應的視覺特徵。

第六個場景是問句式定位,對應MomentSeeker測試集的純文本查詢子集。這類查詢不是描述性的,而是疑問句,比如"從上到下,出現在比賽出發名單上的第一個名字是什麼?"——AI不僅要理解問題,還要定位到能回答這個問題的影片片段(可能是一個出現文字的短暫畫面)。

第七個場景是第一人稱視角自中心定位,對應Ego4D-NLQ的官方驗證集。這類影片是從佩戴攝影機的人的視角拍攝的,查詢同樣是疑問句,比如"我把洋蔥放在哪裡了?"——這要求AI理解第一人稱敘事並在日常生活記錄中搜索。

這七個場景從短到長、從簡單到複雜、從客觀描述到主觀風格、從第三人稱到第一人稱,覆蓋了影片時間定位任務可能遇到的大多數實際情境。

---

六、比賽結果:小型AI偵探團隊完勝千倍規模的對手

實驗結果相當顯眼。

以20億參數的TimeLens2-2B為例,它在七個測試的平均時間重疊度(mIoU,可以理解為"平均精準度")上達到了44.5分,比同等規模的其他模型都要高——比參數量相同的Qwen3-VL-2B高出了14.2分,甚至比參數量是它4倍的TimeLens-8B還高2.4分。

40億參數的TimeLens2-4B表現更加驚人:它在六個測試上擊敗了所有對手,包括那些參數規模是它一百倍的閉源大模型。具體來說,它比擁有3970億參數的Qwen3.5-397B-A17B平均高出7.5分。這意味著一個"小"了將近100倍的系統,在這個任務上的表現超過了那個"大"系統。

針對不同類型的挑戰,性能提升的幅度也不盡相同。與Qwen3-VL-4B基礎模型相比,TimeLens2-4B在VUE-TR(長影片多段定位)上提升了19.6分,在VUE-TR-V2(用戶風格定位)上提升了27.8分,在MomentSeeker(問句式定位)上提升了12.6分,在Ego4D-NLQ(第一人稱定位)上提升了7.2分。這些大幅提升集中出現在最具挑戰性的場景上,表明TimeLens2學到的是真正的"時間搜索"能力,而非單純的數據擬合。

特別值得關注的一個發現是:TimeLens2-93K的訓練數據都是陳述句式的查詢,裡面完全沒有問句。但在MomentSeeker(一個全部用問句提問的測試集)上,用TimeLens2-93K訓練出來的模型,成績從基礎模型的15.3分跳升到了25.8分。這說明AI學到的不是"如何應對陳述句式的查詢",而是"如何在影片裡尋找證據"這個更深層的能力,這種能力自然地遷移到了問句式查詢上。

研究團隊還提供了幾個直觀的對比案例。在一段93.7分鐘的長影片裡,當查詢是"一個穿背心的男人坐在窗邊的花盆旁,手裡拿著一支筆"時,TimeLens2-4B精準找到了在影片第4750秒附近的那一小段,而對比模型要麼給出了無效的時間戳,要麼找到了影片前半段某個相似但錯誤的位置,要麼在正確位置附近但偏差明顯。在另一個多段定位案例里,查詢是"手銬",正確答案是影片裡五個分散的時間窗口,TimeLens2完整找到了全部五個,而其他模型要麼漏掉了一些,要麼加入了錯誤的時間段。

---

七、解剖實驗:每個設計選擇都有多重要?

除了總體性能比較,研究團隊還進行了大量的"拆零件"實驗,驗證每個設計選擇對最終效果的貢獻。這些實驗的結論可以幫助我們理解哪些因素最為關鍵。

關於訓練數據規模,研究團隊發現,數據量和性能之間存在一個"邊際遞減"的規律。僅用5%的TimeLens2-93K(約4,700條樣本)進行訓練,性能就從基礎模型的34.7分跳升到了42.8分;用到20%時達到45.3分;用全量數據達到45.8分。前5%的數據帶來了最大的提升,後面的數據雖然提升幅度越來越小,但在最難的長影片和第一人稱場景上仍有持續改善。

關於標註質量的每一個流水線步驟,研究團隊發現了一個清晰的"層層遞進"效果。如果直接用Qwen3-VL-30B-A3B的原始標註(未經任何驗證)訓練,得到42.0分;加入雙偵探時間共識驗證後,用的數據量從73.5萬條降到了17.4萬條,但得分反而升到了43.4分;再加入語義驗證後,數據量進一步降到9.3萬條,得分升到44.1分;最後加上邊界精修,得分升到45.8分。這說明數據質量的作用遠大於數據數量,精準但少量的標註勝過粗糙但海量的標註。

關於訓練時的最大序列長度,研究團隊發現,把AI一次能看到的影片資訊量從16K個"詞元"增加到100K個"詞元",平均得分從44.4分提升到46.4分。不同類型的任務從這種長上下文訓練中受益的程度不同:Charades這類短影片任務在32K時就基本飽和了,但VUE-TR-V2、MomentSeeker和Ego4D-NLQ這類長影片或複雜任務則一直到100K都還在持續改善。這說明長上下文訓練的核心價值在於擴展AI的"搜索地平線",讓它能在更長的時間線上保持有效的搜索能力。

關於指令和回答格式的多樣化,2×2對比實驗(單一查詢格式 vs 多樣化查詢格式,單一回答格式 vs 多樣化回答格式)表明,兩種多樣化的效果相互疊加,共同多樣化比單獨使用任何一種都更好,平均提升了0.9分,其中在VUE-TR上的提升高達3.0分。

關於Wasserstein獎勵的貢獻,研究團隊發現,它把平均得分從47.0分提升到47.7分,關鍵在於它"拯救了"那些傳統評分給出零分的預測組。在強化學習的每次疊代中,系統會為同一個問題生成一批答案,然後通過比較它們的得分來指導AI改進。如果所有答案都和正確答案沒有重疊,傳統tIoU給所有答案都打0分,平均之後得到的訓練信號是一片空白。研究團隊統計發現,在300個訓練步驟里,傳統tIoU有13.8%的"問題組"是這種"全部答案都是零分"的情況——這些問題組對AI的訓練毫無幫助。而加入Wasserstein獎勵後,這個比例從13.8%降到了3.6%,其中75.8%原本全是零分的問題組,現在都有了有意義的得分差異,能夠有效指導AI改進。

---

說到底,TimeLens2解決的問題看起來像是個"技術細節",但實際上觸及了一個很根本的問題:AI什麼時候才算真正"理解"了一段影片?僅僅能描述內容顯然不夠,能精準定位證據才算真懂。

這項研究最讓人印象深刻的地方,不是某一個單點技術突破,而是它把整個問題鏈條從數據質量、訓練方式到評估指標都重新審視了一遍,並且在每個環節都找到了更合理的解決方案——數據層面用多偵探協商代替單人判斷,訓練層面用多樣格式代替單一模板,優化層面用搬運距離代替零一判定。這種系統性的思維方式,或許比任何單項技術創新都更有參考價值。

對於普通用戶來說,這項研究意味著未來的影片助手將更有能力回答"這件事發生在影片的什麼時候",無論是在監控錄像里查找事故時刻、在教學影片裡快速定位關鍵步驟、還是在長篇紀錄片裡搜索某個特定場景。至於這種能力什麼時候能普及到日常工具里,就要看工業界把這類研究成果落地的速度了。

有興趣深入探究技術細節的讀者,可以通過arXiv編號2607.17423v1查閱完整論文。

---

Q&A

Q1:TimeLens2是什麼,和普通的影片AI有什麼區別?

A:TimeLens2是南京大學等機構聯合開發的影片時間定位模型。普通影片AI只能告訴你影片裡"發生了什麼",而TimeLens2能精準告訴你某件事"發生在影片的哪個時間段",並且支持同一件事在影片裡多次出現的情況,能把所有出現的時間段都找出來。

Q2:TimeLens2-93K數據集是怎麼保證標註質量的?

A:TimeLens2-93K用了一套六步驗證流水線:先從影片描述中自動生成查詢和候選時間區間,再讓兩個不同的AI模型獨立標註,只有當兩個AI的答案高度吻合(重疊度超過90%)且影片內容與查詢語義匹配時,這條標註才被保留,最後還對保留下來的時間段邊界做精細微調。

Q3:時間Wasserstein獎勵解決了傳統時間重疊度評分的什麼問題?

A:傳統的時間重疊度(tIoU)只要AI預測的時間段和正確答案沒有任何重疊,不管差多遠都給零分,無法區分"差一點點"和"差很遠"的預測。時間Wasserstein獎勵通過計算"把預測位置搬運到正確位置需要多遠的距離"來評分,差一點的預測能得到比差很遠的預測更高的分數,從而給AI提供有方向性的改進信號。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新