宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

中科大聯合多所頂尖高校推出「影片深度研究」智能體:讓AI真正「看懂」影片再去搜索,全面超越GPT-5和Claude

2026年08月11日 首頁 » 熱門科技

這項由中國科學技術大學(USTC)主導,聯合小紅書、香港中文大學、香港理工大學、浙江大學、加州大學洛杉磯分校、牛津大學、華東師範大學和清華大學共同完成的研究,以預印本形式發布於2026年8月4日,論文編號為arXiv:2608.03979。感興趣的讀者可以通過該編號在arXiv平台檢索原文。

假設你現在拿到一段影片,影片裡出現了一位你不認識的演員,你想知道這個人是誰、演過什麼作品、有什麼背景故事。你會怎麼做?大概率是先定格畫面,截取那個人的臉,然後去網上搜索圖片,再根據搜索結果進一步追查相關資訊。這整個過程——先"看"、再"搜"、最後"綜合判斷"——聽起來理所當然,但現有的AI系統恰恰不擅長這樣做。它們要麼完全忽視影片畫面,直接用文字去搜;要麼憑藉自己腦子裡記住的知識猜一個答案,而不是老老實實地調用工具去查。

這正是這篇論文要解決的核心問題:如何讓AI真正像人一樣,先把影片"看透",再去網際網路上尋找證據,最終給出可靠的答案。研究團隊將這種能力命名為"影片深度研究中科大聯合多所頂尖高校推出影片深度研究智能體讓AI真正看懂影片再去搜索全面超越GPT5和Claude"(Video-DeepResearch,簡稱VideoDR),並為此構建了一套完整的訓練體系和評估基準。

一、AI看影片時犯了哪些壞毛病

在正式介紹解決方案之前,研究團隊先做了一個診斷實驗,結果相當耐人尋味。

他們挑選了三個代表性的AI模型,分別是規模較小的Qwen3.5-35B-A3B、規模較大的開源模型Qwen3.5-397B-A17B,以及赫赫有名的閉源模型GPT-5,讓這三個模型在一個影片問答基準上接受測試,同時統計它們在回答問題時分別調用了多少次視覺工具(比如截圖搜索)和文字工具(比如直接用文字去網上搜索)。

結果非常能說明問題。即便是最強大的開源模型Qwen3.5-397B-A17B,平均每道題只調用了0.10次視覺工具,而調用文字工具的次數高達1.27次。換句話說,面對一道需要"看影片+上網查"的問題,它幾乎完全跳過了"看影片"這個環節,直接去文字搜索。這就好比讓你認出影片裡的那位演員,你卻不看畫面,只是在搜索框裡輸入"這個影片裡的演員是誰"——這樣的搜索幾乎不可能得到準確答案。

更有意思的是GPT-5的表現。它在同一個基準上拿到了57%的準確率,但視覺工具調用次數為零,文字工具調用次數也只有區區0.12次。這意味著什麼?GPT-5基本上是靠"背答案"在做題——它的訓練數據里可能已經包含了大量相關知識,它直接從記憶里提取答案,而不是真正去做調查研究。這就像一個考試高手,不是因為真的理解題目,而是因為題目他以前見過,直接默寫出來就拿了分。

研究團隊將第一個問題稱為"模態偏見"——AI系統天然傾向於跳過視覺工具;將第二個問題稱為"參數知識泄漏"——模型依靠記憶作弊,而不是依靠工具解題。這兩個問題的存在,讓現有的評估基準也變得不可靠:如果題目可以靠記憶答對,那高分就不代表AI真的具備影片理解和網路調研能力。

二、重新設計"看影片+上網搜"的工作流程

研究團隊的核心思路可以用一個直覺性的比喻來理解:把影片當成一條時間軸上的偵探線索串,AI的任務是先沿著時間軸把關鍵畫面定格下來,把畫面里的重要人物或物體精確裁剪出來,拿著這些圖片去視覺搜尋引擎里比對,獲得初步線索之後,再用文字搜索和網頁訪問來深入挖掘背景資訊,最後把所有證據拼合成一個完整的答案。

為了實現這個流程,研究團隊給AI配備了兩類核心工具。第一類叫"選取關鍵幀"(Select_Keyframe),負責從連續的影片流中挑出資訊最豐富的那幾幀畫面,就像偵探在一卷監控錄像里標記出最關鍵的幾個時間節點。第二類叫"裁剪搜索"(Crop_Search),負責把關鍵幀里某個具體的人或物精確框出來,拿著這張裁剪圖去做視覺搜索,就像偵探把嫌疑人的照片列印出來去大街上比對。

這套工具組合構成了"感知階段",之後才是"探索階段":用文字搜索(Search)和網頁訪問(Visit)來獲取更深層的知識。關鍵在於,研究團隊強制規定了順序——AI必須先把感知階段走完,才能進入探索階段。這個"先看影片再搜網路"的強制順序,是整個方案最核心的設計決策。

在形式化的描述上,這個過程被建模為一個序列決策問題:AI在每一步根據之前所有的操作記錄(問題、影片幀、已執行的工具調用及其返回結果)來決定下一步做什麼。整個行動空間包含了上述所有工具,而策略的學習則依賴於接下來要介紹的訓練體系。

三、如何"教會"AI做影片深度研究

教AI做一件新事情,最直接的辦法是給它大量示範——展示"應該怎麼做"的完整過程,讓它從中學習。但在影片深度研究這個任務上,幾乎沒有現成的高質量訓練數據,因此研究團隊必須從零開始構建整個數據流水線。這個過程分為三個階段,每一階段都像是在為最終的訓練食材做細心的預處理。

**第一階段:篩選合格的"食材"影片。**研究團隊從多個來源——包括學術影片數據集和YouTube等流媒體平台——收集了大量原始影片。然後對這些影片進行兩輪篩選。第一輪是規則過濾,直接丟棄那些太短、太長或畫質太差的影片。第二輪更有意思:他們用一個AI模型來判斷這段影片是否"值得深度研究",也就是說,理解這段影片的內容是否真的需要去網際網路上查資料。比如,一段普通人走路的影片不需要查;而一段專業烹飪比賽的影片,裡面涉及特定廚師、特定賽事,就需要外部知識來理解。只有通過雙重篩選的影片才會進入後續流程。

**第二階段:從影片中提取問答對。**通過篩選的影片進入問答生成流程。研究團隊首先用一個基於圖像相似度的算法(CLIP模型)來提取候選關鍵幀,剔除相鄰幀之間差別不大的冗餘畫面,然後用大模型來最終確認關鍵幀的選擇。接著,對每一幀,大模型預測畫面中各個實體(人物、物體、標誌等)的位置,並把這些實體裁剪出來做視覺搜索,獲取外部知識。在此基礎上,生成兩種類型的問答對:一種是聚焦單個實體的深度問題(比如"畫面中戴棒球帽的男人參演了哪部2024年的音樂奇幻電影"),另一種是需要聯繫多個實體的組合問題(比如"畫面中的兩位女演員之前有沒有合作過")。

生成問答對之後,還有一道關鍵的質量過濾程序:對每個問題進行四次"不用工具"的測試,如果AI僅靠自己的內部記憶就能答對其中任何一次,這道題就會被丟棄。這個設計直接對抗了前面提到的"參數知識泄漏"問題——只有真正需要外部工具才能答對的題目,才會被保留進訓練集。最終,這一階段產生了3萬條高質量的影片問答對。

**第三階段:構建完整的"偵查軌跡"。**有了問答對還不夠,還需要給AI示範完整的解題過程——每一步調用了什麼工具、得到了什麼資訊、怎麼一步步走向正確答案。研究團隊使用了一個強大的大模型(Qwen3.5-397B-A17B)來自動生成這些軌跡,同時採用了"階段性工具解鎖"策略:在前期階段,模型只能使用視覺工具(選幀和裁剪搜索),被強制充分探索影片內容;當模型判斷視覺資訊已經足夠、或者達到了預設的感知上限,才會開放文字工具(搜索和訪問網頁)。只有最終給出正確答案的軌跡才會被保留下來,作為訓練數據使用。經過這道嚴苛的篩選,從原始生成中最終保留了7000條高質量軌跡。

四、兩步訓練:先模仿、再超越

有了7000條正確的偵查軌跡和另外7000條純文字深度研究數據(後者用於補充文字搜索能力),研究團隊開展了兩階段的訓練。

第一階段叫做監督微調(SFT),說白了就是讓AI反覆觀看那些正確示範,把"先看影片再搜網"這個工作方式內化成自己的習慣。這個階段給了AI一個"基本功"——它學會了什麼時候該用哪個工具,大致的推理語法是什麼樣的。但純粹靠模仿有一個天花板:如果訓練數據里沒有出現過某種情況,AI就不知道怎麼處理。

第二階段叫做組相對策略優化(GRPO),這是一種強化學習方法。在這個階段,AI不再只是看示範,而是自己上場嘗試,答對了就得1分,答錯了就得0分。通過大量的自我嘗試和反饋,AI開始探索訓練數據里沒有覆蓋到的解題策略,逐漸發展出超越示範的能力。為了讓這個訓練更有效率,研究團隊專門篩選了"中等難度"的題目來做強化學習訓練——太簡單的題(AI每次都答對)和太難的題(AI每次都答錯)都不會產生有效的學習信號,只有那些有時候對、有時候錯的題目,才能讓AI從對比中學到東西。

整個訓練在4台配備了8塊80GB顯存GPU的伺服器(共32塊GPU)上進行。研究團隊提供了兩個版本:Video-DeepResearch-30B-A3B基於Qwen3-VL-30B-A3B-Instruct,Video-DeepResearch-35B-A3B基於Qwen3.5-35B-A3B,兩者採用完全相同的訓練流程。

五、一個不能靠背答案過關的新基準

除了訓練模型,研究團隊還意識到,現有的評估基準本身存在根本性缺陷——因為有些題目用記憶就能答對,高分不代表模型真正具備影片理解和深度研究能力。於是他們自己動手,創建了一個叫做VIDEODR-BENCH的新基準,共包含200道問題,通過嚴格的人機協作標註流程構建而成。

這個基準的設計核心是"雙重必要性":每一道題的答案,必須同時依賴影片中的視覺資訊和網際網路上的外部知識,缺一不可。標註過程中,人工標註員會在影片的關鍵時間節點暫停,使用裁剪搜索工具驗證畫面里的實體資訊,然後基於驗證結果提出種子問題。接下來,一個多智能體流水線會將這些簡單的種子問題擴展成多跳推理題——比如從"畫面里的人是誰"出發,擴展到"他的職業是什麼"、"他的國籍是什麼"、"和他共同主持節目的男喜劇演員是誰",形成需要多步推理的複雜問題鏈。

對生成的問題,還要再過一道"防背答案"的關卡:如果模型不用工具就能答對,這道題就被剔除。人工標註員隨後再次核驗剩餘題目的準確性和可答性。這樣層層篩選下來,最終保留的每道題都真正需要"先看影片、再查網路"才能答對。

從題目的分布來看,這200道題涵蓋了六個影片領域:知識類(29.5%)、娛樂類(22%)、日常生活類(18.5%)、遊戲和體育類(14.5%)、新聞類(12%)和其他類(3.5%)。從影片長度來看,46%是2分鐘以內的短影片,34%是2至10分鐘的中等長度影片,20%是10分鐘以上的長影片。

六、實驗結果:數字背後的故事

研究團隊在VIDEODR-BENCH和另一個叫做VideoDR的外部基準上,對多個模型進行了全面評測,結果相當清晰地展示了各方的實力差距。

在所有被評測的模型中,Video-DeepResearch-35B-A3B以64.0%的平均準確率拿下了第一名的位置。排在它後面的是Claude-4.5-Sonnet(59.0%)、Gemini 2.5 Pro(57.5%)和GPT-5(52.5%)。要知道,Claude、Gemini和GPT-5都是參數規模龐大得多的閉源模型,背後是全球頂尖的商業AI公司。一個開源的35B參數模型,通過專門的訓練方法,超越了這些龐然大物,這個結果本身就很說明問題。

Video-DeepResearch-30B-A3B的表現也令人印象深刻,59.3%的平均準確率與Claude-4.5-Sonnet幾乎持平,明顯高於GPT-5和Gemini 2.5 Pro。更值得關注的是它相對於自身基礎模型的提升幅度:原始的Qwen3-VL-30B-A3B-Instruct只有40.5%的平均準確率,經過訓練之後躍升至59.3%,提升了整整18.8個百分點。35B版本的提升幅度更大,從42.8%提升到64.0%,提升了21.2個百分點。

分領域來看,兩個版本的模型在知識類(35B版本66.1%)和娛樂類(35B版本65.9%)表現最為突出,均超越了所有閉源模型。在日常生活類別上,35B版本提升了16.3個百分點,表現出較強的泛化能力。新聞類別上,30B版本表現(58.3%)反而優於35B版本(41.7%),這個反轉提示研究團隊,針對時效性強的新聞內容,模型可能需要特別的適應策略。

工具使用行為的變化同樣值得關注。在對比數據中,Claude-4.5-Sonnet的視覺工具調用次數平均為1.83次(在VideoDR基準上),而經過訓練的Video-DeepResearch-30B-A3B高達2.33次,遠超所有原始模型。相比之下,原始的Qwen3.5-397B-A17B只有0.10次。這個數字上的變化,本質上是AI工作方式的重構——從"能不看影片就不看"變成了"先把影片看透再說"。

七、逐步拆解訓練方案:每一步都有價值

為了搞清楚整個訓練流程中哪些環節真正起了作用,研究團隊對30B版本做了一組消融實驗,逐步疊加訓練數據和訓練階段,觀察每一步的效果變化。

從基礎模型的40.5%出發,引入4000條影片深度研究軌跡進行監督微調後,平均準確率提升到46.0%,增加了5.5個百分點。將軌跡數量擴充到7000條,準確率進一步提升到53.0%,說明數據量的增加帶來了持續的收益。接著加入7000條純文字深度研究數據進行混合微調,準確率升至56.8%——這驗證了研究團隊的一個假設:文字搜索能力和視覺搜索能力是互補的,文字數據的加入能幫助模型在視覺任務上也表現得更全面。最後,加入2000條中等難度樣本進行強化學習訓練,最終準確率達到59.3%。每一步都有實質性的提升,每一步都不是多餘的。

研究團隊特別指出了一個有意思的規律:在VIDEODR-BENCH上,7K軌跡微調帶來的提升(從43%到51%)比在VideoDR上(從38%到55%)更為顯著,說明視覺接地能力對於高難度的基準問題尤其重要。而最後的強化學習階段,在VIDEODR-BENCH上貢獻了額外的2個百分點提升,說明強化學習帶來的探索能力對於需要多步推理的複雜任務特別有價值。

八、這意味著什麼:超越分數的深層啟示

研究團隊在討論中提出了幾個值得反覆思考的觀點,這些觀點超越了具體的數字,觸及了AI能力的本質。

第一個觀點是關於規模與能力的關係。傳統認知是,模型越大能力越強。但這次實驗給出了一個反例:參數量高達397B的Qwen3.5-397B-A13B,在平均準確率上只有52.8%,而經過專門訓練的30B模型達到了59.3%,30B不到它參數量的十分之一,卻表現更好。這說明,對於需要特定工作方式的任務,模型的訓練方式比模型的大小更加關鍵。

第二個觀點是關於"工具使用"是否等於"真正理解"的問題。GPT-5不用任何工具就能答對57%的題目,而訓練過的30B模型需要平均調用約2.33次視覺工具和4.24次文字工具才能達到相近的分數。從某種角度看,哪個模型"更聰明"是個複雜的問題。但從另一個角度看,對於那些需要外部驗證的問題,依靠記憶答題是不可靠的——今天恰好記住了,不代表對所有類似問題都能正確處理。研究團隊認為,真正理解一個影片,意味著能夠基於它採取行動,而不僅僅是回憶起與之相關的知識。

第三個觀點是關於"模態偏見"的根源。研究發現,AI系統不願意使用視覺工具,這種偏見不是架構上的天然缺陷,而是訓練數據分布的產物——因為大多數訓練數據是文字的,所以模型的默認行為也是文字導向的。這意味著,要真正解決多模態的對等性問題,不只是需要設計能處理圖像和影片的架構,更需要在訓練數據和訓練範式上做出根本性的調整。

歸根結底,這項研究的價值在於它證明了一件事:讓AI真正"看懂"影片,是可以通過精心設計的訓練流程來實現的,而不是非要等到模型參數量達到某個臨界值才能自然湧現。一個精心訓練的35B模型,在這個任務上比參數量大十倍的模型表現得更好——這個結論對整個AI領域的發展路線都有一定的參考意義。

當然,這項研究也坦誠地指出了自身的局限。當前的方案對計算資源的需求相當高,不論是數據合成還是模型訓練都需要大量GPU資源。VIDEODR-BENCH的構建依賴人工標註,難以快速大規模擴展。未來的工作方向包括探索更高效的訓練流水線,以及開發更自動化的評估方式,以減少對人工標註的依賴。

對於普通讀者而言,這項研究離日常生活並不遙遠。下一次你用手機應用問"這是什麼植物"或者"這個標誌是哪個品牌"的時候,背後的AI是否真的在"看"你發送的圖片,還是在靠記憶猜測,會直接影響答案的準確性。當AI影片助手越來越普及,它們能否真正理解影片內容,而不是只會背題,將成為衡量這類產品是否可靠的核心標準之一。

Q&A

Q1:Video-DeepResearch(VideoDR)和普通的影片問答AI有什麼區別?

A:普通影片問答AI通常直接根據影片內容或內部記憶來回答問題,而Video-DeepResearch系統被設計為必須先"看影片"(選取關鍵幀、裁剪重要實體做圖像搜索),再去網際網路上查詢外部知識,最後綜合兩方面資訊才給出答案。這種"先視覺感知、再網路調研"的強制順序,是它區別於普通影片AI的核心特點。

Q2:VIDEODR-BENCH基準中科大聯合多所頂尖高校推出影片深度研究智能體讓AI真正看懂影片再去搜索全面超越GPT5和Claude為什麼能防止AI靠"背答案"作弊?

A:VIDEODR-BENCH在題目篩選階段加入了一道專門的防泄漏過濾:對每道候選題目進行多次"不允許使用任何工具"的測試,只要AI僅憑內部記憶就能答對,這道題就會被直接丟棄。最終保留下來的每道題,都是那些必須結合影片視覺內容和網際網路外部知識才能答對的問題,單靠記憶無法通過。

Q3:為什麼參數量更小的Video-DeepResearch-30B能超越參數量更大的Qwen3.5-397B模型?

A:這個結果說明,對於需要特定工作方式的任務,訓練方式比模型大小更重要。Qwen3.5-397B雖然參數量巨大,但沒有經過專門的影片深度研究訓練,它天然傾向於跳過視覺工具直接文字搜索,或者依賴內部記憶作答。而Video-DeepResearch-30B經過了專門的軌跡模仿訓練和強化學習,學會了正確的工具使用習慣,因此在這個任務上反而表現更好。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新