宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

給AI影片出一道完形填空題,它考砸了

2026年10月01日 首頁 » 熱門科技

你有沒有玩過這樣一個遊戲:給你一段影片的開頭和結尾,讓你猜中間發生了什麼。

比如開頭是有人打開雞蛋放進鍋里,結尾是一份煎蛋端上桌,你大概能猜出中間無非是煎的過程。這事兒對人來說簡單到近乎無聊,閉著眼睛都能想明白。

但如果讓一個號稱能"看懂影片"的AI來做這道題呢?一群研究者真的做了這個實驗,結果發現,大部分AI在這道送分題上摔得很慘。

**這篇論文的名字就叫TempCloze給AI影片出一道完形填空題它考砸了,它想搞清楚一件事:影片AI到底是不是真的理解影片裡的時間順序,還是只是在耍小聰明蒙對答案。**

先說說這個"耍小聰明"是什麼意思。

現在市面上評測影片AI的題目,大多是選擇題的形式,給一段影片,問一個問題,給四個文字選項,讓AI選。這種形式有個隱藏的漏洞:AI不需要真的看影片,光靠讀題目的文字就能蒙對不少。

論文裡提到一個挺扎心的數據:有研究發現,純語言模型在完全不看影片的情況下,答題正確率能比瞎矇高出25個百分點以上。

這是什麼概念?

就好比一場考試,你根本沒讀文章,光看選項里哪個用詞最"高級"、哪個和別的選項句式不一樣,就能多蒙對四分之一的題。這說明出題人不小心把答案的痕跡留在了措辭里,而不是藏在圖片或影片本身。這種漏洞學術上叫語言先驗給AI影片出一道完形填空題它考砸了,指的是模型靠語言本身的統計規律而不是真正理解畫面內容就能答對題目的現象。這不是AI變聰明了,這是題目出得有毛病。

所以TempCloze團隊想了個狠招:乾脆別用文字選項了,讓AI直接在幾段影片片段里選,選出那段真正應該出現在中間的影片。這樣一來,AI沒法靠"哪個選項寫得更像標準答案"這種文字套路蒙分,它必須真的去看畫面里發生了什麼。

這個思路聽起來簡單,但做起來處處是坑。

**核心的難題是:如果幾個候選影片片段長得完全不一樣,那AI只需要靠畫面里的場景、物體這些表面特徵就能蒙對,根本不需要理解時間順序。**

這就好比你考察一個人是否真的懂做菜的先後順序,結果給的選項一個是切菜畫面,一個是逛超市畫面,一個是睡覺畫面——只要認識"廚房"和"臥室"長什麼樣就能選對,壓根不需要懂做飯邏輯。

TempCloze的解決辦法是:所有候選答案都從同一個影片裡截取,場景、人物、物體全都長得差不多,逼著AI必須靠時間邏輯而不是畫面辨識來做判斷。

這個設計思路催生了論文裡最核心的三個考察維度,也是整篇論文的骨架所在。

三道關卡:內容、時機、節奏

TempCloze把干擾項設計成三種類型,分別叫語義、對齊、進程,英文裡是Semantic、Alignment、Progression,論文裡簡稱S、A、P。

語義*:考察"接下來該發生什麼事",干擾項是同一個影片裡完全不相關的另一段內容,比如本該是煎蛋的畫面,卻給你一段後面收拾廚房的畫面。這類錯誤相對容易識別,因為內容本身就對不上。

對齊*:考察"這件事該發生在什麼時間點",干擾項是把正確答案往前挪、往後挪,或者把範圍擴大,內容看起來是對的,但時間位置不對。比如明明該是煎蛋進行中的畫面,卻給了剛下鍋那一瞬間,或者已經快出鍋的畫面。

進程*:考察"這件事該怎樣一步步展開",干擾項是把正確片段倒放、把內部順序打亂重排,或者把某個動作重複播放。畫面元素完全正確,但發展的邏輯亂了套。

這三關的難度是層層遞進的。第一關只要認出"這是不是同一件事",第二關要判斷"這件事發生的時間點對不對",第三關要看穿"這件事展開的方式合不合理"。

論文裡給了個特別形象的圖解:還是拿煎蛋舉例,語義類干擾項可能給你一段"打雞蛋"的畫面(這明明是開頭已經發生過的事,重複放在中間就不對了);對齊類干擾項給你"提前"或"推遲"的煎蛋片段,或者把整個片段範圍擴大到包含了前後的其他動作;進程類干擾項給你倒放的煎蛋畫面,或者打亂內部順序的煎蛋過程。

為什麼要費這麼大勁設計這三層?

因為如果只測一種錯誤類型,測出來的可能只是AI某個方面的短板,沒法看出它到底是哪個環節出了問題。就像體檢不能只測血壓,還得測血糖、心電圖,才能拼出一個人整體健康狀況的全貌。這三個維度合在一起,才能精確診斷出AI的時間理解到底卡在哪個環節。

從7萬影片到1521條:一場嚴苛的篩選

TempCloze的影片素材來自七個公開數據集,涵蓋長鏡頭影片、第一人稱視角影片和精細動作影片,最終留下1521條影片,平均時長31.3秒。

這個數字看起來不大,但背後的篩選過程相當狠。

論文提到,原始素材里光是LVD-2M給AI影片出一道完形填空題它考砸了這一個來源就有超過8萬條影片,經過時長篩選、AI初篩、畫質檢測、運動幅度檢測這四道關卡後,最後只留下192條,淘汰率高達99.37%。

為什麼篩選這麼嚴苛?

因為很多影片壓根不適合出這道完形填空題。比如那種從頭到尾幾乎不動的靜態鏡頭,你怎麼挖空中間那段,AI都能靠"反正前後差不多"蒙對,因為整個影片就沒什麼變化可言。研究者用了一種叫光流給AI影片出一道完形填空題它考砸了的技術來檢測畫面運動幅度,光流*:一種通過比較連續幀之間像素的移動來判斷畫面中物體運動方向和速度的圖像分析方法,只有運動幅度達標的影片才會被留下來做挖空題。

除此之外,研究者還專門請了一個叫GPT-o3給AI影片出一道完形填空題它考砸了的推理模型來審核每條影片的文字描述,判斷這個影片的情節是否有明確的先後邏輯,能不能靠開頭結尾"鎖定"中間應該發生什麼。如果一個影片的中間部分換成隨便什麼內容都說得通,這個影片就不適合拿來出題,因為它測不出AI是否真的理解時間邏輯。

這個篩選邏輯其實也回應了一個更深的問題:不是所有影片都值得拿來考驗AI的時間理解能力。就像不是所有作文題目都適合考察邏輯思維,有些題目本身就沒有唯一正確答案,硬考只會得出沒意義的結果。

31個AI大比武,結果集體翻車

論文測試了10個閉源模型(比如Gemini、GPT系列、Claude系列)和21個開源模型,覆蓋面相當廣。

結果最扎眼的一組數字是這樣的:

在"內容對不對"這一關(語義維度給AI影片出一道完形填空題它考砸了),表現最好的閉源模型Seed1.8給AI影片出一道完形填空題它考砸了能拿到96.25%的正確率,人類基準線是96%,AI甚至已經追平甚至略微超過人類了。

在"節奏對不對"這一關(進程維度給AI影片出一道完形填空題它考砸了),Seed1.8也能拿到92.11%,同樣接近人類的97%。

但一到"時機對不對"這一關(對齊維度給AI影片出一道完形填空題它考砸了),畫風突變:Seed1.8隻有61.93%,最強的開源模型Qwen3.5給AI影片出一道完形填空題它考砸了也只有51.55%,而人類是98%。

**這意味著,即使是表現最頂尖的AI,在判斷一件事究竟應該發生在什麼時間點上,也要比人類差三四十個百分點。**

這個差距具體意味著什麼?打個比方,如果人類做100道對齊題只錯2道,那表現最好的AI要錯38道,幾乎是人類失誤數的19倍。這已經不是"略遜一籌"的程度,而是能力維度上的斷層。

論文把這個現象總結為整篇研究最重要的發現:對齊維度是當前影片AI的核心瓶頸。它們看得懂"發生了什麼",也能大致判斷"這件事怎麼展開",但一旦要精確定位"這件事該出現在哪個時間點",就集體露怯。

這背後其實揭示了一個挺有意思的認知差異。人類判斷時間點靠的是對物理世界連續性的直覺,比如一顆雞蛋從生到熟需要經歷哪些視覺變化,哪個階段該出現在什麼時候,這種判斷幾乎是本能。而AI處理影片的方式更像是把一堆畫面當成靜態圖片的集合來分析,它能識別每張圖里"有什麼",卻很難精確把握"這些圖之間應該隔多遠的時間距離"。

這就好比讓一個人看一疊打亂的照片去拼出一個完整的故事,內容對不對他一眼能看出來,但要精確判斷兩張照片之間應該隔多久,是隔了五分鐘還是隔了半小時,這種細膩的時間感知反而是最難的部分。

如果不設這道"對齊"關卡會怎樣?

論文特意做了對比實驗:如果把干擾項混在一起隨機出題,不單獨區分維度,會發現對齊類的干擾項是最容易騙到AI的那一類,占了模型犯錯原因里最大的比例。這說明如果不單獨把對齊維度拎出來考察,這個巨大的短板很可能被語義和進程維度較好的表現給掩蓋過去,形成一種虛假的"整體還不錯"的錯覺。

犯錯也有套路:AI最容易踩的兩個坑

論文進一步分析了AI具體是怎麼答錯的,發現錯誤不是隨機的,而是有明顯的模式。

在對齊維度里,最常見的錯誤類型叫"擴展型"錯誤,也就是AI選中了一個範圍被拉長、同時包含了正確答案前後內容的片段。比如Seed1.8-I在所有對齊類錯誤里,有75%都是選中了這種"擴大版"的答案。

這挺好理解,因為擴大版的候選項確實包含了正確內容,只是多加了一些不該有的部分,畫面看起來"沒毛病",AI很容易覺得"這個應該就是對的"。

在進程維度里,最常見的錯誤類型叫"倒放型"錯誤,也就是AI沒能識別出影片被倒著播放了。GPT-5.4在所有進程類錯誤里,有67%都是選中了倒放的版本。

這個錯誤更有意思。倒放意味著整個動作的因果關係反了過來,比如水本該是被倒進杯子裡,倒放後看起來像是杯子裡的水自己飛回了瓶子。這種違反物理常識的情況,對人類來說一眼就能看穿,但對AI來說似乎沒那麼明顯。

這可能反映出AI在處理影片時,更多是在識別畫面里"有什么元素",而不是真正建立起一套關於"事情發展方向應該是怎樣"的物理直覺。就像一個只會認字不懂句法的人,看到"貓追老鼠"和"老鼠追貓"這兩句話里的字都認識,卻分不清誰在追誰。

換個順序問一遍,答案就變了

研究者還做了一系列很紮實的"壓力測試",專門考察AI的答題穩不穩定。

第一個測試是打亂選項順序。同樣的題目,只是把A、B、C、D的順序換一下,AI還能不能選出同一個答案?

結果顯示,雖然平均正確率變化不大(波動通常在4個百分點以內),但答案的穩定性很差。論文裡用了一個叫翻轉率的指標來衡量,翻轉率*:候選項換了個排列順序後,模型對同一道題的判斷從"對"變成"錯"或反過來的比例,數值越高說明模型越不穩定。

數據顯示,翻轉率最高能到48.4%,也就是說接近一半的題目,AI換個選項排列方式就可能改變主意。

這說明什麼?說明AI壓根沒有一個穩固的判斷依據,它的選擇更像是在幾個選項之間做相對比較,而不是對每個選項獨立評分。這就好比一個人做單選題時不是"我覺得A對",而是"矬子裡拔將軍,這幾個選項里A看起來最順眼",一旦選項排列方式變了,這種相對比較的結果自然也會跟著變。

如果不做這項測試會怎樣?

如果只看平均正確率,你會覺得這些AI表現挺穩定的,因為分數波動確實不大。但翻轉率揭示的是另一個真相:穩定的分數背後可能藏著極不穩定的判斷邏輯。這就像一個學生考試總分一直是80分,但每次做對的題目完全不一樣,這種"穩定"其實毫無參考價值,它只是恰好每次蒙對蒙錯的數量差不多而已。

第二個測試是看AI更依賴開頭還是結尾的資訊。研究者做了三種設置:只給開頭、只給結尾、開頭結尾都給。

結果發現,只給結尾的表現普遍是最差的,只給開頭的表現往往接近甚至超過兩者都給的情況。比如Seed1.6在進程維度上,只給開頭能拿到80%,兩者都給是82%,差別不大,但只給結尾驟降到46%,直接腰斬。

這個不對稱現象挺值得琢磨。研究者推測,這可能和AI訓練時接觸的文本大多是按時間順序正向排列的有關,導致它天生更擅長"從過去推未來",而不擅長"從未來倒推過去"。

這就好比一個習慣了從頭到尾看小說的人,突然讓他從結局倒著猜情節發展,會明顯感到彆扭,不是他能力不行,而是他的思維習慣本身就是單向的。

第三個測試是看影片看得越多,AI表現會不會更好。研究者把可見的上下文範圍從只給端點畫面逐步擴大到給完整的前後影片。

結果出乎意料:對齊維度的表現隨著可見範圍擴大而明顯下降。這說明對齊類問題所需要的關鍵線索,恰恰藏在挖空缺口最靠近的那幾幀畫面里,給的上下文越多,這些關鍵線索反而被稀釋、淹沒了。

這個現象讓人想起一個生活場景:找鑰匙時,如果只在門口那一小塊地方找,反而更容易找到,因為注意力高度集中;但如果被要求把整個房子都翻一遍,看似資訊更全,反而更容易因為分心而漏掉鑰匙真正掉落的那個點。資訊量的增加不必然帶來判斷質量的提升,有時反而是一種干擾。

第四個類似的測試是看影片裡抽取的幀數多少(也就是採樣密度)對結果的影響,得到了類似的結論:幀數從8張增加到20張,對齊維度的表現同樣呈下降趨勢。這進一步印證了一個判斷,那就是對齊問題的解題關鍵不在於"看得夠不夠多",而在於"看得夠不夠准"。

第五個測試是給AI多次答題的機會,看它有沒有可能蒙對。這個方法叫作Pass@k,Pass@k*:讓模型對同一道題回答k次,只要其中任意一次答對就算這道題被解決,k越大代表給模型的試錯機會越多,用來衡量模型的答題上限而非單次準確率。

結果發現,多試幾次確實能讓整體正確率往上走,比如Gemini2.5-Pro和Qwen3.5-397B-A17B在嘗試5次後,正確率能比只試1次高出大約30個百分點。但即便這樣,對齊維度依然是墊底的那個,多給幾次機會並沒有改變三個維度之間的相對排名。

這說明對齊維度的短板不是運氣問題,也不是能力發揮不穩定的問題,而是一種系統性的、無法靠多次嘗試來彌補的能力缺失。

這道題給AI研究帶來了什麼啟發

TempCloze最終揭示的核心問題,其實可以概括成一句話:當前的影片AI擅長認出"發生了什麼",卻不擅長判斷"什麼時候發生"。

這個發現之所以重要,是因為它戳破了一種容易產生的錯覺,如果只看那些常見的影片問答類評測,AI在語義理解上表現優異,很容易讓人誤以為它已經"看懂"了影片。但TempCloze通過把語義、對齊、進程這三個維度拆開單獨考察,暴露出了一個被掩蓋的短板:AI對時間軸本身的精確感知力,遠遠落後於它對畫面內容的識別能力。

研究者在論文最後提出,未來的影片AI或許需要一些真正"原生"處理時間維度的架構,而不是簡單地把影片拆成一幀幀圖片來分析。目前大多數影片AI本質上還是在用處理圖片的思路來"拼湊"影片理解,這可能正是它們在時間精確性上表現不佳的根源所在。

這個思路讓人聯想到人類學習樂器的過程。一個剛開始學鋼琴的人,可能很快就能認出每個音符對應哪個琴鍵(相當於語義理解),但要把握好節奏、把音符彈在正確的拍子上(相當於時間對齊),往往需要更長時間的專門訓練。識別"是什麼"和把握"什麼時候",這本身就是兩種不同性質的能力,不能指望其中一種練好了另一種自動就會了。

Q&A

Q1:TempCloze是什麼?

A:TempCloze是一個專門評測影片AI時間理解能力的測試集,它給AI看影片的開頭和結尾,讓AI從四個候選片段里選出正確的中間部分,一共包含1521條經過嚴格篩選的影片。

Q2:為什麼影片AI在TempCloze上表現不好?

A:測試發現AI在判斷"事情發生的時間點是否正確"這個維度上表現最差,即便是最強的AI模型正確率也只有六成左右,遠低於人類98%的水平,而在"內容對不對"和"節奏對不對"這兩個維度上AI表現相對接近人類。

Q3:TempCloze和普通的影片問答測試有什麼不同?

A:普通測試通常是給文字選項讓AI選擇,容易被語言層面的規律矇混過關;TempCloze直接讓AI在幾段視覺上相似的影片片段里挑選,逼迫AI必須真正依靠畫面里的時間邏輯做判斷,而不能靠文字套路蒙對答案。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新