你有沒有想過一件事:讓AI在一張照片裡圈出"那隻戴帽子的貓",可能只要零點幾秒。但如果換成一段影片,讓AI持續跟蹤"那隻戴帽子的貓"跑過整個畫面,同樣的AI可能要磨蹭三十多秒才能給出答案。
這不是錯覺。這是這篇論文一開始就拋出來的問題:影片裡的目標定位,為什麼天然就比圖片慢這麼多。
答案其實很直接。圖片定位只需要預測一個框,四個坐標數字。影片定位不一樣,它得先判斷"這件事發生在哪個時間段",然後在這個時間段的每一幀里都畫一個框。如果這段影片橫跨五秒、按每秒兩幀採樣,那就是十個框,四十個坐標。而現在主流的做法,是讓AI像寫文章一樣一個字一個字地把這些坐標"念"出來。
念得越多,等得越久。這篇論文要解決的,就是這件事。
**問題出在哪:一步一步來的代價**
要理解這篇論文的貢獻,得先搞清楚現在的AI是怎麼幹這活的。論文裡管這個任務叫時空影片定位
時空影片定位(STVG):給一段影片和一句話描述(比如"遞三明治的小販"),AI需要說出這件事發生在影片的哪個時間區間,並且在這個區間裡的每一幀都框出那個人或物體。
多模態大語言模型現在是幹這活的主力,因為文字描述可能很抽象,像"正在把牌翻過來的那張撲克牌",這種需要理解和推理的任務,天然適合語言模型。
多模態大語言模型(MLLM):能同時理解文字和圖像/影片的AI模型,比如市面上常見的Qwen、Gemini這類模型,都屬於這個範疇。
但問題來了。這些模型的輸出方式,繼承自它們最擅長的事情:寫文章。寫文章講究前後文一致,後面寫的字要參考前面寫過的字,這叫自回歸。
自回歸解碼:模型每生成一個詞,都要看著前面已經生成的所有詞,一個接一個往下寫,不能跳步,也不能同時寫多個詞。
寫作文這麼做沒問題,因為句子確實需要前後呼應。但把這套邏輯搬到畫框上,就出事了。論文裡詳細拆解了四種解碼方式,一步步揭示問題出在哪。
最原始的做法,叫非量化令牌解碼。時間戳"3.0秒"和坐標"512"這些數字,直接當成普通文字來生成。麻煩的是,分詞器可能把"512"拆成"5""1""2"三個獨立的token,一個坐標就要三步才能寫完。整段影片的定位軌跡寫下來,輪次多到論文用"許多輪"來形容,直接導致31.6秒的完成延遲。
第二種做法叫量化令牌解碼,思路是把坐標壓縮成單個token。比如坐標"512"不再拆開寫,而是直接對應一個專屬符號。這樣效率提升了不少,延遲降到9.1秒,但輸出坐標這件事本身,依然是一個詞一個詞往外蹦。論文算出來,一個包含T個框的軌跡,需要4+7T輪解碼,軌跡越長,輪次線性增長。
第三種做法叫序列化區塊解碼,這是論文借鑑此前一篇工作(LocateAnything)的思路做的適配。它把"一個完整的框"打包成一個原子單位一次性預測出來,而不是坐標一個一個念。這一步把輪次砍到了1+T,效率明顯提升,延遲降到1.0秒。
但這裡藏著一個致命的沒解決的問題:雖然每個框內部是並行生成的,框和框之間,依然是排隊等著來的。第二個框要等第一個框生成完才能開始,第三個框要等第二個框。軌跡有多長,排隊就有多長。
**多米諾骨牌式的錯誤傳遞**
這個"排隊"的設計,表面上看只是慢一點,但論文用實驗揭示了一個更深層的代價:它還會讓錯誤像多米諾骨牌一樣傳下去。
設想你在玩一個傳話遊戲,十個人排成一隊,每個人只能聽前一個人轉述的話再往下傳。如果第三個人聽錯了一個字,那麼從第四個人開始,所有人傳的話都會帶著這個錯誤往下滾,越傳越離譜。如果換成十個人同時聽一段原始錄音各自轉述,第三個人聽錯了,不影響第四個人,因為第四個人壓根不聽第三個人說的,他自己聽的是原始錄音。
序列化區塊解碼就是那個傳話遊戲。每個框在生成時,不僅要看影片和文字描述,還要"回頭看"前面已經生成的框。論文裡的一張圖直接把這個問題可視化了:隨著解碼輪次推進,AI對影片畫面的注意力權重逐漸下降,對自己剛生成的文字的注意力權重反而越來越高。換句話說,AI開始更相信自己編的歷史,而不是眼前的畫面。
論文還專門做了一個驗證實驗,叫歷史修正分析。研究者故意把某一幀預測錯的框,替換成正確答案,然後看後面的框會不會因此變准。結果發現,離這個"修正點"越近的框,改善幅度越大,隨著距離拉遠,這個改善效果逐漸衰減。這恰好證明了錯誤確實是沿著軌跡傳播的,而不是每幀獨立犯錯。
這也解釋了為什么正確的框不應該依賴前面的框:一個時間點上目標該出現在哪個位置,是由影片畫面和文字描述本身決定的,跟AI自己之前猜過什麼框,沒有任何邏輯關係。讓後面的預測依賴前面的預測,純屬選錯了參照系。
**並行生成整條軌跡:把排隊變成同時開工**
搞清楚問題出在"排隊"之後,這篇論文給出的方案聽起來簡單到有點意外:既然每一幀該畫在哪裡只取決於影片內容和查詢文字,那乾脆讓所有幀的框同時生成,誰都不用等誰。
論文把這個方法叫做並行管道解碼
並行管道解碼(PTD):先用一輪生成時間區間(這件事從幾秒到幾秒發生),再用一輪把這個區間裡所有幀的框全部同時生成出來。整個過程固定是1+1輪,不管這段軌跡有多少幀。
這裡的關鍵設計,是讓每一個時間點上的空間預測塊,都能看到完整的影片和文字描述,但彼此之間互相看不見。論文管這個機制叫解耦區塊注意力
解耦區塊注意力:讓每個位置的框預測,都能訪問共享的影片和文字資訊,包括已經生成的時間區間,但絕對無法訪問其他位置生成的框,靠這個設計實現真正的並行生成。
這個設計打的比方,有點像一個班級同時做同一套試卷。三十個學生共享同一份題目和參考資料,每個人獨立答題,誰也看不到旁邊人寫了什麼。如果換成傳統做法,相當於讓學生排隊進考場,後一個學生進去之前必須先看一眼前一個學生的答卷再答題。聽起來荒謬,但這正是序列化解碼在做的事:每道題(每一幀的框)的答案,本不該依賴別人怎麼答,只取決於題目本身(影片畫面)。
要讓這套機制真正跑起來,模型還得同時保留原來的寫作能力。論文用了一種雙軌訓練法,每個訓練樣本會用兩種目標序列同時監督,一種是保持標準的逐詞生成能力,另一種是這套區塊並行的生成方式,兩者在同一次前向傳播里一起優化。這麼做的好處是,模型既沒丟掉原生的自回歸能力,又學會了新的並行技能。
如果不這麼設計會怎樣?論文的實驗數據給出了答案:並行管道解碼不僅沒有犧牲精度,反而全面超過了前面三種解碼方式的準確率,同時把完成延遲從31.6秒壓到0.4秒,吞吐量從每秒0.5個框提升到45.9個框。79倍的延遲壓縮,92倍的吞吐量提升,這個數字差距不是優化細節能解釋的,而是整個解碼結構被重新設計帶來的。
論文還專門測了軌跡長度增加時,各種方法的延遲變化曲線。結果非常直觀:當框的數量從8個增加到64個,也就是翻了8倍,序列化區塊解碼的延遲從0.72秒暴漲到6.18秒,而並行管道解碼的延遲幾乎紋絲不動,只從0.33秒微增到0.40秒。這說明軌跡變長時,並行方法增加的只是"同時處理的寬度",而不是"要排隊的輪數",這正是這套設計最核心的價值。
**光有並行還不夠:得讓框和時間點都精準**
生成快了不代表生成准了。監督學習用的是逐詞交叉熵損失,本質上是讓模型模仿標註數據里的每一個token,但它並不直接優化"這個框到底套沒套准目標"這種幾何層面的質量。
論文在監督微調之後,又加了一輪強化學習式的訓練,用的是一種叫GRPO的策略優化方法。
GRPO(組相對策略優化):一種強化學習訓練方式,讓模型針對同一個問題生成多個候選答案,再根據這些答案彼此之間的相對好壞來調整模型,不需要額外訓練一個獨立的評分模型。
針對影片定位這個任務,論文專門設計了兩種互補的獎勵信號。第一種是時間定位獎勵,用來衡量預測的時間區間和真實區間重合度有多高,專門解決"事件發生的時間段找錯了"這類問題,比如把整個人物一直在場的時間段都框進去,而不是精確框出真正發生的那個動作片段。第二種是空間定位獎勵,結合了廣義交並比和坐標層面的誤差懲罰,專門糾正框畫得歪、畫得太松,或者隨著時間推移逐漸飄向背景或別的物體這類問題。
論文做了消融實驗驗證這兩種獎勵各自的作用。只用時間獎勵訓練,影片整體交並比從34.9提升到37.4;只用空間獎勵訓練,提升到37.2;兩個獎勵一起用,提升到38.3,是最好的結果。這說明兩種獎勵解決的是不同維度的問題,合在一起才能覆蓋完整的軌跡質量。
這套組合拳打完之後,論文用一個只有40億參數的相對小模型,在VidSTG和HC-STVG這兩個主流的時空影片定位基準測試上,拿到了和70億參數模型持平甚至更好的成績。而且這個模型沒有依賴任何額外的空間定位模組,是純粹靠語言模型自己生成完整的時間區間加空間軌跡做到的。相比之下,不少同類方法還得靠外部的檢測器或者跟蹤算法來補齊空間定位這一塊。
**這套本事能不能用在別的地方**
一個模型學會了一件事之後,能不能不經過額外訓練,直接遷移到沒見過的任務上,這通常是檢驗一個方法是不是真的學到了"本質能力"而不是"死記硬背"的試金石。
論文測試了三個完全沒有專門訓練過的場景。第一個是純時間定位,也就是只需要說出"這句話描述的事發生在幾秒到幾秒",不需要畫框。在Charades-STA這個基準上,模型的平均表現比之前最強的零樣本方法高出4.7分;在ActivityNet這個影片更長、內容更雜的基準上,優勢更明顯,高出9.1分。第二個是有依據的影片問答,模型不僅要回答問題,還得指出"我是看了影片的哪一段才得出這個答案的"。第三個是指代影片目標跟蹤,模型要在整段影片裡持續定位同一個被描述的物體。
這三個任務模型都沒專門訓練過,但表現都相當能打。這恰恰說明,這套並行生成時空軌跡的能力,本質上是一種通用的"理解影片裡發生了什麼、發生在哪裡"的能力,而不是針對某個特定任務硬調出來的技巧。
**沒解決的問題也不少**
論文也很坦誠地列出了幾個還沒搞定的坑。
一類是空間定位本身的困難場景:目標被遮擋後重新出現,身份要重新確認;或者目標又小又快,框很容易畫歪。另一類是時間定位的困難場景:事件的狀態轉換本身就很短暫、邊界模糊,導致預測的時間區間要麼拖得太長,要麼提前結束了。
更深一層的限制是,現有的時空影片定位這個任務設定本身就比較窄。它假設一句話描述對應一個連續的時間段和一條軌跡,但現實里,一個查詢可能對應影片裡好幾個不連續的片段,或者攝像機移動導致目標暫時消失又出現,再或者同一句描述可能同時匹配好幾個目標。這些情況,目前的數據集和方法都還沒顧上。另外,可供訓練的高質量數據集也就那麼兩三個,規模有限,這也限制了模型能學到多廣的場景。
Q&A
Q1:並行管道解碼是什麼?
A:這是論文提出的一種生成方式,先用一輪生成事件發生的時間區間,再用一輪把這個區間裡所有幀的目標框同時並行生成出來,整個過程固定只需要兩輪,不會隨影片軌跡變長而增加解碼輪數。
Q2:為什麼之前的AI給影片畫框那麼慢?
A:因為主流做法是把時間戳和坐標當文字一個詞一個詞生成,還得讓後面的框排隊等前面的框生成完,軌跡越長排隊越久,論文測出來延遲能到31.6秒。
Q3:這種方法生成快了會不會犧牲準確率?
A:不會,論文的實驗顯示並行管道解碼不僅把延遲降低了79倍、吞吐量提升92倍,反而在多個數據集上準確率還超過了原來一步步排隊生成的方式。






