宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

2014年,那個打不過手工特徵的深度學習

2026年08月24日 首頁 » 熱門科技

2014年之前,如果你去問一個做電腦視覺的研究者:"深度學習能不能用來識別影片裡的動作?"

多半會得到一個猶豫的答案。

圖像識別領域那時候已經天翻地覆了。2012年AlexNet橫空出世,把ImageNet圖像分類的錯誤率從26%砍到15%,深度學習一夜之間成了顯學。但影片動作識別是另一個戰場,而這個戰場上,深度學習一直打不過一群"老古董"方法。

最有名的那個老古董,叫做**密集軌跡2014年那個打不過手工特徵的深度學習**

> 密集軌跡(Dense Trajectories):一種手工設計的影片特徵提取方法,通過追蹤影片中密集分布的點隨時間的運動軌跡,統計軌跡周圍的圖像和運動資訊來判斷動作類別。

這套方法在UCF-101這樣的動作識別數據集上能做到87%左右的準確率,而當時所有嘗試用深度學習做影片動作識別的工作,都沒能超過它。差距不是一兩個點,而是實打實的十幾個點。

這在當時是很尷尬的一件事。圖像識別已經被深度學習攻克了,影片不就是圖像加上時間維度嗎?為什麼深度學習偏偏在影片上失靈?

牛津大學的Karen Simonyan和Andrew Zisserman決定啃這塊硬骨頭。他們後來發表的論文,題目叫做《用於影片動作識別的雙流卷積網路》,成為了這個領域的一個轉折點。

有意思的是,這兩位作者幾個月後又發表了另一篇論文,叫VGGNet,成了圖像識別領域另一個里程碑。也就是說,同一個團隊,同一年,一邊在圖像識別上推陳出新,一邊在影片識別上另闢蹊徑。這不是巧合,而是同一批人對卷積網路能力邊界的連續探索。

問題出在哪:影片比圖像多了什麼?

要理解這篇論文的貢獻,得先搞清楚影片識別到底難在哪。

圖像分類,網路只需要學會"看",一張照片裡有沒有貓,有沒有狗,靠的是空間上的紋理、形狀、顏色這些線索。

影片不一樣。一個人在揮手還是在鼓掌,單看某一幀畫面往往看不出來,你需要看到手臂隨時間怎麼運動。這個"隨時間怎麼運動"的資訊,叫做**時序資訊**

> 時序資訊:影片中物體隨時間變化的動態特徵,比如運動的方向、速度、加速度,區別於單幀畫面里的靜態外觀資訊。

直接把影片的每一幀扔進一個普通的卷積網路,網路能學到的只是"這一幀長什麼樣",學不到"這個東西正在怎麼動"。

早期有研究者嘗試把3D卷積網路直接懟上去,讓網路自己從連續幀里學運動模式。結果不理想,準確率遠低於密集軌跡。為什麼會這樣?一個直接的原因是數據不夠。ImageNet有上百萬張標註圖片,而當時最大的動作識別數據集UCF-101隻有13320個影片片段,分成101類。對於需要從頭學會捕捉運動模式的3D卷積網路來說,這點數據完全不夠看。

這就好比讓一個從沒見過自行車的人,只給他看5張自行車的照片,就指望他學會騎車的訣竅,他連車把往哪邊轉會往哪邊走都還沒搞明白,更別提掌握騎車時身體重心該怎麼協調了。數據量不夠,模型學不到規律,這不是網路設計的問題,是原材料的問題。

如果不解決這個數據瓶頸,那網路架構設計得再精巧也是空中樓閣。Simonyan和Zisserman的思路是:既然網路自己從原始像素里學運動特徵這麼難,那能不能先用傳統方法把運動資訊提取出來,變成一種網路更容易消化的形式,再交給卷積網路處理?

核心方案:讓兩條網路各自專注一件事

論文提出的架構叫**雙流網路2014年那個打不過手工特徵的深度學習**

> 雙流網路(Two-Stream Network):由兩個獨立的卷積神經網路組成的架構,一條處理靜態圖像資訊,一條處理運動資訊,最後把兩條網路的判斷結果融合起來得出最終答案。

第一條流叫空間流,輸入就是影片裡的單張RGB畫面,負責識別場景和物體,比如畫面里有沒有球場、有沒有游泳池、人穿的是什麼衣服。這條流本質上和普通的圖像分類網路沒什麼區別,可以直接借用在ImageNet上預訓練好的網路權重,省了不少功夫。

第二條流叫時間流,這才是整篇論文真正的巧思所在。它的輸入不是原始畫面,而是**光流場2014年那個打不過手工特徵的深度學習**

> 光流場(Optical Flow):描述影片中每個像素點從一幀到下一幀運動方向和速度的向量場,可以理解為給畫面里每個點都畫一個箭頭,指出它接下來往哪兒動、動多快。

光流場是用傳統算法(論文裡用的是一種叫TVL1的方法)預先從連續幀里計算出來的,不是靠深度網路學的。計算出來之後,把水平方向的運動和垂直方向的運動分別存成兩張灰度圖,疊在一起變成一個雙通道的輸入,餵給第二條卷積網路。這條網路看到的,全是"什麼東西往哪個方向動了多少",完全不摻雜顏色、紋理這些外觀資訊。

為什麼要這麼拆?因為靜態外觀和動態運動其實是兩種性質完全不同的資訊,一個是"這是什麼",一個是"這在做什麼"。讓同一個網路既學會看清楚場景,又學會捕捉運動細節,相當於讓一個學生同時準備兩門風馬牛不相及的考試,分心是必然的。拆成兩條獨立的網路,各自專注一件事,學習效率會高很多。

這就像一個廚房裡,如果讓一個人同時負責炒菜和結賬收銀,他手忙腳亂,兩件事都做不好。但如果廚房裡一個人專心炒菜,另一個人專心收銀,各自把自己的活兒做到最好,最後配合起來,上菜又快又准。雙流網路就是把"看懂場景"和"看懂動作"這兩件事,分給兩個專才去干,而不是逼一個通才硬扛。如果不拆開,直接讓一個網路吃原始幀序列,前面提到的3D卷積網路的低準確率已經說明了後果,網路會在有限的數據里迷失方向,分不清哪些像素變化是有意義的運動,哪些只是噪聲。

論文裡還有一個細節值得說一下。為了讓時間流吃到更豐富的運動資訊,作者沒有隻餵給它兩幀之間的光流,而是把連續10幀計算出來的光流場堆疊在一起,變成一個20通道的輸入(10幀,每幀2個方向)。這樣網路看到的不是某一瞬間的運動快照,而是一小段時間窗口裡運動的演變過程,資訊更完整。

兩條流各自訓練好之後,怎麼把它們的判斷結果合併成一個最終答案?論文嘗試了幾種融合方式,最簡單的是直接平均兩條流輸出的分類概率,效果居然已經相當不錯。更複雜一點的方法是訓練一個額外的支持向量機來學習兩條流該怎麼加權組合。實驗發現,加權融合比簡單平均稍好一些,但差距不大,說明兩條流本身各自已經學得足夠好,融合方式的重要性反而是次要的。

數據不夠怎麼辦:多任務訓練的補丁

前面提到過,動作識別的數據集當時普遍偏小。UCF-101隻有101類,HMDB51數據集更小,只有51類,影片數量也更少。用這么小的數據訓練一個深度網路,很容易過擬合,網路記住了訓練集裡的細節,卻學不會真正有用的規律。

作者用了一個叫**多任務學習2014年那個打不過手工特徵的深度學習**的技巧來緩解這個問題。

> 多任務學習(Multi-task Learning):讓同一個網路同時在多個相關任務上訓練,共享底層特徵表示,用一個任務的數據幫助另一個任務學得更好。

具體做法是,網路的主體部分共享參數,但在最後接了兩個不同的分類輸出層,一個輸出UCF-101的101類預測,另一個輸出HMDB51的51類預測。訓練的時候,來自兩個數據集的影片都會經過同一個網路主體,只是最後走向不同的輸出層。這樣網路的底層特徵提取能力,實際上是被兩個數據集共同"餵養"出來的,相當於人為地把訓練數據量翻了一倍還多。

這個思路放在生活里也很好理解。假如你想學一門新語言,比如西班牙語,但你能找到的西班牙語學習資料很有限。這時候如果你同時也學一點義大利語,兩種語言的語法結構和詞根有大量相似之處,學義大利語的過程會反過來加深你對西班牙語語法邏輯的理解。兩門課分開看資料都不夠,但放在一起學,底層的語言直覺反而練得更紮實。多任務學習就是讓網路在兩個"資料都不夠"的任務上互相搭把手,如果不這麼做,網路就只能在一個小數據集上死磕,很容易學出一些只對訓練集裡那幾百個影片成立、但換個場景就失效的偽規律。

實驗結果:數字說話

論文在兩個標準數據集UCF-101和HMDB51上做了系統的對比實驗。結果列出來看非常清楚。

| 方法 | UCF-101準確率 | HMDB51準確率 |

|---|---|---|

| 僅空間流(單幀RGB) | 72.6% | 40.5% |

| 僅時間流(光流) | 81.0% | 54.6% |

| 雙流網路(平均融合) | 86.9% | 58.0% |

| **雙流網路(SVM加權融合)** | **88.0%** | **59.4%** |

| 密集軌跡(當時最強手工特徵) | 87.9% | 57.2% |

這組數字里藏著幾個關鍵資訊。

先看只用空間流的效果,72.6%。如果整篇論文只做了這一件事,也就是把單幀圖像扔進卷積網路硬train一發,那結果會比密集軌跡的87.9%差了十五個百分點還多。這意味著每識別5個動作,光看畫面外觀的網路就要比手工方法多認錯將近1個。這也印證了前面說的,只看靜態畫面,分不清揮手和鼓掌。

再看只用時間流的效果,81.0%,比空間流高了將近九個百分點。這個結果本身就很說明問題:運動資訊對判斷"這是什麼動作"來說,比靜態畫面更關鍵。這也是為什麼論文要專門設計一條網路來處理光流,而不是把運動資訊當成外觀資訊的附屬品。

而當兩條流融合之後,準確率衝到88.0%,第一次超過了密集軌跡的87.9%。差距看起來很小,只有0.1個百分點,但這個"第一次超過"的意義,遠大於這0.1個百分點本身。這是深度學習在影片動作識別這個具體戰場上,第一次打贏了統治多年的手工特徵方法。放在2014年的語境下,這句話的分量不亞於兩年前AlexNet在圖像識別上掀起的那場革命,只是這次的對手換成了影片。

在HMDB51這個更難、數據更少的數據集上,雙流網路的59.4%對比密集軌跡的57.2%,優勢更明顯一些,超出了兩個多百分點。這也從側面證明了前面提到的多任務學習確實起了作用,因為HMDB51的數據量比UCF-101還要小,網路更容易過擬合,而多任務訓練相當於給這個小數據集偷偷續了血。

一個容易被忽略的細節:光流到底重要在哪

這篇論文裡有個實驗設計的小心思,值得單獨說一說。

作者做了一個對照實驗,看看如果把光流場換成簡單的幀差(就是直接拿後一幀的像素值減前一幀),網路的表現會怎樣。結果發現效果明顯不如用光流。這說明真正有用的運動資訊,不是簡單的像素變化,而是經過光流算法計算出來的、帶有方向和幅度的結構化運動資訊。

這就好比你想知道一支球隊昨晚比賽跑動積極不積極,如果只是簡單地把兩張不同時刻的全場照片疊在一起看哪裡變了顏色,你能看出些模糊的輪廓,但看不出誰往哪個方向跑了多遠。而光流相當於給每個球員的每一步都標好了箭頭和長度,你一眼就能看出這是一次快速反擊還是原地倒腳。資訊的組織方式,直接決定了後續網路能從裡面挖出多少有效模式。如果不做這層預處理,直接把原始像素差異丟給網路,網路得自己從噪聲里摸索出運動的方向性,這正是前面提到的純3D卷積網路效果不佳的原因之一。

這篇論文之後發生了什麼

雙流網路提出之後,後續研究者在這個框架上做了大量延伸工作。

2015年,Feichtenhofer等人發表了一篇論文,研究雙流網路里兩條流之間該在網路的哪一層進行資訊交互,而不是等到最後一層才簡單相加。他們發現讓兩條流在中間層就開始交換資訊,效果比只在最後融合更好,這個思路後來被稱為跨流融合。

2016年,Wang等人提出了**時序分段網路2014年那個打不過手工特徵的深度學習**(Temporal Segment Network),把一個長影片切成若干段,每段單獨跑一次雙流網路,再把各段結果匯總,這樣網路能看到整個影片的時間跨度,而不只是抽樣出來的幾個片段,進一步把UCF-101上的準確率往前推了幾個點。

2017年,Carreira和Zisserman(還是Zisserman)提出了**I3D網路2014年那個打不過手工特徵的深度學習**(Inflated 3D ConvNet),把2D卷積核直接"膨脹"成3D卷積核,同時結合雙流的思路,一條處理RGB,一條處理光流,兩條都換成3D卷積網路。這篇論文還順帶發布了一個規模遠超UCF-101的新數據集Kinetics,徹底解決了數據不夠的老問題,讓3D卷積網路終於有了施展空間。

從這條脈絡看得出來,雙流網路提出的"拆開處理外觀和運動"這個核心思路,在後續幾年裡被反覆驗證和沿用,只是承載運動資訊的具體網路結構一路在換,從2D卷積到跨層融合到最後的3D卷積。

寫在後面

讀這篇論文的時候,最讓我意外的不是準確率數字,而是那個只有0.1個百分點的勝利。研究者們可以選擇等到深度學習方法明顯碾壓手工特徵再發表,但他們沒有等,抓住了這個剛剛反超的臨界點。這說明科研里的"第一次"往往不是靠壓倒性優勢贏的,而是靠找准了對的方向,哪怕開局只領先一點點。

另一個讓我反覆琢磨的細節是,網路自己去學運動特徵學不好,但把光流這種傳統算法算出來的結構化資訊餵給網路,效果立刻就上去了。這其實是在提醒我們,深度學習不是萬能的暴力美學,很多時候傳統方法幾十年積累下來的領域知識,用對了地方,反而是深度網路的加速器,不是被淘汰的對象。

這個思路會不會在別的領域也適用,比如現在很火的一些多模態大模型,是不是也存在某種"手工先驗"可以先做一遍粗加工,再交給網路去學更高層的東西?這個問題我覺得還挺值得琢磨。

Q&A

Q1:雙流網路是什麼?

A:雙流網路是2014年Simonyan和Zisserman提出的影片動作識別架構,由兩條獨立的卷積神經網路組成,一條處理單幀RGB圖像捕捉場景外觀,一條處理光流場捕捉運動資訊,最後融合兩條網路的判斷結果,是深度學習首次在影片動作識別上超過手工特徵方法密集軌跡的工作。

Q2:雙流網路為什麼要分成兩條網路處理,不能用一個網路嗎?

A:因為靜態外觀資訊(這是什麼)和動態運動資訊(在做什麼)性質完全不同,讓一個網路同時學兩種資訊效果不好,此前直接用3D卷積網路從原始幀學習運動特徵的嘗試準確率明顯不如手工特徵,拆成兩條網路各自專注一件事,訓練效率和最終效果都更好。

Q3:雙流網路的效果到底比傳統方法密集軌跡好多少?

A:在UCF-101數據集上,雙流網路融合後準確率達到88.0%,密集軌跡是87.9%,只高出0.1個百分點,但這是深度學習在這個任務上第一次反超手工特徵方法,意義大於數字本身。在HMDB51數據集上雙流網路的優勢更明顯,達到59.4%對比密集軌跡的57.2%。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新