宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

一堆錯誤標註的地雷照片,差點讓整個研究領域走偏

2026年08月17日 首頁 » 熱門科技

2024年,一群研究者拿到了一份特別的數據集,叫SULAND一堆錯誤標註的地雷照片差點讓整個研究領域走偏。這份數據集裡裝著上萬張照片,拍的是散落在義大利鄉間草地和碎石路上的兩種地雷模型:PFM-1和PMA-2。這兩種地雷有個共同的綽號,一個叫"蝴蝶雷",一個叫"海星雷",名字聽起來挺可愛,實際上都是會要命的東西。

這份數據集之所以珍貴,是因為它做了一件很多同類數據集沒做的事:它專門劃出了一批"域外測試一堆錯誤標註的地雷照片差點讓整個研究領域走偏數據",把拍攝地點從義大利換到了美國,用來檢驗一個AI模型在沒見過的環境裡還能不能認出地雷。

聽起來一切都很完美,直到羅切斯特理工學院的一組研究者決定把這份數據集從頭到尾看一遍。

他們看完之後發現了一件很尷尬的事:這份數據集裡藏著大量的標註錯誤。有些照片裡明明能看到地雷,標註框卻是空的。有些照片裡根本沒有地雷,標註框卻硬生生地畫在那裡。更離譜的是,域內數據和域外數據用的分類編號是反的,同一個數字在兩批數據里指代的是不同的地雷。

這不是小問題。這篇論文要講的,就是這群研究者怎麼把這份數據集從頭到尾修了一遍,又用修好的數據集重新測試了35種不同的AI檢測模型,最後發現了一個讓人有點不安的結論:一個模型在熟悉環境裡表現得再好,也不能說明它在陌生環境裡能救命。

地雷為什麼要用AI來找,以及為什麼用攝影機

先說說這件事本身有多難。

地雷探測這活兒,傳統做法是靠人拿著金屬探測器一寸一寸地掃,極其危險,極其慢。近些年大家開始琢磨,能不能讓無人機或者無人車先飛一圈、跑一圈,把可疑區域先篩一遍,減少人工排查的面積和時間。這就是所謂的"非技術調查"和"技術調查",先大致定位可疑區域,再精細排查。

用什麼傳感器來篩呢?

熱成像、多光譜、高光譜、雷達、金屬探測,這些都試過,各有各的用處。但研究者發現,對於露在地表、肉眼能看見的地雷,普通的RGB攝影機反而效果最好,原因很簡單:攝影機便宜、輕、到處都能買到,而且現在的目標檢測算法本來就是圍著RGB圖像設計的,天生適配。

問題在於,地表上的地雷經常和石頭、樹葉、陰影長得很像,再加上遮擋、光照變化、拍攝角度不同,AI模型很容易把它們認錯,或者壓根沒認出來。

這裡要理清兩個概念。

同分布測試*:指的是測試圖片和訓練圖片來自差不多的環境,背景、光照、角度都比較相似。

域外測試*:指的是測試圖片來自訓練時完全沒見過的環境,比如換了個國家、換了種地形。

一個模型在同分布測試里考100分,不代表它在域外測試里也能及格。這就是這篇論文反覆強調的核心矛盾。

打個比方。你在自己家小區里學會了騎自行車,騎得又快又穩,你會覺得自己"學會騎車"了。但如果把你扔到一條完全陌生的、坑坑窪窪還帶著碎石的山路上,你原來那套"看熟悉的地磚縫隙判斷方向"的本事完全用不上了,摔跤的概率一下子飆升。AI模型也是這樣,它在訓練數據里學到的很可能不是"地雷長什麼樣",而是"義大利這片草地上,地雷附近通常長什麼樣",這兩者聽起來接近,實際上是兩碼事。

SULAND數據集本身,一份來之不易但有瑕疵的寶藏

先說清楚,為什麼這份數據集這麼重要。

現實中能公開發布的地雷圖片數據集少得可憐。原因也好理解:真地雷太危險,沒法隨便拿出來拍照;就算是排雷現場,很多也涉及安全和保密,不能對外公開。所以大部分研究只能用假地雷、複製品或者3D列印的替代品來湊數據。

在這種背景下,SULAND數據集的出現就顯得特別珍貴。它包含33771張圖片,拍攝於義大利的草地和碎石地,涵蓋晴天、陰天、有陰影等各種光照條件,還專門設置了美國的域外測試集,裡面加入了不同的坡度、拍攝角度、目標距離、部分遮擋等各種干擾因素。

研究者為了驗證這份數據集的域內和域外確實存在明顯差異,用一個在ImageNet上訓練好的通用圖像特徵提取器,把3000張域內圖片和3000張域外圖片的特徵提取出來,畫成一張降維後的散點圖。結果兩堆點幾乎完全分開,像是兩個互不相干的族群。這說明這份數據集設計的"域內域外"劃分,在視覺特徵層面確實是站得住腳的,不是隨便拍腦袋分的。

但當研究者一張一張地翻看這份數據集的標註文件時,問題浮出水面了。

他們用了一個自己寫的Python腳本,把每張圖片和對應的標註框疊在一起顯示出來,一幀一幀地看。結果發現,原始數據集裡存在系統性的七類問題。

第一類是漏標和標註不完整。有些照片裡地雷清清楚楚地擺在那兒,標註文件卻是空的,甚至連標註文件本身都丟了。比如在一個叫ITA-v17的影片序列里,第95張圖里有個明顯能看到的地雷沒有被標註,而幾幀之後視覺上差不多的目標卻被標註了。這就很奇怪,同樣清晰的東西,一個標了一個沒標,標準完全不統一。

第二類是假陽性和標註"傳染"問題。有些影片序列里,地雷已經移出畫面了,標註框卻還留在那裡,連續好幾十幀都是這樣,好像標註的人忘了把框刪掉。還有些空蕩蕩的背景區域,壓根沒有任何目標,卻被貼上了地雷的標籤。

第三類是定位不准。標註框和真實目標的位置對不上,偏得很厲害。

第四類是部分可見目標的判斷標準不統一。有些圖里,地雷被草或者樹葉擋住了一部分,這種情況有的被標了,有的沒標,標準前後矛盾。

第五類是非目標物體被誤標。有些照片裡,地雷旁邊放了個白色的標記物或者標籤牌,結果標註框框住的是那個標記物,而不是真正的地雷本體。

第六類是圖像質量導致的標註不確定性。有些照片因為運動模糊特別嚴重,地雷的輪廓根本看不清楚,這種情況下標註的可靠性本身就存疑。

第七類,也是影響最大的一類:域內和域外數據集的類別編號是反的。域內數據里,PFM-1對應編號0,PMA-2對應編號1;域外數據里正好反過來。這意味著,如果直接拿域外數據去測試一個在域內數據上訓練好的模型,模型即便認對了地雷種類,系統給出的評分也會把它判定為"認錯了",因為編號對不上。

這個類別編號反轉的問題特別值得展開說一說,因為它揭示了一個很容易被忽視的坑:數據集內部的一致性,有時候比數據集本身的規模和多樣性還重要。你可以想像一個場景,兩個倉庫分別用紅色標籤和藍色標籤來標記"易碎品",如果兩個倉庫的員工在交接時沒發現這個約定不一樣,紅色標籤的箱子被當成不易碎的粗暴搬運,那不是因為搬運工不小心,而是因為規則本身就沒對齊。如果不把這個規則統一,不管後面訓練模型時多麼用心,測試出來的域外表現永遠是虛低的,你根本沒法判斷模型是真的不行,還是被一個記賬錯誤坑了。

重新標註:不是修修補補,而是從頭再來一遍

發現問題之後,研究者沒有選擇打補丁式的局部修正,而是決定把整個數據集從頭到尾重新標註一遍。這個決定本身就說明了問題的嚴重程度,已經不是修幾個錯別字那麼簡單了。

他們用了一個叫Label Studio的標註工具,重新過了一遍每一張圖片。核心原則是這樣定的:只要目標物體有一部分清晰可辨、能確定它的類別,就應該標註;完全被遮擋、嚴重模糊到無法辨認的,則不標註。

因為原始數據來自影片序列,相鄰幀之間的內容是連續的,所以在判斷某一幀的目標是否可見、屬於哪個類別時,研究者會參考前後幀的畫面來確認,但這種參考只用來確認"這確實是個可辨認的目標",不會用來給完全看不見的東西強行打標籤。

標註框的畫法也定了規矩:要緊貼著目標的可見輪廓畫,不能畫得過大也不能過小。這一點聽起來是個細節,其實很關鍵,因為目標檢測模型的評估依賴於標註框和預測框的重疊程度。

交並比*:衡量兩個矩形框重疊程度的指標,數值從0到1,越接近1說明兩個框重合得越好。

如果標註框本身畫得松松垮垮,把一大片背景都圈進去了,那模型很可能會學到"框裡有草地和石頭就該有地雷"這種錯誤的關聯,而不是真正學會識別地雷本身的視覺特徵。反過來,如果標註框畫得太小或者位置偏了,又會漏掉目標真正有辨識度的部分,讓模型學得更差。這就像給一份合同劃重點,劃多了會把無關的條款也當成重點記下來,劃少了又漏掉了關鍵條款,不管哪種情況,讀的人最後理解的內容都會跑偏。

重新標註完成後,研究者還做了一輪質量控制。他們把每一處改動分成四類:新增的標註框、刪除的標註框、收緊的標註框(也就是位置和大小調整過的)、類別修正的標註框。為了讓人工核查變得可行,他們把每處改動做成局部裁剪圖,湊成每頁50張的"聯繫表",讓三位審核員分別獨立檢查,少數服從多數來決定是否採納這處修改。

這套流程最後產出的,就是SULAND v2版本。它保留了原始的圖片文件和數據劃分方式,只是把標註文件重新做了一遍。

數字上的變化很直觀。整個數據集的標註實例數從10843個增加到12433個,漲了14.7%。但這不是簡單地往上加了1590個框,而是同時發生了增加缺失標註、刪除錯誤標註、修正現有框位置和類別這幾件事。

具體拆開看更有意思。在域內的訓練集裡,單單是新增的標註框就有3134個,同時刪除了1930個錯誤標註,另外還有3580個框被收緊了位置。域內驗證集和測試集也有類似規模的變動。而域外驗證集的變化模式不太一樣,標註實例數只是小幅增加,從3787漲到3856,但裡面有3162個標註因為類別反轉問題被修正了,這也印證了前面說的那個編號反轉問題,是域外數據集變動的主要原因,而不是因為漏標了很多東西。

研究者還專門算了一下,如果把原始SULAND v1的標註當成"預測結果",拿去和修正後的SULAND v2標註做比對,結果顯示,原始標註的精確率只有62.1%,召回率只有51.1%。這兩個數字放在一起看,意味著原始數據集裡差不多有一半的標註資訊是有問題的,這個比例相當高。

標註質量到底多重要:用同一個模型跑兩遍數據集

光說標註有問題還不夠,研究者接下來做了一件很紮實的驗證工作:用YOLOv8這個檢測模型,分別在SULAND v1和SULAND v2上訓練和測試,看看數字到底能差多少。

YOLO*:一種主流的目標檢測算法家族,特點是速度快,能實時處理圖像,在自動駕駛、安防監控等領域被廣泛使用。

結果相當震撼。在域內測試集上,不同規模的YOLOv8模型,mAP@50一堆錯誤標註的地雷照片差點讓整個研究領域走偏這個指標(可以簡單理解為檢測準確率的綜合評分)提升了14.6到19.6個百分點。這是什麼概念?

mAP@50*:目標檢測里最常用的評價指標之一,表示在交並比閾值為0.5的情況下,模型檢測的平均精度,數值越高說明模型認得越准。

也就是說,同樣的模型架構,同樣的訓練方式,只是把標註質量提上去了,準確率就能白白多出將近20個百分點。這相當於什麼呢?假設你有兩個學生,用一模一樣的方法背書,但是一個學生用的是校對過的正確教材,另一個學生用的教材里混進了不少錯別字和錯誤答案,那即便兩人學習能力一樣,考試成績也會天差地別。這19個百分點的差距,不是模型變聰明了,而是原來的"教材"本身就在坑它。

而在域外測試集上,提升幅度更誇張,達到17.8到43.6個百分點。這裡面有一部分是因為類別編號反轉的問題被修正了,研究者也專門做了拆解實驗來驗證這一點。他們把同一批預測結果,分別用原始的反轉編號和修正後的正確編號來評分,發現光是修正這一個編號問題,YOLOv8的平均域外mAP@50就能提升大約25個百分點。剩下的提升,才是標註完整性和定位精度改善帶來的真實收益。

研究者還做了一個更精細的交叉驗證實驗:把模型分別在v1和v2上訓練,再分別拿v1和v2的標註去評分,湊出四種組合。結果發現,固定住訓練好的模型,只是換一下拿來評分的標註版本,分數就能出現巨大的波動。比如用v2標註訓練出來的模型,拿v2標註評分能拿到81.4%,但如果拿v1標註給同一批預測結果評分,分數會掉到42.1%。這個對比說明了一件事:測試集的標註質量,和訓練集的標註質量同樣重要,甚至可以說是兩個獨立的變量,都會影響最終報告出來的數字。

這一整套發現指向一個挺讓人警醒的結論:如果不做這次系統性的重新標註,後續所有基於SULAND v1做的研究,得出的模型排名和性能結論都可能是不可靠的,因為你根本分不清楚,一個模型表現差,到底是它真的學得不好,還是它撞上了數據集裡的錯誤標註。

35種檢測模型大比拼:誰在熟悉環境裡最強,誰在陌生環境裡最穩

修好數據集之後,研究者做了這篇論文裡工作量最大的一部分:把35種不同配置的目標檢測模型,橫跨9個模型家族,全部拿到SULAND v2上跑了一遍。

這些模型大致分成幾類。第一類是單階段檢測器,包括YOLOv8、YOLO11、YOLOv12、YOLO26,每個又分成從小到大五種規模。第二類是兩階段檢測器Faster R-CNN,用了兩種不同的骨幹網路。第三類是基於Transformer架構的檢測器,包括RT-DETR、D-FINE、RF-DETR。第四類是支持開放詞彙檢測的YOLO-Worldv2。

Transformer*:一種最初為處理文字設計的神經網路架構,後來被廣泛移植到圖像識別領域,擅長捕捉圖像里相距較遠的元素之間的關聯。

開放詞彙檢測*:指模型不局限於訓練時見過的固定類別,理論上能識別沒見過名字的新物體類別。

所有模型都用統一的訓練流程和評價方式,這樣才能保證比較是公平的,不會出現"這個模型用了更好的訓練技巧所以看起來更強"這種混淆因素。

結果出來後,呈現出一個很有意思的分裂局面。

在域內測試集上,表現最好的幾乎全是YOLO家族的模型。YOLOv12-Small拿到了全場最高的mAP@50,達到0.908。YOLO26-XLarge則在更嚴格的mAP@50:95指標上拿了第一,達到0.708。這些模型不僅准,速度還快得驚人,每秒能處理幾百幀圖像。

但換到域外測試集,排行榜整個洗牌了。表現最好的變成了RF-DETR-Large,mAP@50達到0.799,召回率達到0.675,把原本在域內領跑的YOLO系列全部甩在後面。大部分YOLO配置在域外測試里的mAP@50隻能維持在0.53以下,和它們在域內的亮眼表現完全不成比例。Faster R-CNN也表現得相當穩,兩種骨幹網路配置的域外mAP@50分別達到0.723和0.746,超過絕大多數YOLO變體。D-FINE-Large在Transformer家族裡表現也不錯,域外mAP@50達到0.569。

這個反轉說明了什麼?

說明"在熟悉環境裡跑得又快又准"和"能扛得住陌生環境的衝擊"這兩件事,壓根不是同一碼事,甚至可能是互相拉扯的兩個目標。這就像選拔運動員,有的人短跑成績特別炸裂,但一到需要耐力和適應複雜地形的越野賽,立刻掉隊了。如果只看短跑成績去選人參加越野賽,選出來的人大概率會讓你失望,因為決定短跑成績的那套身體質素,和決定越野表現的那套質素,根本就不是同一件事。

研究者還專門畫了一張圖,把每個模型在域內和域外的表現畫成散點,再畫一條對角線代表"域內域外表現完全一致"。結果所有點都落在對角線下方,說明每一個模型在換了環境之後都會掉分,只是掉分的幅度天差地別。RF-DETR-Large的表現掉得最少,從域內的0.880掉到域外的0.799,只掉了8個百分點;而不少YOLO配置掉了將近40個百分點。

更讓人意外的是,模型規模變大並不能穩定地換來更強的抗干擾能力。同一個模型家族裡,更大的版本不一定比更小的版本更抗打。這打破了一個直覺性的假設:"模型越大越聰明,應該也更能應付沒見過的場景"。實際數據顯示,這個假設在這份基準測試里站不住腳。

速度和穩健性的取捨:沒有免費的午餐

研究者接著畫了一張速度和精度的關係圖,橫軸是每秒處理幀數,縱軸是檢測精度。在域內測試的場景下,占據這條"帕累托前沿"(意思是在同等速度下精度最高,或者同等精度下速度最快的那批模型)的,清一色是YOLO家族的配置,又快又准。

帕累托前沿*:在多個相互制約的指標之間,找出沒有其他方案能同時在所有指標上都更優的那一批"最優解"集合。

但在域外測試的場景下,這條前沿完全變了樣子。RF-DETR-Large和Faster R-CNN占據了高精度但速度較慢的區域,D-FINE-Large提供了一個精度和速度都還過得去的折中方案,而原本速度飛快的YOLO配置雖然還是很快,但精度已經明顯落後於前面幾個模型了。

這意味著,選擇哪個模型,得先想清楚這個系統到底會被用在什麼場景。如果任務是在已經熟悉的環境裡反覆掃描、快速篩查,輕量級的YOLO模型是很好的選擇,速度快、成本低。但如果這套系統要被部署到一個從沒見過的新戰場、新地形,那麼犧牲一點速度換取更穩的表現,可能才是更負責任的做法。

這個取捨讓我想起一個很現實的類比:你去一個陌生城市自駕,導航軟體一種是響應飛快但只認識大路、遇到臨時封路就懵的那種,另一種是反應慢半拍但能實時結合路況重新規劃的那種。如果你只在自己熟悉的城市裡開車,前者完全夠用,沒必要為了應付根本不會發生的意外多花電費和流量。但如果你要開去一個從沒去過、路況隨時可能變的地方,選擇後者顯然更明智,哪怕它偶爾會讓你多等兩秒鐘才給出新路線。這不是誰更好誰更差的問題,是場景決定了取捨的方向,而如果不做這個區分,直接把"域內測試跑得快"當成唯一標準去選型,很可能會在真正需要穩健性的場合吃大虧。

具體到每一類地雷:精確率和召回率不能只看一個

研究者還專門拆開看了PFM-1和PMA-2這兩類地雷各自的檢測表現,分別看精確率和召回率。

精確率*:模型報出來的"這是地雷"里,有多少是真的地雷。

召回率*:場景里所有真實存在的地雷,模型找出來了多少。

在域內測試里,幾乎所有模型對兩類地雷都表現得又准又全,精確率和召回率都很高。但一換到域外測試,情況就複雜起來了。很多模型出現了一個耐人尋味的模式:精確率維持得還不錯,召回率卻大幅下滑。

這說明什麼?說明這些模型變得更"謹慎"了,報出來的結果大部分是對的,但它漏掉了很多真實存在的地雷,壓根沒敢報。這對於地雷探測這種任務來說是個特別危險的信號,因為漏檢的代價遠比誤報要大得多。誤報頂多是讓排雷人員多跑一趟白跑,漏檢卻可能直接造成人員傷亡。

RF-DETR-Large、Faster R-CNN和D-FINE-Large這幾個在域外測試里表現更好的模型,它們的召回率保持得相對更好,這也和它們整體的mAP表現更強對應得上。但即便是這幾個模型,對PFM-1和PMA-2兩類地雷的檢測表現也不完全對稱,這說明模型的穩健性還和具體目標類別的視覺特徵有關係,不能一概而論。

從圖片裡能看到什麼:錯誤具體長什麼樣

研究者還挑了幾種代表性的模型,分別展示了它們在域內和域外場景下的實際檢測結果圖。域內場景下,不管是哪種模型,基本都能準確框出清晰可見的目標。而域外場景下,幾種典型的錯誤全都出現了:漏檢、把背景里長得像地雷的石頭或紋理誤判成地雷、框的位置偏了、甚至把PFM-1認成了PMA-2。

其中RF-DETR-Large和Faster R-CNN在幾個比較有挑戰性的域外場景里,能找回更多本該被檢測到的目標,而YOLO11-Large和YOLO-Worldv2在這些場景里錯過的目標更多、對背景干擾更敏感。這些具體的圖像案例和前面的整體統計數據是對得上的,給冷冰冰的數字加了一層直觀的畫面感。

這套研究到底意味著什麼

這項工作最核心的價值,不在於又發布了一個新數據集,或者又跑了一遍模型排行榜,而在於它揭示了一件容易被忽略的事:在安全攸關的應用領域,數據集本身的可靠性,和模型架構的選擇,是同等重要的兩件事,缺一不可。

如果只顧著追逐更花哨的模型架構,卻對訓練和測試用的標註數據視而不見,那麼再漂亮的模型排名,都可能建立在一堆錯誤標註堆出來的假象上。這篇論文用紮實的對照實驗證明了這一點:光是修正標註質量,同一個模型的表現就能相差近20個百分點,這個差距足以讓排行榜上的名次徹底洗牌。

研究者也坦誠地指出了這項工作的局限。這份數據集只涵蓋兩種地雷,域外測試也只是從義大利換到了美國這一種遷移場景,並沒有覆蓋更多種地形、季節、遮擋程度的組合。他們也承認,重新標註的過程本身依然依賴人工判斷,面對模糊不清、嚴重遮擋的目標時,標註決策依然帶有主觀性,不能保證這份修正後的數據集是完全無誤的。

這些坦白挺難得的,因為一份號稱"修正版"的數據集如果自吹自擂說自己完美無缺,反而更讓人懷疑。

寫在後面

讀完這篇論文,最觸動我的一點,是那個類別編號反轉的細節。這不是什麼高深的算法失誤,而是一個純粹的記錄疏忽,兩批數據用了相反的編號約定,卻沒有人在交接的時候把這件事說清楚。可這個看起來微不足道的疏忽,單獨就貢獻了大約25個百分點的虛假性能下降。這讓我意識到,很多我們以為是"模型不夠聰明"的失敗,可能壓根不是模型的問題,而是流程里某個環節的溝通沒對齊。

另一個讓我反覆琢磨的地方是,論文裡提到模型規模變大並不總能帶來更強的抗干擾能力。這和很多人心裡"越大越強"的默認預期是擰著的。如果這個結論在更多任務上也成立,那"堆參數"這條被很多人默認為萬能鑰匙的路徑,可能遠沒有想像中那麼可靠,至少在需要跨場景泛化的任務上不是這樣。

這篇論文最後留了一個沒直接回答的問題:既然連精心設計的域外測試,也只是覆蓋了從義大利到美國這一種遷移路徑,那真實世界裡那些更極端的場景,比如地雷被半埋在土裡、被常年風化到顏色都變了、混在完全不同的植被裡,現有這批模型到底還能撐住多少?這個問題,恐怕沒有人敢輕易給出肯定的答案。

Q&A

Q1:SULAND數據集是用來做什麼的?

A:SULAND是一個公開的RGB圖像數據集,專門用來訓練和測試AI模型識別地表可見的兩種地雷模型,PFM-1和PMA-2,同時特意劃分了域內和域外測試集,用來檢驗模型在陌生環境下的表現。

Q2:為什麼原始SULAND數據集需要重新標註?

A:研究者逐幀審查後發現原始數據集存在漏標、假陽性標註、定位不准、部分可見目標判斷標準不一致、非目標物體誤標、圖像模糊導致標註不確定,以及域內域外類別編號相反等七類系統性問題,嚴重影響模型訓練和評估的可靠性。

Q3:修正標註之後模型性能提升了多少?

A:以YOLOv8為例,域內測試集的mAP@50提升了14.6到19.6個百分點,域外測試集提升了17.8到43.6個百分點,其中修正類別編號反轉問題單獨就貢獻了約25個百分點的提升。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新