宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

當自動駕駛汽車遇上「黑天鵝事件」:德州農工等多所高校聯合開發的OpenLongTail如何讓AI司機學會應對意外

2026年07月30日 首頁 » 熱門科技

這項由德克薩斯農工大學、英偉達、斯坦福大學、德克薩斯大學奧斯汀分校、威斯康星大學麥迪遜分校、耶魯大學、Adobe、Meta、德拉瓦大學等多家頂尖機構聯合完成的研究,發表於2026年7月,論文編號為arXiv:2607.09655,有興趣深入了解的讀者可通過該編號查詢完整論文。

一輛自動駕駛汽車在日常城市道路上表現得相當出色——它能識別紅綠燈、禮讓行人、平穩換道。然而,某天路上突然出現了一頭迷路的奶牛,或是一名揮手指揮交通的警察,或是一段被橙色錐桶臨時改道的施工路段。這時候,汽車的AI大腦往往會陷入茫然,因為在它接受訓練的數據里,這些情況幾乎從未出現過。

這就是自動駕駛領域長期面臨的一道難題——"長尾問題"。如果把所有駕駛場景按出現頻率排成一排,最常見的那些場景就是"大頭",而各種罕見卻危險的意外情況則形成了漫長的"尾巴"。大頭容易學,但尾巴上的每一種情況都可能讓訓練有素的AI司機犯下致命錯誤。研究團隊把這類罕見但關鍵的場景叫做"長尾事件",而解決這個問題的關鍵,就在於獲取足夠多、足夠多樣的此類事據來訓練AI。

現實中,記錄這些罕見場景的影片其實並不少見。網上有海量的行車記錄儀影片,Waymo等公司也積累了大量真實路況數據。問題在於,這些影片大多只有一個攝影機拍攝的單一視角——就像你只能用一隻眼睛看世界,很難判斷深度和方向。而現代自動駕駛汽車依賴的是圍繞車身360度布置的多個攝影機,從前方、後方、左側、右側同時觀察,才能做出準確判斷。單眼影片和多眼影片之間的這道鴻溝,讓大量珍貴的真實長尾場景數據根本無法直接用於訓練。

OpenLongTail就是為了填平這道鴻溝而生的。研究團隊開發了一套開源的生成式數據引擎,它能把一段普通的單攝影機行車記錄儀影片,變成完整的多攝影機同步影片資產,就好像給一個只有前視攝影機的汽車,憑空裝上了左、右、後方的攝影機,並讓它們拍出視覺上互相吻合、時間上完全同步的畫面。用這些"擴充"後的數據去訓練AI駕駛系統,效果出人意料地好。

一、那面"看不見的牆":為什麼單攝影機影片用不了

要理解OpenLongTail解決的問題,可以先想像一位只能通過汽車前擋風玻璃向前看的駕駛員。他能看到前方的道路、行人和交通燈,但完全不知道左側是否有自行車正在超車,右側是否有行人即將闖出,更不知道後方是否有車輛正在逼近。

現代自動駕駛汽車通過在車身周圍安裝六個甚至更多攝影機來解決這個問題。訓練這樣的系統,需要所有攝影機同步拍攝的完整畫面——每一幀時刻,前方攝影機、前左攝影機、前右攝影機、後方攝影機、後左攝影機、後右攝影機都要各司其職,並且它們之間的空間關係必須精確已知,這樣AI才能把六幅畫面拼合成對世界的完整理解。

真實世界裡記錄長尾事件的影片,絕大多數只有一個前置攝影機,也就是普通行車記錄儀。研究團隊將這類影片稱為"單目影片",就好比單眼視圖。更麻煩的是,這些影片來自五花八門的設備和渠道,攝影機的安裝位置、焦距、內部參數各不相同,有些甚至完全未知。換句話說,你既不知道鏡頭的"眼睛"有多大、視野有多寬,也不知道攝影機的精確位置,更沒有其他方向的畫面。這就是論文中所說的"模態鴻溝"——單攝影機影片和訓練所需的多攝影機數據之間,存在著一堵看不見卻難以逾越的牆。

要把單目影片變成多目影片,至少需要解決兩個核心問題。第一,要知道拍攝這段影片的車輛是怎麼運動的——它在哪裡、朝哪走、走了多遠——這樣才能推算出其他方向的攝影機"應該"看到什麼。第二,要真正生成那些其他攝影機看到的畫面,而且這些畫面必須和原始的前視畫面在視覺上保持一致,不能出現"左邊是白天,右邊是黑夜"這樣的穿幫場景。

研究團隊把這套從單目影片到多目影片的完整流程,形象地概括為"外推視角合成"——從已知的前方視角出發,向外推算出所有未知的側方和後方視角。這是整個OpenLongTail系統的核心任務。

二、找到車在哪裡:從模糊位置到精確軌跡

在真正生成其他攝影機的畫面之前,系統需要先回答一個基本問題:這輛車的運動軌跡是什麼?

這聽起來簡單,但實際操作起來並不容易。專業採集的自動駕駛數據通常攜帶精確的GPS和慣性導航資訊,每一幀的位置和朝向都有精確記錄。但野外採集的行車記錄儀影片往往沒有這些。研究團隊需要純粹從影片畫面本身來推算車輛的運動。

研究團隊選用了一個名叫MapAnything的基礎模型來完成這項任務。MapAnything的工作方式有點像一位經驗豐富的測量員——它仔細分析連續幀之間的畫面變化,推斷攝影機在三維空間中的移動方式,最終給出每一幀對應的攝影機位置和朝向,也就是所謂的"位姿",並且這個位姿是帶有真實物理尺度的,稱為"度量尺度軌跡"。

然而,從單幀到單幀地估計位置,難免引入噪聲和抖動——就好像你在漆黑的房間裡靠小步邁進來估計走了多遠,每一步的誤差都會積累。為了得到平滑穩定的軌跡,研究團隊在MapAnything的輸出上疊加了一套"先向前、再向後"的平滑處理。

具體來說,他們先用一種叫"卡爾曼濾波"的方法對軌跡做前向平滑,就像給一段顛簸的山路影片加了防抖——隨機的小抖動被消除,但整體運動趨勢得以保留。然後,他們再用一種叫"Rauch-Tung-Striebel平滑器"的方法做反向處理,相當於先把整段影片看完再回頭修正軌跡,確保全局的路徑連貫性。這種前向-後向聯合平滑,讓最終的軌跡既有精準的物理尺度,又足夠平穩,不會因為局部噪聲而讓後續的畫面生成出現異常。

這個軌跡恢復步驟,是整個系統的地基。只有地基穩了,後續在上面"建造"其他攝影機的畫面才有意義。

三、憑空造出其他攝影機:外推視角合成的三個法寶

有了穩定的運動軌跡,接下來就是真正的魔法時刻——讓系統憑空"造出"其他方向的攝影機畫面。

研究團隊選擇了一個叫做Wan 2.1-VACE的影片擴散模型作為生成引擎的骨架。擴散模型是近年來AI圖像和影片生成領域的主流技術,它的工作方式有點像雕塑家——先給出一塊隨機噪聲的"大理石",然後一步步雕刻,最終得到清晰的圖像或影片。但僅僅有這個骨架還不夠,研究團隊為它裝配了三個專門設計的"法寶",分別處理幾何對齊、視覺證據傳遞和跨視角一致性三個關鍵問題。

第一個法寶叫做"Plücker射線幾何編碼"。每當擴散模型在生成畫面時,它需要知道目標攝影機的"眼睛"朝向哪裡——具體來說,是對於畫面中的每一個像素位置,對應的三維空間射線是什麼方向。Plücker射線是描述三維空間中直線的一種數學方式,每條射線用六個數字來描述它在空間中的方向和位置。研究團隊把所有攝影機的每個像素都用這種方式編碼,並把這些編碼注入到擴散模型中,讓模型在生成每一幀時都清楚地知道:"我現在生成的這個像素,對應的是從這個方向、這個位置看出去的場景。"這就好像給模型裝上了一副隨時知道自己在哪裡、朝哪看的空間感知系統。這套編碼同時被注入到模型的主體分支、控制分支和記憶模組三個地方,確保所有計算都在統一的三維坐標系下進行。

第二個法寶叫做"時序深度變換"。前視攝影機已有的畫面,其實包含了大量對生成其他視角有用的視覺資訊。關鍵在於如何把這些資訊"搬運"到目標攝影機的位置。研究團隊的做法是,先用一個叫做DepthCrafter的深度估計模型,推算出前視畫面中每個像素距離攝影機有多遠,也就是深度資訊。有了深度,就可以把前視畫面中的每個像素"搬到"三維空間中,再從目標攝影機的角度重新投影,得到一幅幾何對齊的參考畫面。

這裡有個微妙之處:對於前左和前右兩個攝影機,它們和前視攝影機的視野有一定重疊,所以可以直接用同一幀的前視畫面做空間變換。但對於後方的三個攝影機,它們看的方向與前視攝影機完全相反,同一幀畫面中根本沒有後方的資訊。解決方案是利用車輛向前行駛的特點——現在後方攝影機看到的場景,其實是幾秒鐘前前視攝影機路過的場景。因此,研究團隊對每個後方攝影機設置了特定的時間偏移量,從若干幀前的前視畫面出發做變換,恰好能覆蓋當前時刻後方攝影機應該看到的區域。這種"時光回溯"式的變換,巧妙地把時間維度轉化為空間覆蓋,讓後方視角也有了幾何對齊的視覺參考。

第三個法寶叫做"跨視角記憶庫"。即便有了幾何對齊的參考,相鄰攝影機之間的畫面還是可能出現"拼縫"——就像拼接全景照片時,兩張照片交界處的顏色和紋理可能不協調。為了讓所有生成的攝影機畫面在視覺上渾然一體,研究團隊設計了一個跨視角記憶庫,以及一套明確的生成順序。

五個非前視攝影機按照嚴格的拓撲順序依次生成:前左和前右最先生成,因為它們只依賴原始的前視畫面作為參考;後左依賴前視和前左;後右依賴前視和前右;後方攝影機則綜合參考前視、後左和後右三個已生成的視角。每當一個視角生成完畢,它的特徵就被存入記憶庫,供後續視角的生成參考。

記憶庫中同時維護兩種類型的記憶:一種叫"密集記憶",保存了像素級別的精確空間對應關係,確保相鄰視角在重疊區域的紋理一致;另一種叫"語義記憶",通過一個小型的注意力機制把密集資訊壓縮成64個語義摘要點,提供更高層次的場景內容理解,即使空間上沒有直接重疊,語義上也能保持一致。這兩種記憶在擴散模型的去噪過程中被動態注入,注入的強度還會隨著噪聲級別自適應調整,在早期去噪階段更多依賴語義理解,在精細化階段更多依賴空間對應。

以上三個法寶,加上基礎的擴散模型骨架,共同構成了OpenLongTail的生成引擎。整個系統用一個叫做"流匹配"的訓練方法進行優化,簡單來說就是讓模型學習如何把隨機噪聲逐步變換成真實的目標視角畫面,並且對所有五個目標視角同時訓練,其中後方遠端攝影機因為生成難度最大,被賦予了額外的損失權重以加強訓練。

四、在哪裡學、學得怎樣:訓練數據與評測結果

研究團隊為訓練OpenLongTail整理了一個龐大的數據集,包含來自英偉達PhysicalAI自動駕駛數據集、PandaSet和nuScenes三個來源的超過20萬個影片片段,涵蓋約5萬個不同的駕駛場景。訓練在32塊英偉達H200顯卡上進行,耗時約96小時。

評測分成四個維度,層層遞進,從"生成的畫面像不像"到"用這些畫面訓練出來的AI開車穩不穩",全面檢驗OpenLongTail的實際價值。

首先是視角合成質量的評測。研究團隊把OpenLongTail和四個競爭方法進行了比較:TrajectoryCrafter、Gen3C、ReCamMaster和Vista4D。評測在完全未見過的新場景上進行,用PSNR(峰值信噪比,數值越高代表圖像越接近真實)和LPIPS(感知相似度,數值越低代表視覺上越相似)兩個指標衡量每個目標視角的畫面質量。

在所有五個目標視角上,OpenLongTail均優於競爭方法。以前左視角為例,OpenLongTail的PSNR達到13.28,而表現最接近的競爭方法ReCamMaster僅為12.20;LPIPS方面,OpenLongTail為0.597,同樣優於所有對手。

但更能體現OpenLongTail獨特價值的指標,是"GeoKPM"——跨視角幾何一致性得分。這個指標衡量的是:在相鄰攝影機的生成畫面之間,可以找到多少真正符合三維幾何關係的匹配點?換句話說,就是檢驗各個攝影機畫面是否真的像是在描述同一個三維世界,而不僅僅是看起來各自好看但彼此不一致。OpenLongTail的GeoKPM得分高達82.41,而表現最好的競爭方法Vista4D僅有18.86,TrajectoryCrafter更是只有10.77。這個數量級的差距說明,OpenLongTail生成的多攝影機影片在幾何一致性上遠遠超越了競爭方法,這對於自動駕駛系統理解三維空間至關重要。

第二個評測維度是軌跡恢復質量。研究團隊將OpenLongTail的軌跡模組與DROID-W、MegaSAM、VGGT、ViPE和原始MapAnything進行比較,在218個影片片段上測試軌跡的絕對誤差、旋轉誤差、平移誤差以及軌跡的平滑性(用"加速度方差"和"加加速度"來衡量)。

OpenLongTail在保持與MapAnything相同的絕對軌跡精度的同時,將軌跡的加加速度從4737.4降低到了283.9,加速度方差從53.22降低到了5.96,降幅超過90%。這意味著通過Kalman濾波和RTS平滑處理,軌跡變得極為平穩,為後續的視角生成提供了可靠的幾何基礎。

第三個評測維度,也是最終極的檢驗,是把OpenLongTail生成的數據用於訓練一個真實的自動駕駛AI,然後在一個叫AlpaSim的閉環仿真環境中測試這個AI的實際駕駛表現。

AlpaSim是英偉達開發的一個基於真實場景三維重建的駕駛仿真系統。與簡單地回放錄像不同,AlpaSim會根據AI汽車的實時位置重新渲染出當前應該看到的攝影機畫面,然後把這些畫面輸入給AI,讓AI做出駕駛決策,決策結果又會影響下一時刻的位置,如此循環。這種"閉環"測試能發現AI在真實駕駛中積累錯誤、偏離車道甚至撞車的問題,比僅僅看AI能否預測出與人類駕駛員相同的操作更加嚴格和真實。

研究團隊選用了Alpamayo-R1作為基礎的AI駕駛模型,並在53個長尾事件場景上進行測試,涵蓋複雜路口、騎行者、非常規車輛和施工路段四類情況。評測指標包括AlpaSim綜合得分(越高越好)和碰撞率(越低越好)。

未經額外訓練的Alpamayo-R1在這些長尾場景上平均得分僅為0.534,碰撞率高達58.8%——幾乎每兩次遭遇長尾事件就有一次碰撞。

用英偉達PAV數據集中長尾場景的真實多攝影機數據對Alpamayo-R1進行微調後,得分大幅提升至0.764,碰撞率降為0%。這是"上限"——用真實的多攝影機長尾數據訓練。

而用OpenLongTail從同樣的PAV數據的單目前視影片生成的合成多攝影機數據訓練後,得分達到0.748,碰撞率同樣為0%。合成數據的效果非常接近真實多攝影機數據,僅有約0.016分的差距,證明OpenLongTail生成的數據是真實數據的有效替代品,可以用來訓練長尾事件下更魯棒的AI駕駛系統。

從定性角度看,在施工路段場景中,未經額外訓練的Alpamayo-R1會徑直衝出車道駛入路邊;而使用OpenLongTail合成數據訓練後的版本,能夠識別錐桶和施工標誌,在臨時改道路段保持在正確的車道內行駛,軌跡與使用真實多攝影機數據訓練的版本幾乎一致。

五、擴展到外部數據:Waymo影片和消費級行車記錄儀

OpenLongTail的設計目標之一是能夠處理來自任意來源的影片,而不僅限於英偉達自己的數據集。為了驗證這一點,研究團隊還把OpenLongTail應用到了Waymo的端到端數據集和Nexar消費級行車記錄儀數據集上。

Waymo數據集原本只有前視攝影機影片(針對端到端訓練版本),研究團隊用OpenLongTail為這些影片生成了其他方向的視角,然後把這批數據混入訓練集。結果發現,在非常規車輛識別、騎行者應對和施工路段三個場景上,加入Waymo合成數據後表現有所提升,例如非常規車輛的得分從0.717提高到0.765,施工路段從0.935提高到0.950。

不過,在複雜路口這個類別上,加入Waymo數據後表現反而略有下降。研究團隊對此進行了深入分析,發現根本原因在於數據分布的差異:英偉達PAV數據集中包含大量"臨時路徑重新規劃"(由錐桶或臨時封路標誌改變通行路線)和"人工指揮交通"(警察或施工人員手勢指揮)的場景,前者有671個,後者有62個;而Waymo數據集中前者只有52個,後者為0個。換句話說,Waymo的複雜路口數據更偏向於標準十字路口,而測試集中的複雜路口恰恰以臨時改道和人工指揮為主,加入更多"普通路口數據"並不能幫助AI學會處理這類特殊情況,甚至可能帶來一定干擾。

這個發現揭示了一個重要道理:有效的數據擴展,不僅僅是增加數據量,更重要的是增加與目標場景分布對齊的數據。

Nexar數據集則代表了更極端的挑戰——這是完全來自消費者的行車記錄儀影片,攝影機參數完全未知,存在果凍效應和壓縮偽影,沒有任何標定資訊。即便如此,OpenLongTail依然能夠處理這些影片,從嘈雜的單目前視影片中恢復出穩定的車輛運動軌跡,並生成視覺連貫的多視角畫面,保持了道路走向、路邊布局和周圍交通的整體一致性。這證明OpenLongTail具備了處理真正"野外"數據的能力,而不僅限於高質量的採集數據。

六、開放共享:讓每個人都能使用這套工具

值得一提的是,研究團隊將OpenLongTail作為完全開源的項目發布,提供了生成好的長尾多視角數據、訓練好的模型權重、數據轉換工具和完整代碼。這意味著任何研究機構或企業,都可以利用這套工具把自己收集的單目長尾駕駛影片轉化為訓練多攝影機自動駕駛系統所需的數據,而無需從零開始重新開發這套複雜的流程。

研究團隊也坦誠地指出了當前系統的局限性。擴散模型的推理速度較慢,生成一批影片需要相當的計算資源,這在大規模數據擴充時會成為瓶頸。生成的影片在時間上有時會出現細微的抖動偽影。此外,當處理不同型號、不同安裝角度的攝影機時,模型可能存在一定的偏差。未來的研究方向包括提升生成速度、加入更精細的攝影機參數控制,以及開發能夠自動判斷哪類外部數據最有助於特定長尾場景的智能數據源選擇機制。

說到底,OpenLongTail回答了一個自動駕駛領域長期懸而未決的問題:面對那些珍貴卻"格式不對"的真實長尾場景影片,我們能不能讓它們物盡其用?答案是肯定的。通過把單目影片變成多目影片,這套系統相當於一位技藝精湛的畫家——給你一張前方的速寫,它能幫你補全整幅全景畫,而且每個角度看起來都像是真的站在那裡親眼看到的。更重要的是,用這幅"補全的全景畫"訓練出來的AI司機,在遭遇奶牛、錐桶和揮手警察時,表現得明顯更加從容穩健。

對於普通人來說,這項研究意味著未來坐進無人駕駛汽車時,那輛車應對突發狀況的能力會更強,因為它的AI大腦已經通過更豐富的"意外場景練習"得到了錘鍊。當然,從實驗室的結果到真正上路的安全,還有很長的路要走,但方向是對的。如果你對自動駕駛的安全性或AI訓練數據問題有更多興趣,可以通過arXiv:2607.09655找到這篇論文的完整內容。

Q&A

Q1:OpenLongTail是什麼,它解決了什麼問題?

A:OpenLongTail是由德克薩斯農工大學等多所機構聯合開發的開源生成式數據引擎,專門用於解決自動駕駛中的"長尾問題"。它能把普通單攝影機行車記錄儀影片,自動轉換成多攝影機同步影片,從而讓原本無法使用的野外長尾場景數據(如路上出現動物、臨時施工改道等)變成可用於訓練AI駕駛系統的高質量數據。

Q2:OpenLongTail生成的合成數據和真實多攝影機數據相比,效果差多少?

A:差距非常小。在閉環駕駛仿真測試中,用真實多攝影機長尾數據訓練的AI綜合得分為0.764,碰撞率0%;而用OpenLongTail合成數據訓練的AI得分為0.748,碰撞率同樣為0%。兩者差距僅約0.016分,證明合成數據是真實數據的有效替代品。

Q3:Plücker射線在OpenLongTail中起什麼作用?

A:Plücker射線是一種用六個數字描述三維空間中射線方向和位置的數學工具。在OpenLongTail中,它被用來告訴影片生成模型每個目標攝影機的像素對應三維空間中哪個方向——相當於給AI裝上了空間感知系統,讓它生成畫面時始終知道自己從哪個角度看場景,從而保證不同攝影機的畫面在幾何上相互一致。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新