宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

無人機也有「自我意識」?北郵等高校聯合研究團隊揭開AI空中導航的關鍵短板

2026年07月27日 首頁 » 熱門科技

這項由北京郵電大學牽頭,聯合湖南師範大學與清華大學的研究團隊共同完成的工作,以預印本形式發布於2026年7月,編號為arXiv:2607.12477,感興趣的讀者可通過該編號查閱完整論文。

當你用手機地圖導航時,地圖不僅需要知道路上有什麼,還需要知道"你在哪裡、你在朝哪個方向走、你剛才轉了幾個彎"。這兩件事缺一不可。然而,當我們把這套邏輯搬到無人機身上,目前市面上幾乎所有頂尖的AI大模型,都只做好了前半件事——認識周圍的世界,卻幾乎完全忽略了後半件事——理解無人機自身在做什麼。這個盲區,正是本研究想要正面解決的問題。

研究團隊將這一核心命題稱為"自我與空間"(Self in Space):一架真正智能的無人機,不僅要看懂它飛過的城市,還要清楚地知道自己正在做什麼、剛才做了什麼、接下來該怎麼做。為此,他們構建了一套名為SIS-Bench的評測基準,並專門設計了一種結合光流資訊的運動感知模型SIS-Motion,用嚴格的實驗數據揭示了當前AI的核心短板,同時也驗證了改進方向的可行性。

一、無人機的"導航難題":只認識世界,卻不認識自己

以一位經驗豐富的快遞騎手為例。他騎著電動車穿梭在城市裡,不僅需要認出路口的便利店和醫院,還需要時刻清楚自己剛才是向左轉了彎、還是直行穿過了一條隧道,以及如果接下來再右轉會到哪裡。前者是"認識世界的能力",後者是"認識自己的能力",兩者缺一不可才能安全送達。

現實中的無人機AI面臨的正是這個困境。過去幾年,多模態大語言模型(簡單理解為:能同時看圖、看影片和理解文字的超級AI)被廣泛引入無人機系統,讓無人機擁有了識別地面建築、判斷目標位置、理解飛行指令的能力。然而,研究人員發現,幾乎所有已有的研究和評測系統,都只關注無人機對"外部世界"的理解,對於無人機自身的飛行狀態、運動歷史和行為預測,卻少有系統性的考量。

這不是小問題。在實際飛行中,無人機的每一次姿態變化都會改變它看到的畫面——向左偏轉時,右邊的建築會慢慢進入視野;向下俯衝時,地面會快速放大。如果AI不理解這些變化是"自己在動"造成的,而不是"世界在動",就會產生嚴重的認知混亂,導致判斷失誤。正因如此,研究團隊認為,無人機智能的真正瓶頸,在於如何同時理解"外部世界"與"自身狀態",也就是"自我與空間"的統一建模。

二、SIS-Bench:給無人機AI設計的"駕照考試"

為了系統地衡量AI在這兩方面的能力,研究團隊從零開始設計了SIS-Bench這套評測基準。它就像是一套專門為無人機AI設計的"駕照考試題庫",考題不僅測試你認不認識路,還要測試你記不記得自己剛才怎麼走的、能不能規劃下一步怎麼走。

整個題庫從兩個維度展開。第一個維度是"空間認知",考查AI對外部環境的理解能力,包括識別地面上的物體、判斷建築物的顏色屬性、辨別兩個地標的相對位置關係等。第二個維度是"自我感知",考查AI對無人機自身行為的理解能力,包括識別無人機當前正在執行的飛行動作、記住一段飛行過程中的動作順序、預測執行某個動作後會到達哪裡等。

在這兩個維度內部,研究團隊還按照認知難度設計了三個遞進層次。第一層叫"感知",對應的是最直接的即時觀察,就像你看一眼窗外就能判斷今天是晴天還是陰天,不需要任何回憶或推理。第二層叫"記憶",要求AI能夠在時間軸上保存和提取資訊,就像你需要回想起"剛才經過的那個路口旁邊有一家藍色招牌的藥店"。第三層叫"推理",是難度最高的層次,需要AI把對空間的理解和對自身行為的理解整合在一起,做出複雜的判斷,就像你能在腦海中構建一張地圖,然後規劃從A點到B點的最優路線。

在題目類型上,SIS-Bench共覆蓋13種具體任務。空間認知方面,感知層包含"物體存在性判斷"(這段影片裡有沒有藍色自行車?)、"物體屬性識別"(停在電線杆下的車是什麼顏色?)和"相對方向判斷"(停車標誌的後方是什麼物體?)三類題目;記憶層包含"地標順序回憶"(這幾個地標按什麼順序出現?)、"地標回溯"(玻璃幕牆大樓的前一個地標是什麼?)和"位置關係記憶"(第四段影片裡白色高層右側是什麼?)三類題目;推理層則包含"空間一致性"(假設我懸停在紅頂亭子上方,面向圓形藍色噴泉,我的右手邊是什麼?)和"時空一致性"(從游泳池出發,正確的地標經過順序是什麼?)兩類題目。

自我感知方面,感知層對應"動作識別"(無人機當前在執行什麼飛行動作?);記憶層對應"動作序列回憶"(這段拼接影片中無人機依次執行了哪些動作?)和"動作回溯"(第二段影片裡無人機在做什麼?);推理層則包含"動作預測"(從紅色網球場上方出發,執行這串動作序列後會到哪裡?)和"路徑規劃"(從紅色網球場出發,要到達藍色地板的籃球場,應該執行怎樣的動作序列?)兩類最高難度的題目。

為了讓這些題目儘可能接近真實飛行場景,研究團隊對影片素材也做了精心設計,定義了四種不同的影片格式。單段影片保留一個完整的短片段,用於感知層測試;拼接影片將2到4個短片段連接在一起,用於記憶層測試;長影片保留完整的長時飛行軌跡,用於推理層測試;打亂影片則將一段長影片切成若干片段後隨機重排,強迫AI從混亂的時間順序中還原出真實的空間結構,這也是難度最高的推理場景。

SIS-Bench的數據來源於三個公開的無人機數據集:AirScape、UrbanVideo-Bench和VisDrone,覆蓋城市街道、住宅小區、工業園區、自然景觀等多種環境,總計1646段真實無人機影片,累計時長約14.9小時。所有題目均由兩位專家獨立審核,只有雙方都認可的題目才能進入最終題庫。最終,SIS-Bench共包含4856道多項選擇題,其中感知層占36.3%,記憶層占43.7%,推理層占20.0%。

三、AI現在的真實成績:人類91.7%,最強AI模型71.6%

有了考卷,接下來就是摸底考試。研究團隊將當前業界最強的26個影片多模態大模型無人機也有自我意識北郵等高校聯合研究團隊揭開AI空中導航的關鍵短板一一送上考場,其中包括6個閉源商業模型(Gemini 3 Flash、GPT-5.4、Kimi-2.5、Doubao-Seed-1.8、Doubao-Seed-1.6-Vision、Qwen3.5-Plus)和20個開源模型。同時,他們還招募了6位具有碩士學歷的人類專家參加同樣的考試,作為成績上限的參照。

結果出人意料,卻又在情理之中。人類專家的平均正確率達到91.7%,而表現最好的AI模型Gemini 3 Flash僅取得71.6%的正確率,兩者之間相差超過20個百分點。這說明SIS-Bench並不是一套過於容易的題目,當前的AI距離人類水平還有相當大的差距。

更值得關注的是成績背後的結構性規律。研究人員發現了兩個非常一致、跨越所有模型都成立的現象。

第一個現象是"重空間、輕自我"的系統性偏差。幾乎所有被測試的模型,在空間認知類題目上的得分都明顯高於在自我感知類題目上的得分。換句話說,這些AI更擅長理解無人機看到的外部世界,卻不擅長理解無人機自身在做什麼。以Gemini 3 Flash為例,它的空間認知平均分為83.7%,而自我感知平均分僅為58.6%,差距超過25個百分點。這種系統性偏差在所有26個模型中幾乎無一例外。

第二個現象是"感知好、記憶差、推理更差"的認知層次衰減。隨著題目從感知層上升到記憶層,再上升到推理層,幾乎所有模型的成績都呈現出明顯的下降趨勢。這種衰減在閉源商業模型和開源模型中都同樣存在。直接看一眼就能回答的題目,AI表現尚可;但需要在時間軸上保存資訊再提取的題目,成績就開始下滑;而需要整合空間知識與動作歷史才能完成的複雜推理題,成績下降得最為明顯。

研究團隊還專門做了一系列對照實驗,驗證這些規律不是由題目設計本身造成的。他們測試了不同的影片採樣策略,發現結果幾乎沒有變化;他們對打亂影片重複三次隨機排列取平均,結論也依然穩定;他們給模型加上"思維鏈提示"(讓AI在回答之前先把推理過程寫出來)和"思維樹提示"(讓AI探索多條推理路徑),發現這些技巧對整體結論影響甚微,有的任務甚至會因為提示詞變化而成績下降;而人類專家在面對相同的拼接影片、長影片和打亂影片時,依然能保持接近90%的準確率。這些控制實驗共同說明,觀察到的模型短板是真實存在的能力缺陷,而非題目設計的偏差。

在更細緻的錯誤分析中,研究團隊對4個代表性模型的7987條錯誤回答進行了逐一標註,將錯誤分為8個類別。結果顯示,"動作理解錯誤"占所有錯誤的33.0%,"空間推理錯誤"占18.2%,是兩個最主要的失敗原因。這意味著AI的錯誤並不主要來自"沒看清楚",而更多來自"不理解無人機自己在動"以及"無法在腦海中構建穩定的空間關係圖"。

四、三個具體失敗案例:AI的盲區藏在哪裡

為了讓讀者更直觀地感受到這些局限,研究團隊展示了三類典型的錯誤場景,每一類都揭示了不同層面的認知盲區。

第一類錯誤發生在夜間飛行的動作識別任務中。畫面中,路燈稀少,背景昏暗,只有零星的車燈軌跡可見。正確答案是"無人機垂直下降同時向右偏轉",但包括Gemini 3 Flash、GPT-5.4、Doubao-Seed-1.8和Qwen3.5-Plus在內的所有主流模型都錯誤地選擇了"沿弧線向前飛行同時向右偏轉"。原因在於,這些模型過於依賴視覺中最顯眼的亮點(車燈軌跡),把亮點的移動方向理解成了自身的前進方向,而沒有從整體畫面變化的模式中感知到真實的下降動作。這就像你坐在一輛向後移動的火車上,看到窗外的樹木向前移動,就以為自己在向前走——錯誤的原因不是視力問題,而是對"自己在動"這件事缺乏感知。

第二類錯誤發生在拼接影片的動作序列記憶任務中。影片由三段短片段拼接而成,正確的動作序列是"緩慢下降同時俯仰角下壓 → 保持穩定向前飛行 → 緩慢下降同時俯仰角下壓"。部分模型能正確識別前兩個動作,卻在第三段上判斷失誤,誤以為最後一段是繼續向前飛行。另一些模型則更早就出錯,把第一段也認成了向前飛行,導致整條序列完全錯誤。這類錯誤的本質不是單段影片看不懂,而是無法在多個片段之間建立穩定的時間界限,一旦某段的判斷偏差,就會連帶影響整條序列的理解。這與人類在長時間工作後容易混淆事件順序的情況有些相似,只不過AI的這種混亂即便在很短的影片裡也會出現。

第三類錯誤發生在拼接影片的動作回溯任務中。題目要求模型識別"第三段影片裡無人機在做什麼",正確答案是"順時針旋轉",但幾乎所有被測模型都錯誤地選擇了"俯衝同時向前飛行"或"緩慢向前飛行"。影片中,第三段的視角確實發生了明顯變化,但這種變化是機身在原地旋轉導致的,而不是向前推進造成的。由於這兩種運動在視覺上都會產生"場景在移動"的效果,區分它們需要精細地感知背景整體結構的變化方式,而不是簡單地注意到"畫面在變"。現有模型傾向於把任何明顯的視角變化都解讀為"向前移動"或"俯仰變化",對"原地旋轉"這種更微妙的自我運動模式缺乏有效的識別能力。

五、SIS-Motion:給無人機AI裝上"運動感知器"

發現問題之後,研究團隊沒有止步於診斷,而是進一步探索了一條改進路徑。他們的核心思路是:既然AI對自身運動不夠敏感,能不能專門給它加一套感知運動的"傳感器"?

這個"傳感器"的技術名稱叫光流(Optical Flow)。光流的原理很直觀:對於影片中相鄰的兩幀畫面,你可以計算每一個像素從第一幀到第二幀移動了多少距離、朝哪個方向移動。當無人機向前飛時,畫面中所有元素都會向外擴散;當無人機向右偏轉時,畫面整體會向左平移;當無人機原地旋轉時,畫面會產生一種特殊的旋轉流場。這些運動模式,用人眼觀察非常微妙,但用數學方法計算出來之後,會變成非常清晰的結構化資訊,可以直接告訴AI"機身在以什麼方式運動"。

研究團隊將這套光流資訊封裝成一套與原有視覺特徵並行的"運動編碼器",嵌入到標準的影片多模態大模型中,構成了SIS-Motion框架。具體來說,原有模型會提取影片幀的視覺特徵,描述場景里有什麼、長什麼樣;新增的運動編碼器則同步提取光流資訊,描述每一幀到下一幀之間畫面如何變化。兩路資訊通過一個輕量級的連接模組融合在一起,共同送入語言模型進行最終的推理和回答。

為了訓練這個升級版模型,研究團隊從AirScape數據集的訓練集中構建了一個專門的訓練語料庫,命名為SIS-Motion-54K,包含54000條樣本。這些樣本覆蓋三種形式:多項選擇題格式,覆蓋9個感知和記憶類任務,讓模型在訓練階段就熟悉與評測相同的題目類型;開放問答格式,去掉選項,讓模型直接從影片中生成回答,避免模型僅靠選項匹配取巧;描述格式,包含"運動意圖描述"和"場景內容描述"兩類,讓模型學會同時用語言表達運動資訊和環境資訊。特別值得一提的是,這批訓練數據嚴格只涵蓋感知和記憶任務,沒有包含任何推理類任務的樣本。這樣的設計是刻意為之——如果事後在推理任務上也出現了成績提升,就能說明這種提升來自模型對底層運動資訊的更好理解,而不是靠記住了推理題的答案模式。

六、實驗結果:運動感知帶來了什麼,又沒帶來什麼

實驗結果清晰地展示了SIS-Motion的實際效果。

與同等配置下只使用視覺資訊的基礎微調模型相比,加入運動感知之後,空間認知的平均得分從72.0%提升到74.2%,自我感知的平均得分從60.3%提升到63.7%。這個結果很有意思:運動資訊不僅幫助了自我感知(這是預期之內的),同時也幫助了空間認知(這稍微出乎意料)。原因在於,無人機的運動與它看到的環境本來就是不可分割的——當你知道無人機在向右偏轉,你就更容易理解為什麼畫面左側的建築在變大、右側的建築在縮小,從而更準確地判斷地標之間的位置關係。這正是"自我與空間"統一建模的價值體現。

具體到任務層面,提升最為明顯的包括"物體屬性識別"、"地標回溯"、"位置關係記憶"、"動作識別"、"動作序列回溯"和"動作記憶"等感知和記憶類任務。而在推理層的4個任務上,成績的提升有限且不夠穩定——"路徑規劃"任務有所改善,但"動作預測"任務沒有變化。這與訓練數據的設計完全吻合:模型在沒有接觸過推理訓練數據的情況下,從改進的底層感知能力中獲得了部分泛化,但高層次的複雜推理仍然是尚未攻克的難關。

研究團隊還測試了四種不同的光流估計算法(RAFT、Sea-RAFT、MemFlow、MOFNet),發現所有四種算法搭配後的模型都優於純視覺基礎線,說明這套改進方案對具體光流算法的選擇並不敏感,具有較強的通用性。其中,MOFNet算法的光流質量最高,最終取得了最好的綜合成績,總體正確率達到69.1%。

七、在真實導航任務中的遷移驗證

為了確認這套改進不是僅在題庫里有效,研究團隊還在一個完全獨立的下游任務上進行了驗證。他們基於OpenUAV數據集構建了一個無人機路徑規劃測試集,包含來自22個模擬場景的3895道題目,覆蓋城市街道、沙漠、森林、港口和海島等多種地形。

在這個測試中,所有模型都採用零樣本方式評測,即沒有任何針對這批題目的額外訓練。結果顯示,SIS-Motion的正確率達到92.2%,遠高於同等底座模型Qwen2.5-VL 3B在零樣本狀態下的71.2%,提升超過20個百分點。這說明,在SIS-Motion-54K上學到的運動感知能力,確實能夠遷移到完全不同的下游飛行決策場景中,而不僅僅是在題庫分布內有效。

歸根結底,這項研究做了兩件重要的事。第一件是照鏡子——用SIS-Bench這套精心設計的評測體系,清楚地照出了當前頂尖AI模型的真實短板:它們對外部世界理解得不錯,但對自身行為的感知嚴重不足,而且隨著任務從即時感知升級到時間記憶、再升級到複雜推理,成績會持續走低。第二件是試著補救——用SIS-Motion驗證了一種思路:把光流這種能夠直接描述運動的資訊注入模型,可以在不大幅改動模型結構的前提下,系統性地改善感知和記憶層面的表現,並且這種改善能夠遷移到實際的飛行導航決策中。

當然,研究團隊也坦誠地指出了這項工作的局限。SIS-Motion在推理層任務上的改進有限,路徑規劃這類高層次決策任務需要更複雜的目標導向推理能力,僅靠局部運動資訊並不夠。此外,SIS-Bench本身的評測形式是多項選擇題,更接近於對模型理解能力的間接測量,而不是對無人機真實飛行決策的直接考查。如何將這套對"自我與空間"的理解轉化為可靠的閉環飛行控制,依然是一個需要進一步探索的開放問題。

對於研究人員來說,這項工作提出了一個值得深思的方向:我們是否在構建無人機AI時,太過於關注"認識世界",而忽視了"認識自己"這同樣重要的能力?而對於普通大眾來說,這項研究意味著,未來真正能夠安全、可靠地在城市上空自主飛行的無人機,除了需要一雙"看懂世界的眼睛",還需要一套"感知自身行為的內感覺"。兩者缺一不可,這或許才是無人機真正走向智能化的關鍵一步。有興趣深入了解這項研究的讀者,可以通過arXiv編號2607.12477查閱完整論文原文。

Q&A

Q1:SIS-Bench是什麼,它和普通的無人機測試有什麼區別?

A:SIS-Bench是一套專門用來評測無人機AI能力的題庫,包含4856道多項選擇題,覆蓋13種任務類型。與以往只測試無人機能否識別地面環境的評測不同,SIS-Bench同時測試兩件事:一是無人機對外部世界的理解(比如識別建築顏色、判斷地標順序),二是無人機對自身行為的理解(比如識別當前飛行動作、記憶飛行軌跡)。這種"內外兼顧"的設計,是SIS-Bench區別於以往評測的核心特點。

Q2:當前最強的AI模型在SIS-Bench上表現怎麼樣?

A:表現最好的商業模型Gemini 3 Flash總體正確率為71.6%,而人類專家的正確率為91.7%,差距超過20個百分點。更值得注意的是,所有模型在"自我感知"類題目上的得分都系統性地低於"空間認知"類題目,說明現有AI普遍存在"認識世界強、認識自己弱"的結構性短板。

Q3:SIS-Motion是怎麼改善無人機AI對自身運動的理解的?

A:SIS-Motion通過在原有視覺模型之外增加一套光流分析模組來實現改善。光流能計算出影片相鄰幀之間每個像素的移動方向和距離,把無人機的飛行動作轉化為結構化的運動資訊,讓AI不再只依賴畫面外觀來猜測自身在做什麼。加入這套模組後,自我感知平均得分從60.3%提升到63.7%,空間認知也同步提升,且效果可以遷移到真實無人機導航決策任務中。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新