宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

視覺AI也有「近視眼」?高通AI研究院揭示:像人眼一樣「逐步掃視」,才是讓機器真正學會推理的關鍵

2026年07月29日 首頁 » 熱門科技

這項由高通AI研究院(Qualcomm AI Research)完成的研究,發表於2026年歐洲電腦視覺大會(ECCV 2026),論文編號為arXiv:2607.09061,有興趣深入了解的讀者可通過該編號查詢完整論文。

你有沒有想過,當你看一張複雜的圖片時,你的眼睛並不是一瞬間把整張圖"拍"進大腦的?事實上,你的眼睛每秒會進行好幾次快速跳動,每次只聚焦在一個小區域——先掃左上角,再跳到中間,然後移到右下角……就這樣一點一點把資訊拼湊起來,最終形成對整張圖的理解。這種行為叫做"視覺掃視",是人類視覺系統幾百萬年演化出來的核心機制。

然而,當今幾乎所有主流的AI視覺模型,都是把整張圖一口氣"吞"進去處理的——就好像用一台廣角相機把整個場景同時拍下來,再從這張大照片裡提取所有資訊。這和人類的方式截然不同。那麼,這種"一口吞"的方式到底有什麼隱患?高通AI研究院的研究團隊決定深挖這個問題。

他們的發現令人深思:現有的AI視覺模型,包括當下最先進的大型視覺語言模型,在面對"比訓練時見過的更複雜的圖片"時,會出現明顯的性能崩潰。而他們提出的解決方案,正是讓AI模型"學會像人眼一樣逐步掃視圖像",並配合一種能夠記住每一步狀態的循環計算結構——這個組合,才是讓模型真正理解視覺資訊、並舉一反三的關鍵所在。

一、為什麼AI模型"看圖"會失靈——從一道數學題說起

要理解這項研究在解決什麼問題,先來看一個類比。假設老師教你學加法,從一位數加到十位數,你練習了很多次之後,能很熟練地算出37+58=95。但如果老師突然出了一道三位數加法,比如374+586,你還能做嗎?當然可以,因為你掌握了加法的"規則本身",而不只是記住了每道題的答案。

這種"把規則本身學會、然後在更複雜的情況下也能用"的能力,研究者把它稱為"長度泛化"——意思是模型在訓練時只見過"短"的情況,但在測試時面對"長"的情況依然能正確作答。

在語言AI領域,研究者早就發現,像GPT這樣的Transformer模型在面對比訓練時更長的序列時會表現大幅下滑。高通團隊的這項研究,則首次系統地把這個問題搬到了視覺領域:當一張圖里需要處理的資訊量,超過了模型訓練時見過的複雜程度,會發生什麼?

為了研究這個問題,團隊設計了一套視覺推理測試題,這些題目的共同特點是:答案不在圖片的某個角落,而是分散在整張圖的多個位置,必須把所有位置的資訊綜合起來才能得出正確答案。任務的"長度",就是圖中需要訪問的資訊點數量——資訊點越多,任務越長越複雜。

他們把"訓練時見過的複雜度"和"測試時面對更高複雜度"的表現做了對比,結果發現:當前最先進的視覺AI模型,在訓練範圍內表現優異,但一旦測試複雜度超過訓練範圍,性能會急劇下滑,幾乎失效。這說明這些模型並沒有真正學會"規則本身",而是記住了某種只在特定複雜度下有效的"捷徑"。

二、研究者設計了哪些測試——四道題考驗AI的"舉一反三"

為了讓研究結果更有說服力,研究團隊設計了四種不同類型的視覺任務,每種任務從不同角度考驗模型的泛化能力。

第一種任務叫"視覺奇偶性",靈感來自一道經典的數學題:給你一串由0和1組成的數字,判斷其中1的個數是奇數還是偶數——這叫做"奇偶性判斷"。在視覺版本里,圖中隨機分布著若干個圓形節點,每個節點中心寫著0或1,模型需要找到所有節點,統計其中1的數量,最後判斷奇偶性。關鍵在於,這些節點是隨機散落在圖像中的,不是整齊排成一排——模型必須自己"找到"它們,而不只是從左到右依次讀取。

第二種任務叫"狀態機",難度更高一些。這次圖中的節點不僅有值,還通過箭頭連接成一個有序的鏈條,模型必須按照箭頭指示的順序,從綠色的起始節點出發,經過一系列紫色的中間節點,到達紅色的終止節點。每訪問一個節點,就根據它的值更新一個"當前狀態"——有點像走迷宮時,每經過一個房間就要按照房間裡的規則改變自己的狀態。順序非常重要,換一種順序走就會得到不同的結果。

第三種任務叫"視覺回憶",這是一個作為對照組設計的任務。圖中有一堆紅色T形字母、綠色L形字母,以及紅色L形字母,模型需要回答:"紅色L"在圖中存在嗎?這個任務不需要狀態追蹤,只需要在圖中找到符合特定顏色和形狀組合的目標,類似於在人群中找一個穿紅衣服戴藍帽子的人。

第四種任務叫"尋找函數零點",是一個更貼近現實應用的任務。圖中顯示的是一個數學函數圖像,圖里可能有多個子圖、多條曲線。模型需要找到特定子圖中特定函數與x軸(即y=0那條橫線)的交叉點,也就是函數的"零點"。這模擬了科研人員分析實驗圖表、學生做數學題等真實場景,需要先在複雜圖像中定位目標區域,再仔細分析曲線細節。

通過這四種任務,研究者希望揭示:哪些類型的視覺推理依賴於"逐步積累狀態"的能力,哪些則不需要?

三、"一口吞"式AI為什麼會學壞——捷徑的誘惑

當研究者把當前最先進的視覺語言模型(包括Qwen2.5-VL、GPT-5.4、Claude Sonnet 4.6等)放在這些任務上測試時,結果印證了他們的擔憂。

在訓練範圍內,也就是圖中資訊點數量較少時,這些模型都表現出色,準確率很高。然而隨著資訊點數量增加,超過訓練時見過的最大數量,它們的表現開始快速下滑,從接近滿分逐漸跌落到接近隨機猜測的水平。

為什麼會這樣?研究者的解釋類似於這樣一個故事:假設老師出了很多道"在一排樹中數蘋果"的題,最多的一道題有10棵樹。一個聰明的學生可能沒有真正去數每棵樹上的蘋果,而是發現了一個規律:"如果樹排成這樣的形狀,蘋果總數大概是這麼多"——他記住的是圖形的整體外觀與答案之間的統計關係,而不是數蘋果的步驟本身。這種"走捷徑"的策略在10棵樹以內非常有效,但當老師突然出了一道20棵樹的題,這個規律就完全失效了。

對於一口吞下整張圖的AI模型來說,它很容易從整張圖的全局視覺特徵中歸納出這種捷徑——因為它同時看到了圖中所有的資訊,完全可以用一種全局性的、並行的計算方式得出答案,而不需要一步一步地追蹤資訊。這種全局捷徑在訓練範圍內有效,但在訓練範圍之外就失去了泛化能力。

研究者還發現,這些頂尖模型的失敗不只是因為"沒有算出正確答案",往往還伴隨著更基礎的失誤——它們有時根本就沒能從圖中找全所有的資訊節點,或者誤讀了箭頭的方向。這說明資訊收集本身就是一大難關,而"一口吞"的方式在資訊點增多後對細節的感知力會明顯下降。

四、"掃視機器人"是怎麼工作的——像人眼一樣一步一步看

針對上述問題,高通團隊提出了他們的解決方案:一個叫做FoveAgent-LSTM的模型。這個名字來自兩個概念——"Fovea"(中央凹,眼球中感知最清晰的區域)和"LSTM"(一種具有記憶能力的循環神經網路)。這個模型的核心思路,就是模擬人類視覺掃視的方式來處理圖像。

每一步,FoveAgent-LSTM只觀察圖像中的一個局部區域,但它同時從兩個尺度獲取資訊。一個是"中央凹視野",也就是當前注視點的高清局部圖像,解析度很高,能看清細節,比如節點裡寫的是0還是1,或者曲線是否經過了x軸;另一個是"外周視野",也就是以當前注視點為中心的更大範圍的低解析度圖像,解析度較低,看不清細節,但能感知大致的空間布局,知道周圍還有哪些區域值得訪問。

這個設計模仿了人眼的工作方式:人眼的中央凹(視野正中心的小區域)能看到極高清的細節,而視野邊緣則模糊一些,但足夠讓你感知到"哪個方向有動靜",引導下一次掃視的方向。

在每一步觀察之後,模型會做三件事:第一,更新自己的"記憶狀態"——這是LSTM網路的核心功能,它能把"到目前為止我看到了什麼、當前狀態是什麼"儲存下來,並在下一步繼續使用;第二,輸出一個"探針信號",也就是對當前這一步觀察到的內容的判斷,比如"這個節點的值是1",這類似於做題時的草稿步驟;第三,輸出一個"行動指令",也就是下一步要把視線移到哪裡——用角度和距離來表示移動方向,且下一步的中心點必須在當前外周視野的範圍內,這保證了模型不會一步跳到圖像的任意位置,而是像真正的視覺掃視一樣,每次只移動有限的距離。

當模型認為已經收集到了足夠的資訊,它會輸出一個"停止信號",並給出最終答案。

這個模型之所以有效,關鍵在於兩點的結合。其一是"局部感知":因為每次只看圖像的一個局部區域,模型無法一次性獲得整張圖的全局資訊,也就無法走"全局捷徑",必須老老實實地一步一步積累資訊。其二是"循環記憶":LSTM網路能夠在整個掃視過程中維護一個不斷更新的"當前狀態",把每一步的觀察結果疊加進去,而不是每次都從零開始——這正是人類推理的方式,也是"規則本身"得以被學習的基礎。

五、實驗結果說明了什麼——捷徑vs規則的對決

研究者在上述四種任務上對FoveAgent-LSTM和各種全局模型進行了系統比較,結果清晰地展示了兩種方法之間的本質差異。

在視覺奇偶性和狀態機這兩個需要"狀態追蹤"的任務上,FoveAgent-LSTM在超出訓練範圍的複雜度下依然保持了接近滿分的準確率,而Qwen2.5-VL等全局模型在同樣的情況下準確率急劇下滑,有時甚至接近隨機猜測。這個對比幾乎就是"學會了規則"與"記住了捷徑"的直接對決。

研究者還做了一個精心設計的對照實驗,把模型的"視覺輸入方式"和"計算結構"分開來檢驗,以搞清楚到底是哪個因素在起關鍵作用。他們用同一個LSTM循環骨幹網路,分別配上三種不同的視覺輸入方式來做比較。第一種是"全局輸入",也就是每次都把整張高清圖傳給模型;第二種是"局部+全局輸入",既傳局部高清圖,也同時傳整張高清圖;第三種是FoveAgent-LSTM的方式,只傳局部高清圖和低解析度外周圖,從不讓模型看到整張高清圖。

結果發現,前兩種方式在訓練範圍內表現良好,但在超出訓練範圍後同樣出現了性能下滑,而只有第三種方式(完全局部的感知方式)實現了穩健的泛化。這說明,即使有了LSTM的循環計算能力,只要模型能接觸到整張高清圖,它就還是會學會利用全局捷徑,從而喪失泛化能力。局部感知不是可選的輔助手段,而是防止捷徑學習的必要條件。

接下來,研究者又固定了局部感知的視覺輸入方式,換用不同的計算骨幹網路來比較。他們測試了LSTM、GRU、普通RNN(這三種都是嚴格的循環網路),以及xLSTM、Mamba(這兩種是線性循環網路),還有基於Transformer的Qwen2.5-VL模型。結果是,只有嚴格循環的網路(LSTM、GRU、RNN)實現了穩健的長度泛化,其他結構都在超出訓練範圍後出現了明顯的下滑。這說明,真正的非線性循環計算是第二個不可或缺的條件。

換句話說,要實現視覺推理的長度泛化,必須同時具備兩個條件:一是局部感知(不能一口吞整張圖),二是嚴格的循環計算(而非Transformer或線性循環結構)。二者缺一不可,缺了任何一個,模型都會走捷徑、不泛化。

六、外周視野的精妙設計——大與小的矛盾如何化解

研究者在實驗中還發現了一個有趣的矛盾,並找到了優雅的解決方案,值得詳細介紹。

一方面,為了泛化,局部視野應該儘量小——視野越小,模型每次能看到的資訊越少,就越不可能一次性看到多個資訊節點,從而被迫真正做到"一步一步積累"。但另一方面,視野太小會帶來另一個問題:模型需要更多步驟才能把整張圖都看一遍,而且很難從一個小小的局部窗口裡知道"下一步該往哪走",導航變得困難。

這個矛盾用一個比喻來理解就很清楚:假設你在一個巨大的迷宮裡尋找散落的金幣。如果你戴著一個完全封閉的頭盔,只有一個很小的觀察窗,你每次只能看到腳邊的一小塊地面,你確實無法走捷徑,但你也很容易迷路,不知道該往哪個方向走才能找到下一枚金幣。而如果你能摘下頭盔,一眼看遍整個迷宮,你當然能快速找到所有金幣,但這樣你就不再需要真正"探索"了,你的策略依賴於一覽無餘的全局視角。

FoveAgent-LSTM的解決方案,正是模仿人眼的"中央凹+外周視野"的雙層結構。中央凹是高解析度的小區域,用於細緻觀察當前位置的任務相關資訊,比如節點上的數字;而外周視野是同心的更大區域,但以很低的解析度呈現,足以感知空間布局、判斷周圍哪個方向有值得訪問的目標,但無法清晰讀取具體內容。

這樣一來,高清局部視野保證了細節感知的準確性,而低解析度的外周視野提供了導航所需的空間上下文,同時又因為解析度太低而無法被用於"走捷徑"——你看得到周圍有幾個模糊的圓形,但根本看不清它們上面寫的是0還是1,所以你還是必須導航過去,一個個仔細讀取。

研究者通過系統的實驗,驗證了外周視野的解析度和大小存在一個最優組合。具體來說,外周視野的大小設為中央凹局部視野的4倍,解析度統一縮小到80像素時,模型在準確性和探索效率之間達到了最佳平衡。解析度再高或者範圍再大,模型就會利用外周視野走捷徑;解析度太低或者範圍太小,模型就無法有效導航。

七、沒有路標也能找到路——主動搜索的挑戰

在前面的任務中,圖裡的資訊節點是通過箭頭連接起來的,也就是說模型有明確的"路線圖"可以跟隨,只需要沿著箭頭一步步走就行。但研究者隨後提出了一個更難的問題:如果沒有箭頭,模型能不能自己決定搜索順序?

這個版本的任務里,資訊節點隨機散布在畫布上,沒有任何路徑指示,模型必須自己主動搜尋未訪問的節點,讀取它們的值,更新當前狀態,然後繼續尋找下一個未訪問的節點,直到找完所有節點為止。

這帶來了兩個新挑戰:第一,模型需要知道自己訪問了哪些地方、哪些地方還沒去過;第二,噹噹前的外周視野里沒有未訪問節點時,模型需要知道擴大搜索範圍。為此,研究者給模型增加了兩個輔助功能:一是"空間記憶"功能,每當模型訪問一個節點後,該節點位置上會被標記一個黑點,之後所有的視野中都會看到這個黑點,相當於在地圖上做標記;二是"縮放"功能,當外周視野里找不到未訪問節點時,模型可以執行"縮小"動作,把外周視野的範圍擴大一倍(但解析度相應降低),從而搜索更大的區域,找到目標後再執行"放大"回到原始解析度。

實驗結果顯示,配備了這些功能後,FoveAgent-LSTM在沒有箭頭路標的主動搜索模式下,依然實現了穩健的長度泛化。這說明局部+循環的方式不是依賴於"有路可循"才有效的,而是一種真正通用的資訊收集策略。

八、視覺回憶任務——一個不需要循環的反例

在前面幾個任務中,FoveAgent-LSTM全面碾壓了全局模型。但研究者刻意設計了"視覺回憶"任務作為對照,結果出人意料:在這個任務上,全局模型Qwen2.5-VL反而大幅超越了FoveAgent-LSTM,即使測試時圖中的干擾元素數量遠超訓練時,全局模型依然保持了很高的準確率。

為什麼會這樣?核心區別在於,這個任務根本不需要"狀態追蹤"。找紅色L這件事,不需要你記住之前看過什麼,也不需要把多個位置的資訊綜合起來,你只需要在圖中的任意位置,判斷眼前這個物體的顏色和形狀的組合是否符合要求。這是一種"並行檢測",類似於人臉識別——你不需要從左到右一個個檢查,你的視覺系統可以同時處理整張圖的所有區域,直接輸出"有"或"沒有"的判斷。

全局模型恰好擅長這種並行處理方式,它可以一次性掃描整張圖,找到所有符合"紅色+L形"組合特徵的目標,不需要一步步積累狀態。而FoveAgent-LSTM的局部掃視方式在這裡反而成了劣勢——因為它每次只看一個小區域,在找目標這件事上效率較低,而且也沒有用上局部掃視最大的優勢(也就是防止走捷徑)。

這個對比非常重要,它說明:局部掃視+循環計算的方式並非萬能,而是有其最適合的場景——那就是需要"按順序積累狀態"的推理任務,也就是研究者所說的"狀態追蹤"。對於不需要狀態追蹤的"資訊檢索"類任務,全局並行處理反而是更合適的方式。這與語言模型領域的研究結論高度吻合:Transformer在序列奇偶性這類狀態追蹤任務上失敗,但在鍵值對檢索這類回憶任務上表現出色。

九、真實世界的測試——分析函數圖表的挑戰

最後,研究者把他們的方法應用於一個更貼近現實的任務:在包含多個子圖和多條曲線的數學圖表中,找到特定函數與x軸的所有交叉點。

這個任務之所以有趣,是因為它需要多個步驟的狀態追蹤:首先找到目標子圖,然後在子圖中識別目標函數曲線,然後沿著曲線尋找與x軸的交點,找到一個交點後記錄下來,再繼續找下一個,直到找完所有交點。這是一個典型的"狀態積累"過程。

在這個任務上,研究者使用了一個更強大的模型FoveAgent-Qwen,也就是把局部掃視機制嫁接到Qwen2.5-VL大型視覺語言模型上——這樣可以利用大模型對數學圖表的理解能力,同時加入局部高清視野來提升細節識別。之所以沒有完全換成LSTM骨幹網路,是因為目前還沒有基於循環網路的大型視覺語言模型具備理解數學圖表所需的知識。

對比實驗的結果顯示,加入了局部高清視野後的FoveAgent-Qwen,在訓練範圍內的準確率從全局模型的57.24%提升到了82.26%,在超出訓練範圍的測試場景中也有顯著提升——尤其是"函數零點數量超出訓練範圍"這一場景,準確率從32.63%大幅提升到了67.12%。

研究者還特別排除了"局部視野帶來更多計算量"這一可能的干擾因素。他們發現,當全局模型被分配與FoveAgent-Qwen相同數量的計算資源(通過提高全局圖像解析度來實現)時,準確率的提升極為有限——把全局解析度提高10倍,準確率只提升了不到4%;而同等計算量下FoveAgent-Qwen的優勢約為29%。這說明,FoveAgent-Qwen的優勢來自於資訊獲取方式的根本性改變,而非單純的算力堆疊。

不過,研究者也坦誠地指出,由於這個任務用的是Qwen骨幹(而非嚴格的循環網路),從技術上講還不能算是完全意義上的"循環局部感知",因此在這個任務上的泛化提升,更多地體現了"局部高清視野幫助發現更多視覺細節"的作用,而非循環計算帶來的深層泛化能力。真正強大的循環計算益處,需要等到未來出現循環骨幹的大型視覺語言模型才能完全驗證。

十、這項研究的意義——重新思考AI視覺的設計方向

歸根結底,這項研究告訴我們:當前的AI視覺模型之所以在面對"比訓練時更複雜"的圖像時容易失敗,根源在於它們的感知方式——一口吞下整張圖——給了它們走捷徑的機會,而走捷徑的代價就是無法舉一反三。

要解決這個問題,需要同時滿足兩個條件:一是把感知方式改成局部掃視,每次只看圖像的一個區域,強制模型真正追蹤每一步;二是使用嚴格的循環計算結構,讓模型能在多步掃視中維護和更新一個連貫的"當前狀態"。這兩個條件都是必要的,任何一個都不夠。

值得一提的是,這項研究也暗示了為什麼人類視覺系統演化出了"中央凹+外周視野+眼球掃視"的精妙機制——這或許不只是生物學上的偶然,而是在演化壓力下形成的一種解決"資訊量遠超計算能力"問題的最優策略。如果連人類都需要通過掃視來逐步積累資訊、追蹤狀態,AI模型或許也應該走這條路。

這項發現對未來AI系統的設計有實際影響。當AI被用於分析複雜圖表、在擁擠的視覺場景中追蹤多個目標、或者處理需要多步驟視覺推理的任務時,簡單地"一口吞整張圖"的架構可能從根本上就不適合這些需求。不過,研究者也承認,目前他們訓練模型時用的是預先設計好的最優路徑(專業術語叫"模仿學習"),如何讓模型自己學會更通用的探索策略,還是一個開放的研究問題,未來可能需要強化學習等技術來解決。

有興趣深入了解這項工作細節的讀者,可以通過論文編號arXiv:2607.09061查閱完整論文,論文包含詳細的實驗設置、模型架構說明和完整的實驗數據。

---

Q&A

Q1:視覺語言模型(如GPT、Claude)在視覺推理中會遇到什麼具體失敗?

A:根據論文的實驗,當圖像中需要處理的資訊點數量超過訓練時見過的最大數量時,這些頂尖模型的準確率會急劇下滑。失敗不只是最終答案錯了,往往還伴隨更基礎的問題——模型有時會漏掉圖中的部分節點,或者誤讀箭頭方向,說明資訊收集本身就已經出了問題,而不只是後續推理出錯。

Q2:FoveAgent-LSTM模型和普通視覺模型的最本質區別是什麼?

A:最核心的區別有兩點。普通模型把整張圖一次性"吞"進去處理,容易學到只在特定複雜度下有效的全局捷徑;而FoveAgent-LSTM每次只觀察圖像的一個局部區域,同時用LSTM循環網路在多步觀察中維護一個不斷更新的狀態。局部感知防止了捷徑學習,循環計算保證了多步推理的連貫性,兩者缺一不可。

Q3:局部掃視的AI方法是否在所有視覺任務上都更好?

A:不是。論文專門設計了"視覺回憶"任務作為對照,在那個任務中全局模型反而大幅超過了FoveAgent-LSTM。原因是視覺回憶不需要"按順序積累狀態",只需要在整張圖中找到符合特定顏色和形狀組合的目標,這種並行檢測正是全局模型所擅長的。局部掃視+循環計算的優勢,特別體現在需要狀態追蹤的推理任務上。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新