你有沒有想過,一個AI說它在"用腦子想圖片",但其實它壓根沒在想,只是嘴上說說?
這聽起來像個哲學問題,但2026年這篇來自韓國高麗大學和AIGEN Sciences
的論文,把它變成了一個可以被實驗室驗證的科學問題。而驗證結果,可能會讓不少做多模態AI的研究者坐不住。
多模態大模型
:能同時理解圖片和文字,並且能根據圖片內容回答問題的人工智慧系統,比如你上傳一張照片問"這隻狗在做什麼",它能看圖回答。
近兩年,一個叫"潛在視覺推理
"的技術路線火了起來。它的想法很浪漫:既然人思考問題時不會把每一步都說出口,那AI是不是也可以在"心裡"悄悄推理,不用把中間過程寫成大段文字?於是研究者們紛紛設計各種隱藏狀態、潛在視覺token,讓模型在內部反覆琢磨圖片資訊,然後再吐出答案。
這個方向聽起來很有道理,論文數量也不少。但這篇論文的作者們做了一件挺"掃興"的事:他們抓了幾個當紅的潛在視覺推理模型,做了個簡單粗暴的測試。
核心問題:AI說的"思考",到底是真思考還是裝樣子
我們先弄明白,這些潛在視覺推理模型到底是怎麼工作的。
潛在狀態
:模型內部用一串數字向量表示的中間資訊,不是人類能直接讀懂的文字,而是模型自己內部流轉的"思維載體"。
大致流程是這樣:模型看到一張圖和一個問題,先把圖片資訊編碼進某個隱藏狀態里,然後讓這個狀態經過反覆疊代更新,模擬"看圖思考"的過程,最後用這個狀態生成答案。聽起來挺合理,對吧?
但問題來了。論文作者做了個實驗,V*視覺問答基準
上測試了六個主流的潛在視覺推理方法,把它們精心設計的潛在狀態換成了各種"垃圾內容",包括用一張空白圖片生成的狀態、來自另一個不同答案樣本的狀態、甚至純粹是噪聲。結果呢?
有個叫UniVLR
的方法,不管你怎麼折騰它的潛在狀態,準確率的變化都不超過0.5個百分點。
這個數字意味著什麼?意味著你精心設計的、號稱承載著視覺推理精髓的那串向量,換成隨機垃圾,模型答案幾乎不變。它壓根沒在用你以為它在用的東西。
這就好比一家飯店掛著"每日新鮮食材現場熬製高湯"的招牌,你偷偷把後廚的高湯鍋換成自來水,結果端上桌的湯味道分毫不差。如果高湯真的重要,換了應該立刻能嘗出來;換了沒區別,說明所謂"現場熬製"從來沒真正進入過那道菜的味道來源,招牌是掛著好看的。
那為什麼會這樣?作者又做了一個互補實驗。他們把凍結的預訓練視覺語言模型(也就是沒做任何潛在推理改造的原版模型)在中間某一層的隱藏狀態拆開看:包含圖片和問題兩部分的完整多模態狀態,單獨拿出來的問題部分狀態,純文字過一遍模型得到的問題狀態,以及純文字狀態硬接上原始視覺特徵。
結果發現,完整多模態狀態達到75.9%準確率,而單獨拿出來的"問題部分狀態"是75.4%,幾乎一樣。但純文字狀態只有35.6%,硬接原始視覺特徵也沒幫上忙,還是35.6%。
多模態問題狀態
:模型看過圖片之後,問題這部分token所對應的隱藏表示。它雖然只是問題的向量,但因為是在看過圖之後生成的,所以已經"吸收"了圖片資訊。
這說明一個很關鍵的事實:模型看完圖之後,幾乎所有關於圖片的有用資訊,已經悄悄"滲透"進了問題狀態里,不需要額外費勁設計一個專門的視覺潛在通道。而如果你想在事後硬把視覺特徵拼接回一個沒看過圖的文字狀態,是沒用的,因為那不是模型自然形成的理解路徑。
這兩個發現放在一起,勾勒出一個很扎心的圖景:現有的很多潛在視覺推理設計,可能根本沒有被模型真正依賴,而模型真正依賴的視覺理解能力,其實早就藏在它看圖之後自然產生的問題表示里了。
那怎麼辦?作者提出的方案:把退路堵死
如果一個模型的潛在推理狀態可以被隨便替換而不影響結果,說明存在一條"備用通道",模型可以繞過你設計的潛在狀態直接拿到答案所需的圖片資訊。
那解決方案就很直白了:把備用通道徹底切斷。
這就是這篇論文提出的CVRR
方法的核心思路。
CVRR:全稱Causal Visual Recurrent Reasoning,因果視覺循環推理,是這篇論文提出的新方法,它強制要求模型的最終答案必須經過一個循環更新的隱藏狀態,其他任何能繞過這個狀態直接獲取圖片資訊的路徑都被物理刪除。
CVRR的設計分成三個關鍵動作,我們一個個拆開看。
第一步:從"剛看完圖"的那個瞬間開始循環
前面說過,模型看完圖片之後,問題狀態里已經裝滿了視覺資訊。CVRR的第一個決定是:不要從零開始搭建視覺理解,而是直接從這個已經"看過圖"的問題狀態出發,作為循環推理的起點。
因果視覺讀取邊界
:模型內部哪一層是視覺資訊對後續預測還有實質性影響的最後一層,這篇論文用一種叫"激活拼接"的技術手段去定位這個層。
具體做法是,研究者構造了一批成對的樣本,兩張不同的圖片配上同一個問題,但答案不同。然後在模型的每一層,把一個樣本的視覺激活值替換成另一個樣本的,看這個替換對最終答案概率的影響有多大。如果替換後答案概率變化很大,說明這一層的視覺資訊還在起作用;如果變化很小,說明視覺資訊的影響已經消退了。
用這個方法在Qwen2.5-VL-7B
模型上測試,發現第20層是個關鍵轉折點,從這層往後,視覺資訊的下游影響開始持續衰減。所以CVRR選擇第21層作為循環推理的起始點。
這就像裝修房子要先確定承重牆的位置。你不能隨便挑一層樓開始動工,得先搞清楚哪一層還是結構關鍵、哪一層已經不影響整體承重了,選在那個臨界點開始改造,才不會既破壞了原有結構,又浪費了改造的意義。如果選得太早,視覺資訊還沒充分融入,循環推理相當於從半成品開始;選得太晚,視覺資訊已經消散,循環推理無從下手。
第二步:反覆"回頭看圖",而不是只看一次就算了
光有一個好的起點還不夠。如果只是把這個起點狀態原樣傳下去,那叫初始化,不叫推理。CVRR讓這個狀態經歷多輪更新,每一輪都重新讀取同一份固定的視覺證據。
具體來說,模型復用同一個解碼器層(加上一個小小的可訓練適配模組LoRA),反覆把上一輪的問題狀態和固定不變的視覺資訊重新組合、送進這一層,產生新的問題狀態。這個過程重複若干次(論文裡默認是4次)。
LoRA:一種參數高效的模型微調技術,不用改動模型的全部參數,只訓練一小部分低秩矩陣,就能讓模型適應新任務,這篇論文裡CVRR的循環層用的正是LoRA微調,只占模型總參數的0.0348%。
論文裡做了個特別直觀的實驗來驗證這個"反覆看圖"到底有沒有用。他們把某個樣本的問題狀態和另一個樣本的視覺證據強行拼在一起,看循環推理會不會被這個"錯配"的視覺證據帶偏。結果顯示,當模型能夠訪問這個視覺證據的連接通路打開時,乾淨的視覺證據能把一個原本錯誤的問題狀態拉回正確答案,拉動幅度接近15個百分點;反過來,錯誤的視覺證據也能把一個原本正確的問題狀態帶偏,帶偏幅度同樣接近15個百分點。而一旦把這條連接通路堵住,這兩種效應幾乎都消失了。
這就像你在解一道數學題,每算一步都要抬頭看一眼黑板上的原始條件,而不是憑記憶硬算到底。如果黑板上的條件被人偷偷換掉,你抬頭一看就會被帶偏;但如果你從頭到尾都不看黑板,只憑第一眼的印象往下推,那換掉黑板對你毫無影響,因為你壓根沒在用它。CVRR的設計恰恰是逼著模型必須不斷"抬頭看黑板",而且真的被證明是在看。
第三步:決策前,把所有後門焊死
這是最關鍵、也最狠的一步。在最後一輪循環結束後,CVRR把所有的視覺狀態行、以及原始的多模態緩存(也就是模型看圖時產生的所有中間計算結果)統統刪除。
KV緩存:Transformer模型在生成文字時,為了加速計算會把之前算過的鍵值對存下來復用,這裡指的是模型看圖看問題時產生的中間計算結果緩存,如果不刪除,模型在生成答案時就能"偷看"這些緩存,繞過循環推理直接拿到圖片資訊。
刪除之後,唯一能帶著圖片資訊進入答案生成環節的,只剩下經過多輪循環打磨過的那個最終狀態。這時候,模型如果真的答對了,只能說明它是通過循環推理拿到的視覺資訊,沒有別的解釋。
這一步的意義在於把"應該依賴"變成了"必須依賴"。前文提到那些潛在推理方法之所以能被隨便替換潛在狀態而不影響結果,正是因為它們沒做這一步刪除動作,後門一直開著。CVRR做的事情說白了就是把後門焊死,逼著模型走前門。
實驗結果:焊死後門之後,模型還能打嗎
這是整篇論文最核心的驗證問題:把所有備用路徑都切斷之後,模型的視覺理解能力會不會瞬間崩潰?
答案是不會崩潰,但前提是你得學CVRR這麼設計。
論文在四個視覺問答基準上做了測試:V*(專門考驗高解析度圖像細節定位能力)、MMVP(考驗對視覺相似圖片對的區分能力)、BLINK(一個綜合性的視覺感知測試集)、以及MME-RealWorld-Lite(真實場景理解測試)。
CVRR在V*上達到81.2%的準確率,MMVP的成對準確率達到52.7%,BLINK總體準確率55.2%。這幾個數字本身放在表格里看不出太多情緒,但對比一下同樣被"焊死後門"的其他潛在推理方法,差距就出來了。
論文把六個可兼容的潛在推理基線方法,用同樣嚴格的接口重新訓練了一遍,也就是保留它們原本設計的推理機制,但同樣刪除所有備用視覺路徑。結果這些方法在V*上最高只能達到39.8%,MMVP成對準確率最高只有2.7%,BLINK最高38.8%。
這個對比意味著什麼?意味著"逼著模型走前門"這件事本身不難做到,任何方法都可以做,但如果你的"前門"沒有設計好,模型走進去發現裡面什麼都沒有,準確率直接崩到接近隨機水平。CVRR能撐住,是因為它的前門起點選對了,是那個已經吸收了視覺資訊的多模態問題狀態,而不是從零重建的東西。
再換個角度想這個對比。假設你把公司所有員工的私人小道消息渠道全部關掉,只留官方公告欄。如果官方公告欄本來就寫得清楚詳細,員工照樣能正常工作,甚至效率更高,因為資訊更規範了。但如果官方公告欄一直是擺設,從沒認真更新過內容,一旦把小道消息渠道關掉,公司立刻陷入資訊真空,大家什麼都不知道該幹什麼。CVRR的公告欄,也就是循環推理狀態,是認真更新過的;那些基線方法的公告欄,可能一直只是擺設。
再往深挖一層,作者還做了一系列拆解實驗,想搞清楚CVRR的效果到底是從哪兒來的。
拆解實驗:到底哪個部件在起作用
論文設計了一組對照實驗,把CVRR的三個核心組件——原生多模態初始化、持續視覺重讀、可學習的循環轉換——挨個拿掉,看準確率掉多少。
如果把起始狀態換成一個沒看過圖的純文字問題狀態(論文裡叫做B,專門構造用來做對照),即便保留視覺重讀和訓練過的循環轉換,V*準確率從81.2%直接跌到37.2%,MMVP成對準確率從52.7%跌到2.0%。這個跌幅和完全沒有視覺路徑的情況幾乎一樣。
這說明一個很直白的道理:持續給模型看圖,如果模型壓根沒有一個好的起點去理解這張圖,看了也是白看。就像你給一個完全不懂法語的人反覆朗讀法語新聞,讀一百遍他還是聽不懂,因為他缺的不是"更多次接觸",而是"最初的理解能力"。
反過來,如果保留原生多模態起點和訓練過的循環轉換,但去掉持續視覺重讀這一步(也就是只在開頭看一次圖,之後就不再看了),V*準確率掉了12.0個百分點,MMVP成對準確率掉了34.7個百分點。這說明單純有個好起點也不夠,循環過程中真的需要不斷回頭看圖,才能持續獲得有用資訊。
如果保留原生起點和視覺重讀,但去掉可學習的循環轉換(也就是不訓練那個LoRA適配層),準確率也會下降,V*降4.7個百分點,MMVP成對準確率降20.0個百分點。
三個組件缺一不可,這個結論聽起來平淡,但背後的意義是CVRR不是靠某個單一的"魔法組件"撐起來的,而是三個設計環環相扣,共同構成了一條真正被模型依賴、同時又不犧牲原有理解能力的路徑。
意義追問:這個設計到底在解決什麼根本矛盾
讀到這裡,你可能會問,繞這麼一大圈,到底圖什麼?
圖的是把一句"模型看起來在用視覺資訊推理"這句話,變成一句能被實驗證明的話。
在這之前,很多潛在視覺推理論文的證據鏈是這樣的:我們設計了一個新穎的潛在狀態結構,模型用了這個結構之後準確率提升了,所以這個結構里承載著有用的視覺推理。
這篇論文戳破的正是這條證據鏈里的一個漏洞:準確率提升,可能壓根跟你設計的那個結構沒關係,模型可能是靠別的備用路徑拿到答案的,你設計的那部分只是個擺設,甚至是個累贅卻不影響結果的擺設。
這就好比一個學生考試成績很好,老師歸功於自己新編的教材,但從沒檢驗過,如果把教材換成一本完全不相關的書,學生成績是不是照樣很好。如果照樣很好,說明學生的好成績跟這本教材沒什麼關係,可能靠的是課外補習或者天賦,教材的功勞被高估了。CVRR做的,就是那個被跳過的檢驗環節。
進一步的因果分析
論文後面還做了幾組更細緻的因果檢驗,進一步確認循環推理狀態里到底裝了什麼樣的資訊。
其中一組實驗專門控制問題不變,只改變圖片對應的循環狀態內容,看是不是真的"圖片內容變了,答案跟著變"。結果顯示,乾淨狀態下準確率73.3%,替換成另一張圖對應的狀態之後跌到23.6%到26.7%之間,而替換成一個純文字的錨點狀態反而有50.0%的準確率,比替換成不兼容圖片內容的狀態還高。這說明預測確實跟著hT(也就是最終循環狀態)里攜帶的圖片相關內容走,而不只是因為隱藏狀態整體被打亂了才出問題。
另外還有一個挺有意思的發現,是關於循環過程中不同步驟到底在"看圖的哪個部分"。研究者把圖片切成6x6的區域格子,逐個隱藏問題狀態和某個區域視覺資訊的連接,看這個隱藏對最終答案的影響。結果顯示,不同循環步驟里,真正對答案有影響的圖片區域是會變化的,相鄰兩步之間的相似度只有0.37左右。
這說明循環推理不是簡單地把同一份視覺資訊反覆讀了四遍,而是隨著問題狀態的演化,模型每一步關注的圖片區域也在變化。這有點像你在拼一幅拼圖,第一眼掃的是整體輪廓,第二眼開始盯著某個角落的顏色匹配,第三眼又轉去檢查另一塊的形狀對不對,視線焦點一直在動,而不是一直死盯著同一個地方。
後續影響和跨模型驗證
這項工作的價值不只體現在Qwen2.5-VL-7B這一個模型上。論文還額外在Gemma-3-4B、Gemma-3-12B、Gemma-4-12B、InternVL-3-9B這幾個不同的多模態骨幹模型上重複了整套流程,獨立定位各自的視覺讀取邊界,訓練同樣的嚴格接口。結果InternVL-3-9B在嚴格路徑下達到75.9%的準確率,和完整多模態路徑的75.4%幾乎一致,同時對循環內容的破壞表現出57.1個百分點的敏感度下降。Gemma系列模型也表現出類似的模式,只是效果強弱有差異,Gemma-3-4B這個效應偏弱一些。這說明"保留能力同時強制依賴"這個設計思路不是針對某一個模型量身定做的巧合,具備一定的跨架構可遷移性。
論文本身承認了幾個局限:視覺讀取邊界因骨幹模型而異,需要針對每個模型重新定位;目前的機制性分析主要基於多選題設置;當前設計依賴的是固定不變的視覺證據,而不是模型主動、自適應獲取的視覺資訊。這幾點也劃出了後續研究可以推進的方向,比如怎麼讓模型在循環過程中動態決定該重新關注圖片的哪一部分,而不是被動地反覆讀取同一份固定內容。
寫在後面
讀這篇論文最觸動我的地方,不是CVRR這個方法本身有多精巧,而是它提出的檢驗方式:如果你想證明模型真的在用某個內部機制推理,光靠"準確率提升了"這個證據是不夠的,你得主動去嘗試破壞那個機制,看準確率是不是真的跟著掉。
這個思路其實可以推廣到很多其他場景。比如一個人說自己是通過深度思考做出某個決定的,你怎麼驗證他說的是真的?一個可能的檢驗方式是,假設換一個完全不同的思考過程,他會不會做出同樣的決定。如果會,說明那個"深度思考"可能只是他事後編的一個合理化解釋,真正驅動決定的是別的東西,可能是直覺,可能是習慣,可能壓根沒經過什麼深思熟慮。
論文裡UniVLR那個例子讓我印象很深,換成噪聲都只影響0.5個百分點的準確率。這種級別的"無所謂",說明整個學術圈裡可能存在不少這種"看起來很講道理但其實是裝樣子"的設計,只是沒人去認真檢驗過。這不是說這些方法完全沒用,它們的整體準確率數字確實不低,只是它們號稱的那個機制,可能壓根不是準確率高的真正原因。
這讓我想起一個問題,學術研究里有多少"有效但理由錯誤"的方法,正安靜地待在各種論文的實驗表格里,從沒被真正拆解過。
Q&A
Q1:CVRR是什麼?
A:CVRR全稱Causal Visual Recurrent Reasoning,是一種讓AI必須真正依賴循環推理狀態才能回答視覺問題的方法,它刪除了所有可能繞過這個狀態直接獲取圖片資訊的備用路徑,強制模型走"前門"。
Q2:為什麼現有的潛在視覺推理模型可能是在自欺欺人?
A:論文測試發現,把這些模型的潛在推理狀態換成隨機噪聲或空白圖片對應的狀態,準確率幾乎不變,比如UniVLR方法變化不超過0.5個百分點,說明模型壓根沒依賴那個精心設計的狀態,而是走了別的路徑拿到答案。
Q3:CVRR焊死備用路徑後效果會不會變差?
A:不會明顯變差。CVRR在V*基準上達到81.2%準確率,MMVP成對準確率52.7%,而其他被同樣刪除備用路徑的方法最高只能達到39.8%和2.7%,說明關鍵在於循環推理的起點要選對,也就是從已經看過圖的問題狀態開始。






