你有沒有想過,一個AI在回答問題之前,先自己動手把圖片改一改,會不會答得更准?
比如你問它:"這張照片裡,綠色圓點貼紙後面藏著什麼?"
它沒法直接看穿貼紙,對吧。但如果它能先把貼紙"摳掉",露出下面的東西,再來回答,是不是就簡單多了?
這個想法聽起來很美好。事實上過去兩年裡,學術界一直在往這個方向使勁:讓多模態大模型
(簡稱MLLM
,就是那種既能看圖又能聊天的AI,比如GPT-4V、Gemini這類)先生成一張輔助圖片,再拿著這張圖去回答問題。這套流程聽起來像是給AI裝了一雙"能P圖的手"。
但StepFun
和復旦大學的研究團隊做了一件挺較真的事:他們沒有急著慶祝這個思路多厲害,而是先問了一個更樸素的問題——這雙"P圖的手",到底在哪些任務上真的好使,哪些任務上純粹是添亂?
這就是這篇論文的主角,Aphanta
。
一個容易被忽略的陷阱
在解釋Aphanta之前,得先說清楚這個領域此前踩過的一個坑。
之前很多研究默認了一件事:只要能生成一張"輔助圖",多模態模型的表現就會變好。這個假設聽起來合情合理,因為人類做題的時候確實喜歡在草稿紙上畫一畫。
但這裡有個致命的漏洞:一張圖能不能被正確地"畫出來",和這張圖對回答問題有沒有幫助,其實是兩回事。
舉個例子,你讓AI標出圖里所有的橙色五邊形,方便數數。AI確實生成了一張帶編號的圖,看起來專業極了,編號1、2、3一路排到10。可惜漏標了一個,正確答案其實是11個。這張圖從"看起來對不對"的角度完全合格,但它悄悄地把錯誤答案餵給了後續的推理環節。
這就好比你請了一個裝修工人來貼瓷磚,工人貼得整整齊齊,色彩搭配也很和諧,唯獨牆角少貼了一塊。如果你不親自量一遍尺寸,光看整體效果,你會覺得這活幹得漂亮。但漏的那一塊恰好就是承重的關鍵位置。如果不做這種"驗收",你永遠不知道自己住的房子哪裡出了問題,直到某天牆面開裂了才追悔莫及。
這正是Aphanta要解決的問題:它不滿足於"生成了一張圖"這件事本身,而是要搞清楚這張圖到底有沒有用,以及如果沒用,問題出在哪個環節。
Aphanta的三重對照實驗
Aphanta的核心設計其實很直白,就是設置了三種對照條件,讓同一個問題被回答三次。
第一種叫直接推理(Direct),也就是A組:不給AI任何輔助圖,直接看原圖回答問題。這是基準線,代表AI的"裸考"水平。
第二種叫實際編輯
(Actual Edit),也就是B組:讓AI自己想清楚需要什麼樣的編輯指令,交給一個圖像編輯模型(比如Qwen-Image-Edit
這類工具)去執行,生成一張真實的編輯後圖片,再拿這張圖去回答。這是完整的實戰流程,也是大家平時說的"P圖助手"模式。
第三種叫參考答案(Reference),也就是C組:研究團隊用程序化的方式,人工構造出一張"理想狀態"下應該長什麼樣的圖片,直接把這張完美的圖給AI看,再讓它回答。這張圖不是靠AI自己P出來的,而是提前用代碼精確畫好的標準答案圖。
有了這三組數據,就能算出兩個關鍵指標。
一個是編輯增益
,也就是B組分數減去A組分數,代表這套"AI自己P圖再回答"的完整流程,到底有沒有帶來實際提升。
另一個是參考增益
,也就是C組分數減去A組分數,代表如果有一張完美的輔助圖,這個任務本身能不能從中受益。這個指標衡量的是理論上的天花板,和編輯模型做得好不好沒有關係。
這兩個數字放在一起看,才能真正診斷問題出在哪裡。
如果參考增益很高,但編輯增益很低甚至是負的,這說明什麼?說明這個任務本身確實需要一張輔助圖才能答對,問題在於當前的編輯模型沒能把這張圖畫對。這是一個"執行力不足"的問題,不是"思路錯了"的問題。
這就像考試的時候,你知道解這道題需要畫一條輔助線,思路完全正確,但手抖了,線畫歪了,結果整道題的推導全錯了。你不能說"畫輔助線"這個策略本身是錯的,只能說這次沒畫准。如果不區分"策略對不對"和"執行準不準"這兩件事,你會把一個純粹的工程問題誤判成方法論問題,反而放棄了本該有效的思路。
一個自動化的任務挖掘工廠
光有對照實驗框架還不夠,研究團隊還得回答另一個問題:到底該測試哪些任務?
如果只挑幾個AI表現得特別好的任務來展示,那這份報告就變成了一份"廣告",而不是一份誠實的診斷書。
所以Aphanta搭建了一條四階段的自動化流水線,用AI智能體(用的是GPT-5.3-Codex)來批量提出候選任務,人類專家只在關鍵節點把關質量。
第一階段是提案篩選。AI智能體根據已有的任務模式,提出新的候選任務,人類審核這個任務在概念上是否可行、能否被量化評估。
第二階段是初步診斷。用小規模數據快速跑一遍A/B/C三組實驗,如果發現這個任務參考增益幾乎為零(說明輔助圖根本幫不上忙)、或者基線已經接近滿分(沒有提升空間)、或者編輯模型壓根生成不出想要的圖,這個任務就會被叫停。
第三階段是數據構建。對於留下來的任務,團隊開始批量收集或合成訓練數據,人工審核數據質量和多樣性。
第四階段是訓練評估。用構建好的數據訓練編輯模型,再跑完整的評測流程,結果會反饋回第一階段,形成一個持續疊代的閉環。
這套流程最值得稱道的地方在於,它把"失敗的任務"也完整保留了下來,寫進了最終的審計報告裡,而不是悄悄刪掉。這就好比一個誠實的產品評測,不會只展示成功案例,連翻車的部分也照實記錄,這樣讀者才能看到完整的邊界,而不是被精心篩選過的樣板房忽悠。
如果只報告成功案例會怎樣?讀者會誤以為"AI輔助P圖"是萬能藥,拿去套用到任何任務上,結果撞得頭破血流才發現根本不是這麼回事。
20個任務,畫出一張能力邊界地圖
團隊一共考察了20個候選任務,覆蓋了從底層視覺識別到高階邏輯推理的各種場景。這20個任務被歸到四大類操作。
第一類叫定位(Grounding),意思是找到圖里某個特定物體或區域的位置,比如"鏡子在哪"、"哪裡有產品缺陷"。
第二類叫線索注入(Cue injection),意思是通過標記、圈畫、放大等手段,把一個原本很難看清的視覺線索凸顯出來,比如"數一數圖里有多少個青色菱形"。
第三類叫反事實狀態還原
(Counterfactual state realization),意思是構造一個和現實不符的假設場景,然後讓AI基於這個假設來回答,比如"如果把手錶從手腕上摘掉,你還能在圖里看到手錶嗎"。
第四類叫結構化推演(Structured extrapolation),意思是需要嚴格遵循某種規則或邏輯,精確構造出一個新的圖形狀態,比如瑞文推理矩陣
(Raven's Progressive Matrix,簡稱RPM,一種經典的圖形邏輯推理測試,通常表現為一個3x3的圖案矩陣,缺一個格子,要求你從選項里選出符合規律的那個)里補全缺失的圖案、或者畫一條幾何輔助線來解題。
結果發現,這四類任務的表現差異極大。
反事實狀態還原是表現最好的一類。經過任務專屬優化後,編輯輔助能把下游得分提升0.21到0.37分,這是個相當可觀的漲幅。比如"刪除手錶後還能看見手錶嗎"這個任務,直接問AI時得分只有0.10,加上編輯輔助之後飆升到0.47,而理論上限(參考條件)是0.92。這說明這類任務確實存在巨大的可挖掘空間,而且當前的編輯模型已經能吃到相當一部分紅利。
線索注入類任務同樣表現不錯。密集計數、七巧板分解、密集差異標記這些任務,編輯輔助都帶來了實打實的提升。
定位類任務普遍受益,雖然有時候實際編輯的效果甚至超過了程序構造的參考答案,這恰恰說明參考條件只是一個診斷目標,不是絕對的天花板,AI偶爾能玩出比人工設計更巧妙的花樣。
但結構化推演類任務就沒那麼順利了。兩個RPM變體經過專門優化後確實有所提升,說明"AI完全不懂視覺邏輯"這個說法站不住腳。可電路符號識別、幾何輔助線構造、齒輪轉動關係、流程圖路徑判斷,這些任務反覆出現執行錯誤。它們往往參考增益是正的,說明理論上有提升空間,但實際編輯的效果卻是負的甚至有害,這正是"任務和編輯工具不匹配"的典型信號。
用大白話講,編輯模型擅長的是"局部加一筆、刪一筆、換個顏色"這種操作,一旦涉及到"必須嚴格滿足某種數學或邏輯約束",它就容易露怯。
這就好比讓一個手很巧的裁縫去改衣服的尺寸、換個扣子、縫個補丁,他做得又快又好。但如果你讓他根據一套複雜的力學公式去設計一件能承重兩百公斤的懸掛結構,他大概率會做出一件"看起來像那麼回事"但實際上撐不住的東西。手藝再巧,也替代不了對底層規則的精確理解。如果不做這種任務分類,你可能會把裁縫派去干工程師的活,然後怪裁縫不可靠。
消融和跨模型驗證:數字說話
團隊把留下來的正向任務資源,整合訓練成一個統一的Qwen-Image-Edit模型,在篩選出的正向任務子集上做了完整評測。
結果是,平均任務得分從0.343提升到0.445,絕對提升10.2個百分點,相對提升29.7%。這個數字是在經過篩選的正向任務集合上得到的,不是一份"萬能編輯器排行榜",團隊反覆強調了這一點,避免讀者過度解讀。
對應的參考分數是0.558,說明即便是經過專門優化的編輯模型,距離理論上限依然有不小的差距,這份差距就是未來繼續優化的空間。
團隊還試了幾個不同的模型組合。Seed-2.0配Seedream-4.5,提升了3.5個百分點;Gemini-3配Nano Banana 2,提升了4.5個百分點;而GPT-5配GPT-Image-1.5,居然是負的5.0個百分點,也就是說加了編輯輔助反而更差了。
這個結果挺有意思的。
如果固定用Qwen3-VL做推理模型,只換編輯器,效果從負4.7分到正10.2分不等,跨度非常大。這說明下游效果高度依賴編輯器本身的執行力,而不只是任務類型決定的。
團隊還額外測試了兩個不在自己任務庫里的外部基準,BabyVision和MIRA,用來檢驗這套方法能不能推廣。結果在BabyVision上,三個測試組合全部是負增益,編輯輔助反而拖了後腿。在MIRA上,只有Gemini-3-Flash配Nano Banana 2這一組合出現了小幅正增益,但三個組合的參考條件全都超過了直接推理。這再次印證了那個核心結論:參考增益普遍存在,說明視覺輔助這個思路本身有價值,但實際編輯能不能兌現這份價值,取決於具體的模型組合和任務類型,不能一概而論。
為什麼會出現這樣的邊界
團隊總結出了三條經驗規律。
第一條,可靠的視覺狀態還原。當需要的編輯操作可以表達為"局部添加、刪除、屬性修改或者感知線索標記",同時保留場景其他部分不變時,編輯器表現最穩。這類操作本質上是局部的、可逆的、不需要理解全局邏輯關係的。
第二條,看起來對不代表真的對。一張編輯後的圖片可能視覺上完全合理、構圖協調、光影自然,但同時違反了任務要求的計數、符號對應或幾何約束。這是最容易被忽視的陷阱,因為人眼很難一眼看出"漏標了一個"這種細節錯誤。
第三條,結構化推演不太可靠。當任務需要精確的符號識別、邏輯嚴密的構造、或者保持拓撲關係的路徑規劃時,現有的通用編輯器表現明顯不穩定。團隊特別強調,這是當前測試的這批通用編輯器的經驗邊界,不代表擴散模型這條技術路線本身做不到這件事,已經有專門訓練的模型在迷宮規劃、數獨求解這類結構化任務上取得了進展。
三個規律放在一起看,其實指向的是同一件事:通用編輯器目前更像一個手藝精湛但缺乏專業知識的畫師,讓它畫畫修修補補沒問題,讓它精確按圖紙施工就容易出岔子。
因果性的邊界:這套方法證明了什麼,又沒證明什麼
團隊非常坦誠地指出了這套A/B/C對照實驗的局限性。
B組的完整流程里,除了返回的編輯圖片本身,還多了一次額外的AI推理調用,以及生成編輯指令這個過程本身附帶的文字資訊。也就是說,即便B組分數比A組高,也不能百分之百確定是"圖片內容"起了作用,有可能只是"多想了一遍"或者"編輯指令里的文字描述"本身就提供了足夠的資訊量。
這正呼應了最近另一些研究發現的現象:有些時候AI調用了工具,但實際上並沒有真正使用返回的證據,反而是調用工具前後生成的文字描述本身就已經包含了足夠的資訊。
團隊坦言,要徹底釐清這個因果鏈條,還需要引入"匹配調用次數但不返回圖片"、"用無意義的占位圖片"等對照組,這是留給後續研究的功課,Aphanta目前提供的是一張任務級別的實用性地圖,而不是一份完整的因果證明。
寫在後面
讀到這篇論文的時候,最讓我意外的其實不是那20個任務本身,而是團隊願意把失敗的、被叫停的任務原樣留在報告裡。這在學術圈其實挺少見的,大部分論文的默認邏輯是"展示我做對的部分",但Aphanta反其道而行之,專門設計了一套機制去記錄"這個思路走不通"的證據。
這讓我想起一個很樸素的道理:一份地圖如果只標出成功的路徑,而把死胡同全部抹掉,你走到死胡同的時候只會覺得是自己走錯了,不會意識到這條路本來就沒有出口。Aphanta把死胡同也畫進了地圖裡,這才是它真正的價值所在,而不是那10.2個百分點的提升數字本身。
還有一個細節挺值得琢磨。GPT-5配GPT-Image-1.5那組實驗,編輯輔助反而讓效果變差了,掉了5個百分點。這個"負增益"的結果沒有被藏起來,而是大大方方地擺在了表格里。這種誠實,恰恰說明了研究團隊真正想搞清楚的是"這套方法在什麼條件下會失效",而不是"如何把展示效果做得漂亮"。
那麼問題來了:當AI越來越擅長自己給自己"打草稿"、自己生成輔助材料來輔助推理時,我們該怎麼建立一套機制,讓AI自己知道什麼時候該信任這份草稿,什麼時候該懷疑它?這大概是比"P圖P得準不準"更根本的問題。
Q&A
Q1:Aphanta是什麼?
A:Aphanta是StepFun和復旦大學團隊提出的一套自動化診斷框架,用來判斷多模態大模型自己生成的編輯圖片,對回答問題到底有沒有實際幫助,而不是想當然地認為生成圖片就一定有用。
Q2:Aphanta測試的圖像編輯輔助方法在哪些任務上最好用?
A:在反事實狀態還原(比如刪除物體後判斷還能否看見)、視覺線索標記(比如密集計數、差異標記)、以及物體定位任務上表現最穩定,能帶來明顯的分數提升。
Q3:為什麼有些任務用了圖像編輯反而效果更差?
A:因為編輯模型生成的圖片可能"看起來合理"但實際違反了計數、符號對應或幾何約束等隱藏要求,尤其在電路圖解析、幾何輔助線構造、流程圖判斷這類需要精確結構推演的任務上,編輯模型經常出錯,導致錯誤資訊被傳遞給後續推理環節。






