這項由中國科學技術大學與北京麥石科技聯合開展的研究,以預印本形式發布於2026年7月30日,論文編號為arXiv:2607.27616,有興趣深入了解的讀者可通過該編號在arXiv平台查閱完整論文。
現在的AI繪圖工具已經厲害到令人咋舌。你給它幾張朋友的照片,告訴它"讓他們倆來個擁抱",它真的能畫出來。臉對了,衣服對了,背景對了,感覺挺好——直到你仔細一看:咦,這人怎麼長了三隻手?兩個人的腰好像焊在一起了?那條腿是從哪兒冒出來的?
這不是偶發的小bug,而是當前幾乎所有頂級AI圖像編輯模型都面臨的系統性失敗。更棘手的是,現有的評測工具根本"看不見"這些錯誤——AI考官給這些毛骨悚然的圖像打出了接近滿分的高分。這支研究團隊決定正面解決這個問題,他們搭建了一套全新的測試體系,名叫MPIE-Bench與MPIE-Eval,專門用來戳穿那些表面光鮮、內里一團糟的AI繪圖結果。
一、為什麼AI畫兩個人擁抱會"翻車"
要理解這個問題,先想像一個簡單場景:你請一位畫師幫你畫一張兩個人握手的圖。畫師對每個人單獨畫像毫無壓力,但當兩隻手交匯的那一刻,問題就來了——手指應該如何交疊?誰的手在上面?兩隻手腕的角度是否合理?這些細節在單人肖像里根本不存在,一旦兩個人的身體發生接觸,複雜度就呈指數級攀升。
AI的困境與此高度相似,但問題更加根本。現有的文字轉圖像模型是通過海量圖片"學習"視覺規律的,而在訓練數據里,兩個人緊密接觸的圖像本來就少,身體各部位的歸屬關係更難被模型準確把握。於是,當你要求AI生成"父親扛著孩子"或"兩名摔跤手纏鬥"這類場景時,模型往往會在接觸區域生成一些視覺上說得過去但解剖學上完全不可能的東西——多餘的肢體、融合的軀幹、無處安放的腳。
更令這支研究團隊感到憂慮的是,現有的評測標準對這種錯誤毫無感知能力。主流的評測方式基本上在問四個問題:畫面里有幾個人、這些人的身份對不對、有沒有做出指令要求的動作、畫面好不好看。一張兩個人"擁抱"但彼此身體已經像融化的蠟燭一樣混在一起的圖,依然能在這四個問題上全部得滿分。
研究團隊還發現了一個更諷刺的現象:當他們讓一個智能AI評委(也就是業界常用的視覺語言模型)來評價這些圖時,AI評委對那些融合了肢體的怪異圖像給出了0.98到0.99分(滿分是1分)。而人類一眼就能看出問題所在。這說明,評測工具本身已經出現了嚴重的"飽和"問題——它的尺子太短,量不出真正重要的東西。
二、2500個真實案例組成的考題庫
研究團隊解決這個問題的第一步,是建立一個真正有挑戰性的測試數據集——MPIE-Bench。
數據集的核心思路來自一個精妙的觀察:影片裡天然就包含了"同一批人從互不接觸到緊密接觸"的完整過程。於是研究團隊從三個來源挖掘影片素材,分別是Pexels平台上的免費商業授權影片、Harmony4D數據集以及CHI3D數據集。這些影片覆蓋了街頭生活到專業運動的廣泛場景。
具體的挖掘方法相當聰明。對於每一段影片,研究團隊會自動計算一條"接觸密度曲線"——在影片的每一幀,程序會綜合考慮畫面中兩個人的位置重疊程度、姿勢接近程度、運動方向相似性以及相互遮擋情況,給出一個代表"兩人身體有多接近"的分數,然後把這個分數隨時間的變化畫成一條曲線。這條曲線的低谷部分,就是兩人站得很遠、輪廓清晰的幀——研究團隊從這裡截取每個人的獨立參考照片;曲線的峰頂部分,就是兩人肢體緊密接觸的幀——這成為AI需要生成的"目標圖像"。
有了參考照片(谷底幀)和目標場景(峰頂幀),研究團隊再讓一個AI語言模型"反向"寫出編輯指令——也就是根據目標圖像的內容,寫出一條描述動作和接觸方式的自然語言指令,比如"讓兩人緊緊相擁,R2的臉頰貼著R1的臉頰"。這條指令將是測試時唯一告訴AI該做什麼的資訊,AI看不到目標圖像。
整個流程自動產生了大約兩萬個候選樣本,經過人工審核去除不安全內容和不合格樣本後,最終保留了2500個高質量的測試樣本,覆蓋405個不同場景、14種交互類型和四個接觸密度等級(從完全不接觸到高強度接觸,標記為C0到C3)。在這2500個樣本里,約61%屬於兩個密度較高的等級,也就是身體接觸明顯的場景。大多數樣本涉及兩個人,但有399個樣本(約16%)包含三人甚至更多,最多可達九人。
這個設計有一個關鍵優勢:因為參考照片和目標圖像來自同一個真實場景的同一批人,所以這不是隨機拼湊出來的假測試,而是在考驗AI能否還原真實世界裡真實發生過的人體接觸——這個難度比隨便找兩張人的照片然後說"讓他們擁抱"要高得多。
三、讓AI"照骨子裡"評分——MPIE-Eval的設計哲學
建好了考題,下一步是設計評分標準。研究團隊提出的MPIE-Eval包含六個維度,像六把不同角度的尺子,從各個方向量度一張AI生成圖的質量。
前四把尺子是現有評測體系里比較成熟的:人數對不對(Count)、人的身份認得出來嗎(Identity)、指令里要求做的事情做到了嗎(Instruction)、畫面整體好不好看(Quality)。這四個維度解決的是"任務完成了嗎"這個問題。
真正的創新在後兩把尺子:解剖完整性(Anatomy)和接觸幾何合理性(Interaction)。這兩個維度解決的是"身體還是正常的身體嗎"這個問題。
研究團隊為什麼要用"解剖學"這個詞?因為他們選擇了一種極其直接的檢測方式——對AI生成的圖像做3D人體網格重建(Human Mesh Recovery,簡稱HMR)。這項技術的原理是:給一張普通的2D照片,程序會嘗試在三維空間裡"推算"出照片裡每個人的完整骨架和身體形狀,就像醫院裡的CT掃描從外部圖像推算出內部結構一樣。研究團隊使用了一個叫做Multi-HMR的公開模型作為唯一的重建工具,並且把這個工具的版本凍結,確保所有被測AI都用同一套標準量。
解剖完整性維度的邏輯是這樣的:對一張正常的雙人圖像做3D重建,應該能找到兩套完整的人體網格,圖像里所有"人形的區域"都能被這兩套網格解釋清楚。但如果AI生成了一條多餘的手臂,或者兩人的腰部融合在一起變成了一個奇怪的形狀,那麼3D重建程序就會發現:圖像里有些"人肉形狀"的區域對應不上任何一套正常的人體網格——這些區域就是"剩餘質量",是解剖錯誤的直接證據。
接觸幾何合理性維度的邏輯則是:研究團隊會測量3D重建得到的兩套人體網格之間的空間關係。如果指令要求的是"擁抱"(需要接觸),但兩個網格在三維空間裡幾乎不相交,說明AI畫的人其實沒有真正接觸;反之,如果指令要求的是"站在旁邊"(不需要接觸),但兩個網格大量重疊、一個人的身體穿透了另一個人的身體,也是明顯的錯誤。
值得特別說明的是,這六個維度的分數從不合併成一個總分。研究團隊堅持把它們分開報告,因為他們發現:一個模型可能在解剖完整性上表現很好,但在接觸幾何合理性上一塌糊塗,把這兩個數字平均掉會掩蓋真實的差異。就像一個學生數學滿分、語文零分,如果平均後報"成績一般",就完全誤導了對他能力的判斷。
四、解剖完整性:用"剩餘質量"抓住多餘的肢體
解剖完整性(Anatomy)的具體計算過程,可以用一個偵探尋找"不明物體"的比喻來理解。
程序首先會生成一張"人形前景遮罩"——找出圖像里所有看起來像人體(亮度和顏色與人皮膚、衣物相符)的區域,打上標記。這個過程完全基於傳統圖像處理,沒有用到任何AI學習器,目的是保證客觀性。
然後,程序把3D重建得到的人體網格投影回2D畫面,生成一張"已解釋區域遮罩"——圖像里哪些地方被正常的人體網格覆蓋到了。
接下來,用"人形前景區域"減去"已解釋區域",剩下的就是"剩餘質量"——那些看起來像人體但沒有被正常人體解釋的神秘區域。剩餘質量越大,說明畫面里的解剖問題越嚴重。
研究團隊把解剖錯誤分成四個家族來分別評分。第一個家族是"額外或融合的肢體"——多出來的或者粘在一起的手腳,這通過比較前景遮罩和網格覆蓋的差異來檢測,如果剩餘分數很高但沒有懸浮的碎片,就判定為"附著型假肢"。第二個家族是"漂浮的碎片"——完全脫離人體的孤立人形斑塊,這通過統計孤立的剩餘碎片數量來檢測。第三個家族是"身體結構問題"——尺度錯誤、肢體歸屬混亂或網格自身穿插,這直接來自Multi-HMR的內部質量指標。第四個家族是"殘餘質量"——以上三類沒有覆蓋到的其他人形前景。
每個家族都有自己的軟性評分函數,把原始測量值映射到0到1之間的分數,0代表嚴重失敗,1代表乾淨通過。四個家族的分數以固定權重(0.40、0.20、0.25、0.15)混合,得到最終的解剖完整性分數
。這些權重在任何模型評分開始之前就已經公開鎖定,不會因測試結果而調整。
五、接觸幾何合理性:量出兩具身體之間的"距離真相"
接觸幾何合理性(Interaction)的計算圍繞兩個核心測量展開:穿透程度和表面距離。
穿透程度用一個叫做凸包穿透代理(Vp)的量來估計。凸包可以理解為把一個立體形狀用保鮮膜裹緊後的外殼。研究團隊計算的是兩個人體網格的凸包互相重疊的程度——通過測量一個網格里有多少頂點(身體上的採樣點)落在另一個網格的凸包內部,得到一個"對稱內部比例"(rin),再乘以較小那個人體凸包的體積,就得到穿透代理值。這個值越大,說明兩個身體在三維空間裡"互相穿透"得越厲害。
表面距離(ds)則更直接:在兩個人體網格的所有表面點之間,找到最近的一對點,測量它們之間的距離。這個距離越小,說明兩人越接近;如果這個值大於某個閾值,說明兩人的身體根本沒有接觸到。
然後,研究團隊根據編輯指令中描述的接觸意圖,把每個樣本分成三類,分別採用不同的權重公式來計算最終得分。當指令明確要求接觸(比如"擁抱"、"手牽手")時,穿透分數權重0.45、接近分數權重0.35、質量分數權重0.20——這裡既懲罰不當穿透,也懲罰距離太遠;當指令明確禁止接觸時,穿透分數權重0.55、間隙分數權重0.45——主要懲罰不該有的接觸;當指令對接觸未作明確要求時,穿透分數權重0.85、質量分數權重0.15——主要確保沒有不自然的穿透。
如果3D重建檢測到的人數少於預期人數,Interaction分數會直接減半——畢竟少了一個人,接觸關係根本無從評價。如果重建完全失敗,兩個分數都歸零,確保失敗不會被當成成功藏起來。
這套接觸意圖的判斷來自對編輯指令文本的關鍵詞解析。研究團隊在一個一致性測試樣本集上驗證了這套解析的準確率達到85.3%,而且即便將解析結果替換為人工標註的意圖,全量數據集上的評分結果幾乎沒有變化,說明這個環節足夠穩健。
六、測了十個AI,沒有一個能同時答好兩道題
研究團隊用MPIE-Bench對十個主流AI圖像編輯模型進行了系統評測,其中三個是閉源商業模型,七個是開源模型。閉源的三個是GPT-Image-2、Gemini-3-Pro-Image和Seedream-5-Pro,開源的七個包括FLUX.1-Kontext、DreamO、OmniGen2、UNO、ACE++、BAGEL和FireRed-Image-Edit。
評測結果既令人失望又充滿資訊量。在AI評委評分(V-Inter)那一列,閉源模型的接觸幾何合理性得分高達0.98到0.99,幾乎是滿分;但在3D網格評分(M-Inter)那一列,這些模型的得分只有0.61到0.72。同樣的圖,同樣的問題,兩把尺子量出的結果相差了接近40個百分點。AI評委"看見"了擁抱,但看不見融合的肢體;網格評分程序"摸到了"身體的空間關係,無情地揭示了接觸的失真。
在十個模型里,Gemini-3-Pro-Image在解剖完整性上得分最高,為0.65;Seedream-5-Pro在接觸幾何合理性上得分最高,為0.72——但這兩個最高分來自不同的模型,沒有任何一個模型能同時在這兩個維度上領先。這就像一場考試里,數學最好的人語文不行,語文最好的人數學不行,沒有全才。
開源模型與閉源模型之間的差距在身份識別維度上最為懸殊:閉源模型的Identity分數在0.49到0.58之間,開源模型則普遍在0.02到0.21之間——閉源模型對參考人物臉部特徵的保留能力遠遠超過開源模型。研究團隊還專門測試了"是不是因為開源模型把臉藏起來了"這個解釋,發現即便只統計人臉完整可見的樣本,差距依然存在,只是縮小了一些,說明身份識別能力本身就有本質差距。
研究團隊還按接觸密度分級做了細化分析。隨著接觸密度從C2(中等接觸)升高到C3(高強度接觸),Gemini、Seedream和FireRed的解剖完整性得分都有明顯下滑,說明接觸越密集,這些模型越容易出解剖錯誤。而某些開源模型(比如DreamO)在各密度等級上的得分幾乎一樣低,可以理解為"已經低到無處再低了"。
七、人類用眼睛確認了評分體系的有效性
為了驗證這套新評分體系確實在量正確的東西,研究團隊專門招募了五名成年評審員,對170個難度較高的樣本(接觸密度C2和C3)進行人工評分,覆蓋10個評價項目,包括穿透情況、接觸合理性、額外肢體、身體形狀等。五個人獨立評分,最終用平均分作為"人類金標準"。
結果顯示,五人的評分一致性屬於"中等可靠"水平(Krippendorff's α平均值為0.53),這個水平是合理的——畢竟判斷兩人的身體有沒有穿透,比判斷畫面里有幾個人要主觀得多。核心接觸類項目的一致性最高(0.65到0.68),說明人類在這些問題上雖然不是百分百達成共識,但整體方向是一致的。
然後,研究團隊比較了三種評分方式與"人類金標準"的相關程度:網格評分(M)、AI評委評分(V)以及人類金標準(H)自身。對於9個評價項目中的9個,網格評分與人類判斷的相關性都高於AI評委,其中在"有沒有額外的肢體"和"肢體歸屬對不對"這兩個關鍵項目上,統計檢驗表明差異顯著。唯一例外是"人數對不對"——AI評委在數人數這件事上確實比網格重建更准,這也符合直覺,因為數人數本來就是AI文字理解的強項。
這個驗證告訴我們:這套基於3D重建的評分體系,在衡量人類真正在意的接觸時身體完整性問題上,確實比現有的AI評委更貼近真實的人類判斷。
八、評分體系的穩健性:換個參數還是這個答案
一套好的評測標準必須經得起"如果換個參數會不會排名大變"的考驗。研究團隊為此做了大量的敏感性測試。
在解剖完整性的權重方面,研究團隊嘗試了多種不同的混合方案——平均權重、偏重某一項、調整閾值——結果發現十個模型的排名斯皮爾曼相關係數(衡量排名順序相似度的指標)始終保持在0.98以上,前三名(FireRed、Gemini、Seedream)幾乎穩定不變,只有在使用完全平均權重時BAGEL才擠進前三。
在圖像解析度方面,研究團隊設計了兩條評測軌道:Track A使用各模型提交時的原生解析度,Track B則把所有圖像統一調整到1024×1024的標準解析度再評分。Track B的絕對分數普遍比Track A高出0.06到0.14,這是因為統一解析度減少了因圖像尺寸差異帶來的重建質量波動。但重要的是,兩條軌道下開源模型的排名相關性達到0.89,前三名依然不變,說明解析度選擇影響的是絕對分數,不影響相對排名。
在重建前端方面,研究團隊還額外用了另一種3D重建工具(HMR2)對150個樣本重新評分。單獨用HMR2的結果與Multi-HMR的排名相關性很低,但如果把兩個工具的評分平均起來,排名相關性就回到了0.92。這說明任何單一的重建工具都有局限性,將來可以通過多工具集成來進一步提升可靠性。
九、那些AI還沒學會的"接觸藝術"
研究團隊在測試中觀察到了一些很有規律的失敗模式,值得單獨說說。
手部相關的交互(握手、高五、拉手)是最難的類別之一。在整個數據集的統計里,解剖完整性在這些類別上最低,說明AI在處理兩隻手相遇時特別容易出錯——畢竟每隻手有五根手指,兩隻手交織在一起有多少種不合理的融合方式,可以自行想像。
擁抱同樣是高失敗率的場景,接觸幾何合理性分數在擁抱類別里只有0.48,是所有類別里較低的一檔。有趣的是,拉手(hand-hold)的接觸幾何合理性反而高達0.72,是所有類別里最高的——可能是因為拉手的身體接觸更局限、更明確,AI反而能處理得更好。
競技對抗類動作(格鬥、抓摔)的解剖完整性和接觸幾何合理性都處於中等水平,並不是最差的,這出乎研究團隊的預料。面對面交談的接觸幾何合理性只有0.43,是最低分,但這部分是因為"面對面交談"本身就常常不涉及身體接觸,指令里的接觸意圖是"未指定",評分更偏向懲罰不自然的穿透而非獎勵接觸。
研究團隊還發現了一個潛在的"投機取巧"漏洞:如果一個模型學會了生成兩個人的身體高度重疊(高穿透分、高接近分)但實際上並沒有在正確的部位接觸,理論上可以在接觸幾何合理性分數上得到虛高的分數。他們用AI評委交叉檢驗這種情況,發現它在"要求接觸"且通過了接觸幾何合理性標準的樣本中只出現了約1.3%,屬於較低比例,對整體排名沒有影響。但這個漏洞被誠實地記錄在案,作為未來改進的方向。
說到底,這項研究揭示的是一個令人深思的現實:我們已經有了能夠生成令人信服的人物圖像的AI工具,但當兩個人走到一起、身體發生接觸時,這些工具就會露出一道清晰的"技術裂縫"。融合的肢體、穿透的軀幹、無中生有的手腳——這些錯誤之所以長期被忽視,是因為我們用來檢驗AI的"考卷"設計得太簡單了,根本沒有問到正確的問題。
MPIE-Bench和MPIE-Eval的貢獻,是重新設計了這份考卷。2500個真實人物接觸場景、六個維度的獨立評分、來自3D骨骼重建的幾何檢驗,再加上五人人工評審的驗證——這套體系第一次讓"AI畫人時有沒有把身體畫壞"這件事變成了可以客觀量化的問題。測試結果清楚地表明,當前最好的模型(無論開源還是商業)在這件事上都還有很大的提升空間:解剖完整性最高只達到0.65,接觸幾何合理性最高只到0.72,沒有任何一個模型能同時在兩個維度上領先。
這對普通用戶意味著什麼?如果你在用AI工具生成聚會合影、家庭場景或是任何涉及兩人以上肢體接觸的圖像,遇到奇怪的解剖錯誤是正常現象,不是你的操作問題,而是當前技術的普遍局限。隨著像MPIE-Bench這樣的評測工具開始推動模型開發方向的調整,這個問題有望在未來幾年內得到系統性改善。
研究團隊還在附錄里草擬了一個未來的訓練方案:用FLUX.1 Kontext模型作為基礎,配合一個輔助的骨骼預測流程來強迫模型在遮擋情況下也保持每個人的骨骼完整,再通過按接觸密度分級的課程式訓練——先從簡單的低接觸場景學起,逐步進入高強度接觸場景——來嘗試從根本上改善這個問題。不過這個方案目前只是規劃,尚未有實驗結果支撐,研究團隊誠實地把它標註為"未來工作"而非現有成果。
如果你對這個方向感興趣,不妨思考一下:3D重建工具本身是否足夠準確?當它對一張圖像的重建結果本身就不正確時,基於它的評分是否還可信?研究團隊在論文中承認,當Multi-HMR的檢測置信度較低時,評分結果確實會不穩定,低置信度樣本的得分整體偏低。這是這套體系目前最明顯的局限,也是未來需要解決的核心工程問題。感興趣的讀者可以通過arXiv:2607.27616查閱完整論文,研究團隊也在GitHub上公開了評測代碼和數據,地址是AnnLin0628/mpie-bench。
Q&A
Q1:MPIE-Bench數據集是怎麼收集的?
A:MPIE-Bench通過挖掘影片來構建數據集。研究團隊計算每段影片中人物的"接觸密度曲線",在兩人分開時截取參考照片,在兩人緊密接觸時截取目標幀,再用AI語言模型根據目標幀寫出編輯指令。整個流程自動生成約兩萬個候選樣本,經人工審核後最終保留2500個,覆蓋405個場景和14種互動類型。
Q2:為什麼AI評委給融合肢體的圖打出高分?
A:AI評委(視覺語言模型)的判斷邏輯主要是語義層面的——它能確認"兩個人在擁抱",但無法精確檢測兩具身體在三維空間裡是否互相穿透、肢體是否合理歸屬。這種語義層面的判斷天然對幾何細節不敏感,導致即使畫面里出現明顯的融合肢體,AI評委依然會打出0.98到0.99的接近滿分,產生嚴重的"評分飽和
"問題。
Q3:MPIE-Eval的解剖完整性分數是怎麼算出來的?
A:MPIE-Eval先用Multi-HMR模型對生成圖像做3D人體網格重建,再比較"圖像中人形區域"與"重建網格覆蓋區域"之間的差異,差異越大說明存在越多無法被正常身體解釋的多餘形狀。這些差異被歸入四個錯誤類型(額外肢體、漂浮碎片、結構問題、殘餘質量),分別評分後以固定權重0.40/0.20/0.25/0.15混合得到最終的解剖完整性分數。






