你有沒有想過這樣一個問題:如果讓十個不同的AI給同一張照片寫說明文字,你怎麼判斷哪個寫得好?
大部分人的第一反應是,寫得越詳細越好吧。但事情沒那麼簡單。有的AI會寫出一大段話,恨不得把圖里能看到的每一根睫毛都描述出來,可惜錯誤百出,把藍色說成綠色,把左邊說成右邊。也有的AI惜字如金,寫出來的句子每一個字都對,但只描述了圖片裡十分之一的內容。
這兩種"說明文字",到底哪個更有用?
這個問題不是抽象的學術爭論。圖片說明文字(也就是caption,圖像描述文本)是訓練幾乎所有多模態AI的核心燃料。你現在用的能看圖說話的AI助手,還有能根據文字畫圖的生成模型,背後都是靠海量的"圖片+文字描述"數據餵出來的。如果這些描述文字本身質量參差不齊,那訓練出來的AI能力上限也就被鎖死了。
來自中國科學院大學和中科院自動化所的研究團隊做了一件挺較真的事情:他們把"圖片說明文字寫得好不好"這個模糊的問題,拆解成了兩個可以精確測量的維度,然後去驗證這兩個維度到底分別對哪種下游AI任務更重要。這項工作叫CAPEval
。
一個被長期混淆的問題:全面和準確,從來不是一回事
我們先從一個具體的例子開始。
假設有一張遊樂園的照片,裡面有紫色的過山車軌道、人造棕櫚樹、一個裝滿白色泡沫的游泳池,還有背景里的城市天際線。現在有兩段描述文字:
第一段寫了五百個字,幾乎把畫面里能看到的所有元素都點到了,但裡面有一處把紫色的過山車軌道說成了粉色。
第二段只寫了一百個字,只描述了游泳池和棕櫚樹,但每一句話都準確無誤。
傳統的圖片說明評估方法,比如老牌的BLEU、METEOR、CIDEr這些指標,會把這兩段文字壓縮成一個單一的分數,然後告訴你哪個"更好"。但這個單一分數背後,其實混雜了兩種完全不同的東西:一個是這段話覆蓋了多少真實資訊(覆蓋度
),一個是這段話里說的東西有多少是對的(準確度
)。
這就好比你讓兩個學生寫讀後感,一個學生洋洋灑灑寫了五頁紙,把書里的情節都提了一遍,但記錯了好幾個人名和事件順序;另一個學生只寫了半頁,但每個細節都精準無誤。如果老師只給一個"綜合分",你根本不知道該表揚誰的哪種能力。如果不把這兩種能力分開評分,你既沒法告訴第一個學生"你的問題出在準確性上",也沒法告訴第二個學生"你該多寫點"。
CAPEval做的第一件事,就是把這兩種能力從一個混沌的總分里拆出來,變成兩個獨立的、可以分別測量的指標。
**覆蓋度(Coverage)衡量的是描述文字觸及了多少真實存在的資訊,準確度(Precision)衡量的是這些被提到的資訊里有多少是真的對。**
這兩個概念聽起來簡單,但真正難的是怎麼把它們量化。
怎麼給一張圖片評分:先造一份"標準答案",再拆成50道判斷題
要衡量"覆蓋度"和"準確度",你得先有一個客觀的參照系,不能靠感覺。CAPEval的做法是,先請專業標註員為每張圖片寫一段極其詳盡的人工描述,當作"標準答案"(Ground Truth,簡稱GT)。
> Ground-Truth Caption(GT caption):由人工標註員撰寫的、被當作參照標準的圖片描述文字,用來對比其他AI生成的描述是否準確全面。
這份標準答案有多詳細?論文裡給出的示例平均長度達到346個單詞,最長的一份能有545個單詞。標註員被要求覆蓋五個方面:畫面里的主體和場景關係、圖中出現的所有文字內容(原樣照抄,不做翻譯)、攝影美學層面的屬性比如色調和光線、如果有人物則描述其外貌姿態,還有一些特殊的圖像屬性比如是否有水印或者是拼接圖。而且標註要求極其嚴格,只能寫客觀可見的內容,不能猜測,不能重複描述同一個東西兩次。
寫完之後,這份長篇描述還要經過第二個標註員的審核,才能定稿。
但光有一段長文字標準答案還不夠,因為你沒法直接拿一段AI生成的文字和一段人工標準答案做逐字對比來評分,兩段話措辭不同,順序不同,根本沒法機器判斷。
於是CAPEval做了第二步,把這段長文字標準答案,拆解成一份份原子化的檢查清單。
> 原子化檢查清單
(Atomic Checklist):把一段完整的圖片描述,拆解成一條條只包含單一事實、可以用"是/否"回答的判斷題。比如"圖中是否提到了紫色的過山車軌道","過山車軌道是否被描述為紫色",這類問題分開列出。
還是拿遊樂園那張照片舉例,標註員會把那五百字的描述拆解成"是否提到了紫色過山車軌道"、"軌道是否被描述為彎曲向上"、"左側的大棕櫚樹是否被描述為遮擋了視線"這樣一條條獨立的判斷題。論文裡公布的完整示例里,這一張圖片被拆出了56道判斷題,涵蓋了從物體識別到空間關係的方方面面。
平均下來,每張圖片能拆出大約50條這樣的判斷題,覆蓋了物體實例、屬性、關係、圖像整體資訊、文字、人物、界面元素、世界知識這八個語義維度。
這個設計的巧妙之處在於,它把一個模糊的"這段話寫得好不好"的問題,轉化成了一堆具體的、可以機器批量判斷的"是/否"小問題。這就好比考試改卷,與其讓老師憑感覺打一個"這篇作文寫得不錯"的模糊分數,不如把作文拆成"是否點明了主題"、"是否有具體例證"、"是否有語法錯誤"這樣一條條評分細則,每一條都能客觀核對。如果不拆解成這麼細的原子問題,評判標準就只能靠評分者的主觀感受,不同的人打出來的分數根本沒法比較,也沒法告訴AI具體是哪裡錯了。
有了這份檢查清單之後,接下來的評分過程就變得機械化了。研究團隊用一個叫Qwen2.5-72B的大語言模型當裁判,讓它只根據候選AI生成的描述文字,逐條判斷檢查清單里的每一項是"提到且正確"、"提到但錯誤",還是"完全沒提到"。
> Qwen2.5-72B:阿里巴巴開發的一個擁有720億參數的大語言模型,在CAPEval中被用作自動裁判,負責判斷候選描述文字是否正確覆蓋了檢查清單里的每一條事實。
基於這三種判斷結果,覆蓋度和準確度這兩個分數就可以用簡單的公式算出來了。覆蓋度等於(提到且正確的條目數加上提到但錯誤的條目數)除以檢查清單總條目數,衡量的是這段描述文字"敢不敢提"這些事實。準確度等於提到且正確的條目數除以(提到且正確加上提到但錯誤)的條目數,衡量的是"提到的東西里有多少是真的對"。
300張圖片,14965條檢查項:這份基準數據集有多紮實
光有方法論還不夠,評測的圖片本身質量也很關鍵。研究團隊精心挑選了300張圖片,覆蓋四大類場景:日常場景與物體、人物與活動、文字與界面、設計與知識類圖片。這些圖片來源廣泛,解析度跨度極大,最高能達到8000乘以6618像素,比很多同類基準測試用的圖片清晰度高出一大截。
為什麼圖片解析度這麼重要?因為解析度越高,圖片裡能承載的細節就越多,也就越能考驗AI描述文字的精細程度。一張模糊的照片,你怎麼寫都容易蒙對;但一張8K解析度的照片,裡面藏著的每一處細節都可能成為AI說錯話的陷阱。
整個數據集累計標註了14965條檢查項,平均每張圖片49.88條,覆蓋率達到100%的維度包括物體實例、屬性、關係和整體圖像資訊,這四類是每張圖片都會涉及的基礎維度。而文字、人物、界面、世界知識這四個維度則根據圖片內容按需出現,比如只有出現了人物的圖片才會有人物相關的檢查項。
跟同類型的基準測試比起來,CAPEval的密度優勢非常明顯。論文裡給出的對比數據顯示,此前的基準測試比如NoCaps、Flickr30K,標準答案平均只有16到18個單詞,檢查清單條目更是少到只有1到3條。而CAPEval的標準答案平均346個單詞,檢查清單平均50條,幾乎是此前工作的十幾倍到幾十倍。
這個密度差距意味著什麼?就像用放大鏡和用肉眼去檢查同一件產品的瑕疵,肉眼能發現的問題可能就那麼幾個明顯的,但放大鏡下會暴露出更多細微的缺陷。檢查清單越密集,越能精確捕捉AI描述文字里那些細枝末節的錯漏,而不是只看個大概齊。
十個AI"記者"上場:誰寫得又全又准
有了評分工具,接下來就該請AI來"實戰考試"了。研究團隊挑選了來自四個模型家族的十個開源圖片描述模型,包括InternVL3.5系列(1B、4B、8B、38B四種規模)、Qwen3-VL系列(4B、8B、32B)、LLaVA-OneVision-1.5系列(4B、8B),還有GLM-4.6V-Flash,另外還拿了幾個閉源的頂尖模型比如Gemini和GPT-5.5做參照對比。
結果非常有意思。閉源的頂尖模型確實兩項指標都表現不錯,比如Gemini-3.1-Pro的覆蓋度達到80.2分,準確度更是高達82.5分,兩頭都硬。但在開源模型陣營里,覆蓋度的分數從41.2一路跨越到68.5,準確度的分數從45.1跨越到86.1,跨度都相當大。
更關鍵的發現是,覆蓋度和準確度這兩個指標之間,壓根沒有一種"分數越高就越同步"的正相關關係。
有的模型走的是"廣撒網"路線,比如InternVL3.5-1B,覆蓋度能到48.3,但準確度只有65.2,說明它敢說很多東西,但說錯的概率也不低。而InternVL3.5-4B和8B這兩個模型走的是相反的路線,覆蓋度只有45.0和46.5,但準確度分別達到73.5和72.6,說話謹慎,但說出來的基本可靠。
這就好比兩種記者寫新聞報道,一種記者敢寫敢猜,報道資訊量很大,但經常出錯需要更正;另一種記者惜字如金,每篇報道字字有據,但讀者總覺得資訊量不夠。如果雜誌社不區分這兩種能力單獨考核,只看"稿子寫得好不好"這個籠統評價,那這兩位記者永遠沒法各自揚長避短。
真正的懸念:這些"性格"不同的說明文字,餵給下游AI訓練之後會怎樣
前面說的都還只是給圖片說明文字本身評分,屬於紙上談兵。研究團隊真正的野心在於,他們想搞清楚這些"覆蓋度高但準確度低"或者"準確度高但覆蓋度低"的說明文字,拿去訓練AI模型之後,到底哪種更管用。
這一步是整篇論文裡我認為最紮實的地方,因為他們做的是一個真正的端到端對照實驗。什麼意思?就是把圖片描述文字當成唯一的變量,其他所有條件——用的圖片、模型架構、訓練步數、優化器設置——全部鎖死不變,只換掉訓練用的說明文字來源。這樣一來,如果下游AI的表現出現了差異,那這個差異就只能歸因於說明文字本身的質量差異,而不是別的什麼干擾因素。
> 端到端評測
(End-to-End Evaluation):不只是孤立地給AI生成的描述文字評分,而是把這些文字實際用於訓練下游模型,通過下游模型的最終表現來反推描述文字的真實價值。
這個思路聽起來樸素,但此前的行業慣例其實並不是這麼做的。此前大多數評測基準,比如DOCCI和DetailCaps,都只是把生成的描述文字當作孤立的輸出去評分,從沒有真正測試過這些描述文字拿去訓練模型之後效果如何。這就好比你去評價一種食材的好壞,只聞了聞味道就下結論,卻從來沒有真正把它做成菜端上桌嘗過。
CAPEval搭建了兩條理解類任務的訓練流水線和兩條生成類任務的訓練流水線。理解類任務,也就是讓AI看圖回答問題的視覺語言模型
(VLM),用了兩種不同的視覺編碼器和語言模型組合,一種是CLIP配Vicuna-7B,另一種是SigLIP配Qwen3-4B。
> 視覺語言模型(VLM,Vision-Language Model):能同時處理圖片和文字的AI模型,典型能力是看圖回答問題、描述圖片內容。
生成類任務,也就是根據文字生成圖片的文生圖模型
(T2I),用了Stable Diffusion 3.5 Medium和Qwen-Image兩種主流的擴散模型架構進行微調。
> 文生圖模型(T2I,Text-to-Image):根據輸入的文字描述,生成對應圖片內容的AI模型。
整個訓練過程分為兩個階段。第一階段是視覺語言對齊階段,兩條理解類流水線都用同樣一批558K的固定描述文字數據,這一步不引入任何變量。真正的變量出現在第二階段的正式訓練里,研究團隊從COCO、SAM、LLaVA/LCS這幾個公開數據集裡抽取了120萬張圖片,然後分別用十個不同的AI模型給這些圖片生成描述文字,用這120萬套不同來源的描述文字去訓練同樣架構的模型,其餘配置全部保持一致。
生成類任務這邊同理,從同一批120萬圖片池裡抽取5萬張用於Stable Diffusion的微調,10萬張用於Qwen-Image的微調,配套的說明文字同樣是十個不同AI模型各自生成的一套。
理解類模型訓練完之後,要在16個基準測試上做全面考核,包括通用多模態理解能力、多模態推理能力、視覺感知能力和幻覺
魯棒性這四大類。生成類模型則在T2I-CompBench++、GenEval和DPG-Bench這三個基準上考核,分別對應組合式生成能力、物體級準確度和長指令跟隨能力。
反直覺的發現:不是模型越大,說明文字就越有用
先說一個在InternVL3.5這個模型家族內部觀察到的現象,這個現象直接顛覆了很多人的默認預期。
按照常理推斷,同一個模型家族裡,參數規模越大的版本,理解能力應該越強,寫出的圖片描述應該也越有價值,拿去訓練下游模型效果理應更好。
但實際數據完全不是這樣。
InternVL3.5家族裡的1B、4B、8B三個版本,在理解類任務的下游得分排名是1B(58.5分)大於4B(57.5分)大於8B(57.3分)。而在生成類任務里,排名又變成了4B(71.6分)大於8B(71.0分)大於1B(70.1分)。
**這意味著最大的模型,未必是最有用的說明文字來源。**
為什麼會這樣?答案就藏在覆蓋度和準確度這兩個指標里。1B模型雖然參數最少,但它的覆蓋度反而是三者中最高的(48.3),也就是說它雖然模型小,但"敢寫",願意把畫面里更多的東西都提一嘴。而4B模型的準確度是三者中最高的(73.5),說明它雖然規模不算最大,但寫出來的每句話可信度更高。
這就好比一個剛畢業的實習記者和一個經驗豐富的資深編輯同時去採訪一個新聞事件。實習記者寫得沒那麼老練,但初生牛犢不怕虎,把現場看到的每個細節都事無巨細地記下來,哪怕有些細節記錄得不夠精準。而資深編輯則更謹慎,只寫自己有把握的部分,字字斟酌,但篇幅相對克制。如果你要的是一份"資訊量足夠全面"的初稿去做後續加工,實習記者的稿子可能反而更有用;但如果你要的是一份"直接能拿去發表"的定稿,編輯的稿子顯然更可靠。模型規模大小,跟它到底適合哪種任務,完全是兩碼事。
系統性回歸分析:理解任務靠覆蓋度,生成任務靠準確度
單看InternVL3.5家族內部的這個現象,還只能算個案例,說服力有限。研究團隊接下來做了一件更嚴謹的事情,把十個不同家族、不同規模的AI模型的覆蓋度和準確度分數,和它們各自訓練出來的下游模型表現,放在一起做統計學上的回歸分析。
具體的做法是,對每一條下游任務的流水線,分別擬合一個線性回歸模型,用覆蓋度和準確度這兩個變量去預測下游得分,然後看每個變量的係數大小和統計顯著性(也就是p值,p值越小說明這個變量和結果之間的關聯越不可能是巧合)。
> p值(p-value):統計學中用來衡量"某個觀察到的關聯是不是純屬偶然"的一個數值,p值越小,說明這個關聯越有可能是真實存在的,而不是隨機波動造成的假象。
結果非常一致,而且和InternVL3.5家族內部觀察到的規律完全吻合。
對於理解類任務,覆蓋度是顯著的正向預測變量。在SigLIP配Qwen3的流水線上,覆蓋度的回歸係數是正0.118,p值是0.026,這個數值小於常規統計學裡0.05的顯著性門檻,說明這個關聯是真實可靠的。而準確度的p值高達0.274,遠超顯著性門檻,說明準確度和理解任務表現之間的關係,從統計上看更像是噪音,站不住腳。
在CLIP配Vicuna的流水線上同樣如此,覆蓋度係數正0.215,p值0.047,勉強踩線顯著;準確度的p值是0.445,同樣不顯著。
對於生成類任務,情況完全反過來了。在Stable Diffusion 3.5這條流水線上,準確度的回歸係數是正0.189,p值小於0.001,這是極強的顯著性信號。而覆蓋度的p值是0.322,完全不顯著。
在Qwen-Image這條流水線上,準確度係數正0.235,p值同樣小於0.001,覆蓋度的p值是0.171,依舊不顯著。
**理解類任務偏愛覆蓋度廣的描述文字,生成類任務偏愛準確度高的描述文字,這個規律在四條完全獨立的訓練流水線里反覆得到驗證。**
這個結果背後的道理其實可以想明白。理解類模型的核心任務是讓AI"見多識廣",學會識別各種各樣的視覺概念和它們之間的關係,說明文字覆蓋的語義範圍越廣,模型接觸到的視覺概念種類就越多,學習的素材就越豐富。哪怕這些描述文字里偶爾有個別錯誤,只要總體覆蓋面廣,模型依然能從海量樣本里提煉出正確的規律,個別噪聲會被大量數據平均掉。
而生成類模型的任務完全不同,它要根據一句話精確地畫出對應的畫面,這時候文字和圖像之間的對應關係必須精確無誤。如果訓練數據里的說明文字經常把顏色、位置這些具體細節說錯,模型學到的就是錯誤的文字圖像映射關係,之後你讓它按提示詞畫圖,它畫出來的東西自然也會文不對題。這就好比教一個學徒畫肖像畫,如果師傅一直告訴他"這個人的眼睛是藍色的"(其實是棕色),學徒學到的就是一套錯誤的對應關係,以後每次遇到類似描述都會畫錯;但如果只是讓學徒多看各種各樣的人物畫像積累見識,哪怕偶爾師傅講錯一兩個細節,學徒的整體審美判斷力依然能培養起來。如果不區分這兩種任務對說明文字的不同需求,用同一批數據不加區分地餵給理解模型和生成模型,兩邊都得不到最適合自己的訓練素材。
一個例外:幻覺問題,準確度才是關鍵
前面說理解類任務偏愛覆蓋度廣的說明文字,但這個規律有一個重要的例外,那就是幻覺問題。
> 幻覺(Hallucination):AI在描述或回答時,編造出圖片裡根本不存在的內容,是多模態AI一個常見且棘手的缺陷。
研究團隊專門針對HallusionBench、POPE、AMBER這三個專測幻覺能力的基準做了單獨的回歸分析,結果顯示準確度的p值是0.124,雖然沒有達到嚴格的統計顯著性門檻,但明顯比覆蓋度的p值(高達0.914)更有說服力。
這個發現說明了一件很直觀的道理:如果你想讓AI"少說錯話",那麼訓練數據里的說明文字本身就得少說錯話。你沒法指望用一堆錯漏百出的訓練素材,訓出一個從不胡說八道的模型。這跟前面覆蓋度主導的整體理解能力形成了一個有意思的對照,說明"理解得全"和"不瞎編亂造"這兩種能力,其實分別對應著說明文字的不同質量維度。
這項工作到底帶來了什麼
回過頭來梳理一下,CAPEval這項工作解決的核心問題,是把長期以來被混為一談的"說明文字質量"拆解成了覆蓋度和準確度兩個可以獨立測量的維度,並且通過大規模、多流水線的端到端對照實驗,驗證了這兩個維度對不同下游任務的影響存在顯著且一致的差異。
這個發現對實際做數據工程的人來說,價值非常具體。如果你正在為訓練一個視覺語言模型準備說明文字數據,你應該優先選擇那些願意多說、覆蓋面廣的描述文字來源,哪怕它偶爾犯點小錯也無妨。而如果你在為訓練一個文生圖模型準備數據,你反而應該更看重描述文字的可靠性,寧可資訊量少一點,也不能出現張冠李戴的錯誤。
這種思路其實可以類比到更廣泛的場景里去。企業招人的時候常常也會陷入類似的誤區,招聘方喜歡用一個籠統的"綜合質素分"去評價候選人,卻忽略了不同崗位其實需要完全不同的能力組合。銷售崗位可能更需要"廣撒網、見人說人話"的溝通面,容錯率相對較高;而財務審計崗位則必須"句句為實",一個數字算錯都可能是災難性的。如果拿同一套"綜合分"標準去篩選這兩類完全不同的崗位,招錯人的概率自然會大幅上升。
這項工作的意義,恰恰在於提醒我們,評價一件事物的"好壞",從來都不該只用一個籠統的分數了事,而應該先搞清楚這件事物到底是要服務於哪個具體目的。
寫在後面
讀完這篇論文,我印象最深的其實不是那個"覆蓋度對應理解、準確度對應生成"的核心結論,而是InternVL3.5那組數據背後透露出的一個更微妙的東西:模型參數量這個我們習以為常的"質量代理指標",在具體的下游應用場景里,可能壓根靠不住。
我們太習慣用參數規模去判斷一個AI模型"好不好"了,8B聽起來就應該比4B強,這幾乎成了一種下意識的信仰。但這篇論文用一個乾淨利落的對照實驗告訴你,真正重要的從來不是參數量本身,而是這個模型產出的數據"性格"跟你要用它做什麼事情之間到不到位。
還有一個細節值得單獨說一下,那就是研究團隊構建檢查清單的方式。他們沒有讓AI裁判直接對著圖片評分,而是先讓人工寫出極其詳盡的標準答案,再把這段文字拆解成一條條原子化的判斷題,最後才讓AI裁判去比對候選文字和檢查清單。這個"先人工寫長文本、再拆解成檢查清單"的兩步走設計,其實是在用人力去校準機器評判的邊界,避免讓AI自己既當運動員又當裁判。
這讓我想到一個還沒有被回答的問題:如果說明文字本身還可以細分成覆蓋度和準確度,那影片描述、3D場景描述這些更複雜的多模態數據,是不是也存在類似的、被我們長期混為一談的多個獨立維度?這篇論文打開的可能只是冰山一角。
Q&A
Q1:CAPEval是什麼?
A:CAPEval是一個針對圖片說明文字(caption)的解耦評測基準,它把傳統評測里混為一談的單一質量分數,拆解成覆蓋度(Coverage)和準確度(Precision)兩個獨立指標,並通過實際訓練下游AI模型來驗證這兩個指標各自的價值。
Q2:為什麼說圖片說明文字的覆蓋度和準確度是兩回事?
A:覆蓋度衡量的是描述文字提到了多少真實存在的畫面資訊,準確度衡量的是提到的這些資訊里有多少是對的。研究發現這兩個指標之間沒有正相關關係,有的AI模型敢寫但容易出錯,有的AI模型寫得少但基本可靠,二者是完全獨立的能力維度。
Q3:CAPEval的研究發現對訓練AI模型有什麼實際用處?
A:研究發現視覺語言理解類模型的訓練更依賴說明文字的覆蓋度廣不廣,而文生圖生成類模型更依賴說明文字的準確度高不高。這意味著做數據工程時應該根據下游任務目標,針對性地挑選或優化說明文字來源,而不是用一個籠統的質量分數去篩選數據。






