這項由香港大學、北京大學與字節跳動Seed部門聯合完成的研究,以預印本形式於2026年7月13日發布,論文編號為arXiv:2607.11886。感興趣的讀者可以通過該編號在arXiv平台上找到完整論文。
每當你用一段文字描述去讓AI畫圖,比如"一隻橙色的貓坐在藍色的椅子左邊",你心裡總有個擔憂:AI畫出來的東西,真的符合我說的要求嗎?貓的顏色對嗎?位置關係對嗎?這個"對不對"的判斷,正是整個AI圖像生成領域最核心、也最棘手的問題之一。
研究團隊在這個問題上找到了一個格外巧妙的切入角度。他們的核心想法是:與其正面問AI"你畫得對不對",不如反過來考它——把畫好的圖片給另一個AI看,問它:"你能從這張圖裡,猜回我當初說了什麼話嗎?"如果猜得准,說明圖畫得好;猜不准,說明圖和描述之間有偏差。這個"反向猜題"的思路,就是整篇研究的靈魂所在。研究團隊把這套方法命名為**SpectraReward**,並在此基礎上進一步發展出了**Self-SpectraReward**這個更進一步的變體。
---
一、為什麼AI畫圖需要一個"審查官"
要理解這項研究,先要搞清楚AI圖像生成的基本工作方式。目前最先進的文字生成圖片系統,大致分為兩類:一類是專門的"畫圖選手",比如Stable Diffusion或FLUX,它們只負責把文字變成圖;另一類是"全能選手",也就是既能理解圖片、又能生成圖片的統一多模態模型(Unified Multimodal Models,簡稱UMM),比如研究中用到的BAGEL。
這些系統在生成圖片時,往往無法保證畫出來的內容百分之百符合文字描述。顏色搞錯、數量不對、空間關係顛倒,這些都是常見的毛病。為了讓AI畫得更準確,研究者通常藉助"強化學習"這種訓練方式——說白了,就是給AI的每次畫圖行為評分,畫得好就鼓勵它,畫得差就讓它反思,通過反覆練習來提升水平。
評分的工具,就是"獎勵模型"(Reward Model)。這個獎勵模型就像一位嚴格的美術老師,負責評判每一張圖的優劣。問題在於,請一位靠譜的老師實在太貴了。
現有的獎勵模型大致分兩種路線。第一種是花大力氣收集海量的"人類偏好數據",讓真人給圖片評分,然後訓練一個專門的評分模型。這條路費時費力,而且收集到的數據容易帶有偏見,難以疊代更新。第二種路線是直接拿已經訓練好的多模態大語言模型(MLLM,可以理解為既懂圖又懂文字的超級AI)來充當評委,讓它看圖說話,或者回答"這張圖里有沒有一隻貓"這類問題。這條路省去了數據收集的麻煩,但又帶來了新問題:直接讓AI評分,它給出的分數往往不夠穩定,容易受到問法和語氣的影響;而把描述拆解成一堆小問題來逐一驗證,工程複雜度又很高。
研究團隊正是在這個空白地帶,找到了自己的位置。
---
二、"反向猜題":SpectraReward的核心思路
SpectraReward的工作原理,可以用一個生活場景來理解。假設你給朋友描述了一道菜:"一盤擺在木桌上的、撒了芝麻的紅燒肉,旁邊配著一碟醃黃瓜。"朋友照著描述做了一道菜。現在,你把做好的菜的照片給另一個從未聽過描述的人看,問他:"你能描述出這道菜是什麼樣的嗎?"如果他能說出"紅燒肉、芝麻、木桌、醃黃瓜",那說明朋友的菜做得很到位;如果他只看到了"一盤肉",那說明菜和描述之間存在明顯的落差。
SpectraReward做的事情,在數學上的精確表述是這樣的:把生成的圖片作為視覺輸入,交給一個凍結的(即不需要額外訓練、直接拿來用的)預訓練多模態大語言模型,然後讓這個模型在看著圖片的前提下,逐字逐詞地"預測"原始文字描述里每個詞出現的可能性。每個詞被預測出來的可能性越高,說明這張圖越能支持這段描述。把所有詞的可能性取平均,就得到了最終的獎勵分數。
研究團隊把每個詞的可能性分布,形象地稱為該圖片與文字對之間的"語義頻譜"(Semantic Spectrum)。這個頻譜就像一張細密的網,記錄了圖片在語言層面上對每一個文字要素的支持程度。
這個方法有幾個明顯的優勢。首先,它完全不需要額外訓練,任何已有的預訓練多模態大語言模型拿來就能用。其次,它只需要一次前向推理(forward pass),計算效率很高,不像問答拆解那樣需要反覆調用模型。再者,它給出的是連續的、細粒度的概率信號,而不是離散的1到5的評分,信號更豐富、更穩定。
研究團隊還專門分析了一個可能的疑慮:語言模型本身有"語言先驗"——有些詞本來就容易被預測,跟圖片無關。比如"的""了""在"這類功能詞,無論配什麼圖都容易被猜出來。這是否會干擾獎勵信號的準確性?
答案是:在強化學習的具體使用場景下,這個問題自動消失了。因為強化學習的訓練方式是"組內比較"——同一段文字描述生成的一批圖片互相比較,誰更好就鼓勵誰。對於同一段描述,"語言先驗"對所有圖片的影響是完全一樣的,相互抵消,不影響排名結果。
---
三、"自我評分":Self-SpectraReward的閉環升級
SpectraReward的進一步演化,催生了Self-SpectraReward這個更加優雅的方案。
理解它的關鍵,在於理解"統一多模態模型"的特殊結構。像BAGEL這樣的模型,內部同時包含兩個分支:一個"生成分支"負責把文字變成圖;一個"理解分支"負責看圖說話。這兩個分支共享同一套底層架構,包括詞表、視覺編碼器和預訓練數據分布。
Self-SpectraReward的想法非常直接:既然模型的理解分支本來就能"讀圖",為什麼不讓它來評價自己的生成分支畫出來的圖呢?用理解分支來給生成分支評分,用自己理解自己,形成一個完全不依賴外部模型的"閉環自我提升"框架。
這個設計除了省去了調用外部大模型的計算成本,還有一個更深層的結構優勢。理解分支和生成分支共享同一套"視覺語言",它們看圖的方式天然匹配。就像一個人用自己的眼光來審視自己畫的畫,比請一個審美完全不同的陌生人來評價,往往能給出更有針對性的反饋。研究團隊將這種特性稱為"獎勵-策略對齊"(Reward-Policy Alignment)——獎勵模型與被訓練模型之間的分布匹配程度。
這個概念後來成為整篇研究中最有意思的發現之一。
---
四、"語義頻譜"真的能捕捉細節嗎?
在正式開展大規模實驗之前,研究團隊先做了一系列精心設計的分析,來驗證SpectraReward的"眼力"是否足夠準確。
他們構造了兩類典型的圖文不匹配場景。第一類是"屬性錯誤",用數量來舉例:描述是"兩隻貓坐在沙發上",但對比圖里變成了"五隻貓"。第二類是"物體錯誤":描述是"一把靠在牆上的木吉他",但對比圖里把吉他換成了一把椅子。
對每對圖片,研究團隊都用同一段正確的描述來計算SpectraReward,然後逐詞觀察概率變化。結果非常直觀。在第一類場景里,"兩隻"這個詞在五貓圖上的預測概率急劇下降,其他詞變化不大。在第二類場景里,"吉他"這個詞的預測概率在椅子圖上幾乎跌到谷底,同樣其他詞幾乎不受影響。把所有詞的概率取平均之後,正確圖片對應的獎勵分數明顯高於錯誤圖片。
這說明SpectraReward不只是給出一個模糊的"整體評分",而是真正在詞語層面上感知到了圖文之間的語義偏差,具有細粒度的辨別能力。
研究團隊還進一步驗證了獎勵排序的可靠性。他們拿出同一段描述生成的多張圖片,按照SpectraReward的分數從低到高排列,然後請人來對照文字描述判斷圖片質量。結果顯示,獎勵分數的排名與人類判斷的質量排名高度一致:分數高的圖片,確實更完整地包含了描述中的物體、屬性和空間關係;分數低的圖片,往往缺少某些要素或存在明顯錯誤。
---
五、大規模實驗:數字背後的真實進步
驗證了SpectraReward的理論可靠性之後,研究團隊展開了一場規模宏大的實驗。這場實驗覆蓋了兩種不同的圖像生成模型(SD3.5-M和BAGEL),三種不同的強化學習訓練算法(FlowGRPO、AWM、DiffusionNFT),九種來自四個不同模型家族的獎勵用多模態大語言模型(參數量從40億到2350億不等),以及五個完全不同於訓練數據的下游評測基準(GenEval、TIIF-Bench、DPGBench、GenEval2、WISE)。
以BAGEL作為被訓練的圖像生成模型為核心實驗場景,訓練解析度設定為512×512,每次訓練步驟使用32個文字描述,每個描述同時生成16張圖進行組內比較。獎勵最好的強化學習算法被確認為AWM(Advantage Weighted Matching,一種基於優勢權重匹配的訓練方式),因此主實驗均採用AWM。訓練使用了32塊A100顯卡,總共進行380個訓練步驟。
實驗結果相當亮眼。在512解析度推理條件下,與原始BAGEL基線相比,SpectraReward在TIIF-Bench短文本和長文本總體得分上分別提升了10.0和6.2分;Self-SpectraReward在GenEval上則帶來了5.5分的提升。對比另一個強化學習基線AlphaGRPO,SpectraReward在TIIF-Bench短文本上領先6.3分,長文本領先5.3分,GenEval領先3.3分。
特別值得一提的是,所有訓練都在512解析度下完成,但在1024解析度的推理測試中同樣取得了顯著提升。Self-SpectraReward在1024解析度下,GenEval達到89.8分,GenEval2達到34.3分。在強調世界知識理解能力的WISE基準上,Self-SpectraReward配合模型自身的思維鏈推理,達到了0.76的總分,超越了所有對比方法。
從不同評測維度來看,進步並非集中在某個單一類別上。在GenEval的細分類別中,計數、空間位置和顏色-屬性綁定這些需要複雜組合理解的場景,提升幅度最為突出。在TIIF-Bench中,從基礎屬性跟隨到高級推理組合再到設計師風格提示詞,各個子類別均有可觀的改善。在DPG-Bench中,關係理解和屬性敏感度方面的提升也清晰可見。
---
六、獎勵模型的"最佳體型":規模越大不一定越好
這場大規模實驗還帶來了一個反直覺的發現,顛覆了"越大越好"的常識性判斷。
研究團隊系統地測試了Gemma3、InternVL3.5和Qwen3-VL三個模型家族,參數量從40億一路覆蓋到2350億。結果呈現出一種非單調的模式,也就是說,並非參數越多,獎勵模型就越有用。
以Qwen3-VL家族為例,從8B(80億參數)擴展到30B(300億參數)確實帶來了全面的指標提升,但繼續擴大到235B(2350億參數)反而出現了明顯的下降。在Gemma3家族裡,從4B擴到12B改善了GenEval,但對TIIF-Bench的提升卻不夠穩定。
研究團隊對此給出的解釋很有說服力:更大的多模態大語言模型在預訓練和微調過程中,往往把更多能力分配給了複雜的視覺推理和多任務指令跟隨,而SpectraReward實際需要的,是最基礎的"看圖猜描述"能力——這種能力在中等規模的模型上就已經基本飽和了。對SpectraReward來說,30B級別的模型是一個性價比最高的甜蜜點。
另一個有意思的發現是,預訓練階段的模型往往比經過指令微調的版本更適合充當獎勵模型。Gemma3-12B的預訓練版本在三個評測基準上的表現全面優於經過指令微調的12B版本。原因同樣合理:預訓練階段大量接觸了圖文配對數據,直接學會了"看圖猜文字"這件事;而指令微調更側重於回答問題、執行任務,偏離了SpectraReward所需要的核心能力。
---
七、最出乎意料的冠軍:Self-SpectraReward打敗了比自己大30倍的模型
如果說上面的發現已經夠驚喜,那麼Self-SpectraReward的實驗結果更是令人側目。
使用BAGEL自身的理解分支作為獎勵模型的Self-SpectraReward,不僅在同等規模的獎勵模型中表現最好,甚至在GenEval、GenEval2和WISE等關鍵指標上,超過了使用Qwen3-VL-235B(2350億參數,大約是BAGEL的30倍)作為獎勵模型的SpectraReward版本。
這個結果直接印證了研究團隊關於"獎勵-策略對齊"的核心假設。BAGEL的理解分支和生成分支共享同一套視覺編碼器、詞表和預訓練分布,它"看"BAGEL生成的圖片時,與BAGEL"想像"圖片時的內部表徵天然吻合。這種內在的匹配,讓自我評價的信號比任何外部大模型的評價都更精準、更有針對性。
這就好比一位畫家用自己的審美標準來評價自己的作品,往往比找一個審美體系完全不同的評論家來評分,能給出更有指導意義的反饋。這不是因為畫家的審美更高,而是因為他的審美和他的創作風格高度匹配。
這個發現對整個領域有重要的方法論啟示:在構建強化學習獎勵模型時,獎勵信號與被訓練模型之間的分布匹配程度,可能和獎勵模型的絕對規模同等重要,甚至更重要。
---
八、不同評分方式的比較:為什麼"猜題"比"評分"更靠譜
研究團隊還專門對比了三種利用多模態大語言模型來構建獎勵信號的不同方式,以澄清SpectraReward的優越性從何而來。
第一種方式是直接讓模型給圖片打1到5分,用這個分數作為獎勵。實驗結果很不理想,GenEval的得分甚至比完全不做強化學習的基線下降了6.3分。原因在於,"評分"這個行為高度依賴模型的評分校準是否準確,不同模型、不同問法給出的分數尺度差異很大,很不穩定。
第二種方式是VQA-Score:把文字描述變成一個是非問題——"這張圖里有沒有[描述內容]?"——然後用模型回答"有"的概率作為獎勵。這種方式比直接評分稍好,在TIIF-Bench上有小幅提升,但在GenEval上仍然沒能超越基線。
第三種就是SpectraReward的圖文概率對數似然方法,在三個指標上全面領先。
研究團隊還比較了不同粒度的獎勵計算方式:直接把所有詞的概率平均成一個序列級別的獎勵(sequence-level),以及把每個詞的概率單獨作為一個獎勵信號、分別計算組內優勢然後再平均(token-level)。理論上,詞級別的方式能更精確地放大那些視覺資訊最集中的詞的權重。但實驗結果顯示,詞級別並不穩定地優於序列級別,因此默認採用序列級別的平均概率,更簡潔也更穩定。
---
九、實驗細節里的小發現
除了主要結論,研究團隊還記錄了幾個值得關注的實現細節。
在計算SpectraReward時,研究團隊排除了序列結束符(EOS token)。這個特殊符號標誌著一段文字的結束,它的預測概率更多受到序列長度和終止規律的影響,與圖文語義匹配關係不大。對於較短的描述,EOS會占據平均概率中較大的比重,從而稀釋真正有語義意義的詞的信號。去掉EOS後,GenEval有所提升,TIIF-Bench基本持平。
對於InternVL3.5系列模型,研究團隊發現加上前綴提示"描述這張圖"能給出更穩定的獎勵值,因此對該系列模型單獨做了這個處理,其他模型則不加任何前綴。
在Self-SpectraReward的實現中,BAGEL的理解分支可以選擇是否接收生成編碼器(VAE)輸出的視覺特徵,作為對語義編碼器(ViT)特徵的補充。實驗顯示,同時提供VAE特徵的效果更好,GenEval和TIIF-Short都有提升,TIIF-Long的改善尤為明顯。
---
說到底,這項研究提供的核心貢獻,是一種極度簡潔卻出人意料有效的評估思路:與其直接問AI"畫得好不好",不如反過來測試"能不能從圖裡讀回文字"。這個"讀圖反推"的思路,把一個模糊的主觀評分問題,轉化成了一個有明確數學定義的概率計算問題,同時還復用了多模態大語言模型在預訓練階段積累的大量圖文對齊能力,不需要任何額外訓練或偏好數據收集。
對於普通用戶來說,這項研究意味著未來你用文字描述生成的AI圖片,在顏色、數量、位置、屬性等細節上會更準確,"要一隻貓"就不會冒出五隻,"左邊的椅子"就不會跑到右邊去。對於研究者和開發者來說,Self-SpectraReward的結論更值得深思:打造更強大的AI,不一定總是需要更大的外部評審員,有時候讓模型"自我對話"、自己理解自己的輸出,反而是更有效的提升路徑。
這項研究也有清醒認識到自己的局限。SpectraReward計算的是文字描述中明確寫出的內容的對齊程度,對於那些"言外之意"——比如"熱咖啡"暗示應該有蒸汽——它可能反映不夠充分。此外,它不直接優化美學質量和安全性,這些方面仍需要配合專門的評估工具來使用。有興趣深入了解全部技術細節和實驗數據的讀者,可以通過arXiv編號2607.11886查閱完整論文。
---
Q&A
Q1:SpectraReward是怎麼判斷AI畫的圖好不好的?
A:SpectraReward把生成的圖片交給一個預訓練的多模態AI模型,讓它在看著圖片的同時,逐詞預測原始文字描述里每個詞出現的概率。概率越高,說明這張圖越能讓模型"猜回"原始描述,也就意味著圖和文字越匹配。把所有詞的概率取平均,就得到最終評分。
Q2:Self-SpectraReward為什麼能打敗比自己大30倍的模型?
A:Self-SpectraReward使用的是生成模型自身的理解分支來評分,這個理解分支和生成分支共享同一套視覺編碼器和預訓練數據,"看圖"的方式天然匹配生成圖片的分布。這種內在一致性讓自我評價的信號更精準,彌補了規模上的不足,在多個基準上超過了參數量大30倍的外部獎勵模型。
Q3:SpectraReward訓練出來的圖像生成模型,在哪些方面進步最明顯?
A:最顯著的改善集中在複雜組合場景,包括準確的物體數量、正確的空間位置關係(左/右/前/後)以及顏色-屬性的精確綁定。這些都是傳統方法容易出錯的細節,對應GenEval里計數、空間位置和顏色屬性等子類別得分的大幅提升。






