宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

PANORAMA:給AI裝上一雙能「指認」萬物的眼睛

2026年10月02日 首頁 » 熱門科技

你有沒有試過讓AI描述一張照片,然後再問它"你說的那個杯子在哪兒"?

大概率會發生這樣的事:它嘴上說得頭頭是道,什麼"桌上放著一個白色馬克杯",可你要它在圖上圈出來,它要麼圈錯了地方,要麼乾脆說不清楚。這就像一個人繪聲繪色地給你描述一件事,你追問細節的時候他卻支支吾吾。

這篇來自Inria、捷克技術大學等機構的論文,講的正是如何解決這個"說得出但指不准"的毛病。研究者們把這個任務起了個名字,叫全景接地式描述PANORAMA給AI裝上一雙能指認萬物的眼睛

全景接地式描述(panoptic grounded captioning):一種要求AI模型描述圖像中所有前景物體和背景區域,同時用像素級掩碼把每一個提到的短語都精確定位到圖像具體位置的任務。

說白了,就是既要"全說到",又要"指得准"。這兩件事湊在一起,比聽起來難得多。

一、這件事到底難在哪

先說說AI在這方面走過的彎路。

現在市面上那些做"圖文對齊"的模型,大致分兩條路。一條是像GLaMM、Sa2VA這樣的模型,它們生成一個特殊的[SEG]標記,用這個標記的隱藏狀態直接"解碼"出一張分割掩碼。另一條路是把分割結果編碼成離散的代碼,讓模型像生成文字一樣自回歸地"寫"出掩碼來。

這兩條路都有一個共同的軟肋:讓語言模型的表示直接承擔像素級預測的重活。

這就好比讓一個既要寫產品說明書又要親手畫施工圖紙的人。寫文字描述這個人可能很擅長,但精確到毫米級的圖紙繪製,需要的是完全不同的技能。如果非要用同一雙手同時幹這兩件事,結果往往是文字寫得潦草,圖紙畫得也不准。論文裡的實驗也印證了這一點:用直接生成掩碼的方式,比起論文提出的新方法,在PanoCapsPANORAMA給AI裝上一雙能指認萬物的眼睛測試集上gPQPANORAMA給AI裝上一雙能指認萬物的眼睛指標要低7.5個點,AP50更是低了整整20個點。這個差距集中出現在"精細分割"這一環,說明問題確實出在了"一心二用"上。

再看數據集這一頭,問題也不小。

現有的接地式描述數據集,要麼是GranD-f這種,標註是從別的任務里"順手"拿來的,一句話可能就是"雪地里的公園長椅",短得可憐,圖里大半東西都沒提到。要麼是COCONut-PanCap這種自動生成的數據集,規模是上去了,但質量堪憂,經常出現張冠李戴的錯誤,比如把衝浪板認成雪橇板,把乾枯的棕色地面說成綠草地。

數據質量差,模型學出來自然也差。這是這個領域一直沒被認真解決的兩個根子問題:模型架構設計得不合理,訓練數據質量跟不上。

二、PanoCaps:一份"較真"的數據集

研究團隊乾的第一件事,是自己動手做了一份高質量數據集,取名PanoCaps

PanoCaps:一個基於COCONut、ADE20K、VIPSeg等已有全景分割數據集構建的人工標註基準數據集,包含3470張圖片,約3.4萬個掩碼,3.13萬個被標註的實體。

這份數據集最打眼的一個數字是像素覆蓋率約99%。這意味著幾乎圖里所有能看見的東西,包括牆、地板、天空這些容易被忽略的背景區域,都被標註者用文字描述並且對應到了具體的掩碼上。

標註過程相當講究。團隊先做了一輪試標定協議,然後招募了最多15名標註員和8名審核員,對每張圖片的標註中位耗時約15分鐘,審核約12分鐘,累計投入了大約1530小時的人工時間。每一份標註都經過獨立verification,確保語言質量、區域覆蓋完整性和短語與掩碼對應關係的正確性。

這套流程聽起來繁瑣,但它換來的東西是自動化流水線換不來的:可信度。

打個比方,如果你想知道一份菜譜是不是真的好吃,你可以找一個AI根據菜譜文字自動生成"這道菜大概長這樣"的圖片,也可以找廚師真的做一遍拍照。前者快,但經常和實際不符;後者慢,但每一張圖都對得上文字。PanoCaps選的是後一條路,慢是慢了點,但換來的是每一個短語和每一塊像素之間真實可靠的對應關係。如果沒有這份較真,後面訓練出來的模型也只能學到似是而非的對應,那種"說得挺好但指不對"的毛病就沒法根治。

和COCONut-PanCap對比,在1550張兩個數據集共用的圖片上,PanoCaps引用了99.9%的可用掩碼,而COCONut-PanCap只有79.2%;像素覆蓋率上,PanoCaps是98.2%,COCONut-PanCap是65.4%,足足高了50%。

三、評價標準也得重新設計

有了好數據還不夠,怎麼評判一個模型做得好不好,本身也是個問題。

論文提出了一個叫gPQ的新指標:

廣義全景質量(generalized Panoptic Quality, gPQ):在傳統全景分割質量指標PQ的基礎上,把固定的語義類別匹配換成了自由文本短語的相似度匹配,同時保留了對掩碼重疊度的評估,讓指標既能衡量"說得對不對"也能衡量"指得準不準"。

為什麼要這麼改?因為傳統的召回率(Recall)這類指標有個漏洞:模型只要多預測一些區域,就能"蒙對"更多,哪怕預測里摻雜了大量胡亂猜測的錯誤結果。這就好比一個學生考試時把所有可能的答案都寫上,蒙對的概率自然更高,但這顯然不是我們想要的"會做題"。gPQ同時考慮了預測多出來的部分(假陽性)和漏掉的部分(假陰性),還把匹配上的那部分按照文字和掩碼的相似程度評分,不是簡單的對或錯。

論文還專門驗證了短語相似度的計算方式。以前的GCG評估協議用BERT詞向量做餘弦相似度,閾值設在0.5。但研究者發現這套方法有個大毛病:在一個專門測試詞語相關性的數據集BiRD上,98.8%的詞對(包括完全不相關的詞對)相似度都超過了0.5這個閾值,形同虛設。論文改用了效果更好的Sentence-BERT配合WordNet同義詞判斷,相關性和人類判斷的一致性從0.45提升到了0.72。

這個細節挺有意思的:一個看似客觀的自動化指標,實際上可能在系統性地放水。如果不改進這個指標,即便模型把"雪地里的花盆"錯認成"女士的棕色包",只要掩碼位置差不多重疊,舊指標依然會判定為匹配正確。這在論文的圖8里有個活生生的例子。

四、PANORAMAPANORAMA給AI裝上一雙能指認萬物的眼睛:讓AI學會"選"而不是"畫"

數據和評價標準都到位了,接下來就是核心的模型設計,這也是這篇論文的重頭戲,叫PANORAMA

PANORAMA:全稱是"通過掩碼提案選擇實現全景接地式描述"(PANOptic gRounded cAptioning via MAsk proposal selection),一個把短語接地問題轉化為"從候選掩碼池中挑選"的視覺語言模型。

這個思路的轉變值得好好說道說道。

以前的方法是讓[SEG]標記的隱藏狀態直接"畫"出一張掩碼,PANORAMA反其道而行之:先讓一個專門做分割的模型生成一堆候選掩碼,然後讓語言模型的表示去"挑"出哪些候選掩碼對應當前這個短語。

這就好比找工作時的簡歷篩選流程。一種做法是讓HR一個人憑空描繪出"理想候選人應該長什麼樣",然後照著這個想像去匹配簡歷,這個描繪過程本身就很容易失真。另一種做法是先讓招聘系統海選出一批符合基本條件的候選人(生成候選掩碼),然後由懂業務的HR從這批人里精準挑出最合適的(選擇匹配)。後者把"劃定範圍"和"精準判斷"這兩件不同性質的工作分開來做,各自發揮所長。如果非要一個人同時干兩件事,招聘效率和準確率都會打折扣,這和直接解碼掩碼的問題是一個道理。

具體來說,整個流程是這樣運作的。VLM在生成描述文字的時候,每提到一個可以定位的短語,就吐出一個[SEG]標記。這個標記最後一層的隱藏狀態,會被一個叫概念橋PANORAMA給AI裝上一雙能指認萬物的眼睛的小型投影網路轉換成一個概念向量

概念橋(concept bridge):一個學習得到的投影層,把VLM生成的[SEG]標記的隱藏狀態映射到分割模型能理解的提示空間裡,生成一個256維的"概念向量",作為連接語言模型和分割模型的接口。

這個概念向量接下來做兩件事。第一件事,它去"條件化"一個預訓練好的分割模型(論文用的是SAM 3PANORAMA給AI裝上一雙能指認萬物的眼睛),讓分割模型圍繞這個概念生成一批候選掩碼,一般是200個候選查詢。注意這裡的候選池是針對每個短語單獨生成的,而不是整張圖片生成一份通用候選池後所有短語共用。第二件事,一個輕量級的匹配評分器,會拿這個概念向量去和每個候選查詢做比對,算出一個相似度分數,超過閾值0.5的候選就被選中,作為這個短語對應的最終掩碼。

這套設計帶來了一個很實用的好處:因為是"選擇"而不是"生成單一結果",一個短語可以選中零個、一個或者多個候選掩碼,天然支持"這兩個人"這種指向多個對象的表達,也能優雅地處理"圖里沒有這個東西"的情況。相比之下,很多老方法要麼把多個實例硬塞進一張二值掩碼里,要麼得給每個實例單獨配一個分割標記,處理起來彆扭得多。

論文裡有個細節特別值得琢磨:為什麼要給候選池做"短語條件化",而不是像GROUNDHOG那樣,整張圖片生成一份候選池讓所有短語共用?

論文做了消融實驗,去掉短語條件化之後,gPQ掉了1.8個點,RefCOCO的cIoU掉了2.9個點,掉分最明顯的正是那種"同類物體擠在一起,需要精確區分某一個"的指代分割場景。這個結果說得挺清楚了:如果候選池不知道自己要找的是哪個具體對象,那麼當畫面里有好幾隻貓的時候,模型很難從一堆長得差不多的候選里挑對目標。給候選生成過程加上"你要找的是這個"這個資訊,等於提前把搜索範圍收窄了,剩下的判斷工作自然更容易做對。

五、訓練細節里的取捨智慧

論文還有幾個訓練環節的設計值得一提。

一是訓練數據的配比。研究者搭建了一個95.7萬樣本的混合訓練集,涵蓋密集接地式描述、接地對話生成、指代分割、廣義指代分割、多粒度分割五大類任務。其中密集接地式描述這部分占比最大,達到34%,由PanoCaps和經過清洗的COCONut-PanCap共同構成。

值得一提的是,為了讓COCONut-PanCap能用得上,研究團隊專門用Qwen3-VL-235BPANORAMA給AI裝上一雙能指認萬物的眼睛模型對它的標註做了重新生成和二次校驗,修正了對象指代錯誤、重複短語、格式錯誤的對象引用等問題。這個清洗過程本身也是一種"用AI檢查AI"的思路,挺有意思。

二是proposal supervision(提案監督)的匹配策略。訓練時用了匈牙利匹配算法PANORAMA給AI裝上一雙能指認萬物的眼睛,把每個短語對應的真實目標集合分配給候選提案,匹配代價函數裡除了掩碼重疊度(Dice係數),還加入了匹配評分器給出的分數,權重係數λ設為0.25。

去掉這個評分項之後會怎樣?論文的消融實驗給出了答案:gPQ掉2.4個點,AP50掉7.5個點。這說明當幾個候選掩碼和目標重疊度差不多的時候,評分器提供的額外信號能幫助訓練過程挑出更合適的那個候選去監督,這個設計不是可有可無的裝飾。

三是有一個專門評估run-to-run變異性的細節,研究者用2B模型訓練了三個不同的隨機種子,測出gPQ的標準差是0.6,AP50標準差是1.0。這種嚴謹性在論文裡隨處可見,也提醒我們看模型對比表格的時候,小於1個點的差距可能只是噪聲。

六、PANORAMA的戰績

說了這麼多設計思路,最後還是得看數據說話。

在PanoCaps測試集上,經過微調之後,PANORAMA-4B在七項指標中的五項拿到最好成績,包括AP50達到61.2、mIoU達到66.5、Precision達到66.6、gPQ達到45.6。作為對比,此前在這個基準上表現最好的SAMTok-8B,gPQ是44.5。

這裡有個特別能說明問題的數字對比。在沒有針對PanoCaps微調之前,各路專門做接地任務的模型(比如GLaMM、Sa2VA、SAMTok)零樣本表現都不理想,gPQ普遍只有15到20分左右。但只要用PanoCaps數據微調一下,這些模型的gPQ普遍能提升15到25個點。這個躍升幅度證明了一件事:不是這些模型架構本身不行,而是它們此前從沒見過這麼"較真"的訓練數據。

論文還專門做了一個對照實驗,很能說明PanoCaps的價值不只是"看著好看"。用同樣的訓練預算,分別只用GCG數據、只用清洗後的COCONut-PanCap數據、只用PanoCaps數據訓練模型,結果PanoCaps雖然圖片數量只有2070張,比COCONut-PanCap少57倍,比GCG少95倍,但訓出來的模型在自家測試集上gPQ反而最高,達到44.0分,比用COCONut-PanCap訓練的高6.1分,比用GCG訓練的高25.2分。更難得的是,用PanoCaps訓練出來的模型遷移到GCG這個陌生測試集上時,表現依然優於用COCONut-PanCap訓練的版本,在Recall、mIoU、METEOR、AP50四項指標上全面領先。

這個結果給了一個挺重要的啟示:數據量不是萬能的,標註的精確度和對齊質量在特定情況下能彌補規模上的巨大差距,甚至能帶來更好的泛化能力。這多少有點反直覺,畢竟深度學習這些年給大家灌輸的印象是"數據越多越好",但這裡展示的是"數據越准也很關鍵",而且這個"准"字帶來的收益,能超過57倍的數量差距。

在其他幾個標準測試上,PANORAMA-4B的表現同樣能打。在接地對話生成任務GCG上,微調後拿下十項指標里的七項最優。在指代分割RefCOCO/RefCOCO+/RefCOCOg系列基準上,即使不做任何針對性微調,也已經在四個子集上超過此前最強的SAMTok-4B。在廣義指代分割GRESPANORAMA給AI裝上一雙能指認萬物的眼睛任務上,"無目標準確率"(N-acc)和區域分割質量都拿到全場最高分。在更貼近真實場景的GroundingSuitePANORAMA給AI裝上一雙能指認萬物的眼睛基準上,整體gIoU從此前最好的67.8提升到75.5,其中"Part"(部件)和"Multi"(多目標)這兩個類別提升最明顯,分別從40.8提升到53.5,從72.1提升到80.0,說明這套架構在處理多目標指代方面確實有獨到之處。

七、也不是完美無缺

論文也很坦誠地提到了一些局限。

比如PANORAMA目前只專注於圖像層面的接地,還沒有涉及區域描述或者影片接地這些相關場景。定性案例里也能看到一些不完美的地方,比如某些明顯可見的區域(像圖1里的插座)偶爾會被漏掉,或者描述細節不夠精確(比如把帶蓋的鍋描述得不夠準確)。

研究者提出,未來或許可以引入一種反饋機制,讓VLM根據分割模型的輸出結果去修正自己的預測,這或許能進一步減少這類錯誤。強化學習也被提及作為進一步優化接地和描述質量的可能方向。

寫在後面

看完這篇論文,最觸動我的其實不是那套精巧的架構設計,而是那份"數據比模型更值得較真"的堅持。

現在做AI研究,大家默認的路徑往往是先想模型怎麼改進,數據能湊合就湊合。但這篇論文用一個挺紮實的對照實驗說明了另一種可能:如果你願意花1530個小時去磨一份只有3470張圖片的數據集,讓每一句話都真正對應到正確的像素上,這份數據帶來的收益可能超過一份規模大57倍、但滿是噪聲的數據集。這對做AI應用的人來說是個值得記住的提醒,有時候真正卡脖子的不是模型不夠聰明,而是餵給它的東西本身就在教它犯錯。

另一個讓我反覆琢磨的細節,是那個關於BERT相似度閾值的發現。98.8%的隨機詞對都能通過0.5這個相似度閾值,這意味著此前很多論文用這套指標做評估的時候,可能一直在被"溫柔地"高估。這提醒我們,評價體系本身也需要被審視,一個看起來客觀的數字指標,背後可能藏著系統性偏差,而發現這種偏差往往比設計一個新模型更需要耐心和較真的態度。

如果一個AI真的能像PANORAMA展示的那樣,看一眼圖片就能把每一件東西、每一片背景都說清楚、指准了,那接下來會發生什麼?是不是意味著機器人終於能在雜亂的廚房裡精確地找到"那把放在案板旁邊的黑色削皮刀",而不是含糊地說"廚房裡有些東西"?

Q&A

Q1:PANORAMA是什麼?

A:PANORAMA是一個視覺語言模型,全稱"通過掩碼提案選擇實現全景接地式描述"。它把短語接地問題轉化為從候選掩碼池中挑選的過程,讓AI在描述圖像時能給每個提到的物體或背景區域配上精確的像素級掩碼,既支持指代單個區域,也支持指代多個實例。

Q2:PanoCaps數據集和其他同類數據集有什麼不同?

A:PanoCaps是一份人工標註的基準數據集,包含3470張圖片,像素覆蓋率約99%,每張圖配有人工撰寫的自由格式描述和精確的短語掩碼對應關係。相比COCONut-PanCap這類自動生成的數據集,PanoCaps標註更準確,噪聲更少,標註引用率達到99.9%,遠高於對比數據集的79.2%。

Q3:gPQ指標解決了什麼問題?

A:gPQ是論文提出的廣義全景質量指標,用來同時評估模型描述文字的準確性和分割掩碼的精確度。它改進了此前評估中存在的漏洞,比如老方法用BERT相似度做文字匹配時門檻過低,容易把不相關的短語誤判為匹配成功,gPQ通過更嚴格的相似度計算和綜合懲罰漏檢與誤檢,讓評估結果更貼近真實表現。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新