這項由約翰斯·霍普金斯大學、加州大學聖克魯茲分校、卡內基梅隆大學和萊斯大學聯合開展的研究,以預印本形式於2026年7月14日發布在arXiv平台,編號為arXiv:2607.12450。感興趣的讀者可以通過該編號在arXiv上找到完整論文。
**一、每個人都看得懂的顏色,能否承載所有視覺資訊?**
手機里有三種顏色信號組成了你看到的一切——紅色、綠色和藍色,也就是我們常說的RGB。不管是一張海邊日落的照片,還是一幅精細的地圖,螢幕上顯示的所有內容,最終都被分解成這三種顏色的數值組合。這件事聽起來平平無奇,卻隱藏著一個令人著迷的問題:如果RGB能表達自然界裡幾乎所有的視覺資訊,那它是否也能成為人工智慧理解和創造視覺內容的"通用語言"?
這正是這篇論文所探索的核心問題。研究團隊提出了一個名為"RINO"(RGB In and RGB Out,即"RGB輸入、RGB輸出")的框架,試圖用一種極為大膽的方式來統一人工智慧的視覺理解能力:不管是讓機器"看懂"一張圖片並分析出裡面有什麼物體、物體有多深、表面朝向什麼方向,還是讓機器根據一張草圖或骨架圖生成一張真實感十足的照片,統統用RGB圖片來表示輸入和輸出,用同一個圖像編輯模型來完成所有任務,不需要為每個任務單獨設計專用的模組。
這個想法的靈感來自於語言模型的成功。在處理文字的大模型中,不管是翻譯、寫作還是回答問題,所有任務都以文字為輸入、文字為輸出,同一個模型就能搞定。RINO的研究者問:視覺世界能否也擁有這樣一種"通用文字"?他們的答案是:可以,而這種"通用文字"就是RGB圖像本身。
**二、視覺任務的"巴別塔困境":為什麼以前的做法那麼麻煩?**
在RINO出現之前,電腦視覺領域面對不同任務時,採取的策略有些像建造一座每層都用完全不同語言交流的"巴別塔"——每種任務都有自己專屬的表達方式,不同任務之間幾乎無法共享一套通用的基礎設施。
以幾個常見任務為例來理解這種困境。當人工智慧需要判斷一張照片裡每個像素屬於哪個物體類別(也就是"語義分割"任務)時,它的輸出是一張顏色塗抹圖,每種顏色代表一個類別;當它需要估算照片裡每個點距離相機有多遠("深度估計"任務)時,輸出是一張灰度圖,越亮代表越近;當它需要生成一張符合特定姿勢的人物圖片時,則需要先把姿勢骨架作為特殊格式的輸入信號讀取進來。這些輸入輸出格式各不相同,導致工程師們不得不為每種任務設計專用的"讀取器"(編碼器)和"輸出器"(解碼器),並且還需要額外的"連接適配器"讓它們和主模型通信。
這種做法就像一個家裡有十幾台電器,每台都需要專屬的不同形狀插頭,換一台電器就得換一套插頭——不僅麻煩,而且每次都要從零開始學習怎麼用新設備。RINO的思路則是:給所有電器都裝上標準USB接口,統一進出,一個適配器走遍天下。
**三、RINO的核心思路:把一切都"畫"成RGB圖片**
RINO框架的核心做法非常直觀:不管原本的視覺資訊是什麼格式,在送進模型之前或從模型出來之後,都先把它轉換成一張看得見摸得著的RGB彩色圖片。
以深度估計為例,研究者不是讓模型輸出一堆抽象的數字來表示距離,而是直接讓模型輸出一張"深度可視化圖"——近處的物體顯示為亮色,遠處的物體顯示為暗色,就像攝影師拍攝的那種黑白色調的三維感照片。這張圖依然是普通的RGB圖,人眼可以直接看懂,也不需要任何專門的解碼器。模型做的事,只是把一張普通照片"重新畫"成一張深度可視化圖而已,就像一個畫家把風景臨摹成素描。
對於語義分割,研究者讓模型輸出一張顏色塗抹圖,每個區域塗上對應類別的顏色,比如天空塗成藍色、草地塗成綠色——同樣是一張普通RGB圖。對於人體姿態估計,模型輸出的是一張OpenPose風格的骨架圖,用不同顏色的線條畫出人體各部位的連接關係。
在"生成"方向上,RINO同樣把一切輸入都當作普通RGB圖片來處理。比如,要讓模型根據一張語義分割圖生成真實圖片,就直接把那張分割圖當作普通圖片輸入進去,然後用文字描述告訴模型"請根據這張分割圖生成對應的真實場景"——不需要額外的分割圖編碼器,不需要ControlNet(一種專門處理條件控制生成的附加模組)。
整個RINO框架可以用一個簡潔的公式概括:給模型一張圖加一段文字描述,模型輸出一張圖加一段可選的文字說明。輸入的圖可以是自然照片、深度圖、骨架圖、分割圖;輸出的圖同樣可以是以上任何一種。模型永遠只看到RGB圖片,永遠只輸出RGB圖片,內部的一切邏輯都在這個統一的視覺空間裡完成。
在模型輸出之後,如果需要將RGB圖片還原成某種任務專用的格式(比如把深度可視化圖換算回每個像素的具體距離數值),研究者會用一個完全不含可學習參數的"轉換器"來完成這個工作——就像一把固定的換算尺,不需要額外訓練。
**四、選什麼模型來做這件事?**
RINO框架本身不訓練任何新模型,而是直接借用已有的"圖像編輯模型"作為底座。研究團隊選擇了三款開源的圖像編輯模型,分別是Qwen-Image-Edit(阿里巴巴通義團隊開發,參數量高達200億,基於多模態擴散Transformer架構)、LongCat-Image-Edit(美團開發,60億參數,雙語版本)以及FireRed-Image-Edit(FireRed團隊開發,專注於高保真指令式圖像編輯)。
這三款模型本來是為了"按照文字描述修改圖片"而訓練的,比如"把天空改成黃昏的顏色"或者"給這個人換一件紅色外套"。RINO的做法是:直接把這些模型當作黑盒子來使用,不修改任何參數,不添加任何新模組,只是通過精心設計的文字提示(prompt)來引導模型完成各種視覺任務。
這是整個研究中最令人驚訝的部分——一個本來用來修圖的模型,在完全沒有專門訓練的情況下,居然能夠做深度估計、語義分割、人體姿態估計等專業任務,而且效果與專門訓練的專家模型相差無幾。研究者把這種完全零樣本(zero-shot,即沒有針對目標任務進行任何微調或訓練)的版本稱為"RINO-Zero"。
**五、理解任務的成績單:從深度圖到骨架圖,零樣本能做到幾分?**
研究團隊在超過20個視覺任務和基準測試上評估了RINO-Zero,涵蓋了視覺理解和視覺生成兩大方向。每項任務的結果都被與該領域的專業模型進行了橫向比較,相當於讓一個"通才選手"和多個"專項冠軍"同場競技。
在深度估計任務上,評估指標使用的是δ?(一種衡量預測深度與真實深度吻合程度的分數,越接近1越好)和AbsRel(絕對相對誤差,越低越好)。在NYUv2(室內場景數據集)上,Qwen-Image-Edit達到了δ?=0.927,而專門為深度估計訓練的Depth Anything V1的成績是0.981,差距約為5個百分點。在DIODE-indoor(另一個室內數據集)上,Qwen表現更為接近,達到δ?=0.938,而Depth Anything V1為0.952,差距縮小到約1.4個百分點。在自然圖像差異較大的KITTI(室外道路場景)上,Qwen達到δ?=0.901,與專家模型的0.947相比差距略大。另一款LongCat-Image-Edit在所有數據集上表現稍弱,約在0.840到0.849之間。
在表面法線估計(判斷場景中每個表面朝向哪個方向的任務)上,FireRed-Image-Edit表現尤為突出。以平均角度誤差(數值越低越好)為指標,在NYUv2上FireRed取得了17.73度的平均誤差,而專門為此訓練的DSINE模型為16.4度;在iBims-1數據集上,FireRed的18.62度已非常接近DSINE的17.1度;在DIODE-indoor上,FireRed甚至以17.25度的成績超越了多款專家模型,包括Marigold(16.67度仍優於FireRed,但差距極小)和StableNormal。這意味著在平均表面朝向預測精度上,零樣本通才模型已經可以與專門訓練的專家模型比肩,只是在局部精細度上還有提升空間。
語義分割任務上,RINO在VOC(Pascal VOC,一個經典的圖像分類和分割數據集)上取得了相當不錯的成績。以mIoU(平均交並比,衡量分割區域與真實區域重疊程度的指標,越高越好)為主要指標,LongCat-Image-Edit在Pascal VOC上達到了49.68,超越了多個零樣本分割專家模型,例如GroupViT的52.37雖然更高,但OVSegmentor(53.82)等更好的專家模型還是領先的。值得關注的是,RINO在mAcc(平均類別準確率)和aAcc(所有像素準確率)兩項指標上甚至超越了部分專家模型。在難度更大的ADE20K數據集10類粗粒度設置下,Qwen-Image-Edit達到了40.37的mIoU,與零樣本專家模型MaskCLIP的39.26相當甚至略有超越。在150類細粒度設置下,RINO的表現有所下滑,這說明面對極細分的類別區分時,通用圖像編輯模型還需要更多任務特定的知識來彌補差距。
在目標檢測和實例分割任務上,RINO採用了一種非常有創意的方法:對於每個類別,讓模型把該類別的所有實例"塗"成白色實心區域,背景塗成黑色,然後通過圖像處理技術把不同的白色區域分離成獨立的實例。在COCO(一個包含80個物體類別的大型基準數據集)上,Qwen在零樣本條件下達到了16.3%的box AP50(邊界框檢測的寬鬆準確率),與專門訓練的Mask R-CNN的63.5%相比差距依然很大,但考慮到這是完全零樣本且沒有任何專用參數,能達到非零的有意義結果本身就相當驚人。視覺上,模型已經能夠大致定位和區分不同實例,主要失敗原因是過度檢測或過度分割。
全景分割(同時識別"東西類"如天空、草地等背景區域和"事物類"如人、車等可數對象的任務)的評估結果頗為有趣。雖然RINO在綜合分數PQ(全景質量)上遠低於專家模型,但在SQ(分割質量,衡量分割出的區域形狀有多準確)這一子指標上,Qwen的成績非常亮眼——在Cityscapes、ADE20K和COCO三個數據集上分別達到64.8、71.5和74.3,接近乃至超越了部分有監督專家模型的水平。這說明RINO已經能夠相當準確地識別和勾勒出物體的邊界,主要的短板在於識別階段——知道"這裡有個邊界",但不太確定"邊界兩側分別是什麼類別"。
人體姿態估計是一個對精度要求極高的任務,RINO的表現說明了通用模型的局限和潛力並存。採用PCK(Percentage of Correct Keypoints,關鍵點正確率)評估指標,在絕對坐標下(raw),三款編輯模型的得分都較低,最高的LongCat也只有0.233。但在經過位置對齊處理之後(PA,即忽略平移和縮放的誤差,只看關鍵點的相對位置是否正確),成績明顯提升,三款模型在PA [email protected](更寬鬆的閾值下)都達到了0.767到0.795,說明模型其實能夠理解人體姿態的大致結構,只是在精確定位上還與專業模型(如ViTPose的0.868 raw [email protected])有差距。
指代表達理解和分割(根據一段語言描述定位圖片中特定物體)任務上,Qwen-Image-Edit在RefCOCOg數據集上取得了[email protected](預測框與真實框重疊超過50%的比例)51.8%的成績,以及cIoU(累積交並比)40.3%的分割成績。與監督訓練的專家模型UNINEXT(88.7% [email protected])相比差距明顯,但考慮到這是完全零樣本、沒有任何接地模組或框監督的情況下實現的,已經表明通用圖像編輯模型確實具備將語言描述與像素級視覺定位聯繫起來的初步能力。
開放詞彙實例分割(在SA-Co/Gold數據集上)的評估結果揭示了RINO在一項特定能力上的不足:雖然Qwen在pmF1(正樣本掩碼F1得分)上達到39.8,展現出一定的概念定位能力,但在IL_MCC(判斷某個概念是否存在的準確率)上接近0,導致綜合得分cgF1極低(僅1.7)。這是因為當被查詢的概念不在圖片中時,編輯模型傾向於依然"畫"出一個掩碼,而不是輸出"不存在"。這一局限性與具體任務的識別邏輯有關,並非RGB接口本身的根本缺陷——即使是Vision Banana(一個專門針對此任務改進的生成模型)也需要藉助外部語言模型來完成存在性判斷。
**六、生成任務的成績單:把各種"草圖"變成真實圖片**
在視覺生成方向,RINO把各種條件信號(深度圖、語義分割圖、人體骨架圖、實例圖、邊緣圖)當作普通RGB圖片輸入,然後讓圖像編輯模型生成符合條件的真實照片。這個方向的比較對象是那些專門為條件控制生成而訓練的模型,例如大名鼎鼎的ControlNet系列。
在深度條件圖像生成任務上,遵循MultiGen-20M數據集的標準評估協議,用三個指標來衡量:RMSE-255(由生成圖片反推出的深度圖與輸入深度圖的誤差,越低越好)、FID(衡量生成圖片質量與真實圖片分布差異的指標,越低越好)以及CLIPScore(衡量生成圖片與文字描述吻合程度的指標,越高越好)。Qwen-Image-Edit在零樣本條件下達到了RMSE-255=33.83,與專為此任務訓練的ControlNet(35.90)和GLIGEN(38.83)相比不僅不落下風,甚至略有優勢,但落後於最強的ControlNet++(28.32)。這個結果相當有說服力:一個從來沒有為深度條件生成專門訓練過的模型,僅憑把深度圖當作普通圖片輸入,就能達到與多個專門訓練模型相當的條件控制精度。
語義分割圖條件生成任務的結果更加令人印象深刻。在ADE20K數據集上,三款編輯模型的條件遵循度(mIoU)均在45至46之間,而專為此任務訓練的ControlNet++僅為43.64,ControlNet更只有32.55——三款零樣本編輯模型全面超越了專門訓練的條件控制模型。同時,FID和CLIPScore也與ControlNet++相當甚至持平。在COCOStuff數據集上,同樣的規律成立,RINO的三款模型mIoU均在36至38之間,同樣超越了ControlNet和ControlNet++的34.56。這意味著,在語義分割圖條件生成這項任務上,RINO-Zero已經建立了新的零樣本技術水平(state of the art)。
人體姿態條件生成任務在Human-Art數據集上進行評估,使用CAP(基於餘弦相似度的平均精度,衡量生成圖片的姿態與輸入骨架的吻合程度)、PCE(人數計數誤差)、FID和KID(核初始分布距離,另一種圖片質量指標)以及CLIP-Score來綜合評估。FireRed-Image-Edit達到了CAP=68.09,非常接近監督訓練的專家模型HumanSD(69.68)和Stable-Pose(70.83);同時FID=10.66,在所有方法中處於前列。Qwen的CAP=65.97,與T2I-Adapter(65.65)相當,超越了基礎SD模型(55.71)。從視覺效果來看,RINO生成的圖片在處理不尋常的人體姿態或多樣藝術風格時,往往比ControlNet類方法更為自然。
實例圖條件生成任務在COCO2017上進行,評估指標為AP、AP50和平均召回率(AR)。LongCat-Image-Edit以AP=28.0、AR=44.2的成績超越了專為此任務訓練的InstanceDiffusion(AP=27.1、AR=38.1),Qwen和FireRed也與其接近。同時,三款編輯模型的FID(15.3至18.5)均優於InstanceDiffusion的25.5,說明生成圖片的視覺質量更高。這是另一項RINO超越專門訓練模型的任務。
Canny邊緣圖條件生成任務的結果相對不那麼理想。以邊緣F1分數(衡量生成圖片中的邊緣與輸入Canny邊緣圖的匹配程度)為主要指標,Qwen的零樣本邊緣F1為14.90,而專門訓練的ControlNet++為37.04,差距顯著。研究者做了一個重要的對照實驗:如果不提供邊緣圖,只給文字描述,F1隻有6.75;如果把邊緣圖用語言模型描述成文字再輸入,F1也只有7.79,遠低於直接把邊緣圖作為圖片輸入的14.90。這說明邊緣圖中攜帶的空間像素資訊,是無法通過語言描述來替代的——RGB圖片作為輸入接口,確實傳遞了純文字無法傳遞的空間布局資訊。
**七、研究的誠實局限:通才與專才之間的真實差距**
研究團隊對RINO的局限性保持了相當直接的態度。RINO的強大轉移能力在很大程度上依賴於底座圖像編輯模型在網際網路規模數據上進行的預訓練,這些預訓練數據里可能已經包含了少量的深度圖、分割圖等視覺信號,使得模型對這些格式並不完全陌生。然而這類信號在預訓練數據中占比極小,這解釋了為什麼RINO在某些任務上與專家模型仍存在明顯差距。
RINO的當前版本是完全零樣本的,沒有在任何視覺任務數據上進行過針對性的微調。研究者預期,如果未來將標準圖像編輯訓練數據與一定比例的RGB格式視覺任務數據(如深度圖、分割圖)混合進行指令微調,RINO框架在更廣泛任務上的表現將得到顯著提升,這一改進版本被稱為未來的"RINO-Tuned"。
此外,在某些具體任務上,RINO暴露出一些特定的失敗模式。在開放詞彙分割中,模型不能可靠地判斷一個概念是否出現在圖片中;在目標檢測中,模型容易過度檢測;在細粒度分割中(如ADE20K 150類),模型對細分類別的識別能力不足。這些問題都與模型預訓練數據和任務設計有關,而非RGB接口的根本缺陷。
**八、為什麼這件事在技術上是可能的?**
要理解RINO為什麼能成立,需要理解現代大型圖像編輯模型的本質。Qwen-Image-Edit這類模型在訓練過程中接觸了海量的(圖片,文字描述,編輯後圖片)三元組數據。在這個過程中,模型學會了理解圖片中的語義內容、空間結構、顏色與紋理,以及如何根據文字指令對這些視覺資訊進行變換。
這種訓練方式無意間賦予了模型一種"視覺語言能力"——它能夠理解"把這個區域的顏色改成..."、"按照這張參考圖的風格..."等指令的含義,並在視覺空間中執行這些操作。RINO做的事情,本質上是把"深度估計"任務描述成一種特殊的圖像編輯指令:"把這張照片重新繪製成一張深度可視化圖,近處亮遠處暗"。模型在理解和執行這個指令時,動用的是它在預訓練中學到的整個視覺理解體系,而這個體系恰好足夠通用,能夠完成這項"翻譯"工作。
這種能力的存在,說明在大規模視覺數據上訓練的圖像編輯模型,已經內化了足夠豐富的視覺知識,使得RGB接口成為一個有實際意義的通用視覺語言,而不僅僅是一個理論上的可能性。
**九、這對未來意味著什麼?**
說到底,RINO提出了一個迷人的可能性:就像大語言模型用文字統一了所有自然語言任務一樣,視覺世界也許可以用RGB圖片作為統一接口,把感知和生成融合在一個框架下。
這不僅僅是技術上的簡化——它意味著未來的視覺AI系統可能更接近人類的視覺認知方式。人類看世界時,深度感、物體識別、空間理解都發生在同一套視覺系統中,不需要每種感知都用單獨的"模組"來處理。RINO邁出的這一步,朝著這個方向走得比以前更遠。
當然,現在的RINO-Zero還有明顯的成長空間。研究團隊也明確表示,他們打算通過將RGB格式的視覺任務數據混入訓練來進一步強化這個框架,並希望將其擴展到3D視覺、影片理解乃至世界模型等更宏大的領域。
如果你對這項研究感興趣,可以通過arXiv編號2607.12450查閱完整論文,或訪問論文提到的開源代碼倉庫進一步探索。
---
Q&A
Q1:RINO框架和傳統視覺AI方法相比最大的區別是什麼?
A:傳統視覺AI為每種任務設計專用的輸入輸出格式和專用模組,比如深度估計有專門的深度頭,分割有專門的分割頭。RINO則把所有視覺資訊統一表示為普通的RGB彩色圖片,用同一個圖像編輯模型完成所有任務,不需要任何任務專用模組,類似於語言模型用文字處理所有文字任務。
Q2:RINO在哪些任務上效果最好、哪些任務上還有明顯差距?
A:RINO在語義分割圖條件圖像生成、實例圖條件生成等生成類任務上已經超越了專門訓練的模型;在深度估計、表面法線估計上接近專家模型水平。在目標檢測、細粒度分割(如150類ADE20K)和Canny邊緣條件生成等任務上與專家模型仍有明顯差距,主要原因是這些任務需要更精確的空間定位或細分類別識別能力。
Q3:RINO有沒有對模型進行額外訓練?
A:RINO-Zero版本完全沒有進行任何針對視覺任務的訓練或微調,直接借用已有的圖像編輯模型(如Qwen-Image-Edit、FireRed-Image-Edit、LongCat-Image-Edit)作為黑盒子來使用,所有參數均保持不變。研究者提到未來計劃通過混合RGB格式視覺任務數據進行指令微調來進一步提升效果。






