宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

圖層,而不是像素:當AI設計工具學會像設計師一樣思考

2026年08月19日 首頁 » 熱門科技

你有沒有想過,為什麼用AI生成的海報圖,你想把裡面那隻兔子挪個位置,幾乎是不可能的事?

你打開PS想改一張設計稿里的文字,滑鼠一點,那個文字層立刻被選中,可以拖動、可以改顏色、可以刪除,背後的背景圖完好無損。這是因為設計師從一開始就是按圖層工作的,背景、主體、裝飾、文字,各自待在自己的層里,互不干擾。

但AI生成的圖片不是這樣。

主流的文本生成圖像模型,不管是Midjourney還是Stable Diffusion,吐出來的都是一張扁平的畫布。像素排列得再精美,它們描述的也只是"這個位置該是什麼顏色",而不是"這個區域是一隻兔子,那個區域是月亮,它們之間有前後遮擋關係"。你想單獨挑出那隻兔子挪個位置,模型根本不知道"兔子"這個概念在圖里對應哪些像素、被誰擋住了多少、挪走之後露出的應該是什麼內容。

這就是這篇論文要解決的核心矛盾:生成模型很擅長"畫出來",卻完全不懂"怎麼拼出來的"。

像素記錄的是結果,圖層記錄的是過程

先說清楚這兩者的區別有多大。

像素*:圖像最基礎的單位,每個像素記錄一個顏色值,描述的是畫面"看起來是什麼樣",而不涉及內容的語義結構。

一張扁平化的PNG圖,本質上就是幾百萬個像素點按順序排列。它可以告訴你"這個位置是紅色",但沒法告訴你"這個紅色區域是一件衣服",更沒法告訴你"這件衣服被一個人的手臂遮住了一部分,如果把手臂拿掉,衣服應該是完整的一件"。

而設計師工作時腦子裡想的完全是另一套邏輯:這是背景層,這是主體人物層,這是裝飾元素層,這是文字層,每一層都是一個獨立的、完整的、可以單獨操作的對象。這就是這篇論文提出的核心洞察,用論文裡的話說:像素定義了圖像如何被渲染,而圖層定義了圖像如何被創造、理解和編輯。

這句話聽起來有點抽象,換個說法可能更好懂:一張扁平的圖片就像一份直接端上桌的成品菜,你嘗得出味道,但看不出用了哪幾種食材、哪個步驟先放鹽哪個步驟後放糖。而一份帶圖層的設計稿更像是廚房裡沒洗的備菜台,蔥姜蒜、肉、調料分門別類擺著,你隨時可以單獨拿起某一份重新處理,而不影響其他部分。如果所有食材直接混合下鍋端上桌(也就是只有扁平像素),你想單獨把裡面的薑絲挑出來重新切一遍,基本沒有可能。

於是研究團隊提出了一個叫UniWorld-Design圖層而不是像素當AI設計工具學會像設計師一樣思考的框架,核心思路就是把語義化的RGBA圖層,作為生成、理解、編輯這三件事的最小單位。

RGBA*:一種圖像表示方式,除了常見的紅綠藍三個顏色通道(RGB),額外增加一個Alpha通道,用來表示每個像素的透明度,從而支持"摳圖"式的圖層疊加。

這個框架里有兩個模型。一個叫T2RGBA圖層而不是像素當AI設計工具學會像設計師一樣思考(文本生成透明素材),另一個叫I2L圖層而不是像素當AI設計工具學會像設計師一樣思考(圖片拆解為圖層)。這兩個模型合起來,構成了一個從文字到圖片、再從圖片拆回可編輯圖層的完整循環。

從零開始造一個透明素材:T2RGBA

先看第一個模型,T2RGBA,全稱Text-to-RGBA。

它做的事情很直接:給一句話描述,比如"一隻戴著水手帽的綠松石色鯨魚",直接生成一張帶透明背景的RGBA圖片,而不是一張需要你再去摳圖的普通照片。

這裡有個技術上的巧妙之處。研究團隊沒有從零訓練一個全新的模型來處理透明通道,而是在已有的圖像自編碼器基礎上做了個"微創手術"。

自編碼器(VAE)*:一種能把圖片壓縮成一小段數字編碼,再從編碼還原回圖片的神經網路結構,是幾乎所有主流圖像生成模型的底層組件。

具體做法是,把編碼器最開始那一層和解碼器最後那一層,從處理三個顏色通道(RGB)擴展成處理四個通道(RGBA)。原來的RGB權重原樣複製過來,新增的透明度通道的權重先設成零,解碼器的透明度偏置項設成"完全不透明"。這樣一來,改造完的模型起步狀態就等同於原來的RGB模型,只是多了一個默認全不透明的透明度通道,之後再通過訓練慢慢學會怎么正確地處理透明區域。

如果不這樣做,直接從零訓練一個RGBA模型會怎樣?那意味著要放棄原來RGB模型已經學到的所有關於物體輪廓、光影質感的知識,相當於讓一個已經會畫畫的人重新從拿筆開始學,浪費了大量已有的能力積累。而這種"漸進改造"的方式,更像是給一輛已經會開的車加裝一個新功能模組,而不是把整輛車拆了重新造。

訓練數據方面,團隊用的是內部整理的一批"文字配透明圖"的數據集,包括設計素材、摳好的主體圖、向量畫轉成的插畫。透明圖片占了訓練數據的大多數,但也混入了一部分不透明的圖片,防止模型"忘了"怎麼處理正常圖像。

訓練完成之後,模型還要經歷一套兩階段的優化流程:先做漸進式蒸餾來提速,再用一種叫DiffusionNFT的方法做強化訓練來提質。這個流程我們後面統一講,因為I2L也用了同一套。

在CLIP Score(一種衡量生成圖像和文字描述匹配程度的指標)這個維度上,T2RGBA達到了33.03分,是所有對比模型里最高的,比LayerDiffuse高了13%,比OmniAlpha高了6.5%。不過在FID(衡量生成圖和真實圖分布相似度)和白底合成後的LPIPS(衡量圖像細節相似度)這兩個指標上,OmniAlpha表現更好。這說明T2RGBA更擅長"聽懂你說的話",但在細節質感上還有提升空間。

拆解一張成品圖:I2L怎麼做到"拆得乾淨還能用"

第二個模型是整篇論文裡更硬核的部分,叫I2L,Image-to-Layer。

它接收一張已經畫好的成品圖,加上一句全局指令(比如"把這張圖拆成背景、元素和文字"),再加上針對每一層的具體描述,然後同時輸出一組排好順序的、完整的語義圖層。

這裡的關鍵詞是"完整"。

多數現有的分割方法做的是"可見像素分割",也就是只把畫面上肉眼看得見的部分摳出來。這樣做有個大問題:如果你把某個遮擋物挪走,被遮住的地方就露出一個透明的洞,因為模型壓根沒學過那塊被遮住的區域應該是什麼樣。

I2L要解決的正是這個問題。它學的不是"哪裡能看見什麼",而是"這個物體完整的樣子是什麼",即便這個物體有一部分被別的東西擋住了。論文管這個叫語義完整圖層圖層而不是像素當AI設計工具學會像設計師一樣思考,而不是可見像素分區。

打個比方,這就像給一棟房子拍照和給房子畫建築圖紙的區別。拍照只能記錄你鏡頭前看到的那一面牆,牆後面藏著什麼完全不知道;而建築圖紙會把每一層樓、每一根承重柱的完整結構都畫出來,哪怕現在被牆面裝飾擋住了。等你哪天想拆掉一面牆看看內部結構,有圖紙的房子隨時能查,只有照片的房子就只能瞎猜。如果I2L也只學"可見分割"這一套,那麼用戶挪走一個遮擋物之後,看到的就永遠是一個不明不白的透明窟窿。

要實現這個目標,光靠數據和模型規模堆不出來,還得解決兩個結構性的對應難題。

第一個難題是,每一句針對某一層的描述,必須精確控制住"它對應的那一層",而不能影響到整個圖層堆棧的其他部分。第二個難題是,不同圖層的圖像token(模型內部表示圖像資訊的基本單元)必須共享同一個畫布坐標系,同時又要保持各自獨立的身份和先後順序。

Token*:模型處理資訊時切分出的最小單元,圖像token對應圖片中的一小塊區域,文本token對應一個詞或字。

為了解決這兩個問題,研究團隊設計了一套叫LIB-MMDiT(Layer–Instruction Binding MMDiT)的架構,中文可以理解為"圖層指令綁定的多模態擴散Transformer"。

它包含兩個機制。第一個叫圖層指令綁定注意力,做法是給全局指令和整張輸入圖打上標籤-1,給每一層專屬的描述和對應的圖層圖像打上編號i(i是第幾層)。這樣,某一層的圖像在"讀取"文字資訊時,只能讀到全局指令和自己專屬的描述,讀不到別的層的描述。但圖像和圖像之間的關注是完全開放的,這樣才能讓所有圖層共同判斷彼此的遮擋和堆疊關係。

第二個機制叫圖層索引的三維旋轉位置編碼,簡單說就是給每個圖像token除了原本的行、列坐標,再加一個"層號"坐標,讓模型知道同樣位置的一個點,在不同圖層里是同一個畫布位置,但屬於不同的層。

這套設計的效果,從數據上看很明顯。

在Crello這個基準測試集上,I2L和目前另一個先進模型Qwen-Image-Layered對比,在每層RGB內容的還原誤差上降低了37%(從0.2014降到0.1264),在透明度區域的匹配精度Alpha Soft IoU上提升了34%(從0.5454提升到0.7325)。

| 方法 | RGB L1誤差(越低越好) | Alpha Soft IoU(越高越好) |

|---|---|---|

| Qwen-Image-Layered(4層) | 0.2014 | 0.5454 |

| **UniWorld-I2L(4層)** | **0.1264** | **0.7325** |

在可編輯性指標上,I2L生成的"空白圖層"比例下降了63%(從0.35降到0.13),"糊狀半透明層"(那種既不乾淨也不能單獨用的層)從1.34降到1.19。

| 方法 | 壞圖層數量 | 空白層 | 糊狀層 | 內容差異度 |

|---|---|---|---|---|

| Qwen-Image-Layered(4層) | 1.69(占42.3%) | 0.35 | 1.34 | 0.658 |

| **UniWorld-I2L(4層)** | **1.32(占33.0%)** | **0.13** | **1.19** | **0.690** |

還有一組用視覺語言模型(VLM)評分的評測,從五個維度給拆解結果評分,滿分25分。I2L拿到20.43分,Qwen-Image-Layered拿到17.60分。

在這五個維度里,I2L在語義分離度、背景修補、內容分布、內容有效性這四項上都更強,唯獨在Alpha清潔度(也就是透明邊緣是否乾淨,沒有色彩殘留和光暈)上略遜一籌(2.90對3.33)。論文也坦誠承認了這一點,把邊緣處理和密集文字識別列為當前的主要局限。

拆完還能再拆一次:指令驅動的遞歸分解

I2L不只是"拆一次就完事",它支持一種叫指令可尋址的操作方式。

具體來說有三種玩法。

第一種叫頂層分解,就是把一張完整圖片按你說的語義類別拆成幾層,比如"背景、主體、設計元素、文字"。

第二種叫遞歸分解,也就是把拆出來的某一層再拿去當輸入,進一步細分。比如第一輪拆出了"主體"這一層,裡面其實包含了一個人和一隻鸚鵡,第二輪就可以再拆一次,把人和鸚鵡分開。

第三種叫目標提取,直接告訴模型"我只要這幾個特定元素單獨成層,剩下的合併成一層"。

論文裡給了大量的實際案例,比如輸入一張寫著"中秋"字樣的月亮海報,第一輪指令是"把這張圖拆成背景、元素和文字",第二輪再指定"把左下角的樹、右上角的月亮、屋頂上的兔子分別單獨提取出來"。模型能連續兩輪準確響應,輸出的每一層都保持位置對齊、透明度正確。

這個能力為什麼重要?

因為它把"拆圖層"變成了一個可以被外部智能體(比如自動化設計流水線里的AI助手)調用的工具,而不是一個死板的固定流程。一個多模態智能體可以按需決定"這次要拆多細"、"這次要單獨摳出哪個東西",然後把結果交給別的編輯工具去處理,處理完再合成回去。

論文裡配的一張流程圖講得很清楚:一個純像素接口只能把圖片扔給智能體,智能體拿到手還得自己想辦法猜圖里有什麼結構;而圖層原生的接口直接把一組持久化的、可以單獨操作的對象狀態擺在智能體面前,它可以直接調用生成、拆解、編輯、合成這幾個工具,像搭積木一樣組織整個設計流程。

這就好比你去五金店買一套現成的標準化螺絲釘和螺母(圖層原生接口),和你去礦場挖一塊原始礦石回來自己冶煉、切割、打磨(純像素接口)。後者理論上也能造出同樣的東西,但每一步都要重新發明輪子。如果沒有這套標準化的圖層接口,每個想做AI輔助設計的團隊都得自己再造一遍"怎麼從一張圖里認出物體邊界"這輪子。

訓練數據從哪來:不能用AI生成的圖自己訓練自己

這一部分其實是整篇論文裡我覺得最實在的一段。

研究團隊面臨一個邏輯上的死循環:如果想讓I2L學會"完整圖層"(包括被遮擋的隱藏內容),那訓練數據本身就得包含這些隱藏內容的真實樣子。但如果用AI生成的圖層來構造訓練數據,那些被遮擋的內容也是AI編造出來的,模型學到的東西無非是繼承了生成器本身的偏見和局限,越訓練越像在拿自己的影子訓練自己。

所以團隊選擇了一條更笨但更紮實的路:直接用設計師親手做的PSD文件。

PSD*:Photoshop的專屬文件格式,保存了一份設計作品裡所有獨立圖層的原始資訊,包括被其他圖層遮擋的部分。

PSD文件里,被遮擋的圖層內容其實一直都完整保存在文件里,只是最終導出成圖片時被蓋住了看不見。這就相當於拿到了"標準答案",不需要靠模型去猜測被遮擋的部分應該是什麼。

具體流程是,先把PSD里的圖層渲染出來,用一個視覺語言模型輔助把相關的圖層歸併成有意義的語義組(比如把"眼睛""鼻子""嘴巴"這幾個零散圖層合併成"人臉"),再組織成一個樹狀的層級結構。注意,視覺語言模型只負責"分組建議",所有實際的像素內容都直接來自原始PSD文件,不會被AI二次生成污染。

這棵樹建好之後,一份PSD文檔就能自動衍生出三種訓練樣本:樹的根節點對應頂層分解任務,樹的中間節點對應遞歸分解任務,選中某些節點加上剩餘部分則對應目標提取任務。一份素材,餵養三種能力,這個設計相當聰明,省了不少數據標註的功夫。

讓模型跑得快一點:蒸餾與強化學習

一個模型光是效果好還不夠,如果推理速度慢到沒法用,那價值也大打折扣。

I2L要在一次推理中同時輸出好幾層完整解析度的圖像,這天然就會讓計算序列變得很長,推理成本隨之飆升。為了壓縮這個成本,團隊用了一套兩階段的後訓練流程。

第一階段叫漸進式蒸餾,用一個學生模型去學習一個更慢但更精確的教師模型的行為,目標是把原本需要很多步才能完成的生成過程壓縮到八步就能搞定。這個過程借鑑了SDXL-Lightning的漸進對抗蒸餾思路,還額外加入了一個判別器,專門用來區分"這是教師模型真實生成的終點"還是"這是學生模型模仿出來的終點",防止蒸餾後的模型輸出變得過度模糊平滑。

團隊還試過另一種叫分布匹配蒸餾的技術方案,但發現效果不理想:透明度會莫名其妙變得都很不透明,顏色內容和透明度掩碼對不齊,跟著指令的能力和圖層之間的一致性也變弱了。這段坦誠的"失敗嘗試"記錄挺難得,說明研究團隊確實是踩過坑之後才選定現在這套方案的。

第二階段是用一種叫DiffusionNFT的強化學習方法做後訓練,目的是針對具體任務再打磨輸出質量。

DiffusionNFT*:一種基於擴散模型的強化學習後訓練方法,核心思路是給模型生成的樣本打一個"好壞分數",分數高的樣本被進一步強化,分數低的被反向修正。

針對T2RGBA和I2L,團隊設計了不同的評分規則。

T2RGBA用了三個評分器:一個專門檢查透明度是不是符合預期(該透明的地方透明,該不透明的地方不透明);一個用CLIP式的方法算生成圖和文字提示的語義相似度;還有一個直接讓一個大語言模型給生成結果打0到5分。這三個分數會先經過一層"透明度是否正確"的把關,如果透明度本身就錯了,哪怕另外兩項分數再高也沒用,相當於一個硬性門檻。

I2L的評分規則更聚焦在圖層還原精度上,用逐像素的RGBA絕對誤差加上一個感知相似度網路(LPIPS)的組合分數,每一層單獨算分再平均,不搞跨層的連乘慣性。

寫在後面

讀完這篇論文,最觸動我的其實不是那些提升百分之幾十的指標,而是那個"用PSD文件訓練"的決定。

這背後藏著一個挺樸素但容易被忽略的道理:想讓AI學會某種"完整性"的認知,你不能靠AI自己生成數據去教AI,因為它沒見過真正完整的東西,它只會把自己的偏見傳給下一代。這跟教育里"言傳不如身教"有點像,你想讓模型學會處理被遮擋的隱藏內容,就得先找到真正保存了這些隱藏內容的原始資料,而不是讓模型自己瞎猜然後拿猜測結果當教材。

論文裡還有個細節值得單獨說一下:團隊試過用分布匹配蒸餾來提速,結果發現透明度全變得不透明了,這個"失敗"被坦率地寫進了論文而不是藏起來。做研究的人大概都懂,這種"我們試過A方案但它把顏色和透明度弄亂了,所以換成了B方案"的記錄,比一份只報喜不報憂的成功故事更有參考價值。

如果這條路繼續走下去,下一步大概會是什麼樣子?論文結尾提到,團隊接下來想把這套能力擴展到"圖層插入替換"和"多輪疊代編輯"。那意味著有一天,你也許可以直接跟AI說"把這個人物往左移一點,背景山換成海",而AI真正理解的,不再是一整張照片該怎麼重畫,而是這句話到底指向了哪一層、該動哪塊積木。

Q&A

Q1:UniWorld-Design是什麼?

A:UniWorld-Design是一個把圖像生成從"畫一整張圖"改成"生成可編輯圖層"的框架,核心是把帶透明通道的RGBA圖層當作生成、理解和編輯的最小單位,包含T2RGBA(文字生成透明素材)和I2L(圖片拆解成圖層)兩個模型。

Q2:I2L和普通的圖像分割工具有什麼區別?

A:普通分割只能摳出畫面上肉眼可見的部分,被遮擋的地方會留下透明的洞;I2L學的是完整的語義對象,即使某個物體被遮擋了一部分,拆解出來的圖層依然是完整的,挪走遮擋物後不會露餡。

Q3:這套技術訓練時用的數據從哪裡來?

A:團隊沒有用AI生成的圖層做訓練數據,而是直接使用設計師製作的PSD文件,因為PSD里被遮擋的圖層內容原本就完整保留著,避免了用AI自己編造的內容訓練AI導致的偏見傳遞問題。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新