宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

像素空間和潛空間打了一架,誰贏了?

2026年08月26日 首頁 » 熱門科技

你有沒有想過一件事:現在幾乎所有能打的文生圖模型,比如Stable Diffusion、FLUX、Seedream,背後都藏著一個共同的秘密武器,叫做VAE像素空間和潛空間打了一架誰贏了

這個秘密武器做的事情說起來挺樸素:先把一張1024×1024的圖片壓縮成一個小得多的"潛空間表示",模型在這個小空間裡去學習、去生成,最後再靠VAE把結果解壓還原成圖片。這就好比你要裝修一整棟別墅,先在縮尺模型上把所有家具擺放、顏色搭配都試一遍,確定沒問題了,再按圖施工到真實空間裡。

這套流程確實好用,幾乎所有大廠的圖像生成模型都在用。但阿里巴巴Token Hub像素空間和潛空間打了一架誰贏了這次的研究,把一個大家心照不宣、但很少有人認真算過賬的問題擺上了台面:這個"縮尺模型"到底有沒有代價?如果我們繞開它,直接在像素空間裡訓練和生成,會發生什麼?

結果比想像中要複雜得多。他們發現,直接在像素空間裡從零開始預訓練,收斂速度慢得讓人心疼。但如果換一個思路,先在潛空間裡練好基本功,再把模型"轉移"到像素空間去,效果反而能反超潛空間模型,同時推理速度還能快上3到接近5倍。

這篇論文的價值不在於提出了一個多麼炫酷的新架構,而在於把這條"潛空間到像素空間"的轉換路徑上,每一個容易踩坑的細節都認真測了一遍,給出了一份可以照著抄的操作手冊。

潛空間的降維壓縮:是效率神器,還是隱藏的天花板?

要理解這篇論文在爭論什麼,得先弄明白潛空間和像素空間到底差在哪。

潛空間擴散模型像素空間和潛空間打了一架誰贏了(Latent Diffusion Model,簡稱LDM):先用一個預訓練好的自編碼器(VAE)把圖像壓縮成低維的"潛在表示",擴散過程在這個壓縮後的空間裡進行,最後再用VAE解碼還原成真實圖像的技術路線。

這套思路自2022年Stable Diffusion的前身論文提出後幾乎成了行業標準。原因很直接:直接在原始像素上做擴散計算量太大了,1024×1024的圖片有一百萬個像素點,如果每個像素點都要參與模型的注意力計算,顯存和算力根本扛不住。VAE把這個規模壓縮了16倍甚至更多,相當於把計算負擔削減到了原來的零頭。

但壓縮是要付出代價的。VAE在把圖片"瘦身"的過程中,會不可避免地丟掉一些細節,比如極細的紋理、微妙的色彩過渡,這些東西經過壓縮再解壓之後,很難做到分毫不差。而且更麻煩的是,VAE的訓練目標是"重建",也就是讓壓縮再解壓後的圖片儘量像原圖;但擴散模型的訓練目標是"生成",這兩個目標之間存在錯位。論文裡提到,這種錯位會導致潛空間裡出現一些奇怪的分布偏移,比如紋理被磨平、顏色發生偏差,擴散模型不得不花額外力氣去"糾正"這些由VAE帶來的失真。

這就好比你請了一個翻譯幫你和外國朋友交流。翻譯水平不錯,大部分意思都能傳達,但總有一些微妙的語氣、雙關、文化梗翻不出來,甚至有時候還會因為翻譯習慣引入一點點走樣。你說的話和對方聽到的話,中間隔著一層"翻譯腔"。如果你能直接用對方的語言交流,這層損耗就不存在了,但代價是你得從頭學一門新語言,前期會說得磕磕巴巴,進步也慢得多。

像素空間擴散模型像素空間和潛空間打了一架誰贏了,就是那個"直接用對方語言交流"的選擇。它跳過VAE這一層,直接在原始RGB像素上完成去噪和生成,理論上能夠摸到VAE壓縮所丟失的那部分視覺資訊的天花板。而且推理時也不需要額外的VAE解碼步驟,直接省下一步計算,這在講究速度的實際應用里是個實打實的優勢。

那問題來了:這門"新語言",好學嗎?

第一個真相:像素空間預訓練,收斂速度慘不忍睹

論文做了一個非常直接的對照實驗。他們用完全一樣的模型架構(基於阿里的Z-Image像素空間和潛空間打了一架誰贏了)、一樣的訓練數據(超過200億組圖文對)、一樣的算力預算,唯一的區別是:一個模型在潛空間裡學,另一個直接在像素空間裡學。

結果毫無懸念地一邊倒。

在GenEval和DPG這兩個衡量圖文對齊質量的評測基準上,潛空間模型從訓練一開始就遙遙領先,尤其是在訓練初期這個差距特別明顯。

具體來看訓練曲線,潛空間模型在很早期就能畫出基本可靠的物體結構和圖文對應關係,而像素空間模型在同樣的訓練步數下,畫面還是一團模糊。論文裡給了個具體例子,同樣是訓練到5萬步,讓模型畫"一張長椅的照片",潛空間模型已經能畫出結構清晰的長椅,像素空間模型的輸出還是散亂的色塊。即便訓練到15萬步,像素空間模型仍然沒有追上。

為什麼會這樣?

論文給出的解釋是,VAE不只是一個壓縮器,它其實是一種經過大規模數據訓練學出來的、結構化的視覺表示方式。它把雜亂的像素資訊整理成了一個更規整、更貼近語義的空間,濾掉了大量局部冗餘和高頻噪聲,只保留和圖像內容、外觀相關的核心資訊。

這相當於VAE已經幫擴散模型把學習任務"降了維度"。潛空間模型只需要在這個已經被清理乾淨的空間裡學會去噪,而像素空間模型得直接面對未經處理的原始信號,一邊要學全局的圖像結構,一邊要學局部的紋理統計規律,一邊還要學怎麼去噪,三件事情揉在一起,學習負擔陡然加重。

打個比方,這就像兩個學生準備同一場考試。潛空間模型拿到的是老師精心整理過的重點筆記,知識點已經被提煉歸納好了;像素空間模型拿到的是幾百頁原始教材,什麼是重點、什麼是廢話,全靠自己一點點摸索。就算給兩人同樣多的複習時間,筆記黨的效率顯然更高。就算像素空間模型最終能學明白,那也得花更久,而在這篇論文的實驗設置里,即使砸進去200億組數據,它依然沒能追平差距。

這個發現直接推翻了一種可能存在的直覺:既然像素空間避免了VAE的資訊損失,是不是從頭訓練一個像素空間模型天然更有優勢?答案是否定的,至少在預訓練階段,潛空間的"降維預處理"帶來的優化便利性,遠遠蓋過了它損失的那點資訊。

轉折點:與其死磕到底,不如換個跑道

既然像素空間預訓練這麼吃力,論文沒有選擇硬剛,而是提出了一個更聰明的思路:潛空間用來打基礎,像素空間用來做精修。

這個思路聽起來簡單,業內也不是第一次有人這麼想(論文提到了此前的L2P像素空間和潛空間打了一架誰贏了等相關工作),但真正把這條轉換路徑的每一個環節都仔細測過、找出最優解的,這篇論文算是做得比較徹底的一個。

具體來說,團隊先在潛空間裡把模型的基本能力練紮實,學會理解文本、構建物體結構、掌握基本的圖像語義,然後再想辦法把這個已經"身經百戰"的模型,遷移到像素空間去繼續訓練,讓它最終能直接輸出RGB像素。

這個轉換過程里,藏著好幾個魔鬼細節。

**權重初始化:帶著記憶重新出發,還是清空重來?**

第一個問題是,當模型要從潛空間切換到像素空間時,之前學到的那些知識和參數,要不要繼續沿用?

論文做了對比:一個像素空間模型直接從潛空間訓練好的權重繼續訓練,另一個則完全從零開始訓練,其他條件保持一致。

結果非常清楚,用潛空間權重初始化的模型,在GenEval和DPG評分上全程領先,而且這個領先優勢貫穿整個訓練過程。從零開始訓練的那個模型,進步速度很慢,長時間內都遠遠落後。

論文裡給了一個具體的定性對比案例,用同一句複雜的中文提示詞(描述一個雨夜孤獨走在街上的女子),帶潛空間權重初始化的模型在訓練5000步的時候就已經能畫出識別度很高的畫面結構了,而從零訓練的模型直到5萬步,畫面還是不穩定、結構混亂。

這個現象其實不難理解。潛空間訓練階段學到的,不只是"怎麼在潛空間裡畫畫"這麼表面的技能,更深層的是關於物體結構、構圖邏輯、文字和圖像如何對應的通用知識。這些知識很大程度上是跟具體的輸出空間無關的,換句話說,模型學會的是"怎麼理解一句話該畫成什麼樣",而不是"潛空間的像素該怎麼擺"。這種通用知識是可以遷移的。

這就好比一個已經在小提琴上練了十年基本功的音樂家,突然要轉學大提琴。雖然樂器變了,弓法、指法的具體手感都得重新適應,但他對樂理、節奏、音樂表達的理解是現成的,不需要從零學起。如果非要找一個從沒碰過任何樂器的人從頭學大提琴,進度自然要慢得多。如果論文裡沒做這個權重遷移,直接讓像素空間模型從零練起,那前面辛辛苦苦攢下的潛空間預訓練成果就完全浪費了,等於是白白多花一遍力氣。

**訓練數據的配方:自產自銷,還是引入外部食材?**

第二個要解決的問題是,用什麼數據來餵這個正在轉型的模型。

直覺上,既然像素空間的優勢就是能直接從真實高質量圖片裡學習細節,那是不是應該多用真實圖片訓練?

論文的實驗結果給出了一個有點反直覺的答案:只用真實圖片訓練,收斂速度反而是最慢的那個選項。

真正收斂得快的,是用潛空間源模型自己生成的圖片來訓練像素空間模型。團隊的解釋是,這些自己生成的樣本和潛空間模型原本學到的條件分布高度貼合,相當於給轉型過程搭了一座"低落差"的橋,模型不需要一邊適應新的輸出格式,一邊還要應付陌生的數據分布,兩件事解耦開了,轉型自然更順暢。

論文還做了一個對照,用另一個完全不同的模型(FLUX2-klein像素空間和潛空間打了一架誰贏了-9B)生成的數據來訓練,效果明顯不如用源模型自己生成的數據,這進一步說明了數據分布和源模型的匹配程度,直接決定了遷移的順滑程度。

自監督數據像素空間和潛空間打了一架誰贏了(Self-generated data):由訓練初始化所用的那個源模型自己採樣生成的圖片,因為分布和源模型高度一致,用來做後續訓練時能大幅降低"水土不服"的風險。

但自產數據也不是萬能的,它天生帶著源模型和VAE解碼過程里遺留下來的錯誤。論文舉了個具體例子,比如畫面里的排版文字(typography)如果只用自產數據訓練,那些扭曲變形的文字錯誤會被繼續沿用下去,怎麼都改不掉。

於是團隊的最終方案是把自產數據和高質量真實圖片按1:1混合。自產數據負責讓轉型過程又快又穩,真實圖片則負責把VAE壓縮過程中丟掉的那些細節資訊找補回來,同時糾正源模型遺留的各種錯誤。

這其實特別像做菜時候的"提鮮"和"補充營養"兩件事分開做。你可以先用現成的高湯(自產數據)打底,保證味道框架穩定不跑偏,再往裡加新鮮的食材(真實圖片)來補足營養和口感層次。如果只用高湯,湯底雖然穩,但缺少新鮮食材帶來的那些細膩口感;如果只用生食材從頭燉,火候和味道很難把控,耗時也長。兩者結合,才是效率和品質都兼顧的做法。

**預測目標之爭:預測噪聲速度,還是直接預測乾淨圖像?**

擴散模型在訓練時,本質上是讓神經網路去預測"從當前帶噪圖像到目標之間差了什麼",這個"差了什麼"可以有不同的數學表達方式。論文裡提到兩種主流選擇:

x-prediction像素空間和潛空間打了一架誰贏了:模型直接預測出乾淨、無噪聲的目標圖像本身。

v-prediction像素空間和潛空間打了一架誰贏了:模型預測的是沿著擴散路徑運動的"速度",這是目前主流潛空間模型(包括Z-Image本身)常用的做法。

之前有研究(論文提到的JiT)認為,在像素空間訓練里,x-prediction是保證訓練穩定的關鍵,而v-prediction可能會導致訓練發散、崩掉。

但這篇論文的實驗場景有點特殊,因為它的像素空間模型是從一個用v-prediction訓練出來的潛空間模型初始化而來的。這就帶來一個新問題:遷移過程中,到底要不要把預測目標也跟著換掉?

實驗結果顯示,因為有了潛空間權重打底,兩種預測方式都能穩定訓練,不會出現從零訓練時那種發散問題。但即便如此,切換到x-prediction的模型,在各項評測指標上依然穩定優於繼續用v-prediction的模型。

這說明了兩件事:潛空間的初始化確實能兜住訓練穩定性這個底線,但要拿到最好的最終效果,還是得讓預測目標匹配上像素空間本身的特性。

**解碼器架構的選擇:多花參數量買畫質,值不值?**

模型內部處理完資訊之後,總得有一個模組把這些抽象的特徵,轉換成具體的每個像素點的顏色數值,這個模組叫做解碼頭。

論文對比了五種方案:JiT的線性投影頭(結構最簡單)、DiP的輕量級卷積U-Net、PixelDiT的Transformer解碼頭(簡稱PiT)、Deco的頻率解耦頭,以及作為參照的傳統VAE。

結果呈現出一個很清晰的效率和質量的權衡關係。

| 解碼器 | 參數量(M) | 延遲(ms) | GenEval | DPG |

|---|---|---|---|---|

| JiT | 2.95 | 0.07 | 0.7380 | 86.19 |

| DiP | 10.09 | 6.02 | 0.7545 | **87.54** |

| PiT | 2249.82 | 74.96 | **0.7697** | 86.36 |

| Deco | 315.92 | 5.01 | 0.7347 | 86.10 |

PiT這個方案,畫質評分(GenEval)確實是最高的,但代價極其驚人,它的解碼器單獨就有22.5億參數,相當於整個66億參數主幹網路的37.5%,計算量高達19731 GFLOPs。這就像為了讓門鎖開得更順滑一點,專門給你的公寓裝了一個和主體建築差不多重的門把手,性價比完全說不過去。

JiT這個方案效率是最高的,延遲只有0.07毫秒,但代價是畫面質量打了折扣,而且會在圖像分塊的邊界處出現明顯的網格狀瑕疵,就像拼圖沒拼嚴實,能看到接縫。

DiP最終勝出,靠的是恰到好處的平衡:只用1009萬參數,DPG評分反而是所有方案里最高的,GenEval也具有競爭力,而且它生成的圖像在分塊邊界處過渡更平滑。論文解釋說,這得益於卷積網路天生的"局部空間歸納偏置",卷積操作本身具有局部性和權重共享的特性,能讓相鄰的圖像塊特徵在最終生成像素之前先互相"打個招呼",從而減少塊與塊之間的生硬拼接感,而且不需要像PiT那樣堆疊巨大的參數量。

**噪聲調度的隱藏陷阱:理論算出來的最優解,居然不是真的最優**

這是整篇論文裡我覺得最有意思的一個細節,因為它展示了一次"理論推導很漂亮,但現實打臉"的過程。

從潛空間轉到像素空間,圖像的空間解析度變了(潛空間通常是原圖的1/8大小),信號的數值分布也變了。這意味著原本給潛空間設計的噪聲調度方案,直接搬到像素空間用,很可能會讓模型面對一個完全不匹配的信噪比環境。

信噪比(Signal-to-Noise Ratio,簡稱SNR):衡量在擴散過程某個時間步,圖像里"有效信號"相對於"噪聲"的強弱程度,是擴散模型設計中非常核心的一個概念。

團隊沒有選擇重新設計整套噪聲調度,而是引入了一個簡單的縮放因子γ,用來調整噪聲的強度。他們先做了一個理論推導:假設像素空間和潛空間的唯一區別就是空間解析度(潛空間的空間尺寸是像素空間的1/8),那麼通過匹配兩者的信噪比,可以推算出γ的理論最優值應該是8。

但實際測試γ取1、2、4、8這四個值後發現,效果最好的居然是γ=2,理論算出來的8反而是效果最差的幾個之一。

| γ值 | GenEval | DPG |

|---|---|---|

| 1 | 0.6811 | 84.03 |

| **2** | **0.7545** | **87.54** |

| 4 | 0.7413 | 86.01 |

| 8 | 0.7316 | 85.64 |

定性觀察也印證了這一點,γ取1、4、8的時候,生成的圖片都會出現明顯的色彩偏移,只有γ=2的時候色彩渲染最平衡自然。

這說明什麼?說明"解析度差異"這個單一因素,根本沒法完整解釋潛空間和像素空間之間真正的分布差異。VAE編碼器不等同於簡單的平均池化操作,RGB像素和VAE潛在表示在信號統計特性、預測目標上還有很多沒被這套簡化理論捕捉到的差異。

這個發現其實挺有啟發性的。很多時候我們會本能地信任一個"看起來很嚴謹"的數學推導,覺得算出來的答案肯定錯不了。但複雜系統里往往藏著理論模型沒有覆蓋到的變量,這時候老老實實做實驗去試,比迷信公式更可靠。這就像你按照營養學公式精確計算出了一份"理論最優"的減脂餐單,結果真人試吃下來,身體的實際反應和公式預測的完全對不上號,因為人體的複雜程度,從來不是一套簡化公式能完全裝下的。

效率的進一步壓榨:把圖像切得更粗,把採樣步數砍得更狠

搞定了訓練階段的各種細節之後,論文還琢磨了怎麼讓最終的模型跑得更快。這裡用了兩招。

**第一招:漸進式擴大圖像分塊尺寸**

Patch Size(圖像分塊尺寸):擴散模型處理圖像時,通常不是逐像素處理,而是把圖像切成一個個小方塊(patch),每個小方塊被打包成一個"視覺詞元"(token)送進模型。分塊尺寸越大,同樣大小的圖片被切出來的詞元數量就越少,模型需要處理的序列就越短,速度就越快,但每個詞元需要承載的資訊量也越大,容易丟細節。

論文原本的設置用的是ps16(每個塊16×16像素),對應1024×1024圖片會被切成64×64的網格。如果想提速,很自然的想法是加大這個塊的尺寸,比如換成ps32,塊數直接減少4倍。

但直接從頭訓練一個ps32的像素空間模型,效果很差,會出現明顯的局部瑕疵。原因也不難理解,因為這樣做同時改變了兩件事,一是從潛空間換成像素空間的預測目標,二是把詞元的空間粒度一下子變粗了。兩個變化疊在一起,模型的局部視覺先驗知識很難順利遷移過去,每個詞元要覆蓋的空間範圍變大了,學習難度陡增。

論文的解決辦法是分兩步走:先把模型從潛空間遷移到像素空間,同時保持ps16這個精細粒度不變,等這一步穩定收斂了,再把它進一步適配到ps32,這個方案被稱為ps32-adapt16。

結果是,ps32-adapt16的收斂速度比直接訓練ps32快得多,最終效果和ps16基本持平,而且用的詞元數量只有ps16的四分之一。

但如果再進一步,從ps32-adapt16繼續擴展到ps64呢?論文也試了,雖然又能再省4倍的詞元,但這次細節明顯開始劣化,評測分數也跟著下滑。這說明這條路是有邊界的,壓縮到一定程度後,畫面細節的損失就藏不住了。

這整個過程其實特別像學游泳換泳姿。你已經練熟了自由式的基本動作,突然讓你直接改成難度更高的蝶泳,還要求速度更快,大概率會手忙腳亂,姿勢變形。更可靠的做法是先在原來熟悉的自由式節奏里,把新學到的呼吸方式練穩,再逐步過渡到蝶泳的動作幅度。如果沒有這個循序漸進的過渡,直接一步到位地跳到最省力的姿勢,反而更容易嗆水。如果論文沒有做這個漸進適配,直接訓練更大分塊尺寸的模型,畫面質量的損失是要吃更大虧的。

**第二招:步數蒸餾,把100步壓縮到4步**

第二個提速手段是步數蒸餾。

步數蒸餾(Step Distillation):讓一個原本需要幾十上百步疊代去噪才能生成圖像的擴散模型,學會用極少的幾步甚至一步就完成生成,同時儘量不損失畫質的技術。

在潛空間模型里,步數蒸餾雖然管用,但有一個隱藏的成本瓶頸:當去噪步數被壓縮到極致(比如只剩4步)之後,原本可以忽略不計的VAE解碼那一步,占總耗時的比例就變得越來越大了。這就好比你把做菜的步驟從10步壓縮到2步,結果發現最後擺盤裝飾這一步原本占用時間很少,現在卻成了整個流程里最耗時的部分。

像素空間生成天然沒有這個包袱,因為它本來就直接輸出RGB像素,沒有額外的解碼步驟。論文應用了兩種蒸餾技術(Decoupled-DMD和DMDR)對像素空間模型進行加速。

最終效果相當亮眼。僅僅是把預測空間從潛空間換成像素空間,就能帶來1.10倍的提速;加上漸進式分塊適配後,單張圖片的延遲降到4.56秒,相當於4.41倍加速;再疊加步數蒸餾之後,像素空間模型生成一張圖只需要0.20秒,而同等條件下的潛空間蒸餾模型需要0.95秒,加速比達到4.75倍。把所有技巧疊加在一起,相比最初那個原始的潛空間流程,總體加速比高達100.6倍。

最終成績單:又快又好,不是自我感動

理論和局部實驗說了這麼多,最終還是要看整體表現能不能立得住。

論文在Z-Image和FLUX2-klein兩個模型家族上都驗證了這套方案。

在100次函數評估(NFE,可以理解為去噪疊代的次數)的設置下,Z-Image的像素空間版本相比原始潛空間版本,推理延遲從20.12秒降到4.56秒,加速4.41倍,同時GenEval評分從0.7510提升到0.7644,DPG評分從86.91提升到87.60,幾乎是又快又好。

對比此前同類工作L2P,新方案在四個評測基準上全面勝出,延遲還更低。而在4次函數評估(也就是極限壓縮到幾乎"一步出圖")的場景下,加速比達到4.75倍,畫質評分同樣反超原版。

| 模型 | NFE | 延遲(秒) | GenEval | DPG |

|---|---|---|---|---|

| Z-Image(潛空間) | 100 | 20.12 | 0.7510 | 86.91 |

| L2P(像素空間) | 100 | 18.26 | 0.7612 | 86.00 |

| Ours(像素空間) | 100 | **4.56** | **0.7644** | **87.60** |

| Z-Image-Turbo(潛空間) | 4 | 0.95 | 0.7625 | 85.31 |

| Ours-Turbo(像素空間) | 4 | **0.20** | **0.7698** | **86.85** |

更關鍵的是,這套方法在換到另一個完全不同的模型家族FLUX2-klein上依然管用,同樣取得了3.18到3.29倍的加速,同時大部分評測指標優於原版和此前的對比方案AsymFlow。這說明這套"潛空間打底、像素空間精修"的配方,不是針對某一個模型量身定做的偏方,而是有一定普適性的方法論。

寫在後面

讀完這篇論文,最讓我意外的地方其實是γ=2那個實驗。一個推導得挺嚴謹的理論公式,算出來的最優解是8,結果實測下來2才是最好的,而且差距不小。這提醒我一件事:在複雜系統里,理論模型往往只捕捉到了幾個主要變量,剩下那些沒被建模進去的因素,很可能才是決定成敗的關鍵。這種"算得漂亮但測不出來"的落差,在很多工程領域可能都反覆出現,只是很少有論文願意老老實實把這個過程寫出來。

另一個值得琢磨的地方是,論文裡反覆出現的"自產數據"策略,用源模型自己生成的圖片去訓練它的下一代版本。這種自己餵自己的做法乍一看有點像近親繁殖,容易把自身的缺陷也一起遺傳下去(論文裡提到的文字排版錯誤就是證據)。但它同時又是讓訓練變快最有效的手段。這種"效率和純淨度互相拉扯"的局面,感覺在很多自我疊代的系統里都會遇到,AI訓練AI,或許遲早得面對這個問題。

論文裡也留了一個沒解決的坑:ps64-adapt32這個更激進的壓縮方案為什麼會掉分,具體是哪個環節丟了細節,論文沒有深挖。如果未來能找到辦法讓詞元壓縮得更狠還不掉畫質,那這套像素空間路線的天花板可能還能再往上頂一頂。

Q&A

Q1:像素空間擴散模型和潛空間擴散模型的核心區別是什麼?

A:潛空間擴散模型先用VAE把圖片壓縮成低維表示,在壓縮空間裡訓練和生成,最後再解碼還原成圖片;像素空間擴散模型直接在原始RGB像素上訓練和生成,不需要VAE壓縮和解碼這道工序,能保留VAE壓縮過程中可能丟失的細節,推理時也少一步解碼,速度更快。

Q2:為什麼不直接從零開始訓練像素空間模型,而要先在潛空間訓練?

A:論文實驗發現,在完全相同的算力和數據條件下,直接從零訓練像素空間模型收斂速度明顯慢於潛空間模型,而且訓練很久也追不上潛空間模型的效果。所以更好的做法是先在潛空間高效地訓練出模型的基礎能力,再把這個模型遷移轉換到像素空間繼續訓練,這樣既能借到潛空間訓練快的優勢,又能拿到像素空間畫質和速度上的好處。

Q3:這套潛空間轉像素空間的方法能帶來多大的速度提升?

A:在Z-Image模型上,100步採樣場景下能實現4.41倍加速,4步快速採樣場景下能實現4.75倍加速,疊加分塊尺寸優化和步數蒸餾後總加速比達到100.6倍;在FLUX2-klein模型上也能實現3.18到3.29倍加速,同時生成質量基本持平或優於原始潛空間模型。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新