這篇綜述由麥吉爾大學、蒙特婁學習算法研究所(Mila)、劍橋大學、多倫多大學、穆罕默德·本·扎耶德人工智慧大學等多所機構聯合完成,於2026年7月以arXiv預印本形式發布,編號為arXiv:2607.13431v1。有興趣深入了解的讀者可通過該編號查詢完整論文。
當你使用ChatGPT或其他AI助手生成一段文字時,你可能從未想過,這段文字是如何被"造出來"的。在絕大多數人的認知里,AI寫字就像人打字一樣——一個字一個字地往後拼,前一個字決定後一個字,環環相扣,不可回頭。這種方式叫做"自回歸生成",是目前幾乎所有主流大語言模型的核心機制。
然而,這篇綜述想要告訴你的是:還有另一條路,一條更像"拼圖"而不是"打字"的路。這條路的名字叫做**離散擴散模型**(Discrete Diffusion Models,簡稱DDMs)。研究團隊花費大量篇幅,系統梳理了這一領域從理論基礎到實際應用的全貌,並提出了一套統一的分析框架——其核心主張是:**"分詞方式"本身就是模型設計的第一塊基石,而非可以隨意忽視的預處理細節。**
一、為什麼"一個字一個字往後寫"會出問題
要理解離散擴散模型的價值,得先明白它想解決什麼麻煩。
現有的主流AI寫作方式,本質上是一種"單行道"。模型從左到右,依次生成每一個詞,生成完就算數,無法回頭修改。這就好比你用一支鋼筆在紙上寫字,墨水一落,白紙變黑,永不可撤銷。這種方式在某些場景里工作得很好,比如連續對話、流式輸出。但一旦遇到需要"全局謀劃"的任務,麻煩就來了。
舉個例子。如果你讓AI幫你完成一段代碼,代碼的第一行必須和最後一行相互呼應,而自回歸模型在寫第一行時,根本還不知道最後一行會是什麼。它只能"蒙著眼睛往前走",一旦走偏,後面的所有內容都會跟著偏。又比如,你讓AI幫你填寫一段中間缺失的文字(這種任務叫"填空"或"infilling"),自回歸模型天然不擅長,因為它的"視野"只朝一個方向開放,看不見右邊已有的內容。
此外,自回歸模型的生成速度也受到根本性限制。無論你的電腦有多少個處理器並排工作,生成第100個詞之前必須先完成第99個詞——這是一種無法繞過的串行依賴,序列越長,等待越久。
離散擴散模型的核心思路恰好相反。它不從左到右一步步"打字",而是先把整個輸出全部遮住(想像一張全是馬賽克的圖片),然後通過反覆"去噪"的方式,逐漸讓清晰的內容浮現出來。每一次去噪,模型都能同時看到整個序列的當前狀態,從而做出更具全局意識的判斷。這種方式天然支持"回頭修改"——某個位置的詞語如果生成得不好,可以在下一輪去噪時重新考慮。
二、"拼圖遊戲"的物理學起源
離散擴散模型的靈感來自物理學中的一個經典現象:擴散。你往一杯清水裡滴一滴墨水,墨水會慢慢擴散,最終均勻分布在整杯水中。這個過程是不可逆的——你無法讓均勻的墨水自動重新聚集到最初的那一滴。
擴散模型的核心技巧,正是讓神經網路學會"逆轉這個過程"。在圖像生成領域,這已經大獲成功:先把一張清晰的圖片慢慢加噪聲,直到變成隨機的白噪聲;再訓練一個網路,學會從白噪聲一步步"還原"出清晰圖片。這就是現在廣泛使用的Stable Diffusion等圖像生成工具的底層邏輯。
但文字不是圖片。圖片裡的像素是連續的數值,可以自然地被高斯噪聲"污染"。文字是離散的符號——"貓"這個詞要麼是"貓",要麼是"狗",中間沒有"0.7個貓加0.3個狗"這種東西。直接把圖像擴散的方法搬到文字上,會產生嚴重的"語義錯位":模型在連續空間裡學會的去噪技巧,回到離散文字空間時會出現大量"四不像"的結果。
因此,離散擴散模型的研究者們放棄了"先把詞語嵌入連續空間再擴散"的投機路線,轉而在離散空間裡直接定義噪聲過程。這意味著,"污染"一個詞語的方式不是加高斯噪聲,而是把它替換成另一個詞、或者替換成一個特殊的"遮蔽符號"([MASK])。相應地,"去噪"的任務變成了:根據上下文,猜出被遮住或被替換的那個詞原本是什麼。
三、三種"弄髒文字"的方式及其深遠影響
這篇綜述花了相當大的篇幅,討論如何在離散空間裡定義"噪聲"——因為這個選擇幾乎決定了後續一切。
最直接的方式叫**均勻替換**:每個詞以一定概率被隨機替換成詞表中的任意其他詞。這就好比把一篇文章里的某些詞隨機替換成字典里隨便一個詞,結果可能是"今天天氣很好的"變成"今天香蕉很好的"。這種方式在數學上很乾淨,但實際使用時效果不理想——因為模型必須在幾萬個候選詞中猜對一個,難度太高。
第二種方式叫**吸收態遮蔽**(Absorbing/Masking):每個詞以一定概率被替換成統一的[MASK]符號,一旦被遮住,就再也不會自動恢復。這就像把文章里某些詞塗成黑塊,模型的任務是根據未被遮住的內容推斷黑塊下面應該是什麼。這種方式和BERT等預訓練模型的訓練方式幾乎一致,因此工程上非常成熟,訓練也最穩定。事實上,目前幾乎所有大規模離散擴散語言模型都採用了這種方式,包括MDLM、LLaDA等影響力較大的系統。
第三種方式叫**結構化轉移**:替換的目標詞不是隨機選取的,而是根據某種"相似度"來決定——比如,和原始詞在語義上接近的詞更可能成為替換目標。對於蛋白質序列,這種相似度來自生物進化數據;對於音頻編碼,這種相似度來自編碼本的幾何結構。這是最具資訊量、也最難設計的方式,目前在實踐中應用較少,但研究者認為這是一個被嚴重低估的方向。
這三種方式的選擇,不只是技術細節。它根本性地決定了:模型在訓練時面對什麼難度的問題、生成時按照什麼順序"揭曉答案"、以及最終輸出的質量和多樣性。研究團隊將這個選擇稱為"轉移矩陣設計",並指出它是整個離散擴散框架中最重要的設計軸之一。
四、"分詞"憑什麼是第一塊基石
這篇綜述最核心的主張,也是最容易被忽視的洞見,就是:**分詞方式本身不是預處理細節,而是模型設計的第一個決策,它的影響貫穿後續所有環節。**
以文字處理為例。現在主流的大語言模型通常使用BPE(字節對編碼)或WordPiece等算法,把文字切成子詞單元。"tokenization"這個英文詞可能被切成["token", "ization"]兩個子詞。這種切法能壓縮序列長度,但帶來一個微妙問題:這些子詞在語義上完全沒有相互關係,"token"和"##ization"在詞表里的編號可能相差幾千,但這個編號差沒有任何意義。
當離散擴散模型試圖用"均勻替換"來污染文字時,它會把"token"隨機替換成詞表里任意一個子詞。問題在於,詞表里可能有幾萬個子詞,絕大多數替換都毫無語義聯繫。這導致噪聲太"猛烈",模型需要從極度混亂的狀態中恢復資訊,訓練難度極高。這正是吸收態遮蔽之所以流行的原因——[MASK]這個符號雖然也是"無資訊"的,但它至少明確標記了"這裡有內容被隱藏了",這比隨機替換提供了更多的結構資訊。
在圖像和音頻領域,分詞問題更加複雜。連續的像素值或音頻波形需要先經過一套"向量量化"(VQ-VAE、VQ-GAN等)系統,轉換成離散的編碼本索引。這套系統本身就是一個神經網路,它的編碼本(codebook)決定了每個離散符號所代表的視覺或聲學內容。關鍵的是,這個編碼本是有幾何結構的——編碼本里編號相近的兩個符號,其對應的圖像塊往往在視覺上也相似。然而,幾乎所有現有的離散擴散模型在處理圖像token時,都把它們當作"沒有結構的離散符號",完全忽視了這種幾何相似性。研究團隊指出,這是一個被浪費的機會:如果噪聲過程能利用編碼本的幾何結構(讓視覺上相似的符號更容易相互轉換),理論上能得到更平滑的噪聲軌跡和更高質量的生成結果。
在科學領域,分詞天然就是有結構的。蛋白質是由20種胺基酸組成的序列,DNA和RNA由4種核苷酸組成。這些"字母"有著來自進化生物學的相似度矩陣(比如BLOSUM矩陣)——某些胺基酸在進化過程中更容易相互替代,這種替代概率就是一種天然的"噪聲結構"。分子圖裡的原子類型和化學鍵類型也有化學意義上的相似性。研究團隊建議,這些領域的離散擴散模型應該把領域知識直接融入噪聲過程的設計,而不是繼續沿用文字處理里的通用吸收態遮蔽。
五、統一框架的四個零件
綜述的一大貢獻是提出了一套統一的分析語言,把各種離散擴散模型都拆解成四個零件的組合:**噪聲算子、去噪網路、訓練目標和採樣器**。
噪聲算子就是前面討論的"如何弄髒輸入",可以是吸收態遮蔽、均勻替換、結構化替換,或者它們的混合。去噪網路是一個神經網路,它接收被噪聲污染的序列,輸出對原始內容的猜測。大多數現代模型選擇讓網路直接預測原始的乾淨詞語是什麼,這種做法叫做"x?參數化"——相當於直接讓網路"猜謎底",而不是猜中間狀態。
訓練目標決定了網路用什麼損失函數來學習。最嚴謹的方式是最大化變分下界(ELBO),這在數學上等價於最小化模型生成分布和真實數據分布之間的差距。研究表明,對於吸收態遮蔽擴散,這個複雜的變分目標在數學上等價於一個簡單的"加權遮蔽語言模型損失"——也就是說,訓練離散擴散模型在數學上和訓練BERT幾乎是一回事,只是對不同噪聲程度下的預測誤差加了不同的權重。這個發現極大簡化了訓練流程,使得擴散語言模型可以直接復用成熟的BERT式訓練基礎設施。
採樣器是推理階段的決策系統,決定如何從完全遮蔽的序列出發,一步步"揭示"最終輸出。最簡單的方式是按照學到的反向轉移概率逐步採樣,但實踐中有更多精細的策略:按照置信度排序,先揭示模型最確定的位置(置信度高的位置先"定稿");或者允許已經揭示的位置重新被遮蔽,重新猜測(相當於"悔棋")。這些策略的選擇會顯著影響生成質量和速度,且完全不需要重新訓練模型——這是離散擴散相比自回歸模型的一個獨特優勢。
六、從文字到蛋白質:一個框架走遍所有離散數據
這篇綜述的另一個雄心是證明:這套框架能夠跨越領域邊界,統一地解釋和指導文字、代碼、圖像、音頻、影片、蛋白質、DNA、分子圖等完全不同類型的離散數據生成任務。
在文字和代碼領域,當前最先進的離散擴散語言模型(如LLaDA、Dream 7B等)已經在指令跟隨、數學推理、代碼填充等任務上展現出與自回歸模型相當的競爭力。這些模型的一個顯著優勢是對"填空"任務的天然適應性——因為生成過程本就是雙向的,模型可以同時利用左側的前文和右側的後文來填補缺失部分,而自回歸模型做同樣的事情需要額外的工程技巧。代碼生成尤其適合擴散模型,因為代碼的全局約束極強(函數的開頭和結尾必須匹配,括號必須配對),離散擴散的全局視野在這裡有天然優勢。
在圖像、音頻和影片領域,離散擴散模型通常作為"第二階段"出現:先用向量量化編碼器把連續信號轉換成離散token序列,再用離散擴散模型在token空間裡進行生成。這種方式的核心優勢是"可編輯性"——只需要重新遮蔽圖像中某個區域的token,就能在不改動其他部分的情況下修改那個區域,類似Photoshop的局部塗改功能,但無需重新訓練任何模型。
在蛋白質和DNA/RNA領域,離散擴散模型正在成為一種核心工具。蛋白質本質上就是一串由20種胺基酸組成的離散序列,DNA就是由4個字母組成的長字符串。這些天然的離散性使得序列直接在"字母表"上進行擴散,無需任何量化步驟。更重要的是,這些領域有豐富的領域知識可以融入噪聲過程設計:進化替代矩陣能告訴我們哪些胺基酸在進化中容易相互替換,化學價鍵規則能約束分子圖的噪聲過程只產生合法的化學結構。目前已經有多個工作將離散擴散用於抗體設計、蛋白質逆摺疊(從三維結構反推胺基酸序列)、DNA調控元件設計等任務,並取得了令人鼓舞的結果。
在分子圖生成領域,挑戰在於圖本身是一個複雜的組合結構:原子是節點,化學鍵是邊,兩者都有離散的類型,而且必須滿足嚴格的化學價鍵約束。DiGress等模型把離散擴散直接應用於原子類型和化學鍵類型的聯合噪聲-去噪過程,取得了在分子生成標準基準上的競爭性結果。但化學有效性問題至今仍是主要瓶頸——一個隨機去噪的分子很可能在化學上是"非法"的(比如某個碳原子接了五根鍵),需要在採樣階段施加額外的約束。
七、推理時的"下棋"策略
離散擴散模型的推理階段,是整篇綜述中技術細節最豐富的部分之一。簡單來說,推理就是從一個全部被遮蔽的序列出發,經過若干步去噪,最終得到一個完整的輸出。但"若干步"怎麼走,大有學問。
最簡單的策略是按照固定的步驟數均勻地降低噪聲程度,每一步讓模型預測所有被遮蔽位置的內容,然後按照某種規則決定哪些位置"定稿"、哪些繼續保持遮蔽狀態。"按置信度優先揭示"是目前最常用的策略:模型在每一步預測所有遮蔽位置,對每個位置的預測都有一個置信度分數(通常是預測概率的最大值),然後優先"定稿"置信度最高的若干個位置,其餘位置繼續保持遮蔽。這就像在做多項選擇卷子時,先把最有把握的題做完,再用剩下時間攻克難題。
更精細的策略允許"悔棋":已經定稿的位置,如果後續發現它與上下文不協調,可以重新標記為遮蔽狀態,重新接受模型的審視。這種機制在自回歸模型中根本不存在(已經輸出的token是不可撤回的),是離散擴散模型獨有的能力。研究表明,適度的"悔棋"能顯著提升生成質量,尤其在需要全局一致性的任務(如數學推理、代碼生成)中效果更突出。
另一個重要方向是"分塊擴散"(Block Diffusion):把輸出序列切成若干塊,在塊內部進行雙向擴散,塊與塊之間保持自左向右的因果順序。這種方式在自回歸模型和全局擴散之間取了一個折中點,兼顧了流式輸出(用戶不需要等整個序列生成完才能看到結果)和全局一致性(每個塊內部的生成是雙向感知的)。這被認為是離散擴散走向實際部署的重要過渡方案。
推理加速也是一個活躍的研究方向。由於每次去噪都需要對整個序列做一次雙向注意力(計算量是序列長度的平方),推理速度是離散擴散模型面臨的主要工程挑戰之一。當前的加速方案包括:知識蒸餾(把多步去噪壓縮成少步甚至一步)、KV緩存復用(針對已經穩定不變的token跳過重複計算)、推測解碼(先用小模型快速草稿,再用大模型驗證),以及選擇性更新(只對還在變化的位置重新計算,跳過已經穩定的位置)。
八、訓練大型離散擴散模型的實踐智慧
綜述還系統整理了在大規模訓練離散擴散語言模型時積累的實踐經驗,這些經驗對於打算進入這個領域的研究者尤為珍貴。
噪聲調度(noise schedule)的設計類似於課程設置:它決定了在訓練過程中,模型面對的題目難度如何隨時間變化。對於吸收態遮蔽擴散,噪聲調度就是"每個時間步遮蔽多少比例的token"。研究發現,餘弦調度(cosine schedule)在數學上對於吸收態遮蔽擴散是最優的,這為一個原本只靠經驗調參的超參數提供了理論依據。不同的噪聲調度會顯著影響訓練的穩定性和最終模型的生成質量。
從預訓練的自回歸模型出發,通過持續訓練把它轉換成擴散模型,是一種節省計算資源的常見策略。DiffuLLaMA等工作展示了如何從LLaMA等開源自回歸模型出發,通過相對少量的訓練步數轉化為離散擴散模型。這種轉化通常需要一些特殊處理,比如把模型的注意力機制從單向改成雙向、調整位置編碼等。
對齊和強化學習同樣可以應用於離散擴散模型,但方式與自回歸模型有所不同。在自回歸模型中,強化學習可以按照token逐步給出獎勵;在擴散模型中,一次去噪產生的是整個序列的修改,信用分配(credit assignment)的難度更高。當前的研究提出了多種變體,包括基於DPO(直接偏好優化)的方法、基於策略梯度的方法,以及針對去噪軌跡整體進行優化的方法,各有優劣權衡。
九、如何評價一個離散擴散模型的好壞
評估離散擴散模型並不像評估自回歸模型那樣直接,這也是綜述著重討論的話題之一。
對於文字生成,傳統的BLEU、ROUGE等基於字符串匹配的指標對擴散模型不公平——因為擴散模型生成的文字往往比自回歸模型更多樣化,與參考答案的字面重合度更低,但並不代表質量更差。更合理的評估方式是在閉合答案的標準測試集上評價(比如數學推理、代碼執行通過率),或者採用大型語言模型作為評委進行主觀評分。研究團隊還特別指出,現有的AI生成文字檢測工具對擴散模型幾乎失效,因為這些工具假設了自回歸的生成順序,而擴散模型的生成順序是無序的,需要專門設計適配擴散模型的水印和檢測方法。
對於似然值(likelihood)的比較,需要格外小心。自回歸模型的困惑度(perplexity)是精確的對數似然值;大多數擴散模型報告的是變分下界,是真實似然值的近似,而且近似的緊度取決於步驟數和參數化方式。直接比較兩者會產生誤導。研究團隊建議,在比較自回歸模型和擴散模型的似然時,必須明確說明報告的是哪種值、使用了多少推理步驟、以及分詞方案是否一致。
速度和效率的評估同樣需要標準化。由於擴散模型的生成質量隨推理步數增加而提升,單一的"用N步生成的速度"數字意義有限;更有價值的是"質量-速度帕累托曲線",展示在不同速度預算下能達到的最高質量。研究團隊建議所有論文都報告這樣的曲線,而不是單點比較,以便公平對比不同系統。
十、已知的局限與開放問題
這篇綜述難得地在充分肯定離散擴散潛力的同時,也直接點出了尚未解決的問題,沒有迴避現實的挑戰。
上下文學習能力(in-context learning,即通過幾個示例就能理解新任務的能力)目前在離散擴散模型中普遍弱於相同規模的自回歸模型。研究者認為,這可能與訓練目標(遮蔽預測 vs. 下一詞預測)的內在差異有關,也可能是規模和訓練數據不足的體現,確切原因仍有爭議。
KV緩存類比物的缺失是工程上的重大挑戰。自回歸模型通過KV緩存,使得生成第N個token時不需要重新處理前N-1個token,從而實現了高效的逐token流式輸出。離散擴散模型每步去噪都需要重新處理整個序列,理論上沒有類似的直接等價物。當前的研究正在探索各種近似方案(比如對已經穩定的token跳過計算、延遲更新KV狀態),但距離自回歸模型的效率仍有差距。
流式輸出問題也困擾著實際部署。自回歸模型可以邊生成邊輸出,用戶能立刻看到第一個詞。擴散模型原則上需要等所有去噪步驟完成,才能輸出一個相對穩定的序列——這對交互式應用體驗是個明顯缺陷。分塊擴散是緩解這個問題的方向,但目前還沒有完美的解決方案。
在理論層面,擴散模型的收斂性保證、表達能力的邊界、不同參數化方式的等價性,都還有大量未解問題。研究團隊認為,這些理論問題不只是學術興趣,解答它們能直接告訴我們如何選擇噪聲調度、如何設計轉移矩陣,以及何時應該優先選擇擴散而非自回歸。
歸根結底,這篇綜述描述的是一個正在快速成熟但尚未定型的研究方向。離散擴散模型已經證明了自己能夠做到很多自回歸模型不擅長的事情,但在通用語言理解、低延遲部署、上下文學習等關鍵能力上,還有明顯的追趕空間。研究團隊預測,未來的主流系統很可能是自回歸和擴散的混合體——用自回歸處理流式交互,用擴散處理需要全局謀劃和反覆修改的任務。這不是一場你死我活的競爭,而是兩種生成哲學在各自擅長的舞台上共存和互補。如果你對這個方向感興趣,建議通過arXiv編號2607.13431查閱完整論文,那裡有比這篇解讀更豐富的數學推導和實驗細節。
Q&A
Q1:離散擴散模型和普通大語言模型(如GPT)在生成文字時有什麼根本區別?
A:普通大語言模型(自回歸模型)像打字一樣從左到右一字一字生成,已經輸出的內容不能撤回。離散擴散模型則是先把整個輸出全部遮蔽,再通過多輪"去噪"逐漸揭示內容,每一輪都能看到整個序列,因此能做全局修改和"悔棋",天然適合填空、代碼補全等需要雙向上下文的任務。
Q2:離散擴散模型生成速度慢嗎?
A:相比自回歸模型,離散擴散模型每一步去噪都要處理整個序列,計算量更大;但它能並行生成多個位置,不必串行逐詞輸出。實際速度取決於使用的步驟數和加速技巧,Mercury等商用系統聲稱在特定場景下速度超過優化後的自回歸基線,但這一說法基於特定硬體和批量設置,不能直接一般化。
Q3:蛋白質序列設計為什麼特別適合用離散擴散模型?
A:蛋白質本身就是由20種胺基酸組成的離散序列,天然符合離散擴散的建模假設,無需任何量化步驟。更重要的是,生物進化數據提供了胺基酸之間的替代概率矩陣(如BLOSUM),可以直接用作結構化噪聲,讓模型學到更生物學合理的序列變異規律,比隨機遮蔽更有資訊量。






