這項由德克薩斯大學奧斯汀分校研究團隊完成的研究,以預印本形式於2026年5月7日發布,論文編號為arXiv:2607.14106v1,感興趣的讀者可通過該編號在arXiv平台檢索完整論文。
現在的AI寫作工具,大多數人對它的印象是"一字一字往外蹦"——像極了你高中時盯著考卷苦苦思索,先寫第一個字,再寫第二個字,每次落筆都要參考前面已經寫下的內容。這種方式叫"自回歸生成",它很好用,但速度是它的硬傷:必須一步一步來,無法並行加速。
正因如此,另一類AI寫作方案近年來引發了廣泛關注——"擴散語言模型"。這類方法的思路更像一位畫家:先在畫布上塗抹一片朦朧的噪點,然後一輪一輪地細化,直到清晰的圖像浮現出來。在語言版本里,AI從一堆隨機字符出發,經過多輪"去噪",最終得到一段有意義的文字。最大的優勢在於,這個過程可以並行處理所有位置的字符,大幅提升生成速度。
然而,現有的擴散語言模型存在一個根本性的缺陷,德克薩斯大學奧斯汀分校的研究團隊將其稱為"因式分解問題"。簡單說,當AI在一步之內同時決定多個字的內容時,它實際上是把每個字獨立地猜出來,而不是真正考慮它們之間的搭配關係。這就好比你讓一群人同時猜謎,每個人只能聽到謎面,相互之間無法交流——結果雖然每人都給出了"合理"的答案,合在一起卻可能驢唇不對馬嘴。
面對這個問題,研究團隊提出了一種全新的方案,名為"Token時間連續擴散模型"(TTCD,Token Time Continuous Diffusion)。這個名字聽起來很拗口,但它背後的核心思想卻出人意料地直覺化:不同的字,應該以不同的速度從"噪聲"變成"清晰"。有些字天生容易猜,就讓它先變清楚;有些字需要參考更多上下文,就讓它慢一點。
一、從"一鍋燉"到"分檔火候"——擴散語言模型的困境與出路
要理解TTCD究竟解決了什麼問題,先得明白現有擴散語言模型的運作方式。
現有的擴散語言模型大體上分為兩類。第一類在"離散空間"里操作,也就是直接對詞彙表中的具體詞語進行操作。比較有代表性的方式是"遮蓋擴散":把文章中的每個詞都先用[MASK]遮住,然後一步一步地揭開遮蓋,讓AI逐漸填上正確的詞。另一種方式是從完全隨機的詞語出發,然後逐步替換成更合適的詞。第二類在"連續空間"里操作,把每個詞轉換成一個數字向量(可以理解為詞語的"坐標"),然後讓這些坐標從隨機噪聲出發,一步步流向正確詞語對應的坐標位置。
"因式分解問題"主要困擾的是離散空間模型。每當模型需要在一步之內同時決定多個詞的內容時,它其實是在獨立地對每個位置做決策,就像多個互不相識的演員同時即興表演,雖然各自表現都不錯,但合演出來的戲卻缺乏默契。這個問題在生成步數很少(也就是"高倍速"生成)時尤為突出——步數越少,每步需要同時決定的詞就越多,集體"各說各話"的概率就越大。
連續空間模型理論上能繞開這個問題,因為詞語的"坐標"在變成最終答案之前一直處於模糊狀態,不需要在中途做出明確的離散決策。然而,連續空間模型有自己的麻煩:研究人員發現,詞語的"坐標"在從噪聲向目標移動的過程中,存在一個"突變區間"——在很長一段時間內,坐標仍然一片混亂,毫無規律;但當噪聲水平降到某個臨界點時,所有詞語幾乎同時"跳變"為清晰的答案。這意味著大部分去噪步驟都是無效的,真正有用的資訊只在極短的窗口內出現。更麻煩的是,當AI需要根據已有的前綴(輸入的提示詞)來生成後續內容時,現有連續空間模型的"全局時間"機制會把輸入詞和待生成詞都放在同一個噪聲水平下處理,無法區分"這是已知的乾淨輸入"和"這是需要從噪聲中生成的內容"。
研究團隊的核心洞察是:這兩個問題都源於同一個設計缺陷——整個句子中所有詞語共享同一個"時間"(即噪聲水平)。有些詞本來很容易猜,但受制於統一的時間表,不得不和難猜的詞一起慢慢等待。提示詞明明是乾淨的已知資訊,卻被強行賦予與待生成詞相同的噪聲水平。
二、給每個詞配一塊"獨立進度條"——per-token時間的設計
TTCD的核心創新是引入了"每個詞獨立時間"(per-token時間)的概念。
在傳統連續擴散模型里,有一個"全局時間"參數,取值從0到1,0代表純噪聲,1代表乾淨的詞語。這個參數對句子裡所有詞都是一樣的,就像一個統一的鬧鐘,所有詞同步出發、同步到達。
TTCD打破了這個統一鬧鐘。每個詞現在有自己的"本地時間",這個本地時間由兩個因素決定:全局時間(相當於整場比賽進行了多久)和這個詞的"排名"(rank,相當於這個詞被分配到了哪個賽道)。排名高的詞,本地時間推進得更快,也就是更早從噪聲變成清晰的詞語;排名低的詞,本地時間推進得更慢,更晚才變清晰。
具體的數學設計頗為精巧。每個詞的排名是從0到1的均勻隨機數,在整個生成過程中固定不變。給定全局時間和排名,本地時間通過一個特殊函數計算得出。這個函數的設計滿足幾個關鍵要求:當全局時間為0時,所有詞的本地時間都是0(全部處於純噪聲狀態);當全局時間為1時,所有詞的本地時間都是1(全部變成乾淨詞語);在中間過程中,排名越高的詞本地時間越大(越靠近清晰狀態);而且所有詞本地時間的平均值恰好等於全局時間(保持整體進度的一致性)。
研究團隊選用了Beta分布的分位數函數來實現這個映射。直觀上,可以把這個設計理解為一場馬拉松:全局時間是比賽進行的總時長,每個詞是一名選手,排名決定了選手的"起跑優勢"——排名高的選手跑得快,已經接近終點;排名低的選手跑得慢,還在後半段苦苦追趕。但無論快慢,所有人都在同一場比賽里,開始時同在起跑線,結束時都會抵達終點。
這個設計帶來了幾個直接好處。在任何給定的全局時間點,句子中同時存在處於不同清晰程度的詞:有些詞已經接近清晰,可以為模型提供參考;有些詞還在噪聲中,需要藉助前者的資訊來猜測自己的內容。這讓模型在訓練和推理過程中,能自然地學會利用已清晰詞語來推斷未清晰詞語,這正是語言建模的核心能力——理解詞語之間的依賴關係。
三、聰明地分配"進度條"——基於確信度的排名分配
TTCD的per-token時間設計還解決了另一個問題:哪些詞應該被賦予更高的排名(更早變清晰),哪些詞應該被賦予更低的排名(更晚變清晰)?
最簡單的方式是隨機分配排名,就像隨機給馬拉松選手分配出發順序。研究團隊在Sudoku(數獨)實驗中測試了這種方式,發現確實比現有方法有所提升,但還不夠好。
更好的方式是讓模型自己判斷:哪些詞它已經很有把握,哪些詞它還很不確定?有把握的詞應該更早固定下來,為其他不確定的詞提供參考;不確定的詞應該多等一等,等周圍詞變清晰之後再做決定。
TTCD的推理算法中實現了這個想法。在正式開始逐步去噪之前,模型先做一次"偵察":把所有待生成的詞都初始化為純噪聲,做一次前向推理,看看模型對每個位置的預測有多確定。衡量"確定程度"的指標是熵(entropy)——熵越低,說明模型對這個位置的預測越集中(比如有90%的概率認為這裡應該是"的"),確信度越高;熵越高,說明模型對這個位置摸不準頭腦,各種可能性都有。
偵察結束後,按照每個詞的熵值重新排列排名:熵低(確信度高)的詞獲得高排名,熵高(確信度低)的詞獲得低排名。這樣,那些模型"一眼就能看出來"的詞會更早變清晰,成為其他詞的"參照錨點";那些需要更多上下文才能確定的詞,則等待更多資訊後再做決定。
這個設計和人類寫作的直覺高度吻合。當你寫一篇文章時,有些詞幾乎是自然而然就確定了(比如文章的主題詞、固定搭配),而有些詞需要斟酌再三(比如一個微妙的形容詞)。TTCD讓AI也能做到這種自然的"先確定容易的,再處理難的"。
四、連續空間裡的確定性之路——去噪步驟的設計
在正式介紹去噪步驟的設計之前,有必要解釋一下連續擴散模型的基本操作邏輯。
在連續空間裡,每個詞都對應一個"詞向量"(一組數字,可以理解為詞語在多維空間裡的坐標)。純噪聲狀態是一堆隨機散布的坐標,乾淨詞語狀態是每個詞對應的固定坐標。去噪的過程就是讓坐標從隨機位置逐步移向目標詞的坐標位置。
每一步的移動方向怎麼確定?模型根據當前的坐標狀態(以及詞語的本地時間),預測每個位置最終應該是什麼詞,然後用"預測詞的詞向量的加權平均"作為目標,計算出移動的方向和距離。這就像你在迷霧中移動,每一步都根據當前位置和隱約看到的目標燈塔方向,向前邁一步。
TTCD在這個基礎上加入了per-token時間的調整:每個詞的移動步長不再由統一的全局步長決定,而是由它自己的本地時間步長決定。排名高、本地時間推進快的詞,每步移動得更多;排名低、本地時間推進慢的詞,每步移動得更少。這保證了整個系統的一致性:每個詞都嚴格按照自己的"進度條"前進。
對於有輸入提示詞的情況(也就是"給定前綴,續寫後文"),TTCD的處理極為自然:提示詞的本地時間直接設為1(完全乾淨),在整個生成過程中保持不變,對應的詞向量也永遠是提示詞的真實詞向量。這意味著模型始終能看到完整、乾淨的輸入提示,而無需猜測它。相比之下,現有的連續空間模型會把提示詞和待生成詞放在同一個時間尺度下處理,無法做出這種清晰的區分。
五、一步壓縮多步——快捷模型的蒸餾
TTCD還引入了一套自我蒸餾(self-distillation)機制,進一步提升少步生成的質量。
這套機制參考了"快捷模型"(shortcut model)的思路:正常的擴散模型需要很多小步才能從噪聲走到乾淨狀態;快捷模型則試圖讓一大步(比如直接從全局時間0.3跳到0.7)的效果等同於兩個小步(從0.3到0.5,再從0.5到0.7)疊加的效果。
實現方式是在原有的TTCD模型訓練完成之後,用一個額外的微調階段來訓練快捷模型。微調時,模型需要同時接收"起始全局時間"、"終止全局時間"(以及輔助穩定訓練的"中間全局時間")作為條件輸入,學會預測在這段時間區間內的"平均流速"。訓練目標是讓一步的預測結果與兩步展開的預測結果保持一致,通過最小化兩者的KL散度(一種衡量兩個概率分布差異的指標)來實現。此外,還保留了一個輔助損失項,確保當步長趨近於0時,模型的預測與真實數據保持吻合。
在推理階段,快捷模型與標準TTCD的推理流程相同,只是額外接收終止時間作為條件。這讓快捷模型能夠在更少的步數內完成高質量生成,對於需要快速響應的應用場景尤為重要。
研究團隊在OpenWebText(一個大規模網際網路文本數據集)上的實驗中,先用1M步訓練標準TTCD模型,再用5萬步微調快捷版本(其中前4萬步用均勻採樣的時間區間,後1萬步用特殊的採樣策略進一步強化少步場景)。實驗中還發現,在快捷蒸餾時,除了起始和終止時間外,額外提供中間時間作為條件輸入,能顯著穩定訓練過程——這是因為大步長會導致排名資訊"模糊",而中間時間的加入能彌補這一資訊損失。
六、改造建築結構——在Transformer中嵌入per-token時間
實現per-token時間還需要對模型架構做出調整,否則模型無法感知每個詞各自處於什麼"時間"。
TTCD基於擴散Transformer(DiT)架構,這是一種在圖像和語言擴散模型中廣泛使用的結構。標準DiT通過"自適應層歸一化"(adaLN)機制將全局時間資訊注入模型:將全局時間編碼成一個向量,然後用這個向量來縮放、平移和門控每一層的歸一化操作,相當於讓時間資訊滲透到模型的每一個計算步驟中。
TTCD的改造思路是:保持完全相同的參數結構,但把"全局時間"替換成"每個詞各自的本地時間"。也就是說,同一層的不同詞,用的是不同的時間向量來調製歸一化操作。這個改造不引入任何新的參數,只是改變了輸入的構成方式。
對於快捷蒸餾版本,需要同時接收多個時間作為條件(起始、中間、終止),研究團隊採用了拼接後降維的方式:把三個時間的嵌入向量拼在一起,再通過一個線性層壓縮到與標準單時間嵌入相同的維度,然後餵給adaLN層。這樣在不增加參數量的前提下實現了多時間條件的支持。
七、數獨遊戲裡的壓力測試——極限少步生成
研究團隊選擇數獨(Sudoku)作為第一個測試場景,原因頗為有趣:數獨是一個有嚴格約束的邏輯推理任務,每個空格的答案與其他空格強烈相關,完美地暴露了"獨立採樣多個token"的問題所在。
測試設定是9×9數獨,約25個格子作為已知輸入,其餘56個格子需要模型填寫,評估指標是"整塊棋盤完全正確"的比例。測試了2步、4步、8步、16步四種生成預算。
對比方法包括:基於遮蓋的離散擴散(隨機揭蓋和按熵值揭蓋兩種策略)、全局時間連續擴散(不使用時間翹曲和使用時間翹曲兩種變體)、以及TTCD的兩種變體(隨機排名和基於熵的排名)。所有方法都在相同的小型6M參數Transformer上訓練100個epoch。
結果相當清晰。在最極限的2步生成場景下,離散遮蓋模型(隨機策略)的準確率僅0.62%,幾乎等於亂猜;離散遮蓋模型(熵策略)有11.65%;連續全局時間模型接近0%;而TTCD(基於熵的排名)達到了31.51%,在所有方法中遙遙領先。
在4步生成時,TTCD達到61.33%,而最佳離散基線(熵策略)達到68.29%,兩者接近。在8步和16步時,離散熵策略憑藉足夠的步數占據優勢(92.90%和97.30%),而TTCD分別為65.85%和68.46%。
這個結果驗證了核心假設:在極少步數的情況下,連續空間+per-token時間的組合能有效規避因式分解問題,同時基於熵的排名分配能讓模型在第一次前向推理後就正確識別出"容易的格子"和"難的格子",賦予合理的去噪順序。
八、在真實語言上的較量——OpenWebText上的規模化實驗
研究團隊將TTCD擴展到160M參數規模,在OpenWebText數據集上進行了1M步的完整訓練,並對蒸餾版本進行了系統性評估。
評估分為兩種模式。無條件生成模式下,模型需要憑空生成1024個token的文本,不依賴任何輸入提示。前綴條件生成模式下,模型接收1024-K個token的乾淨前綴,生成後續K個token(K分別取32和128兩種設定),更接近實際應用場景。
評估指標使用了"生成困惑度"(Generative PPL)和"文本熵"的組合。生成困惑度由GPT2-large模型評估,數值越低意味著生成文本越像真實人類寫作;文本熵衡量詞彙多樣性,數值越高說明生成文本越不重複。一個好的模型應該在這兩個指標上都表現良好,即位於"困惑度低、熵值高"的右下方區域。研究團隊通過調整推理參數(採樣溫度和初始噪聲標準差)來描繪每個模型的表現曲線,提供更全面的性能圖景。
對比的方法涵蓋非蒸餾和蒸餾兩組。非蒸餾組包括MDLM(遮蓋離散擴散)、Duo(均勻噪聲離散擴散)、FLM(連續空間離散生成擴散,即Flow Map LM),以及TTCD。蒸餾組包括Duo w/ DCD(蒸餾版Duo)、FMLM(蒸餾版FLM),以及TTCD w/ Shortcut。
在無條件生成實驗中,TTCD在4步和8步生成時與Duo表現相當,並優於MDLM;而在16步和32步時,TTCD與Duo的差距進一步縮小。與FLM的對比尤為顯著:FLM在改變推理參數時表現極不穩定,文本熵的可調範圍很窄,且在某些參數設置下會出現嚴重的重複(熵值趨近於0);TTCD的表現則平穩得多,在更廣泛的參數範圍內都能維持正常的文本多樣性。
在蒸餾版本的對比中,TTCD w/ Shortcut在1步到4步的生成中優於Duo w/ DCD,與FMLM相比也有競爭力,且在文本熵的可調範圍上明顯更寬。一個具體的數字:在4步蒸餾生成時,TTCD w/ Shortcut的生成困惑度在溫度1.0時約為249,而Duo w/ DCD約為305,FMLM約為112但文本熵僅約5.37(相比TTCD的5.56),說明FMLM以犧牲多樣性換取了較低的困惑度。
前綴條件生成的結果更為突出。在32 token畫布的2步生成(相當於16倍加速)場景下,TTCD w/ Shortcut的表現全面優於所有基線。FLM在這個任務上幾乎完全失效,生成的文本熵值低於3(極度重複),甚至超出了圖表範圍。這印證了per-token時間在處理輸入/輸出不對稱場景時的天然優勢:提示詞直接被賦予時間=1,無需特殊處理;待生成詞從時間=0出發,完全與提示詞區分開來。
研究團隊還提供了定性生成樣本作為輔助說明,可以看到TTCD(包括蒸餾版本)在不同步數下都能生成語義連貫、詞彙多樣的文本,儘管在2步這種極端加速下語義連貫性仍不如步數較多時的版本。
九、分子設計上的遷移——QM9數據集上的分類引導實驗
除了語言任務,研究團隊還在分子生成任務上驗證了TTCD的遷移能力,使用的數據集是QM9(一個包含小分子結構的化學數據集)。
測試場景是"分類引導生成"(classifier-free guidance):在生成分子時,同時優化分子的某個化學屬性(此處為環計數,即分子中苯環等環狀結構的數量),引導係數從1到5變化。評估指標包括生成的新穎分子數量(在1024次生成中,不重複的新分子有多少)和新穎分子的平均環計數。
對比方法包括UDLM(均勻噪聲離散擴散)、MDLM(遮蓋離散擴散)、全局時間連續擴散,以及TTCD(per-token時間連續擴散)。
結果顯示,連續空間方法整體優於離散方法,能生成更多新穎的有效分子。在連續方法內部,TTCD相比全局時間連續擴散進一步拓展了性能邊界——在引導強度變化時,TTCD能在更高的環計數水平下維持更多的新穎分子數量。此外,無論是2步、8步還是32步生成,TTCD的性能邊界都持續優於全局時間連續方法,證明per-token時間的優勢不依賴於特定的生成步數,也不局限於文本領域。
說到底,TTCD講述的是一個關於"差異化對待"的故事。在AI領域,很長一段時間裡,我們習慣於用統一的流程處理所有內容:同一個噪聲水平、同一個去噪速度、同一個時間表。這種整齊劃一的方式有其美學吸引力,但它忽略了一個基本事實:內容本身是有差異的,有些詞天然比其他詞更容易確定,有些位置的資訊比其他位置更早明朗。
TTCD所做的,就是把這種差異性納入模型設計的核心。用一個通俗的說法:現有模型像是一個整齊的合唱團,所有人必須同步出聲、同步停止;TTCD則更像一支爵士樂隊,每件樂器都有自己的節奏,但整體上保持協調,最終奏出一曲有層次感的樂章。
這項研究目前的局限性也值得坦率面對:實驗規模最大隻到160M參數,與業界動輒數十億參數的主流模型相比仍是小體量。是否能在更大規模下保持性能優勢,仍是一個開放問題。此外,儘管TTCD在少步生成場景下表現出色,但在步數較多(如32步以上)的場景下,與最優基線相比的優勢趨於收窄,說明per-token時間的收益主要集中在"壓縮步數"這一維度。
對於想進一步探索的讀者,可以考慮這樣幾個方向:per-token時間的理念能否遷移到離散擴散模型中(論文末尾也提及了這一方向)?在代碼生成、數學推理等結構性更強的任務上,per-token時間的差異化處理是否能帶來更顯著的收益?排名分配策略除了基於熵之外,是否存在更優的方案?
完整論文可通過arXiv編號2607.14106v1檢索,有興趣的讀者可以直接在arXiv平台上找到所有技術細節和實驗數據。
Q&A
Q1:TTCD與傳統離散擴散語言模型相比最大的區別是什麼?
A:傳統離散擴散模型在生成時需要同時對多個詞做獨立決策,容易產生詞語之間不協調的問題,在少步生成時尤為明顯。TTCD在連續空間中操作,詞語的"坐標"在變成最終答案前始終保持模糊狀態,不需要在中途做出離散決策,從根本上規避了這個問題。同時,per-token時間讓部分詞先變清晰,為其他詞提供參考,進一步提升了生成質量。
Q2:TTCD的per-token時間在前綴條件生成任務中如何發揮作用?
A:在前綴條件生成任務中,已知的輸入提示詞直接被賦予時間等於1的狀態,也就是完全"乾淨"狀態,整個生成過程中始終保持真實詞向量不變。待生成的詞從時間等於0的純噪聲出發,逐步推進。這樣模型始終能看到完整乾淨的輸入,而不是把輸入和輸出放在同一個噪聲水平下混淆處理,使得條件生成的準確性大幅提升。
Q3:TTCD的快捷蒸餾是如何實現少步高質量生成的?
A:快捷蒸餾的基本思路是讓模型學會"跳步":讓一大步的生成效果等同於兩個小步疊加的效果。訓練時,模型同時接收起始、中間、終止三個全局時間作為條件,學習在時間區間內的"平均流速",目標是讓一步預測結果與兩步展開結果保持一致。經過5萬步微調後,蒸餾版TTCD能在極少步數(1到4步)內完成高質量生成,在少步場景下優於對比的離散蒸餾基線。






