宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

谷歌DeepMind如何將一台「逐字打稿機」改造成「整段噴墨機」?DiffusionGemma背後的速度革命

2026年08月11日 首頁 » 熱門科技

這項由谷歌DeepMind研究團隊主導完成的工作,以技術報告的形式於2026年8月4日正式發布,論文編號為arXiv:2608.00146v1,掛載於電腦科學·計算與語言(cs.CL)分類下。有興趣深入了解原始細節的讀者,可以通過該編號在arXiv平台檢索完整報告。

**當你在手機螢幕前等待AI回復時,究竟發生了什麼?**

每一次你向AI助手提問,模型就像一台老式打字機,逐個字母、逐個詞彙地往螢幕上敲。它必須先敲出第一個字,才能決定第二個字;敲完第二個字,才能考慮第三個字。這種"串行"工作方式在技術上被稱為自回歸生成,是當前幾乎所有主流大語言模型的核心機制。這種機制在學術上十分嚴謹,但它有一個無法迴避的物理瓶頸:無論你的手機有多好、伺服器有多貴,每次生成一個詞都需要把整個模型從內存里"喚醒"一遍,然後算出這一個詞,然後再喚醒一遍,算出下一個詞,如此循環往復。

這就像讓一位廚師每炒一粒米就要打開冰箱門取一次調料——冰箱開關的時間,遠比炒那粒米的時間長。AI晶片大部分時間都在等待內存把數據傳過來,而不是在真正"思考"。谷歌DeepMind的工程師們看著這台不停開冰箱的廚師,決定徹底改變烹飪方式。

DiffusionGemma谷歌DeepMind如何將一台逐字打稿機改造成整段噴墨機DiffusionGemma背後的速度革命就是他們的答案。這個模型不再一個詞一個詞地往外吐,而是一次性規劃256個詞的完整"草稿",然後像雕刻師打磨石塊一樣,反覆修改這塊草稿,直到它變成流暢、準確的回答。這種工作方式借鑑了另一個領域的成熟技術——擴散模型(diffusion model),這種技術此前主要用於生成圖片,比如讓AI從一團噪點中逐漸"顯影"出一張人臉。現在,谷歌DeepMind把同樣的思路搬到了文字生成上。

測試結果顯示,在單張NVIDIA H100 GPU上,DiffusionGemma每秒可以生成約1500個詞——是同等規模傳統自回歸模型的7倍有餘,即便與配備了專業加速技術的競爭模型相比,仍有近5倍的領先優勢。更關鍵的是,這一速度並非以犧牲智能為代價換來的:在涵蓋數學推理、編程、常識問答、多模態理解等多個維度的綜合評測中,DiffusionGemma的得分依然處於同類文字擴散模型的最前列,與部分頂級閉源商業模型形成了真實意義上的競爭關係。

---

**一、從"打字機"到"雕刻師":擴散模型如何處理文字**

要理解DiffusionGemma的工作原理,先要理解它所依賴的數學基礎,而這個基礎其實可以用一個非常直覺化的比喻來描述——從噪點中"顯影"出答案。

傳統語言模型在生成文字時,遵循一條嚴格的因果鏈:已知前面所有的詞,預測下一個詞。這條鏈從左到右,不可逆轉。如果第三個詞說錯了,後面的詞只能將錯就錯,或者靠額外的邏輯繞回來修補,就像那位先提交了錯誤答案、事後發現"等等,我算錯了"的學生。

擴散模型則完全不同。它的訓練過程是這樣的:給模型看一句完整的好句子,然後隨機地把其中一些詞替換成亂碼,讓模型猜原來是什麼詞。替換的比例從0%到100%不等,模型要學會在不同程度的"損壞"下,重建原始資訊。用雕刻的比喻來說,擴散模型在訓練時看的不是"從零開始雕刻",而是"一塊已經七八成成形、但某些地方被人隨機鑿掉的雕塑,請你把缺口補全"。

在推理(即實際使用)時,模型從一塊完全隨機的"石頭"——256個毫無意義的隨機詞——出發,一輪又一輪地修改這塊石頭:哪些詞已經很確定了,就把它們"鎖定"下來;哪些詞還不確定,就讓它們繼續接受修改。經過平均12輪左右的打磨,這256個詞就變成了一段連貫、有意義的文字。

這裡有一個非常關鍵的技術細節:在每一輪修改中,模型對256個詞的判斷是同時進行的,而不是一個接一個。這就是為什麼它可以這麼快——相當於打字機換成了噴墨印表機,一次性把整行字噴出來,再校對,再噴一遍。

谷歌DeepMind團隊在這個框架下選擇了"多項式擴散"而非"掩碼擴散"。兩者的區別在於:掩碼擴散會把不確定的詞位置變成一個特殊的"占位符",而多項式擴散則是把那個位置換成詞彙表里的任意一個詞。後者的好處在於,即便是已經被"鎖定"的詞,在後續輪次里依然可以被修改——這讓模型擁有了真正意義上的自我糾錯能力,而不只是從空白處慢慢填滿。

---

**二、站在巨人肩膀上:為什麼不從零開始訓練?**

創造一個強大的AI模型,通常需要用海量文本數據預訓練——這個過程代價極其高昂,往往需要消耗數百萬乃至數千萬美元的算力。谷歌DeepMind的工程師們選擇了一條更聰明的路:從一個已經訓練好的優秀模型出發,再做針對性改造。

他們的起點是Gemma 4谷歌DeepMind如何將一台逐字打稿機改造成整段噴墨機DiffusionGemma背後的速度革命,一個混合專家架構(Mixture-of-Experts,簡稱MoE)的語言模型。這個模型總參數量為252億,但每次實際工作時只激活約38.5億個參數。混合專家架構可以理解為:模型內部有128組不同的"專家團隊",每次處理一個詞時,只有最適合的8組專家會被調用,其餘的繼續休息。這讓模型在保持高能力的同時,控制了實際計算量。

從這樣一個已經具備強大語言理解和生成能力的模型出發,改造成擴散模型只需要解決一個核心問題:原來的模型用的是"因果注意力",也就是每個詞只能看到它前面的詞;而擴散模型需要"雙向注意力",即一個詞可以同時參考它左邊和右邊的詞。這就像把一個只能向前看路的司機,改造成可以同時看前方和後視鏡的司機。

這種改造意味著不能把預訓練完全拋掉,但也不能完全不動。谷歌DeepMind的解決方案是:保留所有原始權重,通過後續的微調讓模型同時掌握兩種注意力模式。編碼上下文(用戶輸入的問題)時用因果注意力;生成回答(256個詞的"畫布")時用雙向注意力。整個訓練過程消耗的數據量不到原始預訓練的10%,大幅節省了計算資源。

除此之外,DiffusionGemma還繼承了Gemma 4的一個特殊組件:自我條件化(self-conditioning)。這個機制讓模型在每一輪修改時,除了參考當前的"噪點草稿",還能參考上一輪自己的預測結果。這就像雕刻師除了看眼前的石頭,還能參考上一刀下去之前自己的設計草圖,從而做出更連貫的決策。為此,模型額外增加了780萬個參數,專門用於處理這個自我條件化信號。

---

**三、兩階段訓練:先學會雕刻,再學會快速雕刻**

改造完架構之後,谷歌DeepMind設計了一套兩階段訓練流程,每個階段針對不同的目標。

第一階段叫做"監督微調"(SFT)。這一階段的目標很簡單:讓模型學會擴散的基本功——接收一塊部分損壞的"石頭",把它修復成有意義的文字。訓練數據從各類文字語料中抽取,對每一段文字隨機做不同程度的詞彙替換,然後讓模型預測原始詞彙。模型輸出的預測與真實答案之間的差距,被用來調整模型的權重。

從實驗曲線來看,非思考模式的性能提升非常迅速,只需完成整個SFT階段前四分之一的訓練量,就能達到相當不錯的水平;而思考模式的學習曲線則要慢得多,起步時模型會頻繁陷入循環、重複生成同樣的詞,就像一個新手演講者上台第一次,說著說著就卡殼了,然後不停重複最後一個詞。只有堅持完成完整的SFT訓練,模型才能穩定地生成連貫的推理鏈。此後隨著訓練時間的拉長,兩種模式的性能均呈現出近似對數線性的穩步提升——投入越多訓練,效果越好,但增速逐漸放緩。

第二階段叫做"採樣器蒸餾與強化學習"(SD·RL),這才是真正讓DiffusionGemma脫穎而出的關鍵步驟。僅完成SFT的模型,在用大量修改輪次(比如192輪)的情況下效果尚可,但如果把輪次壓縮到實用的48輪以內,生成質量會急劇下降,甚至出現嚴重的重複循環。更糟糕的是,一旦模型陷入重複循環,它的預測熵(衡量不確定性的指標)會急劇下降,觸發"自適應停止"機制提前結束生成,導致模型給出一個空白的答案。這就是在質量和速度之間無法兼顧的困境。

SD·RL階段的設計目標,正是同時解決這兩個問題。這個階段讓模型用較高的修改輪次生成"高質量草稿",作為"在線教師";同時,引入強化學習,用外部獎勵信號(比如數學題答對得分、代碼通過測試得分)來引導模型生成更正確的內容。最關鍵的是,這兩個目標被整合進同一個訓練目標,一次梯度更新同時優化兩個方向。

訓練過程中出現了一個非常有趣的自動加速效應:隨著強化學習的推進,模型的預測越來越有把握,每個詞位置的預測熵越來越低;熵越低,"自適應停止"機制就越早觸發;停止越早,意味著需要的修改輪次越少;需要的輪次越少,訓練數據中就會出現越來越多的"短軌跡"樣本;短軌跡樣本反過來進一步訓練模型快速完成任務。這形成了一個正向飛輪——模型越聰明,就越省力;越省力,就能接受更多訓練反饋,就變得更聰明。谷歌DeepMind的工程師們發現,即使在平均獎勵分數不再提升之後,繼續進行SD·RL訓練仍然有價值,因為它還在持續壓縮每次生成所需的修改輪次。

SD·RL完成後,模型在GPQA-Diamond(研究生級科學題)和LiveCodeBench-v6(編程題)兩項測試上的綜合得分比SFT完成時提升了10個百分點;每次前向傳播產出的詞數(TPF指標)從5個提升到近20個,速度翻了四倍。

此外,SD·RL還帶來了一個意外的副作用:模型變得更加簡潔。與SFT模型相比,最終版本的輸出長度縮短了約一半。這與傳統強化學習訓練的語言模型相反——傳統方法往往鼓勵模型寫更長的推理鏈條,因為更長的思考鏈通常意味著更高的得分。谷歌DeepMind認為,這種簡潔性來源於擴散模型的特殊機制:減少總詞數,直接等於減少修改輪次的工作量,而減少工作量是熵降低的自然結果。簡潔即速度。

---

**四、智能採樣器:如何決定"這個詞,鎖定"**

256個詞同時推進修改,並不意味著每次修改都對所有詞進行同等力度的處理。DiffusionGemma使用了一套精心設計的採樣器,決定每一輪修改中哪些詞可以"畢業"、哪些詞還要繼續接受修改。

這套採樣器的核心思路是按熵排序。熵在這裡衡量的是模型對某個詞位置的不確定程度——如果模型對位置7的詞極其有把握,這個位置的熵就很低;如果模型對位置23的詞拿不定主意,這個位置的熵就很高。採樣器會把所有詞按熵從低到高排序,然後從最有把握的詞開始,逐個"鎖定",直到這一批詞的累計熵超過預設閾值(0.1)為止。超出閾值的那些詞,會被重新隨機化,在下一輪重新接受修改。

這種機制類似於考試時的答題策略:先把最確定的題答上,把不確定的題留到後面反覆斟酌,而不是花一樣多時間在每道題上。被重新隨機化的詞位置,相當於被重置為"最大不確定性",強迫模型在下一輪從更開闊的角度重新考量這些位置,避免陷入局部最優解。

與此同時,採樣器還引入了溫度退火機制。溫度是一個控制生成多樣性的參數——溫度高,模型就更"大膽",會給低概率詞更多機會;溫度低,模型就更"保守",傾向於選最確定的詞。在擴散的早期階段(石頭還很粗糙),溫度設為0.8,鼓勵模型探索更多可能性;隨著修改輪次推進,溫度線性降低到0.4,讓模型逐漸收斂到最確定的答案。

最後,採樣器還設有"自適應停止"機制。當連續兩輪修改中,模型對所有詞位置的預測都幾乎沒有變化(平均熵低於0.005,且最可能的詞序列完全相同),就認為這塊"石頭"已經雕刻完成,不必再等待湊夠48輪的上限。這一機制讓實際平均修改輪次降至12輪左右,等於最大預算的四分之一。

不同任務類型在這個維度上表現出了明顯差異。簡單的數學算術題(比如GSM8K)平均只需要8到9輪就能停止;中等難度的編程題(HumanEval)需要9到10輪;涉及深度推理的研究級科學題(GPQA-Diamond)需要14到15輪;而複雜的競賽級編程題(Codeforces)則需要17到18輪。模型自動根據任務難度分配計算量,難題多用幾輪,簡單題少用幾輪,從不"偷懶",也不"浪費"。

---

**五、硬體層面的速度解析:每次修改為何只慢3.2倍?**

DiffusionGemma每次修改要同時處理256個詞,而傳統語言模型每次只處理1個詞。按直覺,前者應該慢256倍才對。但實際測量顯示,每次修改只慢了3.2倍。這個數字背後,藏著精細的工程優化邏輯。

慢下來的主要原因集中在三個環節。第一是混合專家層(MoE)。傳統語言模型每次只激活8個專家;而DiffusionGemma處理256個詞時,平均會激活約84個不同的專家,導致這一層的運算時間增加了4.3倍。這並非設計失誤,而是混合專家架構在高並行度場景下的固有特性——處理的詞越多,需要"請教"的專家就越多,加載這些專家權重的時間也就越長。如果換成密集架構(非混合專家),這部分額外開銷會減少到不足2倍。

第二是採樣計算本身。擴散採樣需要做256個詞的完整概率分布計算、自我條件化向量的矩陣乘法,以及在262000個詞的詞彙表上做softmax操作。這些步驟加起來耗時3.06毫秒,而傳統語言模型只需0.56毫秒,差距約5.5倍。

第三是注意力機制。傳統語言模型因為一次只處理一個詞,可以用高度優化的單詞注意力核心;DiffusionGemma需要在256個詞上做完整的雙向注意力,只能使用普通的FlashAttention-4核心,速度慢了約4倍。

但另一方面,DiffusionGemma每次修改處理256個詞,同樣大幅節省了某些環節的時間。其中最顯著的是KV緩存(Key-Value Cache)的傳輸——這是AI推理中一個重要的內存頻寬消耗來源,傳統模型每生成一個詞都要從內存里讀一遍所有歷史上下文,而DiffusionGemma每生成256個詞才需要讀一遍,節省了大量內存頻寬開銷。

綜合計算,每次修改比傳統語言模型慢3.2倍,但每次修改生成約20個詞,淨效率提升約6倍。加上GPU核心的精細調優和CPU-GPU通信的異步化處理,最終在單張H100上實現了1456詞/秒的實測吞吐量。

在多用戶並發場景下,DiffusionGemma在低並發(1到16個並發用戶)時對每位用戶的生成速度以及總體吞吐量,均優於配備了多詞預測加速技術的Gemma 4。只有在並發用戶數超過約32個時,傳統語言模型才開始在總吞吐量上追趕上來——這是因為高並發時批次越大,傳統模型的計算效率越高,而DiffusionGemma在高批次場景的優化工作尚未完成。

---

**六、雙向注意力的實際價值:能"反悔"的語言模型**

除了速度,擴散機制還帶來了一個傳統語言模型天然缺失的能力:在生成一段文字時,可以根據後面的內容修改前面的詞。

傳統語言模型必須在說出答案的第一個詞時,就已經"押注"了答案的大致方向。以一道數學題為例:題目要求先給出答案,再寫推導過程。傳統語言模型必須先輸出一個答案詞,然後才開始推導。如果這個答案詞猜錯了,後面的推導過程就會努力自圓其說,或者在末尾尷尬地補一句"等等,我重新算一下"。

在報告提供的例子中,面對題目"7×(√(111+10)-3)-9?,先給答案再推導",Gemma 4的傳統版本第一個詞就輸出了"-1"(錯誤答案),整個推導過程在正確計算到-25之後,不得不在末尾寫道:"等等,重新計算:56-81=-25。正確答案是-25。"整個回答內部自相矛盾。

DiffusionGemma面對同樣的問題,則在第一輪修改時對"-1"賦予了較高概率,但在隨後幾輪中,隨著推導過程的詞彙逐漸確定,位置靠前的答案詞也被同步修正為"-25"。最終輸出從第一個詞開始就是正確答案,推導過程與答案完全吻合,沒有任何自相矛盾。

同樣的自我修正能力也體現在邏輯陷阱題目上。面對一個關於青蛙過河的謎題(青蛙每次跳5英尺,但第20英尺處的荷葉會把它傳送回5英尺處,問是否能到達25英尺),傳統語言模型第一個詞就輸出了"是",然後在推導中意識到會陷入無限循環,最終給出了前後矛盾的回答。DiffusionGemma則在早期修改輪次中賦予"是"較高概率,但隨著推導邏輯("無限循環")在後續詞彙中逐漸成形,最終修正為"不",乾淨利落地給出了正確答案。

這種能力在結構化輸出任務(比如生成符合特定格式的JSON數據)上尤為突出。當輸出格式被明確規定時,大部分詞的內容幾乎是確定的,模型在第一輪修改時就能以83%以上的平均置信度完成大部分詞的填寫,第二輪就能以100%的置信度全部鎖定——整個任務只需兩輪修改,相當於在一秒內完成了傳統語言模型需要數十次串行預測才能完成的工作量。

---

**七、不僅僅快:評測成績究竟如何?**

速度只是故事的一半。真正有價值的問題是:快了之後,還夠聰明嗎?

谷歌DeepMind在一套覆蓋二十個標準評測集的測試體系上對DiffusionGemma進行了全面評估,涵蓋數學推理(AIME 2026競賽數學題、GSM8K小學數學題、MGSM多語言數學題、Putnam大學數學競賽題)、代碼生成(LiveCodeBench-v6實時編程題、HumanEval基礎編程題、BigCodeBench複雜編程題)、科學知識(GPQA-Diamond研究生級科學題)、多語言理解(MMLU、MMLU-Pro)、多模態推理(MMMU-Pro,涉及圖片+文字的綜合理解)以及指令遵循和智能體任務(IFEval格式遵循題、Tau-bench模擬真實場景的工具使用題)。

在開啟思考模式(即允許模型先做內部推理再輸出答案)的前提下,DiffusionGemma在AIME 2026數學競賽題上得分69.1分,GPQA-Diamond科學題上73.2分,LiveCodeBench-v6編程題上69.1分,GSM8K基礎數學題上96.3分,HumanEval基礎編程題上94.5分,IFEval格式遵循題上97.4分。

與其起點——Gemma 4 26B A4B的傳統自回歸版本——相比,DiffusionGemma在大多數項目上有一定的性能損耗。例如,Gemma 4傳統版本在AIME 2026上得分84.2,在GPQA-Diamond上得分79.8,在LiveCodeBench-v6上得分71.4。DiffusionGemma付出了約5到15個百分點的性能代價,換取了速度上的巨大提升。

與同類開源文字擴散模型相比,DiffusionGemma的優勢則非常明顯。LLaDA 2.1 Flash 100B——一個參數量是DiffusionGemma四倍的開源擴散模型——在AIME 2026上得分80分,在GPQA-Diamond上得分68.7分,在LiveCodeBench-v6上僅得39.4分,且需要8張NVIDIA B200 GPU同時工作,每秒只能生成375個詞。Nemotron Diffusion 14B在GPQA-Diamond上得47分,每秒僅能生成49個詞,差距相當懸殊。

與閉源商業擴散模型Mercury 2相比,DiffusionGemma的綜合評測成績相當,Mercury 2在推理知識類測試上的綜合均分約為80分,DiffusionGemma約為75.3分;在編程類測試上,Mercury 2約82.4分,DiffusionGemma約76.9分。但在速度上,DiffusionGemma達到約1479詞/秒,而Mercury 2通過公開API估測約為489至600詞/秒,DiffusionGemma大約快了2.5倍。

一個值得特別關注的指標是DiffusionGemma的"保留自回歸能力"。因為它的架構與Gemma 4完全相同,訓練後的權重可以直接以傳統自回歸模式谷歌DeepMind如何將一台逐字打稿機改造成整段噴墨機DiffusionGemma背後的速度革命加載使用,不需要做任何額外改動。以自回歸模式運行時,DiffusionGemma的性能介於其擴散模式和原始Gemma 4之間——比如AIME 2026得84.2(Gemma 4)、自回歸模式的DiffusionGemma得84.2,和擴散模式的69.1之間,它的自回歸模式得分為84.2,幾乎與原始Gemma 4相當。這意味著同一套權重文件可以根據任務需求動態切換:速度優先用擴散模式,質量優先用自回歸模式。

---

**八、開放給所有人:開源、微調與下游應用**

谷歌DeepMind選擇以Apache 2.0許可證開放DiffusionGemma的全部權重,這意味著任何人都可以下載、修改、商用,沒有任何限制。與此同時,團隊還發布了一套完整的微調工具包,允許開發者在自己的數據集上進一步訓練模型。

微調工具包基於一個叫做"Hackable Diffusion"的開源研究工具箱,支持LoRA(低秩自適應)技術——這項技術的原理是,不修改模型的主體權重,只在主體旁邊附加一組小型的"補丁"權重,通過調整這些補丁來讓模型適應新任務。用裝修的比喻來說,LoRA就是"不拆牆,只貼壁紙",以極低的成本(2塊A100 80GB顯卡即可完成)實現任務適配。

作為演示,研究團隊選擇了數獨謎題求解作為測試案例。數獨是一類典型的非自回歸任務——謎題的81個格子之間存在複雜的相互約束關係,任何一格的值都可能影響其他格子,傳統的逐詞生成方式在這類任務上有天然的局限。經過LoRA微調(rank=8,僅800萬可訓練參數),DiffusionGemma在4096道測試題上達到了84.4%的準確率,同時平均修改輪次從基礎模型的40.65輪壓縮至10.72輪——因為特定任務的熵天然更低,模型更快收斂。未經微調的基礎模型在這道題上準確率為0。

在醫學問答領域(PubMedQA),微調同樣帶來了明顯提升:答案準確率從75.6%提升到76.6%,但更關鍵的是,生成的解釋性文段質量(用BLEU分數衡量)從10.76分提升到20.67分,提升幅度接近一倍。

報告發布後短短數周內,已有外部團隊將DiffusionGemma部署到具體應用場景中:一家公司用它構建了多語言自動語音識別系統,另一家醫療科技公司用它開發了放射科報告交互式輔助草擬系統。前者利用了擴散模型並行處理的高效性,後者則發揮了模型對高度結構化文本快速收斂的特性。

---

**九、已知的局限與未來的方向**

谷歌DeepMind在報告中坦率地列出了當前版本的已知問題,這種透明度對理解模型的實際能力邊界非常重要。

性能與起點的差距是最顯著的局限。DiffusionGemma的整體能力確實低於Gemma 4的自回歸版本,這源於多重因素的疊加:跳過了從零開始的擴散預訓練;SFT階段受計算預算限制而偏短;SD·RL階段為追求超低延遲而主動犧牲了部分峰值性能潛力;以及模型架構和數據配比本是為自回歸優化的,不一定最適合擴散範式。

"過於簡潔"是SD·RL帶來的另一個副作用。模型產出的文字比SFT版本短約一半,這讓它在某些需要深度思考、長篇論述的任務上表現不如預期。強化學習目標與擴散機制的特性共同驅動了這種簡潔性,但目前尚未找到在不影響速度的前提下恢復更長輸出的方法。

偶爾的詞彙循環問題在SD·RL之後雖然大幅減少,但仍未完全消除。極少數情況下,模型會陷入重複生成同一個常見詞(如"the the the")的循環,這主要發生在修改輪次被壓縮到極限的情境下。

多模態任務中,思考模式有時會丟失閉合標籤(即思考過程的結束符號),導致回答被錯誤截斷。在MMMU-Pro(圖文綜合理解題)上,這一問題導致開啟思考模式的得分(54.3分)反而低於關閉思考模式的得分(66.0分)。谷歌DeepMind承認這是在最終發布前發現但來不及修復的問題。

高並發吞吐量在32個以上並發用戶時遜於傳統語言模型(配備多詞預測),這是由於DiffusionGemma的高並發批次優化工作尚未完成,例如在高批次下使用top-k截斷可以顯著提升吞吐,但這項優化目前尚未實裝。

參考實現已同時發布在HuggingFace Transformers和vLLM兩個主流推理框架中,前者以學術可擴展性為優先,後者針對高性能部署優化,方便不同需求的用戶選用。

---

歸根結底,DiffusionGemma做的事情可以用一句話概括:它證明了一個已有強大能力的語言模型,不需要從零開始重新訓練,只需一套精心設計的改造方案,就可以從"打字機"變成"雕刻師",在保持相當智能水平的同時,把生成速度提升一個數量級。

這種改造的代價確實存在——比起起點模型有一定的性能損耗——但得到的回報同樣真實:單張消費級伺服器GPU上的每秒1500詞,意味著原本需要一秒才能完成的回答,現在只需七分之一秒;原本需要一組GPU集群才能服務的並發用戶量,現在一張卡就能應付。這對於實時語音交互、在線客服、即時代碼補全等對延遲極度敏感的應用場景,意味著用戶體驗的質變而非量變。

更長遠地看,DiffusionGemma暗示了一個可能的未來:同一套模型權重,在空閒時用擴散模式高速生成草稿,在關鍵任務時切換回自回歸模式精細推理,兩種範式協同工作。這條路還很長,但門已經打開。有興趣深入研究的讀者,可以通過arXiv:2608.00146v1獲取完整的技術報告,模型權重及微調代碼均已在Hugging Face平台公開發布,搜索"diffusiongemma-26B-A4B-it"即可找到。

---

Q&A

Q1:DiffusionGemma是怎麼做到比傳統語言模型快那麼多的?

A:DiffusionGemma一次性處理256個詞的"草稿",通過反覆修改來完善內容,而不是像傳統語言模型那樣逐個詞輸出。平均下來每次修改只需要約12輪,每輪雖然比傳統模型單步慢3.2倍,但同時產出約20個詞,綜合速度提升約7倍。

Q2:DiffusionGemma的能力比Gemma 4原版弱多少?

A:在大多數測試項目上,DiffusionGemma的得分比原版Gemma 4低大約5到15個百分點。例如AIME數學競賽題,原版得88.3分,DiffusionGemma得69.1分。不過DiffusionGemma保留了原版的自回歸運行能力,切換到自回歸模式後性能接近原版水平。

Q3:普通人如何使用DiffusionGemma或基於它開發應用?

A:DiffusionGemma以Apache 2.0開源許可發布,任何人可以免費下載和商用。模型權重已上傳至Hugging Face平台(搜索"diffusiongemma-26B-A4B-it"),谷歌DeepMind同步發布了HuggingFace Transformers和vLLM兩套參考實現,以及支持在消費級GPU上微調的LoRA工具包。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新