這項研究由德國弗勞恩霍夫研究所(Fraunhofer IAIS)、達姆施塔特工業大學(Technische Universitat Darmstadt)、德國人工智慧研究中心(DFKI)、維爾茨堡大學(Universitat Würzburg)、柏林工程與經濟應用科學大學(Berliner Hochschule für Technik)、L3S研究中心等多家德國頂尖研究機構聯合完成,並獲得德國聯邦經濟事務和能源部(BMWE)資助。論文於2026年7月10日發布在預印本平台arXiv,編號為arXiv:2607.09424v1,歸屬於電腦科學·計算與語言(cs.CL)領域。整個項目由德國聯邦人工智慧協會(KI Bundesverband)統籌協調。
一、為什麼歐洲需要"自己的大腦"
全球AI大模型的發展速度讓人目不暇接,GPT、Llama、Qwen……一個接一個地湧現。但如果你仔細觀察,會發現一個讓歐洲研究者深感不安的現象:這些功能強大的模型,幾乎都是美國或中國團隊做出來的,訓練數據和運算基礎設施也都在歐洲以外。對於德國這樣一個擁有強大工業和科研基礎、對數據安全和法規合規高度敏感的國家來說,這不僅僅是技術問題,更是主權問題。
更具體地說,存在三個讓研究者頭疼的缺口。第一個缺口,是"開放"的真實含義。市面上所謂"開放"的模型,絕大多數只是公開了模型權重——也就是最終的參數文件,就像你拿到了一道菜的成品,卻不知道食材來源、烹飪步驟和調料比例。研究者無法真正審計、復現或改進這些模型。第二個缺口,是語言代表性不足。大多數多語言模型要麼以英語為絕對核心,要麼試圖同時覆蓋幾十種語言,結果每種語言都淺嘗輒止。德語作為歐洲最大經濟體的官方語言,在這些模型里的表現遠不如其地位所應得的。第三個缺口,也是最直接影響實際部署成本的那個,是推理效率。當你要同時服務大量用戶、處理超長文本時,傳統的Transformer架構會隨著文本長度增加而越來越慢——這就像一個圖書管理員,每次找書都要把整個圖書館翻一遍,書越來越多,他就越來越慢。
正是為了同時填補這三個缺口,Soofi S 30B-A3B誕生了。
二、Soofi S是一個什麼樣的模型
要理解Soofi S的設計思路,不妨用一個大型餐廳廚房作為比喻框架,貫穿整篇文章。
傳統的AI大模型就像一個超級大廚,無論做什麼菜,都要把整個食譜庫從頭到尾翻一遍,菜越複雜、食譜越多,效率就越低。而Soofi S的設計更像一個高度分工的現代化廚房:專門有人負責記流水賬(Mamba-2層),有幾位主廚只在關鍵步驟出手(GQA注意力層),還有一大批各有所長的專項廚師按需調用(MoE專家層)。
從技術層面說,Soofi S採用的是"混合Mamba-Transformer專家混合"架構,直接沿用了NVIDIA公開發布的Nemotron 3 Nano參考設計。整個網路共有52層,其中23層是Mamba-2序列混合層,負責用固定大小的"記憶槽"高效處理長文本;23層是細粒度MoE層(專家混合層),每次處理一個詞,只激活128個專家中的6個;剩下6層是分組查詢注意力層(GQA),只有這6層會維護傳統Transformer那種隨文本長度增長的鍵值緩存。
模型總參數量約為31.6億,但每次處理一個詞只激活約32億(含詞嵌入約36億)參數。這意味著Soofi S擁有一個300億參數量級大廚房的"知識儲備",卻只需要動用一個30億參數量級小廚房的"實際工作量"。更關鍵的是,由於絕大多數層(Mamba-2層)使用的是固定大小的循環狀態而非隨文本變長的緩存,整個模型在處理超長文本時,內存占用幾乎不隨文本長度增加。
研究團隊之所以選擇直接採用Nemotron 3 Nano的參考架構而不自己從頭設計,出於三個非常務實的考量。其一,這個架構已經被主流推理框架(如vLLM)原生支持,模型一發布就能直接部署,無需用戶額外做工程適配。其二,該架構在長文本、高並發場景下的效率優勢已經得到充分驗證。其三,與NVIDIA的Nemotron 3 Nano共享相同架構,意味著兩個模型之間的性能差異可以完全歸因於訓練數據的不同,從而實現科學上的"受控實驗"。
三、訓練配方:從普通食材到精品料理
一個大模型的能力,很大程度上取決於它"吃了什麼"——也就是訓練數據。Soofi S的訓練分為三個階段,就像一道精心設計的多道菜晚宴:先上開胃菜打開胃口(多樣化預訓練),再來主菜精細烹飪(高質量退火),最後是一道特製的長桌料理(長文本擴展)。
第一階段是"多樣化預訓練",共消耗約20萬億個詞(token),相當於幾十萬本小說的文字量。這一階段的數據來源極為豐富:英文網頁數據(包括NVIDIA公開的Nemotron-CC系列,涵蓋高質量網頁、合成改寫版本、多樣化問答格式和翻譯版本)占了最大份額約50.3%;學術與百科數據(論文、維基百科、PDF文檔等)占約8%;代碼數據(來自網頁爬取的代碼和代碼倉庫,包含五種合成變體:代碼評審、問答、重寫、師生對話和跨語言轉譯)占約14.6%;數學數據(從網頁提取並保留LaTeX公式的數學內容)占約6%;推理與STEM數據占約10.4%;SFT格式的指令數據(已在預訓練階段就引入指令格式)占約3.5%;德語數據占約7.2%,顯著高於參考配方中5%的多語言份額。
德語數據的來源非常多元:有質量過濾後的網頁爬取數據(HPLT v3和v4,取前10%高質量文檔)、德語公開文本(German Commons,約1546億詞的開放授權德語文本)、商業授權的Genios新聞資料庫(來自916個德語報紙和行業媒體的1.931億篇文章,涵蓋2010-2025年,總計約576億詞,是本項目中唯一無法公開再發布的數據來源)、德語PDF文檔和維基百科,以及機器翻譯和合成德語數據(將高質量英文文檔翻譯成德語,或將英文推理鏈翻譯成德語)。
高質量數據的處理方式也頗為講究:高質量和合成版本會被重複訓練多個輪次(epoch),相當於讓廚師多次練習這道菜;而中等質量的大型數據池則被直接排除在外(epoch設為0),寧缺毋濫。
第二階段是"高質量退火",共消耗約6.58萬億詞。這一階段相當於用最好的食材做一道精品料理:完全去掉低質量網頁數據,只保留最高質量的網頁內容(占36.4%);大幅增加代碼(16.4%)、數學(5.2%)、推理(11.8%)和指令格式數據(8.5%)的比重;德語數據更是躍升至15.3%,是參考配方多語言份額的三倍以上。這一階段新增的德語數據來源包括更新版的HPLT v4(取前10%高質量)和用KletterMix管道將ClimbMix數據集翻譯成德語的大規模語料。
研究團隊還在退火數據中加入了一個有趣的組件:25個標準英德NLP評測基準的訓練集的改寫版本,類似於OLMo 3等項目的做法——讓模型在預訓練階段就見過這些題型的"變體",從而在評測時表現更穩。
第三階段是"長文本擴展",共消耗約1006億詞,將模型可處理的最大文本長度從8192個詞擴展到100萬個詞。這一階段將約1885億詞的數據按文本長度分成9個桶(4K、8K、16K、32K、64K、128K、256K、512K、1M),確保模型見過各種長度的文檔。七個領域的數據被納入其中:通用網頁(28.78B)、代碼(9.51B)、數學(6.73B)、德語(6.68B)、通用SFT(31.25B)、代碼SFT(29.24B)和數學SFT(76.31B)。值得注意的是,數學數據源不提供超過64K的文檔,所以長文本桶主要由網頁、代碼和SFT數據填充。
四、廚房裡的操作規程:訓練超參數與動態過程
訓練一個大模型,不僅僅是準備好食材,還需要精確控制烹飪過程——火候、時間、步驟。
Soofi S採用AdamW優化器(一種在神經網路訓練中廣泛使用的參數調整算法),學習率調度方案為"預熱-穩定-衰減"(Warmup-Stable-Decay,WSD):先用254步的線性預熱將學習率從0提升到峰值1e-3,然後在整個20萬億詞的基礎預訓練階段維持這個峰值(穩定平台期),進入退火階段後按照minus_sqrt曲線從1e-3衰減到1e-5,之後再以1e-5的固定學習率繼續訓練約158萬億詞(常量退火),最後嘗試了一個從1e-5降到0的最終退火階段,但該階段的檢查點沒有帶來明顯的基準提升,研究團隊選擇放棄。
每個優化步驟處理25,165,824個詞(批大小3072、序列長度8192、張量並行度1、專家並行度8的組合結果)。訓練全程使用bf16混合精度,每101次疊代觸發一次手動垃圾回收。
整個訓練過程的動態曲線非常穩健:損失函數在穩定訓練階段平穩下降,進入退火階段因切換到高質量數據而出現明顯的快速下降;梯度範數全程穩定,退火階段略有上升但沒有出現任何發散或異常尖峰;訓練吞吐量全程穩定(約10-12百萬詞/秒),偶爾的下降對應於保存檢查點和評測操作。
整個訓練在德國慕尼黑的"工業AI雲"基礎設施上完成,該設施由德國電信(Deutsche Telekom)與NVIDIA合作運營,於2026年2月正式投入使用。Soofi S是這個平台上的首批旗艦工作負載之一。訓練使用了512塊NVIDIA B200 GPU(64個DGX B200節點,每節點8塊GPU),節點內通過第五代NVLink/NVSwitch全連接,節點間通過8軌NVIDIA Quantum-2 NDR InfiniBand網路互聯(每GPU 400Gb/s頻寬,每節點3.2Tb/s對外頻寬)。將專家並行組保持在節點內,使得MoE的全轉發通信(all-to-all)走的是節點內NVLink而非較慢的節點間網路,對整體吞吐量至關重要。整個訓練從2026年3月24日持續到5月13日,共消耗約253,000 B200 GPU小時。
該數據中心完全由可再生能源供電,採用從附近Eisbach運河取水的水冷系統,並將餘熱接入周邊Tucherpark區域供暖系統——研究團隊特別提到這一點,以強調主權模型不僅是數據和計算的主權,也包括對可持續性的承諾。
五、真正的"透明廚房":數據開放與溯源
Soofi S最與眾不同的地方,也許不是它的性能,而是它的透明度。
大多數大模型的數據資訊就像餐廳的秘密配方,最多告訴你"用了多少食材",卻不說食材來自哪裡、怎麼加工的。Soofi S的團隊則做了一件在AI領域非常罕見的事:把每一個數據源的名稱、原始詞數、訓練輪數、有效詞數、在每個階段的比例全部公開,連"考慮過但最終沒用"的數據源也逐一列出並說明原因。
整個26.68萬億詞的訓練數據中,絕大多數來源都是公開可獲取的——NVIDIA的Nemotron-CC系列、Dolma 3、FinePDFs、ClimbMix、SwallowCode、UltraData-Math、AceReason、HPLT、German Commons、KletterMix等。唯一的例外是商業授權的Genios資料庫,占第一階段有效詞數的約1.3%。對於Genios,研究團隊公開了完整的統計資訊(916個德語出版物來源、1.931億篇文章、約576億詞、覆蓋2010-2025年,以及按年份的文章數量分布),但不能再發布原始文本。研究團隊明確聲明:在OSI的開放源代碼AI定義1.0(OSAID 1.0)框架下,Soofi S滿足開放要求;但在要求所有訓練數據均可再發布的更嚴格歐洲開放標準下,由於Genios的存在,約99%的數據可被獨立重建,還差最後那1.3%。研究團隊選擇明確說明這個邊界,而不是模糊處理或虛報開放程度。
除數據透明度外,研究團隊還公開發布了完整的訓練代碼(GitHub上的Soofi-Pretraining倉庫)、評測代碼(base-eval和eval-hive兩個倉庫),以及完整的超參數設置、學習率調度、各階段詞量預算,和一個可以實時追蹤訓練動態的Weights & Biases公開看板。模型權重、部分中間檢查點也將在HuggingFace的Soofi-Project主頁上發布,全部採用開放友好的許可證。
六、德語+英語雙語冠軍:評測表現
接下來是最直接的問題:這個模型到底好不好用?
研究團隊使用統一的評測框架(lm-evaluation-harness),在同樣的提示詞、同樣的少樣本設置下,對17個開放基礎模型進行了橫向對比,涵蓋代碼、數學、知識、推理、科學、閱讀理解和德語語言能力等維度,既有英文評測也有德文評測,部分基準是在任何消融實驗中都沒有用到的"保留集",以確保評測的公正性。
在"全開源"模型對比組中(Alia 40B、EuroLLM 22B、Apertus 70B、OLMo 3 32B),Soofi S在幾乎所有維度上都排名第一。英文綜合分70.1,比次優的OLMo 3 32B高2.8分;德文綜合分79.1,比次優的Apertus 70B高6.3分;保留英文集41.4,比次優高8.3分;保留德文集41.8,比次優高5.6分。代碼生成方面,Soofi S在HumanEval(73.8%)、MBPP(70.2%)、HumanEval-DE(65.5%)、MBPP-DE(84.2%)四項上均排第一,只有防污染代碼評測LBPP(31.0%)略遜於OLMo 3 32B(32.1%)。數學方面同樣全線第一:GSM8K 86.1%,GSM8K-Platinum-DE 87.1%,Minerva-500 79.4%,Minerva Math-EN 81.0%,Minerva MATH-DE 56.0%,部分超出次優20分以上。知識與推理方面,MMLU-STEM 75.9%,MMLU-Pro 51.4%,INCLUDE-DE(專門測試德國本土知識的基準)61.2%,BBH 78.8%,GPQA-Diamond(研究生級別科學題)43.4%,GPQA-Diamond-DE 41.9%,ARC-Challenge 90.6%,均排第一。德語能力方面,GLP-DE(德語語言水平)88.8%,ARC-Challenge-DE 92.3%,全部第一,部分領先次優10分以上。
在"開放權重"模型對比組中(Nemotron 3 Nano 30B-A3B、Qwen3.5 35B-A3B、Ministral 3 14B、Gemma 3 27B),Soofi S的綜合成績與密集參數量14-27B的大模型相當,僅以30億活躍參數實現了這一水平。Qwen3.5 35B-A3B在英文綜合(74.6%)、德文綜合(81.6%)和保留集上仍是最強,但Soofi S在代碼生成(HumanEval第一、MBPP第一、MBPP-DE第一)和德語專業知識(INCLUDE-DE與Qwen並列第一)上仍有突出優勢。最重要的對比是與架構完全相同的Nemotron 3 Nano:Soofi S的英文綜合提升1.8分,德文綜合提升4.2分,保留英文集提升6.7分,保留德文集提升2.0分,GLP-DE(德語語言水平)大幅提升15.1分,INCLUDE-DE提升1.5分,GPQA-Diamond提升9.6分,代碼英文綜合提升2.2分,CommonsenseQA提升5.1分——這些提升幾乎完全可以歸因於德英雙語的數據配方,而非架構差異。代價方面,德語競賽數學(Math-DE綜合)下降1.4分,開放域事實問答(NaturalQuestions)下降1.3分,GSM8K小幅下降0.4分,這些是德語數據占用了部分英文知識容量的合理代價。
研究團隊特別誠實地披露了一個評測中遭遇的重大問題:初始評測配置在Minerva數學題上使用了" "作為停止符號、生成上限1024個詞,導致模型的長鏈式推理被截斷,得出的分數極低(Soofi S僅9.8分,Nemotron僅5.6分)。修正為不設停止符、生成上限4096詞後,成績才恢復到正常水平(79.4和81.0)。這種主動披露評測bug的做法,在AI研究界並不常見。
七、最強的實際部署優勢:長文本、高並發下的速度
如果說評測分數決定了一個模型"會不會",那麼推理效率決定的是"夠不夠用"。
研究團隊用一個非常務實的指標來量化效率:在單塊NVIDIA B200 GPU上,批處理32個請求,以不同輸入長度運行時,每秒能生成多少個詞(TPS/GPU)。他們用"延遲相減法"將推理延遲分解為預填充(處理輸入)和生成(逐詞輸出)兩部分,重點關注生成階段的吞吐量,因為這才是實際服務成本的主要來源。
結果非常驚人。在40K詞的上下文長度、批大小32的條件下,Soofi S達到4820 TPS/GPU,是Ministral 3 14B的9.2倍,是EuroLLM 22B的8至9倍,是OLMo 3 32B的類似倍率。更關鍵的是,隨著上下文長度從4K增長到256K,Soofi S的生成速度幾乎完全不變(從4290 TPS/GPU到4300 TPS/GPU,變化不超過34%);而傳統密集Transformer模型的速度則隨上下文增長急劇下降——Qwen3 32B全密集版的256K速度測量耗時6428秒,而Soofi S僅需373秒完成同樣測量。
這種優勢的根源在於Soofi S的架構:在52層中,只有6層GQA層會維護隨文本長度增長的鍵值緩存,每個詞的緩存增量僅約6KB;而典型密集模型的緩存增量是Soofi S的11到53倍。Mamba-2層使用的循環狀態是固定大小的,完全不隨文本長度增長。
有趣的是,同樣採用混合架構的Qwen3.5 35B-A3B也展現出類似的平穩擴展特性,但其每秒速度僅為Soofi S的一半左右(2600 TPS/GPU vs 4820 TPS/GPU)。研究團隊分析認為,這是因為Qwen3.5使用了Gated DeltaNet混合層,其9B版本中8/32層為全注意力層,鍵值緩存增量約32KB/詞,是Soofi S的5.3倍。
在首次生成時間(TTFT,即模型處理完所有輸入開始輸出第一個詞所需的時間)方面,Soofi S在40K上下文下達到22.7秒,而Ministral 3 14B需要71.9秒,Gemma 3 27B需要92.9秒,OLMo 3.1 32B需要101.7秒,Qwen3 32B全密集版需要213.4秒。
八、這項研究的局限性和未來方向
研究團隊同樣坦誠地指出了三個明確的局限性。第一是德語競賽數學:儘管德語小學數學(GSM8K-Platinum-DE 87.1%)已與參考模型相當,但德語競賽數學(Minerva MATH-DE 56.0%)仍比Qwen3.5 35B-A3B(76.5%)和Gemma 3 27B(65.6%)差得較多。這可能是因為高質量的德語數學推理數據仍然稀缺。第二是開放域事實記憶:NaturalQuestions(79.0%)略遜於最大密集模型(Gemma 3 27B 83.5%),這與Soofi S每次只激活30億參數有關——能"裝進腦子裡"的世界知識自然有上限,但研究團隊認為檢索增強部署可以彌補這一點。第三是長文本聚合任務:在RULER長文本評測中,Soofi S在常見詞提取(CWE)這類需要聚合整篇文檔中最頻繁詞語的任務上,超過32K後性能急劇下降(256K-1M時僅約3%,而參考模型為60-64%)。研究團隊將此歸因於長文本數據配方中缺少專門針對聚合類任務的合成數據,計劃在下一版本的長文本數據管道中專門補充。
未來工作方向上,研究團隊計劃沿三條線繼續推進:一是對Soofi S進行開放式後訓練(指令微調和大規模強化學習),推出指令版和推理增強版;二是構建更寬泛、更深入的德語評測體系;三是持續擴大高質量德語數據管道,因為這被認為是進一步提升性能的核心瓶頸。
說到底,Soofi S代表的是一種新的可能:一個國家或地區完全可以自己建造、完全控制、完全透明、真正好用的AI大模型。它不是一個遙遙領先的技術奇蹟,而是一個精心工程化的"已經夠用且完全自主"的存在。對於歐洲的研究者、開發者和企業來說,這個模型最有價值的地方也許不是它在某張榜單上的排名,而是它背後那套可以被審計、被復現、被信任的完整開放配方。
有興趣深入了解的讀者可以通過arXiv編號arXiv:2607.09424v1查閱完整論文,或訪問HuggingFace上的Soofi-Project主頁獲取模型權重和相關資源。
Q&A
Q1:Soofi S 30B-A3B在實際部署中比普通大模型快多少?
A:在40K詞上下文、批處理32個請求的條件下,Soofi S每秒可生成約4820個詞/GPU,比同規模的Ministral 3 14B快9.2倍,且隨上下文從4K增長到256K,速度幾乎不變。這是因為模型只有6層傳統注意力層,其餘層使用固定大小的循環狀態,內存占用不隨文本變長而增加。
Q2:Soofi S的德語能力有多強,真的比Apertus 70B還好嗎?
A:在全開源模型對比中,Soofi S的德語綜合評分79.1,比參數量是它兩倍多的Apertus 70B(72.8)高6.3分,在德語語言水平、德語代碼、德語數學、德語區域知識等專項評測上均排名第一。相比架構完全相同的Nemotron 3 Nano,Soofi S的德語綜合分提升4.2分,德語語言水平(GLP-DE)提升15.1分。
Q3:Soofi S的訓練數據是否完全公開,Genios資料庫是什麼?
A:約99%的訓練數據來自公開可獲取的來源,並已完整披露每個數據源的名稱、詞數和配比。唯一例外是Genios資料庫,這是一個覆蓋916家德語報紙和行業媒體、含1.931億篇文章的商業授權語料庫,占第一階段約1.3%的數據,研究團隊公開了其統計資訊但因版權無法再發布原文。






