你有沒有想過一個問題:為什麼現在的大模型越來越會"說話",卻越來越囉嗦?
問一個簡單的選擇題,它能給你寫出兩千多個字的推理過程,反覆驗證、反覆檢查,最後才憋出一個答案。這不是它在認真,這更像是一個記不住重點的人,只能靠不斷念叨來防止自己忘掉剛才想到了什麼。
2026年,上海人工智慧實驗室的研究團隊發布了一篇論文,提出了一個叫Mobius的新架構。這篇論文裡有一個數據讓我第一次讀到時愣了一下:同樣的推理任務,換了這個新架構的模型只用516個token就搞定了,而原來的Transformer架構要用2364個token。差了將近4.6倍。
這不是靠"少說話"的指令調出來的效果,而是架構本身變了。要理解這個變化,你得先明白當前大模型內部到底是怎麼"記憶"和"思考"的。
知識和推理綁在一起,是問題的根源
在傳統的Transformer架構里,模型的每一層都長得差不多:一個自注意力模組,緊接著一個前饋網路,再往上疊很多層。
**自注意力(Self-Attention)**:負責讓模型在處理一句話時,同時關註上下文裡所有相關的詞,捕捉詞與詞之間的關聯,這是模型"推理"的核心部件。
**前饋網路(FFN,Feed-Forward Network)**:一般被認為是模型儲存具體知識的地方,你可以理解成模型的"知識庫"。
問題就出在這裡。在Transformer里,每一層的FFN是那一層專屬的,第一層的知識庫只屬於第一層,第十層的知識庫只屬於第十層。資訊只能往前傳,淺層的東西可以往深層送,但深層想往回夠淺層的知識,幾乎不可能。
這就好比一個大公司,每個樓層都有自己獨立的檔案室,檔案不能跨樓層調閱。一樓的員工整理好的資料,十樓的人想用,只能一層一層地把資訊往上搬,搬的時候難免丟失、變形。如果某個關鍵資料恰好鎖在三樓的柜子里,而十樓的人當時並不知道該往哪層去找,那這次決策就可能出錯,只能靠反覆開會討論(也就是模型生成很多token去"試錯")來彌補資訊不對稱。
現在主流做法是用**思維鏈(Chain of Thought, CoT)**去補這個洞:每生成一個新詞,就用這個詞去激活下一步需要的知識,靠一步步試探把分散在各層的資訊拼出來。
這個辦法能用,但代價很大。研究者的判斷是,這種做法本質上是低效的:模型被迫用大量重複、囉嗦的輸出去補償架構本身資訊傳遞不暢的問題。
把知識倉庫拿出來單獨放,會怎樣
Mobius的核心思路,是把FFN從每一層"私有"的狀態里解放出來,變成全局共享的一個大倉庫。
**Mobius架構
**:一種把知識儲存(Memory,用FFN實現)和推理運算(Reasoner,用Self-Attention實現)解耦的新型模型架構,所有層的推理模組可以共享訪問同一個知識資料庫。
具體來說,原來每層自帶的FFN被合併成了一個巨大的、全局共享的知識向量資料庫。所有層的自注意力模組,不管是第一層還是最後一層,都可以直接向這個資料庫查詢需要的知識,查完之後再把結果傳回去繼續做推理。
這就好比把公司原來一層一層的獨立檔案室,全部拆掉合併成一個中央資料庫,任何樓層的人都能直接進去查,不用再一層層往上傳遞申請。三樓要用十樓那份資料,直接去中央庫調就行,不用再經過中間七層樓的層層轉手。
論文裡管這個設計叫**反向殘差連接
(Backward Residual Connection)**:讓深層的計算單元也能直接訪問淺層甚至任意層的知識,而不只是被動接收前面層往後傳的資訊。
**殘差連接(Residual Connection)**:深度學習里的一種連接方式,讓資訊可以跳過某些層直接傳遞,主要作用是防止網路太深導致訓練不穩定。傳統的殘差連接只能讓淺層資訊往深層傳,是單向的。
這裡有個技術上很現實的問題:如果真的讓每一層都能物理上直接連到每一層,那計算圖會變得極其複雜,硬體根本不好並行處理。研究團隊選擇了一種更聰明的辦法,不去直接搭建那種複雜的跨層連線,而是讓所有層共享同一份知識儲存。這樣一來,"每層都能訪問全部知識"這個效果就自然實現了,用不著真的畫出那些錯綜複雜的連接線。
如果不這麼做會怎樣?論文裡的實驗對比說得很清楚:一個從零訓練的7B參數模型,用了Mobius架構後,達到跟傳統Transformer基線一樣的下游任務分數,只需要基線數據量的62.6%。換句話說,同樣多的錢花在數據上,Mobius能多學62.6%意義上的"性價比",這個差距不是幾個點的誤差,是訓練成本層面的實質差異。
讓模型在"腦子裡"多想幾步,而不是嘴上多說幾句
Mobius的第二個關鍵設計,叫**動態潛在推理
(Dynamic Latent Reasoning)**。
**潛在推理(Latent Reasoning)**:不通過生成具體的文字token,而是讓模型在內部的連續向量空間裡完成多輪"思考",思考完了才輸出精煉的文字結果。
傳統模型的最小推理單位是token,一個詞。每生成一個詞,都要完整走一遍所有的網路層。這就像你腦子裡每冒出一個念頭,都要把這個念頭寫成一句完整的話說出來,再讓別人聽完反饋,再想下一句。效率很低,而且"說出來的話"這種載體本身資訊密度不夠高,你腦子裡其實轉了很多彎,寫出來卻只有一句平淡的結論。
Mobius換了個玩法。它讓模型在少數幾層之內,反覆地在向量空間裡查詢知識、精煉表達,這個過程完全不需要立刻decode成具體的文字。等這個內部的"思考向量"被反覆打磨到足夠成熟,才一次性解碼出多個高質量的token。
這就像一個作家在正式落筆之前,先在腦子裡把整段話的邏輯理順、措辭斟酌好幾輪,想清楚了才一口氣寫出一段流暢的文字,而不是每想一個字就寫一個字、寫完再糾結要不要撤回重寫。如果沒有這個"先在腦內打磨"的過程,作家就得像傳統模型那樣,邊寫邊改,寫出一堆改來改去的痕跡,讀者看到的成品自然又長又亂。
這也是為什麼論文說Mobius"可以看作是循環Transformer(Looped Transformer)和擴散語言模型(Diffusion Language Model)的升級綜合"。它既有循環模型那種反覆疊代的特性,又有擴散模型那種一次性處理多個位置的並行感。
數據上體現得很直接。論文對比了Mobius和Transformer在多個測試集上的平均輸出長度,MMLU Pro任務上短了4.6倍,GPQA Diamond任務上短了整整5倍。這不是把內容刪減了,而是把原本靠囉嗦堆出來的"試錯性思考"內化到了模型內部的向量疊代里。
知識倉庫太大了怎麼辦
這裡必須承認一個代價。把FFN拆出來做成全局共享的超大資料庫,意味著每次推理時,模型要在一個巨大的知識空間裡去檢索,這必然帶來更高的內存訪問壓力,單次前向計算的效率也會下降。
研究團隊的解決辦法是引入**混合專家(MoE, Mixture of Experts)**式的分塊激活機制:把這個龐大的共享知識庫切分成很多小塊(也就是"專家"),每次推理只激活其中一小部分相關的知識塊,而不是把整個倉庫都翻一遍。
**MoE(混合專家模型)**:一種讓模型在推理時只激活一部分參數(專家)的技術,可以在不顯著增加計算量的前提下,讓模型擁有更多的總參數量。
這就好比中央資料庫雖然大,但你查資料的時候系統會自動幫你定位到相關的那幾個書架,不用把整個倉庫的燈都打開、把每一本書都翻一遍。雖然找資料這一步(檢索)比原來複雜了一點,但真正搬運和處理的知識量反而變小了,整體效率不降反升。
論文裡也做了實驗驗證這個設計的有效性,從零訓練的Mobius-7B模型和繼續在Qwen3.5-35B基礎上訓練出來的Intern-S2-Mobius-35B,都用了這種分塊稀疏激活的方式。
實測效果到底如何
先看訓練效率。論文用MMLU這個綜合知識測試對比了從零訓練的Mobius和傳統Transformer,兩者用一樣的數據量訓練,Mobius的分數始終更高。用Transformer訓練1萬億token後的分數作為基準線,Mobius只用0.626倍的數據量就能達到同樣水平,相當於1.6倍的數據效率提升。
再看規模化之後的表現。研究團隊沒有從零開始訓練一個巨大的Mobius模型(成本太高),而是選擇在開源模型Qwen3.5-35B的基礎上做繼續預訓練,把架構切換成Mobius,得到了Intern-S2-Mobius-35B。結果很有意思,切換架構不僅沒有讓模型變笨,反而在多項測試上超過了原來的Qwen3.5-35B。
| 通用任務 | Intern-S2-Mobius-35B | Qwen3.5-35B |
|---|---|---|
| MMLU Pro | **89.05** | 85.31 |
| GPQA Diamond | **80.81** | 80.24 |
| IMO Bench | **81.25** | 77.50 |
| AIME 2026 | **95.31** | 92.08 |
| HMMT 2026 | **85.51** | 78.50 |
| UGD hard | 73.02 | **78.02** |
| AMO | **58.00** | 50.00 |
| SimpleQA | **28.90** | 21.39 |
| HLE | 19.11 | **22.40** |
| 平均分 | **67.88** | 65.05 |
科學任務上的差距更誇張:
| 科學任務 | Intern-S2-Mobius-35B | Qwen3.5-35B |
|---|---|---|
| Biology-Instructions | **51.40** | 3.77 |
| Mol-Instructions | **45.73** | 21.70 |
| MolecularIQ | **59.29** | 29.13 |
| 平均分 | **52.14** | 18.20 |
Biology-Instructions這一項,51.40對3.77,這不是提升,是數量級的差異。原因可能和Mobius的知識壓縮能力有關,專業領域的知識本身比通用對話知識更依賴精確檢索和組合,而Mobius的共享知識庫天然更適合這種場景。
推理速度上的提升同樣明顯。論文測了不同批次大小(Batch Size)下的請求吞吐量,聚合多個測試集之後,Mobius比Transformer實現了最高4.6倍的吞吐量提升。論文標題里說的"4倍推理加速",指的就是這個綜合表現。
這些效率提升,到底從哪來的
論文用一個具體案例來解釋這個問題,而不是空談架構優勢。
案例是一道線性代數選擇題,兩個模型都答對了(選項C)。研究者把兩個模型的推理過程按步驟對齊做了逐項比較。
在"任務理解"這一步,Mobius用17個token,Qwen3.5用20個token,差別不大。到"陳述1的判斷"這一步,Mobius用178個token舉了一個反例就得出結論,Qwen3.5卻先試了零向量、又試了平行向量兩種情況,用了283個token。到"選項匹配"這一步,Mobius只用22個token說"匹配選項C",Qwen3.5卻又花了122個token重新表述一遍已經得出的結論。
最關鍵的差異在"重複推導和檢查"這一步,Mobius完全沒有這一步,而Qwen3.5額外花了1147個token去做一次完整的重新推導和多輪驗證。
這說明什麼?說明Mobius的省token不是靠壓縮表達、砍掉必要的推理步驟,而是它本身就不需要那麼多次的自我驗證。傳統Transformer因為每一步推理都要重新"從頭激活"相關知識,容易出現不確定感,於是習慣性地反覆檢查。Mobius因為可以在潛在空間裡直接、多輪地精煉答案,一次到位的確定性更高,自然不需要那麼多來回確認。
最終統計下來,同一道題,Mobius用516個token,Qwen3.5用2364個token,差了4.6倍。這個數字和論文標題打出來的"4倍加速"基本對得上,說明這不是刷分技巧,而是真實的推理效率差異。
這個架構的野心,不只是省token
論文最後一部分很有意思,研究團隊沒有止步於說"我們的模型更快更強",而是提出了四個更大的問題,都是當前AI領域正在爭論的方向。
第一個是**自我進化(Self-Evolving)**,模型能不能持續吸收新知識而不遺忘舊的?團隊的判斷是,傳統Transformer架構因為知識和推理綁在一起,任何一次更新都可能同時改變兩者,容易導致**災難性遺忘
(Catastrophic Forgetting)**:模型學了新東西之後,把之前學的東西忘掉了的現象。Mobius因為把知識和推理拆開了,理論上可以做到只擴充知識庫而不動推理模組,從而減少這種衝突。
第二個是**世界模型
(World Model)**,讓AI理解連續的物理世界而不只是處理文字。團隊認為傳統Transformer要建模好連續空間可能需要天文數字級別的參數量,而Mobius原生支持的潛在推理,給這類建模提供了更自然的起點。
第三個是**科學發現**,團隊認為現在的AI擅長解題,卻缺乏提出突破性假設的能力,這需要知識之間更自由的組合和聯想,而Mobius"打平"所有知識、讓它們可以被任意層直接調用的特性,理論上有助於跨領域知識的組合。
第四個是**軟硬體協同設計**,因為知識和推理分開了,未來有可能只把負責推理的那部分參數長期放在GPU顯存里,而把海量的知識參數放在更便宜的SSD儲存里,按需調取。這對於降低大模型部署成本,可能是一條現實的路。
這四個方向目前都還只是論文裡的"設想",團隊自己也承認,能不能真的落地還需要大量後續驗證。但這至少說明了一件事,Mobius不只是一個讓推理更快的技巧,它試圖回答一個更根本的問題:知識和推理,到底應不應該被綁在一起?
寫在後面
讀到那道線性代數題的逐步對比時,我腦子裡冒出的第一個念頭是:我們可能一直把"話多"當成了"思考深入"的證據,但這篇論文用具體數字打破了這個錯覺。Qwen3.5多花的那1147個token的"重複推導",翻回去看內容,其實和之前說過的沒什麼本質區別,只是又走了一遍流程。這讓我想起寫論文或者做匯報時,有些人反覆重申觀點,看起來很鄭重,實際上只是缺乏底氣的自我說服。
論文裡那個專家激活模式的圖(附錄B)也值得單獨說一說。從零訓練的Mobius-7B激活分布很均勻,說明模型自己學會了靈活調用整個知識庫;而從Qwen3.5轉換過來的Intern-S2-Mobius-35B卻保留了明顯的"塊對角"結構,說明原來Transformer那種層級分工的思維慣性,並沒有被繼續訓練完全抹掉。這其實提示了一個問題,架構轉換可能沒有從零訓練那麼"乾淨",繼續訓練能改善但改不徹底。
還有一個沒細說但值得追問的地方:論文反覆強調Mobius的效率優勢,但對訓練成本本身談得比較少。共享知識庫意味著更高的檢索開銷,MoE式分塊是緩解方案,但這個方案本身的調參複雜度、路由穩定性有沒有隱藏成本,論文沒有展開。這大概是留給後續工作的問題。
Q&A
Q1:Mobius架構是什麼?
A:Mobius是上海AI實驗室提出的一種新型大模型架構,核心是把知識儲存(用FFN實現的Memory)和推理運算(用Self-Attention實現的Reasoner)解耦,讓所有層的推理模組共享同一個全局知識資料庫,而不是像傳統Transformer那樣每層各自擁有獨立的知識儲存。
Q2:Intern-S2-Mobius比Qwen3.5-35B強在哪裡?
A:Intern-S2-Mobius-35B是基於Qwen3.5-35B繼續預訓練得到的Mobius架構模型,在MMLU Pro、GPQA Diamond、AIME 2026等多項通用任務上超過原模型,平均分67.88對65.05,在生物、分子等科學任務上優勢更明顯,同時推理吞吐量提升最高達4.6倍,輸出長度平均縮短1.5到5倍。
Q3:Mobius為什麼能用更少的token完成推理?
A:因為Mobius引入了動態潛在推理機制,讓模型在內部連續向量空間裡反覆精煉答案,避免了傳統模型靠生成大量文字token反覆試錯驗證的低效模式,案例顯示同一道題Mobius只用516個token,Qwen3.5需要2364個token。






