阿里巴巴集團今日正式發布其Qwen系列開源大語言模型的全新成員。
Qwen3.8-Max是這家中國電商巨頭迄今為止能力最強的大語言模型,擁有2.4萬億參數,約為阿里巴巴今年2月發布的Qwen3.5模型的7倍。該模型在響應查詢時會激活其中950億個參數。
Qwen3.8-Max支持最多100萬Token的提示詞輸入。據阿里巴巴介紹,這使模型每次請求可分析超過200頁文本或約100小時的影片內容。響應輸出最多可包含13.1萬個Token。
目前,阿里巴巴尚未公布Qwen3.8-Max的詳細架構說明。此前發布的Qwen3.5和Qwen3.6共享了若干相同的技術特性,包括一種名為"Gated DeltaNet"的注意力機制。新模型是否同樣採用了這一技術,目前尚不明確。
大語言模型的注意力機制是其用於理解提示詞的軟體模組,負責對輸入文本進行攝取,識別其中最重要的內容,並在處理過程中對其優先排序。Gated DeltaNet是這一技術的變體,由英偉達
的研究人員於去年提出。
線性擴展優勢
標準注意力機制的計算複雜度呈二次方增長,這意味著提示詞長度翻倍,所需內存和算力將增加至四倍。Gated DeltaNet模組則不同,其複雜度呈線性增長,對處理器和內存的需求不會隨提示詞長度的增加而急劇攀升,從而有效降低了大語言模型的硬體開銷。
Gated DeltaNet並非唯一支持線性擴展的注意力機制實現方案,其獨特之處在於結合使用了"門控更新規則"和"Delta規則"兩種數據處理技術。據英偉達介紹,這兩種技術能夠提升具備線性擴展注意力機制的大語言模型在處理長提示詞方面的能力。
在正式發布前,阿里巴巴已對Qwen3.8-Max進行了多項測試評估。據悉,該模型在無需人工介入的情況下成功完成了一個歷時16天的編程項目。另一項測試中,Qwen3.8-Max完成了一項包含500餘個步驟的晶片設計優化任務。
在衡量大語言模型界面開發能力的"Frontend Code Arena"基準測試中,該模型獲得1668分,僅比Anthropic最新大語言模型Claude Opus 5的最強版本低37分,同時超越了包括Meta旗艦模型Muse Spark 1.1在內的十餘個前沿模型。
Qwen3.8-Max已於發布當日在阿里雲平台上線。阿里巴巴計劃於下周將其開源,並同步發布一款體積更小、更具硬體效率的版本——Qwen3.8-27B。
Q&A
Q1:Qwen3.8-Max有多少參數,和上一代相比提升了多少?
A:Qwen3.8-Max擁有2.4萬億參數,約為今年2月發布的Qwen3.5模型參數量的7倍。在響應查詢時,模型會激活其中950億個參數。
Q2:Qwen3.8-Max支持多長的上下文輸入?
A:Qwen3.8-Max支持最多100萬Token的提示詞輸入,每次請求可分析超過200頁文本或約100小時的影片內容,響應輸出最多包含13.1萬個Token。
Q3:Qwen3.8-Max在基準測試中表現如何?
A:在Frontend Code Arena基準測試中,Qwen3.8-Max獲得1668分,僅比Anthropic最新模型Claude Opus 5的最強版本低37分,並超越了包括Meta旗艦模型Muse Spark 1.1在內的十餘個前沿模型。






