怎麼全世界都開始吻上 Flash 模型了?
就在剛剛,DeepSeek
正式發布 DeepSeek V4.1 Flash
模型,並已全面上線官網、App 和 API 端。
正式發布 DeepSeek V4.1 Flash
模型,並已全面上線官網、App 和 API 端。作為 DeepSeek 新一代模型結構系列中的最小尺寸版本,V4.1 Flash 並沒有簡單延續擴大模型規模的路線,而是從架構設計、緩存管理和推理流程多個方面重新優化大模型運行方式,且具備原生多模態視覺理解能力。

官方表示,DeepSeek V4.1 Flash 的目標是同時提升模型能力上限、推理速度、吞吐能力,並為未來擴展到更大規模模型提供新的技術基礎。
其中最受關注的是,DeepSeek V4.1 Flash 是一個擁有 552B 參數的 MoE 模型
,但通過新的計算架構,讓實際推理成本大幅降低。
,但通過新的計算架構,讓實際推理成本大幅降低。APPSO 此前也曾簡單體驗過這款新模型,歡迎點擊下文回看:
DeepSeek 新模型突然上線,Flash 的模型,Pro 的野心



更快更便宜更智能的秘密,藏在這些黑科技里
APPSO 查閱 DeepSeek V4.1 Flash 的技術報告,發現其最大的變化,是採用了一套全新的 Causal Encoder Decoder(CED)架構。
傳統 Transformer 模型在處理輸入和生成輸出時,通常採用相對接近的計算方式。但實際上,用戶輸入內容的理解過程和模型生成內容的過程,對計算資源的需求並不完全相同。
DeepSeek V4.1 Flash 通過非對稱設計,讓模型在不同階段採用不同規模的激活參數。
官方數據顯示,V4.1 Flash 總參數規模達到 552B,但輸入階段激活參數約為 8B,輸出階段激活參數約為 16B。
這意味著,模型擁有大規模參數帶來的能力上限,同時在實際推理過程中只需要調用部分計算資源,從而降低運行成本。

論文鏈接:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
這種設計主要解決的是大模型進入長上下文時代後的效率問題。
過去,模型處理幾千字內容時,計算壓力並不明顯。但隨著 AI Agent
興起,一個任務可能需要模型連續讀取網頁、分析文件、調用工具,再根據新資訊繼續推理。
興起,一個任務可能需要模型連續讀取網頁、分析文件、調用工具,再根據新資訊繼續推理。在這樣的場景中,模型不僅需要具備理解能力,還需要長期保存和調用大量上下文資訊。其中影響效率最大的部分之一,就是 KV Cache
——可簡單理解為模型保存歷史上下文的緩存機制。
——可簡單理解為模型保存歷史上下文的緩存機制。根據 DeepSeek 技術報告,CED 設計能夠降低長上下文輸入階段的計算壓力,讓模型面對大量文本時擁有更高效率。
其次是 Compressed Sparse Attention 2(CSA2
)。
)。在普通注意力機制中,模型生成一個新 token 時,需要關注此前所有 token 資訊。例如面對百萬 token 的上下文,理論上模型每生成一個新 token,都需要處理此前的大量內容。
CSA2 則通過跨層復用 KV Cache,並結合 Top-K 索引,讓模型優先關注更加重要的資訊。

DeepSeek 介紹,CSA2 包含 Full、Reindex 和 Reuse 三種模式。
Full 模式會重新計算 KV 和索引;Reindex 模式會復用 KV,但重新選擇關注位置;Reuse 模式則直接復用 KV 和 Top-K 索引。
通過這種方式,不同網路層無需反覆保存和計算相同資訊,從而降低生成過程中的計算量。
除了架構優化,DeepSeek V4.1 Flash 還進一步壓縮了 KV Cache 儲存需求。新模型採用 FP4 KV Cache
,相比上一代 DeepSeek V4 使用的 FP8 Main KV Cache,進一步降低緩存占用。
,相比上一代 DeepSeek V4 使用的 FP8 Main KV Cache,進一步降低緩存占用。官方數據顯示,與上一代模型相比,DeepSeek V4.1 Flash 對 HBM 的需求降低至原來的四分之一,對 SSD 的需求降低至原來的八分之一。

如果與初代模型相比,DeepSeek 表示,目前 KV Cache 規模已經縮小約 437 倍。
對於企業部署而言,更小的緩存意味著同樣硬體資源可以支持更多並發請求;對於普通用戶而言,則意味著更快的響應速度和更低的調用成本。
生成階段,DeepSeek V4.1 Flash 還加入了 DSpark 技術
。該技術通過輕量模組提前預測部分 token,再由主模型確認結果,提高 Decode 階段生成效率。
。該技術通過輕量模組提前預測部分 token,再由主模型確認結果,提高 Decode 階段生成效率。最終效果會直接體現在用戶感知上,也就是模型每秒能夠生成多少 token。
綜合這些優化以及大規模的強化學習後訓練,DeepSeek V4.1 Flash 在多個 Agent 能力測試中超過包括 DeepSeek V4 Pro 在內的一系列旗艦模型。
這也讓 Flash 系列的定位發生變化。
過去,Flash 更多意味著更輕量、更低成本的版本。而在 V4.1 Flash 中,DeepSeek 正嘗試讓 Flash 成為兼顧性能和效率的新一代主力模型。
從一個模型,到一套 AI 工作環境
隨著 DeepSeek V4.1 Flash 發布,DeepSeek 同步調整了 API 服務。
目前,V4.1 Flash 已正式接入 DeepSeek API,用戶只需要調用 deepseek-flash 模型名稱即可使用最新版本。
此前的 DeepSeek V4 Flash 和 V4 Flash Vision Exp 已停止服務。

為了保證已有應用兼容,原模型名稱 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 會暫時自動路由至 V4.1 Flash。
與此同時,DeepSeek 計劃逐步下線 V4 Pro。官方表示,經過多項測試,V4.1 Flash 在性能、費用、速度以及整體任務耗時方面已經超過 V4 Pro。
至未來 V4.1 Pro 上線之前,用戶繼續訪問 deepseek-v4-pro 時,請求將自動轉向 V4.1 Flash,並按照 V4.1 Flash 的價格計費。

價格方面,DeepSeek 也同步下調 V4.1 Flash API 費用。
得益於新架構帶來的成本優化,DeepSeek 希望進一步降低模型使用門檻。同時,API 仍然採用峰谷價格機制
,閒時時段價格為高峰時段的一半。
,閒時時段價格為高峰時段的一半。目前,騰訊 WorkBuddy
、CodeBuddy 以及 OpenCode 已經接入 DeepSeek V4.1 Flash。
、CodeBuddy 以及 OpenCode 已經接入 DeepSeek V4.1 Flash。除了模型本身,DeepSeek 也在同步升級圍繞模型運行的 Agent 環境。
此次發布的 DeepSeek Harness v0.1.5,就是其中的重要更新。
新版 Harness 針對 DeepSeek V4.1 Flash 進行了專項訓練和優化,覆蓋標準模式、程序化工具調用(PTC)模式以及極簡模式。
其中一個重要變化,是支持在保留已有 KV Cache 的情況下更新系統提示詞。對於連續運行的 Agent 任務而言,這意味著用戶可以調整任務方向,而無需重新開始整個上下文計算過程。

Harness 的文件處理能力也進一步增強。新版 Web 界面支持上傳圖片、PDF 等多種類型文件,模型可以通過文件工具讀取內容。
右側 Sidebar 新增工作區文件管理,可瀏覽文件樹並預覽 Markdown、HTML、PDF、代碼和圖片。模型生成的文件也能直接查看,或用系統默認應用打開。
新版 Harness 擴展了插件生態,在左右兩側提供標準化插件入口,支持將工具接入側邊欄和內容面板,並以多標籤、分欄或全螢幕方式展示。
Harness 正從模型調用工具,逐漸轉向可擴展的 Agent 工作環境。
多 Agent 協作也得到增強。父子 Agent 支持雙向通信,用戶可在任務執行中補充資訊、調整方向,並排隊發送、編輯、刪除消息,插入指令或停止任務。主 Agent 還可為子 Agent 選擇模型和推理強度。

此外,DeepSeek 推出實驗性功能 Agent Teams。主 Agent 可創建團隊成員,通過共享任務列表分配和跟蹤工作;不同 Agent 可互發消息,主 Agent 能查看進度、等待結果並統一匯總。目前該功能以插件形式提供,默認關閉,需手動開啟。
插個題外話,DeepSeek 目前已經調整了界面設計,將快速、專家和識圖功能整合到了一起,不再單獨提供專家模式。
從 DeepSeek V4.1 Flash 到 Harness v0.1.5,DeepSeek 正在嘗試構建的不只是一個更強模型,而是一套圍繞 Agent 工作流展開的技術體系。
模型能力決定 AI 能做什麼,而推理效率、工具生態和運行環境決定 AI 能否真正進入日常工作。DeepSeek V4.1 Flash 的發布,正是在這一方向上的一次有力的探索。






