一塊 8.24GB 內存的 CPU,一個 2.78 萬億參數的大模型,甚至不需要顯卡,Kimi K3 就這麼水靈靈地跑起來了。

而滿血版的 DeepSeek V4 Flash,也只需要用一台老黃的 DGX Spark,或者配備 128GB 運行內存的 Mac 電腦就可以運行。

從 2025 年初橫空出世的 DeepSeek R1 掀起了一大波本地部署的潮流,各種密集的攻略教大家如何避開 DeepSeek 的「伺服器繁忙,請稍後再試」,用手邊的電腦,就能自己搭建一個不受限制的 DeepSeek R1。
到了今年,大模型的參數幾乎都從千億到了萬億, 671B 的 R1 對比現在 2.78T 的 Kimi K3 和 2.4 T 的 Qwen3.8-Max,看起來是格格不入。

快速問答版本的 DeepSeek V4 Flash 維持在 284B,但 V4 Pro 預覽版的總參數也達到了 1.6T。
硬體上的變化同樣如此,內存大漲價和本地 Agent 工具爆發的背景下,讓 Mac Mini 等產品直接斷貨,蘋果上調 Mac 等產品線起售價。黃仁勛去年年底推出的 DGX Spark,都從建議零售價 3999 美元漲到了 4699 美元起。
AI 一天,人間一年。當時的本地部署教學放到眼下的萬億參數大模型上,都有了新的變化。
如何在 2026 年部署一個本地大模型?需要什麼配置?什麼樣的工作流適合自己部署一個大模型?部署哪個大模型?我們用這篇文章給大家講清楚。
太長不看總結版
8GB 能跑 Kimi K3,但要 1.7TB 固態,一個 Token 等半分鐘。
本地部署先看顯存容量,再看內存頻寬。
8GB 顯存適合 4B—7B;16GB 可跑 9B—14B;24GB 進入 24B—27B;120B 模型通常需要 80GB 以上顯存或大容量統一內存。
DeepSeek V4 Flash 正把前沿模型帶上個人桌面。
Kimi K3 是怎麼跑起來的
輸入「The capital of France is」,程序輸出「Paris」。
這個名為 kimi-k3-in-c 的 GitHub 項目,用不到 200KB 的 C 語言代碼,完成了 Kimi K3 的 CPU 推理。沒有 PyTorch,沒有 CUDA,整個程序只依賴編譯器、OpenMP 和系統數學庫。

但 2.78 萬億參數並沒有被塞進這 8GB 內存里。完整權重仍然占據約 1.56TB 硬碟空間,項目真正壓縮的,是模型在任意時刻必須停留在內存中的部分。
簡單來說,就是開發者將模型的其他的權重全放到一塊固態硬碟上。根據 Kimi K3 官方模型卡,模型共有 2.8 萬億參數,但每處理一個 Token,只會激活其中約 1040 億參數,占總量的 3.7%。
Kimi K3 一共有 93 層,其中 92 層使用 MoE
。每一層都準備了 896 個不同的專家,路由器會根據當前 Token 的內容,從中選出 16 個參與計算。
。每一層都準備了 896 個不同的專家,路由器會根據當前 Token 的內容,從中選出 16 個參與計算。剩下的 880 個專家,當前這一輪完全用不上。

既然每層只用 16 個專家,程序只需要根據路由結果,從硬碟讀取這 16 個專家。但把路由專家留在硬碟後,模型還有 113.49GB 無法繞開的稠密權重。
這裡包括注意力層、路由器、歸一化、共享專家、Embedding 和輸出層。它們幾乎每生成一個 Token 都要參與計算,普通的 MoE 卸載方案通常會把這一部分完整放進內存。

kimi-k3-in-c 又做了一次流式處理,原始 Kimi K3 權重被分成 96 個模型權重文件,同一層里的權重散落在體積巨大的分片中。項目先運行一個打包腳本,把 93 層的稠密權重重新整理成一個約 109GB 的連續文件,每一層都對應一個固定的磁盤位置。
開始推理後,程序會根據內存預算,儘可能固定一部分層。放不下的部分,則通過一個循環緩衝區逐層讀取:當前層進來、完成計算、騰出緩衝區,下一層繼續覆蓋。
最終,整個內存縮減過程變成了四個數字:
5.56TB:所有參數採用 BF16 時的理論體積;
1.56TB:官方發布的 MXFP4 權重;
113.49GB:專家權重留在磁盤後,需要持續參與計算的部分;
8.24GB:連稠密主幹也改成逐層讀取後,實際測得的峰值內存。

Kimi K3 的 69 個 KDA 層也幫了很大忙。KDA 不需要為每個歷史 Token 保存一份完整 KV Cache,只維護固定大小的遞歸狀態;另外 24 個 MLA 層則通過低維表示壓縮注意力緩存。

Kimi K3 框架,KDA 是 Kimi Delta Attention,一種注意力機制
配合增量解碼,第一輪先處理完整 Prompt,之後每一輪只需要處理剛剛生成的新 Token。內存不會隨著生成長度迅速失控,程序才有機會把更多空間留給權重調度。
8 GB 的代價,是每個 Token 等半分鐘
8 個 Token 總共花了 261.5 秒,內存占用降到了 8.24GB,真正的成本轉移到了硬碟和時間上。
在最低內存配置下,Kimi K3 每生成一個 Token,需要讀取約 25.83GB 專家權重。由於沒有空間固定稠密層,適合 9B—14B 模型;二手 RTX 3090 24GB 約為 5000—8000 元,可以進入 24B—27B,但要承擔 350W 功耗、礦卡歷史和顯存維修風險。
如果模型完整放進顯卡,6—8 個現代 CPU 核心通常夠用。8GB—16GB 顯卡建議搭配 32GB 系統內存,24GB—32GB 顯卡搭配 64GB;想通過混合卸載運行 70B,則要準備 128GB 內存。
關於硬體主要還是顯卡,內存、CPU、硬碟都是夠用就行,但硬碟最好從 1TB 固態起步,長期使用更推薦 2TB。
沒有獨立顯卡,也可以考慮 Mac Studio、Ryzen AI Max+ 395 和 DGX Spark 這類大容量統一內存設備
。96GB—128GB 內存可以裝下 70B、109B 甚至部分 120B Q4 模型,代價是更高的整機價格和有限的升級空間。
。96GB—128GB 內存可以裝下 70B、109B 甚至部分 120B Q4 模型,代價是更高的整機價格和有限的升級空間。
如果直接要對應到模型,8GB 顯存或 16GB 普通內存電腦,Phi-4 Mini 3.8B、Qwen3.5 4B 這類小模型最穩妥。它們適合摘要、翻譯、格式整理和簡單工具調用,也不會讓整台電腦陷入內存不足。
來到 16GB 顯存,Qwen3.5 9B、Gemma 4 12B 是更均衡的選擇。Gemma 4 12B 支持文本、圖片、音頻和影片,Google 甚至展示過通過專用 AI Edge 運行時,在 16GB 普通筆記本上運行它。
24GB 顯存開始進入本地 Agent 的實用區間。Devstral Small 2 24B 主打編程和軟體工程,官方給出的本地硬體參考包括單張 RTX 4090 或 32GB 內存的 Mac。
同一檔位還可以選擇即將開源的 Qwen3.8 27B,它支持文本和視覺輸入,中文能力更有優勢。
32GB 顯存則可以運行 Qwen3.5-35B-A3B。它擁有 35B 總參數,每次只激活約 3B,在模型完整裝入顯存後,可以得到比同等總參數稠密模型更輕的計算負擔。
80GB—128GB 是另一條分界線。gpt-oss-120b 官方稱可放入單張 80GB GPU;這些模型更適合大容量統一內存工作站、專業計算卡或多卡系統。
拿 DeepSeek V4 Flash 舉例,目前公開驗證較完整的一套方案,是一台配備 4 張 GB300 的伺服器。每張 GB300 擁有 288GB 內存,四張卡合計約 1.15TB 顯存。這樣的配置遠遠超過模型權重本身,剩餘空間將用於 KV Cache、DSpark、長上下文和並發請求。

而社區里一些經過量化的方案,也能做到在 168GB RAM 上運行 DeepSeek V4 Flash 無損 4 位,在 110GB RAM 上運行 3 位。
選擇合適的本地 LLM 軟體
硬體選好後,下一步才是運行工具。
LM Studio 更適合第一次接觸本地模型的人。它提供完整的圖形界面,可以直接搜索、下載和切換模型,還能在加載前使用專門的命令 lms load --estimate-only 估算模型、上下文、Flash Attention 和視覺組件需要多少內存。

Ollama 則更適合開發者。安裝後通過 ollama run 就能啟動模型,也可以提供 OpenAI 兼容 API,連接 Open WebUI、Cherry Studio、編輯器和各種 Agent 工具。

需要留意的是,Ollama 現在同時提供本地模型和雲模型。帶有 cloud 標記的模型會把計算轉移到 Ollama Cloud;如果你對隱私和離線運行有明確要求時,應先檢查模型是否完全在本地執行。
llama.cpp 提供更細的控制。用戶可以精確設置 GPU 卸載層數、上下文、KV Cache 量化和線程數等參數,也可以在 CUDA、ROCm、Metal、Vulkan、SYCL 以及純 CPU 之間切換。它適合需要壓榨硬體、運行 GGUF 或處理非主流設備的人。

Mac 用戶還可以選擇 MLX-LM。它針對 Apple Silicon 和統一內存設計,除推理外,也支持量化、微調和分布式運行。

如果模型需要同時服務多人,或要做一個正式的內部 API,vLLM 和 SGLang 更合適。它們支持連續批處理和更高並發吞吐,但部署環境通常更偏向 Linux 伺服器。
這裡還有一個常見誤區:Open WebUI 和 Cherry Studio 主要負責界面,它們通常還要連接 Ollama、llama.cpp 或 vLLM 等推理後端。

有人說,真正的數字自由,是在自己的設備上擁有一個不受平台限制的 AI。
沒有每周額度,沒有服務中斷,也不用擔心賬號被封;模型廠商調整套餐、下架版本或者收緊權限時,本地模型仍然可以繼續處理自己的文件、代碼和數據。
但到了 2026 年,「本地運行」已經需要分成三個方面來看:
能跑,是權重可以被裝進顯存,或者從硬碟逐層讀取;能用,是速度、上下文和模型能力足以完成任務;值得部署,則意味著省下的 API 費用,或者獲得的隱私、穩定性和控制權,能夠覆蓋硬體、電費與維護成本。
DeepSeek V4 Flash 的出現,似乎開始把這個三角變得完整起來。
它已經擁有接近前沿閉源模型的能力,經過量化後,卻可以進入 110GB—168GB 內存,甚至一台配備 128GB 統一內存的 Mac 或 DGX Spark 所能觸及的範圍。

這樣的設備對普通用戶依然昂貴,但相比過去必須依賴多張專業計算卡和伺服器機櫃,最強模型與個人桌面之間的距離,已經縮短了一大截。
接下來,MoE緩和專家模型、低比特量化
、稀疏注意力
和權重流式加載
等技術的進步,大概還會繼續降低部署成本,統一內存設備也會把更大的模型搬上桌面。
、稀疏注意力
和權重流式加載
等技術的進步,大概還會繼續降低部署成本,統一內存設備也會把更大的模型搬上桌面。今天需要十幾萬元工作站才能運行的模型,幾年後可能就會進入普通電腦。






