Kimi K3
正式開源以後,最先衝到 Hugging Face 準備下載的人,滑不了幾下,就會看到一個數字:2.8T。
正式開源以後,最先衝到 Hugging Face 準備下載的人,滑不了幾下,就會看到一個數字:2.8T。
Hugging Face 倉庫當前約 1.56 TB,包含 96 個 safetensors 權重分片,單片大多約 16GB。Kimi 官方建議,這台模型最好運行在由 64 個或更多加速器組成的超級節點上。
光看這些數字,可能還不足以死心,DeepSeek 當年都可以自己部署,K3 就一點都不行嗎?那麼就只能算賬了——
堆
Mac mini 也沒用的一集
Mac mini 也沒用的一集說起來像一個悖論,過去說起開源軟體,人們想到的是把模型下載下來,自己安裝、調試和運行;開源模型最初進入大眾視野時,也伴隨著類似想像。
如果仍沿用之前一度很流行的「買一台Mac mini,在本地跑DeepSeek」這套想像,我們可以來算一下:
2024 款 M4 Pro Mac mini 最高可以配置64GB統一內存,拿倉庫體積 1.56TB 的 K3 權重做一個極粗略的除法,至少需要 25 台,才剛剛能把權重全部塞進內存(考慮到作業系統、推理框架、KV 緩存和必要的運行餘量,實際還得再備幾台)。

更何況,這些 Mac mini的內存並不會自動拼成一個巨大的內存池:896 個專家的權重需要在機器之間不斷調度,而 Mac mini 沒有數據中心 GPU 集群使用的高頻寬互連。即使真的把二三十台機器堆滿一張架子,也不意味著 K3 已經能以可用的速度運行。
這和當年 DeepSeek-R1 開源時掀起的自部署潮形成了鮮明對比,也反映出,當時人們所說的自部署,多數並不是在運行 671B 參數的完整 R1,而是官方同時發布的 1.5B、7B、8B、14B、32B 和 70B 蒸餾模型。
一台 Mac mini 就可以運行其中的 7B 或 14B 版本,內存更大的機器甚至可以嘗試 32B;安裝 Ollama、輸入一行命令,普通用戶確實能夠得到一台完全離線的 AI。

K3目前開放的是2.8T完整權重,沒有提供一套從小到大的官方蒸餾版本,自部署的單位因此從「一台Mac mini」變成了「至少二三十台Mac mini組成的集群」——前者還勉強可以說是 AI 狂熱 fomo 患者的治療項目,後者已經接近一項機房工程。
顯然,「開放」不是面向一台普通電腦的,既然用戶無法直接擁有它,那麼,2.8T 的模型究竟開給了誰?
開源了,但它不是一台個人電腦上的模型
答案並不神秘:雲計算廠商、推理服務商、企業和應用開發者。
K3 擁有 2.8 萬億總參數,是目前首個開放權重的 3T 級模型,它同時具備原生視覺能力和 100 萬 token 上下文窗口,面向長程編程、知識工作和需要持續調用工具的智能體任務。
為了把如此龐大的模型真正跑起來,K3 採用了 MoE,也就是混合專家架構,可以把這個架構想像成一家公司。公司一共有 896 個專業部門,但每處理一個 token,只會根據任務叫來其中 16 個部門,再加上共享專家共同工作。

這樣一來,K3 每次實際參與計算的參數約為 1040 億,而不是完整的 2.8 萬億,計算成本因此大幅下降。但「每次只調用 16 個部門」,不等於整棟辦公樓可以不存在。896 個專家的權重仍然需要被保存,並在多個加速器之間快速調度。MoE 減少的是每一步推理要進行的計算,不是把一台 2.8 萬億參數模型變成了一台 1040 億參數模型。
K3 還加入了 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE 等新架構,它們分別處理長上下文中的注意力效率、深層網路中的資訊流動,以及極高稀疏度下專家如何穩定分工。Moonshot 給出的結論是,相比 K2,這些變化讓 K3 獲得了大約 2.5 倍的整體擴展效率。

這裡的關鍵詞是「效率」,K3 使用 MXFP4 權重和 MXFP8 激活,已經通過量化進一步壓縮模型,並針對大規模推理優化專家通信和緩存;但官方依然建議使用 64 個以上加速器組成的高頻寬超級節點。

「官方建議」通常聽聽就好,畢竟,能有這些錢的,也不太需要官方建議了……
總體上 K3 的開源需要稍微換一種理解:它是一次完整的開放權重,任何人都可以查看、部署、修改和開發衍生產品,但「任何人都可以」指的是權利上的開放,並不意味著每個人都具備運行它的基礎設施和條件。
因此,恰恰是雲廠商和推理服務商可以部署 K3,把它作為 API 提供給開發者;企業可以在自己的基礎設施上運行或微調模型,把內部數據和工作流程接進去;做編程、研究、設計、遊戲或辦公產品的團隊,也可以把 K3 嵌入某項具體功能,而不必從零訓練一台前沿模型。
K3 的自定義許可證甚至專門區分了兩類業務。一類是直接向第三方出售模型推理或微調能力,也就是「模型即服務」;另一類是把模型能力嵌入某項具體功能或 harness
的終端產品。前者在收入超過一定規模後需要與月之暗面另行簽約,後者則不被視為純粹的模型服務。
的終端產品。前者在收入超過一定規模後需要與月之暗面另行簽約,後者則不被視為純粹的模型服務。
這個看似法律化的定義,其實透露出非常清楚的產品方向:月之暗面不只是希望別人把 K3 原封不動地包裝成另一個聊天接口,也希望開發者圍繞它建立新的工作環境和具體應用。
同一個 K3,不同的產品
對普通用戶來說,K3 開源後最直接的變化,可能不是桌面上多出一個可以本地安裝的軟體,而是在越來越多產品裡間接遇到它。

AI 行業常把模型外面的產品叫作「殼」,這個說法多少帶有貶義色彩,好像只要接入一個 API、套上一層界面,就能假裝擁有自己的技術。
這種產品當然存在,但在智能體和長程任務里,模型外面的 harness 已經遠遠不只是一層聊天界面。
它決定模型能不能讀取整個代碼倉庫,能不能打開終端、運行程序和查看報錯,能不能訪問瀏覽器、文件系統與外部工具;它也決定 100 萬 token 的上下文如何分配,舊內容什麼時候被壓縮,任務進行到一半時如何保存狀態,以及模型準備刪除文件、發送郵件或執行付款前,是否必須得到用戶確認。
模型提供的是一組潛在能力,harness 負責把這些能力組織成一套可以工作的流程。一個工具權限不完整、上下文管理混亂的環境,足以讓同一個模型表現得像換了一副腦子。
K3 自己的官方評測,就提供了很直觀的例子。技術報告中的編程和智能體成績,並不是讓所有模型在同一個空白聊天框裡回答問題,而是分別放進 Kimi Code、Claude Code、Codex 等不同運行環境中。
K3 在部分測試中使用自家的 Kimi Code,在另一些測試中則使用 Claude Code;同一項 Kimi Code Bench 2.0 里,K3 使用 Kimi Code 得到 72.9 分,放進 Claude Code 時則達到 73.7 分。權重沒有改變,改變的是模型周圍的工具、提示、上下文管理和執行循環。

K3 在這方面還有一個非常具體的要求:它採用「保留思考歷史」的訓練模式,在多輪對話和工具調用中,harness 必須把模型此前返回的完整消息原樣傳回,包括推理內容和工具調用記錄,而不能只保留用戶最後看到的答案。
100 萬 token 上下文同樣如此,擁有一個足夠大的上下文窗口,不代表把所有東西一股腦塞進去就是最優方案。K3 在 BrowseComp 評測中也展示了同一模型在不同運行配置下的差異。更高的計算和上下文預算可以換來更好的成績,但成本也隨之上升;官方在部分配置中會在上下文達到 30萬 token 時主動壓縮,而不是機械地把 100 萬 token 窗口全部用滿。窗口大小是模型參數,什麼時候整理、保留和遺忘,則是 harness 的工作。

K3在BrowseComp中的得分與單任務成本,不同運行檔位呈現出明顯的效果—成本差異。圖源:Kimi K3技術報告
這次 K3 推出時被大書特書的遊戲開發,可能是最容易被普通讀者理解的例子。用戶用幾句話描述遊戲以後,模型並不是一次性吐出一份完美代碼,它需要先編寫程序,再運行遊戲,查看實時截圖,發現角色位置、界面布局或交互效果的問題,然後回到代碼繼續修改。

這裡真正完成任務的,不只是一個會寫代碼、也會看圖的模型,而是模型、終端、運行環境、截圖反饋和錯誤重試組成的循環。拿走其中任何一環,「幾句話生成遊戲」都會退化成「幾句話生成一堆看起來像代碼的文本」。
「套殼」更加有機會
這就是為什麼,模型開放以後,「殼」反而可能變得更重要。
緊隨 Kimi 步伐,OpenAI 也開源了 Codex Security 的 CLI、TypeScript SDK、Docker 配置、工作流和掃描結果管理等代碼,並採用 Apache-2.0 許可證,允許查看、修改、再分發和商業使用。

但它並不是一套下載後就能完全脫離 OpenAI、自主運行的漏洞檢測系統。README 明確要求用戶登錄 OpenAI 賬戶或提供 API key,掃描默認調用 GPT-5.6 Sol,這意味著真正承擔推理與漏洞判斷的,仍然是 OpenAI 的閉源服務。
這和 K3 幾乎形成了一個非常工整的鏡像:
Kimi K3 開放的是模型權重,但一般用戶很難運行,於是仍然需要開發者和社區圍繞它造 harness。
OpenAI Codex Security 開放的是 harness,但真正工作的模型仍然掌握在 OpenAI 手裡。
當只有少數公司能夠使用最強模型時,應用的競爭優勢往往來自「我接入了別人沒有的模型」。比如 Slack、Notion 這樣的應用,會第一時間接入,這也一度是他們的優勢來源。

一旦 K3 這樣的前沿權重向更多開發者開放,這個優勢會迅速縮小。大家都能得到同一副大腦,新的差異就來自誰能為它配上更合適的眼睛、手腳、記憶和工作檯。
當然,這不是說所有套殼產品突然都有了護城河,個個都能高枕無憂了,只是添幾個模型、增加幾套提示詞,依然很容易被複製。真正有價值的 harness,需要理解自家產品的使用場景里,具體工作如何發生,把模型接入足夠好的工具,並處理那些模型本身不會替用戶解決的麻煩:權限、安全、狀態、失敗恢復、協作和交付。

對普通用戶來說,未來判斷一款 AI 產品,也不能只問「它背後用了哪個模型」,還需要問:它能看到什麼,能做什麼,如何利用現有的資源而不是重複造輪子,是否記得任務進行到了哪裡,以及在真正採取行動之前,誰擁有最後的決定權。
K3 開放了模型層,卻沒有讓產品層變得不重要,反而更清楚地指出了一件事:前沿模型距離用戶之間,始終隔著一整套複雜的系統,這個系統在未來很長一段時間裡,都持續存在,「模型即產品」反而越來越像個暴言。

絕大多數人不會下載 1.56TB 的 K3,也不會親自管理 64 張加速卡,但他們會在不同產品里,一次又一次遇見同一個 K3。有的能連續工作幾個小時,自己發現錯誤並修正;有的換一個頁面就忘記剛才做了什麼;有的可以完成一整項任務,有的仍然只會在聊天框裡給出建議。
模型決定了能力有哪些,恰恰是外面那層「殼」,承載著、開發著這些能力,並護送它們最終抵達用戶。






