
神仙打架,這周的大模型圈,已經卷到了幾乎一天一個新旗艦。
有 Cursor 數據加持的 Grok 4.6 突飛猛進,馬斯克還說 4.7 馬上就要來;DeepSeek V4 Pro 正式版虛晃一槍後正式發布,多項 benchmark 直指 Fable 5;還有一個不能算旗艦的 Gemini Flash。
然後今天,智譜也把 GLM-5.3 端了上來。
這個在 5.2 期間,一直被調侃「我知道很好用,但不給我開會員用」的頂尖國產編程模型,終於迎來了更新。
新的模型繼續在編程方面發力,評測榜單的結果顯示,GLM-5.3 在編程能力上比肩 Fable 5 和 GPT-5.6 Sol。在社交媒體上參與內測用戶的反饋則提到,使用體感比 Kimi K3、DeepSeek V4-Pro-0813 要更好。

能跟 GLM-5.3 上桌對比的模型,在可視化圖表中只剩下了 Kimi K3、Fable 5 和 GPT-5.6 Sol。以前是開源自己一堆模型對比,不找閉源自討苦吃,現在是「對標 Fable 5」成了開源的基本配置。
六個 benchmark,GLM-5.3 的表現都不賴,尤其是由 OpenAI 提出的 GDPVal 評估測試,智譜拿到了第一名。
AutomationBench、Agents』 Last Exam,一個是用來測試跨應用工作流編排能力,一個是測試智能體能力,GLM-5.3 的成績也是數一數二。
和 Kimi K3、Qwen3.8-Max 邁向萬億大參數不同,GLM-5.3 這次參數量和上一版本差不多,同樣是 7000 億參數級別。官方技術部落格中提到,此次升級帶來的提升主要原因是後訓練 Scaling。
就是靠著 743B 的基模,智譜訓練出來了 Kimi K3 2.8T 級別的大模型。
我們在與 GLM-5.2 完全相同基座上高效推進強化學習,可能我們還遠未開發出這個基座(即 GLM-5.2 模型)的智能上界。

▲ 更完整的 benchmark 對比,經過後訓練的 GLM-5.3 對比 GLM-5.2 提升相當明顯,Coding、網路安全和 Agentic 成績進步都不像是一個基座模型。
不得不說,現在大模型做好後訓練在某些程度上比預訓練都更好使。就拿四月份發布的 DeepSeek V4 Flash 預覽版和 7 月底發布的正式版相比,兩個模型的能力幾乎是斷層的。
智譜這次還開源了名為史萊姆 Slime 的一個後訓練框架,直接能覆蓋發布級模型後訓練所需要的完整工作流。他們說從 GLM 4.5 開始,就一直在用這套框架進行後訓練。
目前 Slime 支持對 GLM 系列、Qwen 系列以及 DeepSeek 系列的部分模型和 Llama 3 進行後訓練。

▲ 教你如何用 128xH100 訓練 DeepSeek R1,以及如何蒸餾
除了主打編程,GLM-5.3 的另一個重點方向是網路安全。從 Hugging Face 事件開始,現在哪個模型不能談談網路安全,都算不上是一個好模型。
無論是模型的攻擊能力強,能逃出設置的沙箱,還是防守能力強,能監控、抵禦和分析複雜的 AI Zero Day 漏洞;這些以前聽著離我們普通用戶很遠的東西,也成了大模型角力的新賽場。
GLM-5.3 在網路安全相關的任務中,表現與 Claude Mythos 5 持平。其中 ExploitGym 網路安全測試,就是 OpenAI 在評估自己的待發布模型時,為了解決更多問題去攻擊了 Hugging Face,GLM-5.3 的表現也非常不錯,898 到題,限時 6 小時內完成的情況下,達到了 130 道。

針對模型的網路安全能力,智譜還公開了一項網路安全披露賬本
,記錄模型在不同的項目中找到的各種漏洞。GLM 找到的最古老漏洞,甚至可以追溯到大約 40 年前。
40 年都沒找到,GLM-5.3 一出手就找到了,放 OpenAI 或者 A 社手裡,這不比證明了一個數學難題強嗎。

▲ 網路安全披露賬本 https://cvd.z.ai/
雖然我們普通用戶不會拿它去找各種攻防漏洞,但模型的能力提升是實打實的,具體到日常的辦公和編程任務上,GLM-5.3 的表現又如何。
APPSO 提前拿到了 GLM-5.3 的測試資格,繼續用一些 3D 網頁生成、網頁應用開發、macOS 小工具開發等任務,來看看 GLM-5.3 的表現是否能快速實現我們的想法。
目前 GLM-5.3 已經上線智譜官方 Agent 應用 Zcode 和效率工具 AutoClaw,同時面向 GLM Coding Plan 用戶全量開放並開放訂閱。

▲ 在 Zcode 應用內可以直接選擇 GLM-5.3 進行體驗
第三方平台像是 WorkBuddy,QwenWork,TraeWork 等應用也已經開放搶先體驗。而 API 調用預計在下周二開放,模型的完整權重則會在兩周內開源。
當所有 AI 都開始卷編程
相較於寫作或者文科領域,那些見仁見智,審美無法統一的任務,編程大概是大模型最適合發力的場景。
簡單粗暴的一句提示詞丟進去,就等著看它用代碼能寫出什麼好看好玩有意思的畫面。
我們先是讓它做了一個人體血液循環的 3D 交互仿真系統,原以為它會做一個寫實的人體透視,至少像是這種細節滿滿的 3D 仿真,有真實的身體輪廓,合理排放的血管,真實的肌肉線條。

但不知道是不是提示詞不夠詳細,GLM-5.3 給的交付是看起來比較粗糙的版本。整個人更像是一個火柴人,內部器官也全部堆在了一起。
比較難得的是,整個的演示有較多的自定義,例如視圖圖層可以選擇不同的場景,生理參數也有心率、壓力等內容。我們甚至可以選擇失血性休克的場景,直接看到血液循環的流向。

▲ 提示詞:做一個高精度的人體血壓
循環 3D 可交互仿真系統,使用 GLM-5.3 + Claude Code
總的來說,這個交互網頁能夠用在教學場景,但就是沒有那麼好看。
繼續我們在 DeepSeek Harness 中的金字塔滑板遊戲測試,同樣的提示詞,GLM-5.3 + Claude Code 最高推理深度給出的結果也不賴——遊戲體驗好,場景渲染也準確。

▲ 如果你不好好操作,可能真的會輸,只是這個滑板的殘影,過於「亮眼」。
當我們想要它生成一些驚艷的 3D 場景時,像是一個滿是水母的湖,數百萬隻寫實的水母在一片翡翠湖泊里飄動。

這個效果確實還挺漂亮的,渲染水母就不會像渲染人體一樣,只用一些簡單的圓圈,不過這個 3D 水母的提示詞也相當長。
在 Claude Code 中使用 GLM-5.3 時,如果你開啟了自動審批命令,會經常遇到一個錯誤,顯示「auto mode cannot determine thesafety of Bash right now.」即「自動模式目前無法判斷 Bash 命令的安全性。」
這大概是 Claude Code 應用自身的機制來處理自動模式下,如何識別不同的命令是否需要彈窗通知交給我選擇,但第三方的模型,暫時還沒有適配 Claude Code。
於是我們切換到 ZCode 進行體驗,它能像 Codex 一樣使用不同的工具,不斷對已經生成的網頁截圖識屏,分析存在的問題,然後持續優化,整個運行時間也比單純在 Claude Code 中使用會更久。

就像這個行星撞地球的模擬,兩個行星碰撞,我們在 Claude Code 中的任務最長沒有超過 1h,但這個 3D 網頁過了一個小時,ZCode 還在反覆地測試檢查。
好在最後的效果沒有讓人失望,我們第一眼就能看到地殼開裂、熔岩噴出、碎片形成行星環等壯觀畫面。就這些複雜的粒子運動,要面面俱到的編程好,肯定是需要一點模型底子的。

同尺寸里的最強模型
GLM-5.3 的意義,我們測試下來就覺得它還是回到了原本屬於它的位置,即同尺寸最強模型,編程開發者的首選。
K3 用了 2.8T,DeepSeek V4 用了 1.6T,而 GLM 5.2 用了不到一半的參數,就實現了同樣程度的智能。
所以如果你本來就在用智譜,已經購買了 Coding Plan(今天下午他們也重置了一次),從六月中旬發布的 GLM-5.2 切換到 5.3,是能感受到比較明顯的差異。
雖然 API 版本預計要等到下周二更新,目前官網顯示的 API 價格也還是 GLM-5.2 版本,但同樣的模型尺寸,估計 GLM-5.3 的 API 定價不會有太大的變化。

Kimi K3、Qwen3.8-Max、DeepSeek V4 正式版、Grok 4.6、Gemini 3.7 Flash、GLM-5.3,最近的模型發布節奏幾乎是前所未有,每天都有新的模型,新的工具可以測試。
模型之間的區別也隨著密集的發布逐漸在縮小。拿我們自己來說,曾經 Claude 被認為是寫作上最好用的模型,優化一些句子的結構,把腦子裡亂成一團的想法讓它有邏輯的串聯起來,Claude 給的文章有時比人類寫得還要好。
但頻繁封號的 Claude,讓我們轉到了用 GPT 以及其他的模型,於是發現好像所謂的 Fable 5 和 Opus 5 並不是那麼的非它不可。
寫作如此,編程、生圖、整理文檔、做報告、構建知識庫也越來越接近這個狀態。

GLM-5.3 和最近這一連串新模型一起,把大模型的「最強保質期」壓得越來越短。
新發布的 GLM 用了 20 天,就有更強更好的 Kimi,Kimi 用了 20 天,又能換到新發布的 DeepSeek,等 DeepSeek 不好用了,那個時候又可以輪到 GLM 了。
所以當別人問你,現在最好的國產編程模型是什麼,你會說 Kimi K3、DeepSeek V4 還是 GLM 5.3?






