
盼星星,盼月亮,我們等來了七月初一的月光——
就在今天凌晨,DeepSeek 官網毫無預兆地更新,DeepSeek V4 Pro 0813 正式登場。依據慣例,無需手動調整,現在 API 接入的 deepseek-v4-pro 就會是最新模型。
此外,DeepSeek API 使用與 OpenAI/Anthropic 兼容的 API 格式,簡單粘貼 API Key,就能在 Codex、Claude Code 和 OpenCode 等第三方工具中將 DeepSeek 作為後端模型使用。

令人稍顯寬心的是,雖然已經通過提前預告的方式給用戶們打了很久「API 即將漲價」的預防針,更新到 0813 版本後的 DeepSeek V4 Pro 目前依然沒有漲價。每百萬 token 輸入(緩存未命中)與輸出的定價分別是 3 元和 6 元,和預覽版保持一致,也正好是 DeepSeek V4 Flash 的三倍。
事不宜遲,這就來看看在預覽版發布的 111 天后,終於問世的 DeepSeek V4 Pro 正式版帶來了哪些變化。
Agent 能力,終於支棱起來了
不同於往常偏好在白天流量時段發布新模型,DeepSeek 這次的凌晨更新顯得有些倉促,看似官網只來得及修改模型參數介紹、API 使用指南等少數文檔頁,連這回的更新日誌都還沒端上來。進一步的更新解讀,可能要留待今日白天。
但考慮到 V4 Pro 正式版發布的時間只比 7 月 31 日更新的 V4 Flash 正式版晚了不到半個月,我們可以有很大把握相信,二者共享了相近的優化思路(如果不是完全相同的話)。
所以,直接看 V4 Flash 正式版的更新日誌來推導 V4 Pro 的變化也未嘗不可。

DeepSeek V4 Flash 0731 更新日誌里最引人注目的資訊,莫過於官方宣稱其基模與預覽版在模型結構、尺寸上都保持一致,僅僅重新進行了後訓練,但針對性的後訓練也確實使得「Agent 能力大幅增強,基準測試遠超 V4-Pro-Preview」 。
如果今晚的 V4 Pro 正式版也是如此,那我們可以預期觀察到它在 Agent 能力上的突飛猛進。

目前網上流傳的第一批跑分結果,很大程度上印證了這一預期。在這些與 Agent 強相關的評測集中,V4 Pro 的表現比起預覽版可謂突飛猛進,在一些項目中接近甚至超越了目前的性能標杆 Fable 5:
代表 DeepSeek 自家軟體工程基準的 DeepSWE 從 12.8 分飆升至 62.7 分;代表 DeepSeek 全棧開發基準困難子集的 DSBench-Hard 分數翻了一倍多,達到 67.2 分;通過自然語言從零生成代碼倉庫的 NL2Repo 從 38.5 分提至 61.5 分 ……
也就是說,同一個 API 名稱,昨天基本還不會做的活兒,今天就可以跟全球第一梯隊的代碼 Agent 掰掰手腕了。

當然了,有 KIMI K3 珠玉在前,即使是更新後的 DeepSeek V4 Pro 正式版也還沒坐上開源界的頭把交椅(一些測試上與 K3 有輕微差距);但眾所周知,DeepSeek 的思路一向是:
比我強的沒我便宜,比我便宜的沒我強。
在補上了 Agent 能力短板後,我們的大鯨魚,再一次維護了這一神聖秩序。
為了更好地理解 V4 Pro 的能力,我們把它接入了 Workbuddy,做了一些簡單的 Agent 任務實測,看看它會交出怎樣的結果。
5 個實測案例,完全自主規劃
第一個任務很簡單:接入我的微信讀書 Skill,用讀取到的數據做一個簡單的數據報表。利用 Skills 來工作,本來就是 Agent 能力的日常體現。
這一點當然完全難不倒 DeepSeek,令人驚喜的是,它還主動閱讀了我此前因為其他工作而放在文件庫里的設計規範 Skill,給閱讀報告也配上了我們的專屬配色。

接下來兩個是網頁設計任務:
(1)搜集近日科技新聞,以 THE IFANR POST 為標題,製作一個仿照傳統新聞媒體的網站首頁,並為頭條製作一張虛假的渲染配圖;
(2)製作一個現代化的設計風格展示網站,展示極簡、斯堪地那維亞、新擬物等多種設計風格的 Bento 卡片。
因為時間所限,我沒有詳細地撰寫提示詞規定各種約束和指導條件,可以說是相當模糊的任務指令。但就結果而言,V4 Pro 都完成得非常好——
在構建新聞首頁的任務上,它找到了過去幾天我們在選題會上討論過的真實新聞,模仿傳統媒體格調的版式設計和襯線字體也非常對味,還「手繪」了一張看著很像樣的配圖。
該圖片疑似使用了AI生成技術,請謹慎甄別

構思設計風格展示網站時,V4 Pro 更「自作主張」地用上了.style 的網站名稱後綴和漸變色標題,各種設計風格示例卡片也大體正確,整體來看精緻靈動。

將模糊指令重新梳理為清晰需求,並根據這一需求自主規劃、分步完成項目,DeepSeek V4 Pro 正式版的智能程度可見一斑。
至於更複雜的交互式實例,V4 Pro 也展現出了不俗實力:
一個是基礎的俄羅斯方塊遊戲,方塊的繪製顯然相當精美,帶有一點小小的偽 3D 效果。

另一個案例則是從我讀書記錄中的《隨椋鳥飛行》中獲取靈感,製作了一個顯示簡單規則如何湧現出複雜秩序的「椋鳥群模擬器」,動畫效果令人驚艷。

為什麼是模型來「獲取靈感」?那是因為在布置後面幾個任務時,我只跟模型說了「我要去睡覺」,要以什麼方向來構思示例、又應該以何種方式來實現,都完全是 DeepSeek 自己在掂量。

你看,只要模型足夠聰明,當媒體老師也不用真的熬夜追熱點——AI Agent 能夠自行替我解決大多數問題。
還有一個「隱藏大招」
話說回來,DeepSeek V4 Pro 正式版的發布當然是一件大事,但如果把時間拉長來看,它可能只是另一件大事的前奏。
如果仔細閱讀此前官網關於 V4 Flash 正式版的更新公告,會發現裡面隱藏著一條關鍵資訊:
對於公開基準測試集中的 Code Agent 任務,正式版 DeepSeek-V4-Flash 使用 DeepSeek Harness 極簡模式(即將發布)作為框架進行測試,並使用 max 檔位,topp=0.95,temperature=1.0
沒錯,DeepSeek Harness 要來了。
近一兩年,AI 工程的研究者們逐漸形成了一個共識:隨著各家 AI 模型在推理能力上接近天花板,未來真正決定 AI Agent 能力的將不會是底層模型,而是 Harness(運行框架)。
如果說 LLM 是一個數字員工的大腦,那 Harness 就是它的辦公系統,負責給它分配權限與任務、調取工具、審批流程、檢查結果、保存日誌等工作。
沒有好的運行框架,再強的智能也無從發揮,甚或是會讓 AI 成為失去管控的脫韁野馬。反過來說,一套足夠好的 Harness,能讓平庸的員工發揮出 200% 的實力。
如今,隨著 V4 Pro 正式版問世,未來 DeepSeek AI Agent 系統的模型部分已完全到位。那麼,Harness 是不是已經準備好了呢?

答案顯然是肯定的。無論是此前 DeepSeek 招聘 Harness 研發工程師的新聞,還是前天註冊「DeepSeek Harness 團隊」公眾號,一切證據都指向:
短至數天、長至數月之內,DeepSeek Harness 就將與我們見面。
或許,新的 DeepSeek 時刻不會太遠。






