宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

實測完DeepSeek V4 Pro正式版,我發現下一條「斬殺線」可能藏在它的Agent里

2026年08月13日 首頁 » 熱門科技
一夜之間,三款重磅模型罕見撞車。
Grok 4.6 紙面跑分逼近 Fable 5,大有成為海外御三家的勢頭。
實測完DeepSeekV4Pro正式版我發現下一條斬殺線可能藏在它的Agent里
總參數達到 2.4T 的 Qwen3.8 Max 也如期開放權重;DeepSeek 這邊,DeepSeek V4 Pro 正式版(deepseek-v4-pro)同步上線,並開放 API 接口。實測完DeepSeekV4Pro正式版我發現下一條斬殺線可能藏在它的Agent里
看完 V4 Pro 正式版的跑分圖,我只能說,這波提升還是肉眼可見的。
實測完DeepSeekV4Pro正式版我發現下一條斬殺線可能藏在它的Agent里
但這年頭,跑分沒輸過,實際體驗沒贏過的模型我們也見得太多了。因此,我們也第一時間將 deepseek-v4-pro 接進 Codex 和 Claude Code,看看實際效果如何。
V4 Pro 正式版到底好不好用?
先從文字能力開始。
我讓 V4 Pro 正式版模仿魯迅,寫一篇約 400 字的短文,吐槽現代人餓著肚子也要先給飯菜拍照發朋友圈,同時要求兼顧年代感、諷刺和幽默。
結果如下:
實測完DeepSeekV4Pro正式版我發現下一條斬殺線可能藏在它的Agent里
說實話,第一眼看過去,離真正的魯迅先生肯定還有距離。
開頭甚至直接借用了魯迅最具辨識度的經典句式,模仿痕跡相當明顯。但 V4 Pro 正式版至少沒有把「魯迅風」機械理解成半文半白、生僻詞和之乎者也。
它能抓住句式節奏,也知道把「吃飯拍照」從一個日常行為慢慢引向展示欲、面子和旁觀者評價。
更重要的是,整篇文章的「AI 命題作文味」已經比較淡。雖然還算不上一代文豪,但至少沒有那種讓人兩眼一黑的模板拼接感。
如果說模仿魯迅多少還有點「考試」意味,接下來這封商務郵件,就更接近日常工作了。
我假設公司內部失誤,導致一個大客戶的定製系統延期一周,讓它寫一封道歉郵件,要求承認責任、提出補償,同時不能把客戶合作信心寫沒了。
實測完DeepSeekV4Pro正式版我發現下一條斬殺線可能藏在它的Agent里
V4 Pro 正式版沒有用「多方面因素」「項目節奏調整」這類常見的職場模糊表達,而是直接承認「此次延期完全源於我方內部的失誤」,隨後給出了延長質保、增加免費培訓和專屬運維三項補償。
整封郵件 28 秒左右完成,正文基本到了修改一下資訊就能使用的程度。
有意思的是,郵件寫完以後,它又額外解釋了一遍為什麼這麼寫,頗有一種交完卷還要給老師講解答題思路的執著。
文筆測完以後,我把 DeepSeek V4 Pro 正式版接進了 Codex。
DeepSeek 已經原生支持 OpenAI Responses API,官方也直接提供了 Codex 接入方案。配置完成後,Codex CLI、ChatGPT 桌面端和 VS Code 的 Codex 插件可以共用同一份配置。
我也測試了幾個編程任務。
我先丟給它一個很典型的「大而全」前端需求。
實測完DeepSeekV4Pro正式版我發現下一條斬殺線可能藏在它的Agent里
經典的 macOS 風格 Web OS,要求所有代碼放進單個 HTML 文件,同時加入文本編輯器、Terminal、代碼編輯器、遊戲、文件管理、畫圖和影片編輯等應用。
實測完DeepSeekV4Pro正式版我發現下一條斬殺線可能藏在它的Agent里
單看完成度,這應該是我此前測試過的同類模型里,功能最豐富的一版。多個應用都做出了基本界面和交互,系統框架也搭得比較完整,只不過審美嘛,就比較中規中矩了。
隨後我又測試了一個拍立得相機案例,需要完整模擬按快門、閃光、出紙和 8 到 10 秒化學顯影的過程,同時疊加復古偏色、輕微雜色以及類似寶麗來照片的表面質感。
實測完DeepSeekV4Pro正式版我發現下一條斬殺線可能藏在它的Agent里
從成品來看,動畫之間的銜接也是比較自然流暢的。
再比如直接上 Three.js 和 WebGL,讓它生成可以交互的黑洞吸積盤,滑鼠改變觀察角度以後,星空、吸積盤和光線彎曲都要跟著變化。
面對 WebGL 這類對性能敏感的場景,V4 Pro 對粒子數量、實時計算、渲染開銷和動畫複雜度的控制仍然偏激進。光打開網頁,我的 M2 電腦已經開始明顯掉幀。
實測完DeepSeekV4Pro正式版我發現下一條斬殺線可能藏在它的Agent里
最後則是一套科幻飛船駕駛艙 HUD,需要同時處理動態準星、雷達、航向、速度、能量、目標鎖定和滑鼠移動後的慣性偏移。V4 Pro 正式版最終把主要交互關係都做了出來。
實測完DeepSeekV4Pro正式版我發現下一條斬殺線可能藏在它的Agent里
總的來說,如果不存在官方部署 bug 的前提下,V4 Pro 正式版應對複雜任務的完整度還是有所提高,只不過,整體體驗下來,我也總感覺少了一些特別驚艷感,甚至有些地方沒有比 V4 Flash 拉開想像中那麼大的差距。
不過放到 Agent 場景里,如果 Flash 已經能完成 80% 甚至 90% 的任務,Pro 只負責少數高難度節點,那麼真正高效的系統,會動態決定什麼時候調用 Flash,什麼時候調用 Pro,而不會全程掛著最貴的模型。
換句話說,模型之間的能力梯度,本身可以變成 Agent 的成本優化空間。
DeepSeek 的下一張牌,藏在 Harness 里
規格上,DeepSeek V4 系列已經把上下文拉到 1M tokens,最大輸出達到 384K tokens。
普通聊天基本用不到這麼大的窗口,但 Coding Agent 很容易需要同時處理幾十個文件、歷史修改、工具返回結果和長時間任務狀態。上下文越長,模型能夠留在手裡的項目資料越多。
代價也是不言而喻的,Token 會迅速上漲。
這也解釋了 DeepSeek 宣布近期會上調 API 價格以後,為什麼外界如此關注。
當前 V4 Pro 正式版緩存命中的輸入價格為每百萬 tokens 0.025 元,緩存未命中輸入 3 元,輸出 6 元。V4 Flash 則分別是 0.02 元、1 元和 2 元。
實測完DeepSeekV4Pro正式版我發現下一條斬殺線可能藏在它的Agent里
Pro 的輸入和輸出價格基本是 Flash 的三倍,但放到全球市場裡,依然十分便宜。
DeepSeek 自己也已經提前提醒,API 服務近期計劃整體漲價,而且漲幅預計不會小。所以現在的 3 元輸入、6 元輸出,更像一個階段性價格。
另一個值得注意的地方是,按照現有模型資訊,它的主要能力仍集中在文本、推理、Coding、Tool Calls 等方向,暫時還沒有看到圖像、影片等原生輸入能力。簡言之,多模態目前並不是 V4 Pro 正式版的重點。
相比之下,V4 Pro 正式版發布前後,DeepSeek 在 Agent 方向上的動作明顯密集了起來。
實測完DeepSeekV4Pro正式版我發現下一條斬殺線可能藏在它的Agent里
在過去的兩三個月里,我們也看到正式掛帥 DeepSeek Harness 部門的崔添翼,在各個平台瘋狂搖人,主打一個求賢若渴。
包括一個名為 「DeepSeek Harness 團隊」 的官方微信公眾號近期也完成註冊,認證主體屬於深度求索,目前還沒有發布內容。
Harness 是今天 Agent 競爭里經常被模型光環遮住的一層。
模型負責推理,真正決定 Agent 如何讀文件、調工具、管理上下文、失敗重試和持續執行的,還有外面的整個運行框架。
Claude Code 和 Codex 的實際體驗,也從來不只由底層模型決定。
尤其當 DeepSeek 手裡同時有 Flash 和 Pro 之後,Harness 又多了一項很現實的工作:決定什麼任務值得上 Pro,什麼任務交給 Flash 就夠了。模型路由一旦做好,Agent 不需要為了少數高難度步驟,全程承擔 Pro 的價格。
實測完DeepSeekV4Pro正式版我發現下一條斬殺線可能藏在它的Agent里
在模型的成本優勢上,我們已經見識到了 DeepSeek 的斬殺線實測完DeepSeekV4Pro正式版我發現下一條斬殺線可能藏在它的Agent里打法,它不必在每一項能力上都拿第一,只要模型達到「絕大多數任務能做完」的水平,再把調用價格壓得足夠低,就足以占據一席之地。
同理,現在 DeepSeek Harness 團隊最值得關注的地方,是如何將 DeepSeek 已經建立起來的模型成本優勢,繼續傳導到整個 Agent 系統。
讓模型更少重複讀取上下文,讓工具調用更高效,讓長任務儘量避免無意義消耗,讓同樣一個任務需要的 Token 更少,再把底層模型本身的價格優勢疊加上去。
到那時,哪怕 DeepSeek 未必要親手做出下一個稱霸市場的 Claude Code,只要越來越多的 Claude Code 建立實測完DeepSeekV4Pro正式版我發現下一條斬殺線可能藏在它的Agent里這套極致性價比的體系之上,同樣也是一種不容忽視的勝利。
宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新