科技圈的刺激,總是來得猝不及防。
同一天,兩家大模型領域的絕對頂流,不約而同地丟出了自己的重磅炸彈。一邊是 OpenAI 突然宣布 GPT-5.6 系列模型價格大跳水;另一邊,DeepSeek
正式發布 V4-Flash 模型,帶著通過後訓練(Post-Training)全面強化的推理與代碼能力,霸氣登場。

過去兩年,大模型的競爭主線是追趕能力上限:參數更大、上下文更長、跑分更高。今天這兩份公告放在一起,則釋放出另一個信號:
頂級模型的競爭,正在從單純比拼能力,轉向爭奪「智價比
」。
這種變化對 Agent 尤其重要。
讓聊天機器人寫一封郵件,模型回答一次,工作基本結束。讓 Codex 修一個 Bug,它卻要先讀項目文件、搜索代碼、應用補丁,再運行測試;一旦測試報錯,還得回頭檢查並重新執行。
任務越長,模型調用次數越多,價格就越直接地影響 Agent 能否真正投入日常工作。
DeepSeek V4-Flash 的 API 價格仍是每百萬 token 輸入 1 元、輸出 2 元。OpenAI 則把 GPT-5.6 Luna 的 API 價格下調約 80%,Terra 也便宜了 20%。

能力繼續往上走,調用成本卻開始往下掉。這次我們更想知道的是:價格更低的模型,能不能把事情同樣做好?
模型還是那個模型,但更會幹活了
DeepSeek 今天更新的 V4-Flash,目前只能通過 API 使用,網頁版和 App 都沒有更新。
開發者使用 API 調用 deepseek-v4-flash,後台則會自動換成新發布的 V4-Flash-0731。它可以一次讀取 100 萬 token 的內容,適合塞進大份文檔或整個代碼項目,也原生支持 OpenAI 的 Responses API,可以接入 Codex。
有意思的是,DeepSeek 稱,V4-Flash-0731 與預覽版的模型結構、尺寸完全一致,這次只重新進行了後訓練。
可以把基礎訓練理解成上學,後訓練更像入職後的專項練習。模型原本已經會寫代碼、讀文檔,接下來還要反覆練習怎麼拆解任務、選擇工具、發現錯誤,以及如何把一件事情從頭做到尾。身板沒變,做事的習慣變了。
官方給出的提升幅度確實很大,甚至宣稱「遠超 V4-Pro-Preview」。在測試模型能否操作終端、連續完成任務的 Terminal Bench 2.1 中,它從 61.8 分漲到 82.7 分;另一項代碼 Agent 測試 DeepSWE,則從 7.3 分漲到 54.4 分。

這些數字翻譯成人話就是,新版不只更會寫代碼,也更擅長調用工具,把一件事情從頭做到尾。
更關鍵的是,能力上漲並沒有伴隨漲價。V4-Flash 仍維持每百萬 token 輸入 1 元、輸出 2 元。
幾乎同一時間,OpenAI 也在降低模型調用門檻。據 Axios 報道,上線僅 3 周的 GPT-5.6 Luna 輸入和輸出價格均下調約 80%,Terra 也降價 20%。降價後的 Luna 每百萬 token 輸入 0.2 美元、輸出 1.2 美元。
但便宜的前提是能把活幹完。Agent 往往要連續調用模型幾十次,任何一步出錯,整個任務都可能返工。
所以這次,我們把 DeepSeek V4-Flash 接入了 Proma,給它安排了 5 個從簡單到複雜的任務。過程中不追加提示,也不替它處理問題,看看它拿出的第一版到底能不能用。
5 個任務跑下來,V4-Flash 的驚喜不只是便宜
第一輪,我們把和 APPSO 的 320 篇早報數據交給 V4-Flash,讓它分析兩個賬號的閱讀、互動、選題和發布節奏,並把結果做成一份網頁報告。

V4-Flash 先用幾張數字卡片交代整體情況,再把內容拆成賬號對比、閱讀趨勢、互動畫像、選題分析、結構透視、爆款榜單和全量明細。頁面里混用了柱狀圖、折線圖、環形圖、雷達圖和散點圖,散點圖還能切換賬號、縮放查看。
視覺上也相當成熟。深色背景、藍黃色強調色和卡片層級保持一致,十幾張圖塞在同一頁里,依然能一眼分清重點。雖然這份報告很長,但好在並沒有明顯的拼貼感。
接下來,我讓 DeepSeek V4 做了一個稍微複雜一些的任務——一個打磚塊小遊戲,既要處理球、擋板和磚塊的碰撞,又要加入重力、動量傳遞、磚塊耐久、連鎖爆炸、4 種道具和粒子效果。
它給出的結果意外地還不錯,普通磚、金屬磚和爆炸磚在視覺上有明確區分;金屬磚被擊中後會出現裂紋,爆炸磚會波及周圍磚塊。多球、加寬擋板、粘性擋板和雷射也不是只出現在說明里,實際遊玩時都能觸發。

- 真實的物理引擎:球與磚塊、牆壁和擋板的碰撞遵循彈性碰撞與動量守恆。擋板移動時的速度應該能傳遞給球(例如:向右快速移動擋板擊球時,球會獲得額外的向右水平速度)。加入輕微的重力效果,使軌跡更豐富。
- 磚塊類型與生命值:設計不同顏色和耐久度的磚塊(如普通磚塊需要擊打 1 次,金屬磚塊需要擊打 3 次並伴有視覺開裂效果,爆炸磚塊被擊碎時會炸毀周圍的磚塊)。
- 道具系統:擊碎特定磚塊會隨機掉落道具,包括:多球模式(分裂出 3 個球)、擋板加寬、粘性擋板(球碰到擋板後先粘住,按空格鍵再發射)、以及雷射射擊(擋板可以發射子彈直接摧毀磚塊)。
- 視覺與特效:包含擊碎磚塊時的粒子散落效果、球撞擊時的微弱螢幕抖動、流暢的 60 FPS 動畫,以及簡潔現代的 UI 界面(計分板、生命值顯示、暫停和重新開始按鈕)。
- 代碼結構:所有的 HTML、CSS 和 JavaScript 代碼必須全部打包在一個文件中,確保可以直接雙擊在瀏覽器中運行,且無外部依賴庫。
接下來,我們又把題目換成了三體軌道模擬器。這類頁面很容易靠星空、光球和拖尾矇混過關,真正的難點是算出三顆星體下一秒各自會去哪裡,並讓軌道持續運行。

- 物理計算:使用龍格-庫塔法(RK4)或 Verlet 積分算法來計算三個質點在萬有引力作用下的運動軌跡。允許用戶實時調整引力常數 G、三個質點的質量、初始位置和初始速度向量。
- 交互與控制:用戶可以通過滑鼠拖拽來改變質點的初始位置,或者通過軌跡線上的箭頭調整初始速度。包含暫停、單步調試、重置、以及內置幾種經典穩定軌道(如 figure-8 八字形軌道、Lagrange 軌道等)的一鍵預設功能。
- 可視化效果:使用 Canvas 繪製質點的實時運動,並保留漸隱的運動軌跡拖尾(利用半透明背景刷新實現)。實時顯示每個質點的位置、速度和加速度數值。
- 代碼要求:完全原生 JavaScript 實現,無需外部庫,界面設計美觀、富有科技感。
V4-Flash 交付的頁面採用了四階龍格-庫塔法,也就是 RK4 來計算軌道。它還加入了引力軟化,避免兩個質點距離太近時數值突然爆炸;當加速度變大、天體接近相遇時,程序會自動把一個計算步長繼續拆細,降低軌跡發散的概率。
界面完成度同樣在線。主要畫面留給軌道,複雜參數集中在右側,狀態資訊收在左上角,沒有因為控制項多就變成一塊密密麻麻的工程面板。
算完軌道,我們再換個方向,看看它的審美。任務是一張科幻控制艙儀錶盤,不僅要有實時波形、環形進度和滾動日誌,點擊「超載模式」後,整套界面還要同時進入警報狀態。

- 視覺風格:深色調背景,使用熒光藍、霓虹綠和警示橙作為主配色。加入網格背景暗紋、發光特效(box-shadow)和數字科技感字體。
- 動態組件:包含一個實時波形圖(使用 Canvas 繪製的音頻波形或心率圖模擬)、幾個帶有平滑過渡動畫的環形進度條(展示 CPU 占用率、能源百分比等),以及一個不斷滾動的實時日誌終端(Terminal)。
- 交互控制:用戶可以點擊「超載模式」按鈕,此時儀錶盤所有指示燈變為閃爍的紅色,數據刷新速度加倍,且有警告音效(用 Web Audio API 合成,無需外部音頻文件)。
- 代碼規範:使用響應式設計,所有 CSS、HTML 和 JS 代碼必須內嵌於同一個文件中,保持現代優雅的視覺表現力。
V4-Flash 這一版卻做得像模像樣,挺有內味的。實時波形、環形進度、能量流、系統狀態和日誌終端有清楚的主次關係,發光效果沒有蓋過數據本身。波形持續運動,環形數字平滑變化,終端也會不斷刷出新的系統日誌。
前面的任務都可以在本地完成。最後,我們加入聯網、調用 API 和讀取外部資料,讓 V4-Flash 從一句話開始,做出一份開源 AI 項目周報。

把這個周報做成一個美觀、有科技感的網頁,略有極客風,簡潔明了的界面。
它創建了 Python 腳本,實際運行並檢查結果,最終交付了腳本、Markdown 周報和一份 JSON 原始數據,以及一個精緻的網頁。
5 個任務全部結束後,我回頭看了一眼費用——
DeepSeek 後台一共記錄了 393 次 API 請求,累計消耗約 3422 萬 token,前前後後只花了 2.85 元。測試前充進去的 10 元,連三分之一都沒用完。

當大模型開始從「做大」轉向「做精」
5 個任務當然無法測出一個模型的全部能力,但它們已經足夠讓我們一窺 V4-Flash 的優勢:速度快、價格低,也能把一段含糊、抽象的要求變成完整、可操作的成品。
過去幾年,AI 行業主要遵循 Scaling Law:模型參數更多、訓練數據更大、投入算力更高,能力通常也會隨之提升。
華為何庭波提出的「韜(τ)定律」,代表的則是另一種思路——當幾何縮微越來越困難,就把優化範圍從單個器件擴展到電路、晶片和整個系統,通過縮簡訊號傳播時間、提高協同效率,繼續挖掘性能。
兩者討論的並不是同一個技術問題,卻代表了兩種不同的發展路徑:一條繼續擴大規模,另一條想辦法讓現有系統運行得更有效率。
V4-Flash 這次的變化,更接近後一種思路。模型結構和尺寸沒有變化,僅靠後訓練,它在代碼、工具調用和連續執行任務上的表現就有了明顯提升。它沒有否定 Scaling Law,只是說明繼續堆參數之外,數據質量、強化學習、推理策略和訓練方法,依然可以從現有模型里挖出更多能力。

無獨有偶,OpenAI 今天也宣布 GPT-5.6 系列模型大幅降價。頂級模型的競爭,正在從單純比拼能力上限,轉向同時爭奪「智價比」。
模型廠商之間的價格戰已經全面展開。對廠商而言,這會繼續壓縮利潤空間,並加速行業洗牌;但對開發者和普通用戶而言,模型價格下降意味著 Agent 可以調用更多次、思考更長時間,也能承擔過去因成本過高而無法落地的任務。
當模型能力繼續提升,調用成本持續下降,真正被打開的,或許不只是一個更便宜的聊天機器人,而是一個可以長時間運行、反覆試錯,並真正替人完成複雜工作的 Agent 時代。






