
DeepSeek 終於「開眼」了。
DeepSeek 推出了一款面向 Agent 時代的多模態模型:deepseek-v4-flash-vision-exp。
目前,該模型已經上線 DeepSeek
API 平台上
,用戶可以通過設置 model=』deepseek-v4-flash-vision-exp』 訪問該模型。
官方介紹,這是一個實驗性質的模型。該模型在保持 DeepSeek-V4-Flash 文本能力的基礎上,新增視覺理解能力,可以處理圖片輸入,並進一步提升多模態 Agent 任務表現。

與此同時,DeepSeek Harness
0.1.1 版本也加入了對該模型的原生支持,開發者可以直接調用 deepseek-v4-flash-vision-exp,將圖像理解能力接入現有 Agent 工作流。
這意味著 DeepSeek 的多模態能力開始從單純的「看圖問答」走向更複雜的任務執行場景。
從文本模型到多模態 Agent
過去一段時間,AI Agent 的競爭重點逐漸從模型生成能力轉向任務執行能力。
一個能夠完成真實工作的 Agent,需要理解用戶輸入的資訊,也需要讀取文件、識別圖片、調用工具,並根據環境變化調整行動路徑。
在這一過程中,視覺能力成為重要組成部分。
DeepSeek 表示,deepseek-v4-flash-vision-exp 在文本能力方面與 V4-Flash 保持一致,包括 Agent 能力、推理能力以及世界知識。
同時,該模型在多模態 Agent 基準測試中,相比 V4-Flash 有明顯提升,模型表現接近 Opus-4.8 等高端模型。


目前,deepseek-v4-flash-vision-exp 支持混合文本和圖片輸入,圖片可以通過 Base64、外部 URL 或 Files API
方式提供。
開發者可以通過 Chat Completions、Messages 以及 Responses API 調用該模型,使圖片理解能力接入不同類型的應用。
例如,在辦公場景中,Agent 可以讀取截圖、分析文檔頁面、理解表格內容;在開發場景中,它可以識別界面問題、分析錯誤資訊;在內容生產場景中,它可以根據圖片素材輔助生成內容。
比如我們可以用 deepseek-v4-flash-vision-exp 生成商業定製西藏自駕游 PPT。

再比如,我們還可以用它對 DeepSeek Harness 官網進行二次創作。

簡言之,多模態能力的加入,讓 Agent 能夠處理的資訊範圍進一步擴大。
定價延續 V4-Flash,圖片按 Token 計費
從 API 價格來看,deepseek-v4-flash-vision-exp 延續了 DeepSeek-V4-Flash 的價格體系。
模型輸入和輸出均按照 token 數量計算費用,其中圖片會根據尺寸轉換為 token,與文本 token 一同計費。
官方表示,每張圖片最高會換算為 384 tokens,並按照 V4-Flash 的價格標準計費。

目前,deepseek-v4-flash-vision-exp 的百萬 tokens 輸入價格如下:
緩存命中情況下,空閒時段價格為 0.05 元,高峰時段為 0.10 元。
緩存未命中情況下,空閒時段價格為 1.5 元,高峰時段為 3 元。
輸出價格方面,空閒時段為每百萬 tokens 4.5 元,高峰時段為 9 元。
其中,高峰時段為以及 14:00 至 18:00,其餘時間按照空閒時段價格計算。
相比一些主打多模態能力的大模型,DeepSeek 繼續保持相對較低成本的 API 策略,希望降低開發者調用視覺模型的門檻。
Files API 解決圖片復用問題
伴隨視覺模型上線,DeepSeek 同步推出 Files API。
此前,開發者調用視覺模型時,通常需要在每次請求中重新上傳圖片。當圖片需要在多個請求、多輪對話或者 Agent 任務中重複使用時,不僅增加網路傳輸成本,也會受到請求大小限制影響。
Files API 提供了一種新的方式。
開發者可以先上傳圖片文件,隨後通過 file_id 在不同請求中引用同一文件,無需重複上傳。

目前,Files API 支持 JPEG、PNG、GIF 和 WebP 格式,單個文件最大支持 64 MiB,單用戶最大儲存空間為 25 GiB,最多可以保存 10000 個文件。

對於複雜 Agent 工作流來說,這類文件管理能力的重要性正在提升。
例如,一個需要長期分析產品資料的 Agent,可以先上傳大量圖片、文檔素材,之後根據任務需要反覆調用,而無需每次重新傳輸數據。
值得一提的是,DeepSeek 此次上線 deepseek-v4-flash-vision-exp,並沒有單獨強調圖像生成或視覺娛樂能力,而是將重點放在多模態 Agent 場景。
從行業趨勢來看,AI Agent 正在從處理文字指令,走向理解現實世界中的各種資訊。
文字是人類交流的重要方式,但大量真實工作依賴圖片、文件、界面和環境資訊。一個只能處理文本的 Agent,很難真正進入辦公、設計、開發等複雜場景。
因此,多模態能力正在成為 Agent 進一步發展的基礎設施。DeepSeek 通過 V4-Flash-Vision-Exp、Files API 以及 Harness 生態支持,正在嘗試補齊這一環節。
只能說,那個熟悉的 DeepSeek 終於又回來了。






