DeepSeek 在 Hugging Face 上線了 DeepSeek-V4-Flash-Vision-Exp,這是 V4 家族首款實驗性多模態模型,採用 MIT License。模型參數量達 305B,基於 V4-Flash-0731 底座,在原有語言模型基礎上接入視覺編碼器和 Aligner,經持續訓練獲得圖像理解能力。

image.png

不做“看圖說話”,專攻多模態 Agent

與傳統多模態模型主打視覺問答不同,DeepSeek 爲這個 Vision 版本劃定了全新賽道:官方重點強調多模態 Agent 能力,讓 Agent 直接讀取網頁截圖、軟件界面、圖表等視覺信息,再結合工具調用繼續執行任務。換言之,這雙“眼睛”不是給人看的,而是給 Agent 用的。

此次開源內容相當完整,包括模型權重、Tokenizer、Prompt Encoding 參考實現以及一份最小化 PyTorch 推理實現,覆蓋視覺編碼器、Aligner、DFlash Attention、MoE、Hyper-Connections 等核心模塊。社區跟進迅速,Hugging Face 頁面上已出現 7 個面向 llama.cpp、LM Studio、Ollama 的量化版本。

時間線上也有值得注意的細節:8 月 21 日該模型先上線 DeepSeek API,當時只能調用、不給權重,開發者可通過 API 同時輸入文字和圖片,圖片按 Token 計費;十天後權重才正式開放,本地部署和二次開發由此成爲可能。這種“先賣 API 再開源”的節奏,也透露出 DeepSeek 對其以 API 服務爲主的定位。

image.png

性能逼近 Claude Opus 4.8,官方措辭依舊剋制

從跑分來看,加入視覺能力後純文本 Agent 能力基本不受影響:Terminal Bench 2.1 從 82.7 漲到 83.9,DeepSWE 從 54.4 漲到 59.3,反而超過 Opus 4.8 的 58.0。多模態 Agent 提升更明顯:ApexBench Pass@1 達到 36.5,Agents' Last Exam 以 27.3 超過 Opus 4.8 的 25.7,ZeroBench Pass@5 也以 35.0 壓過對手的 34.0。

不過 DeepSeek 並未宣稱“全面超越”:NL2Repo 項目上其得分 57.7,與 Opus 4.8 的 69.7 差距不小。官方表述也保持克制,僅稱“多模態 Agent 能力接近 Claude Opus 4.8”。把近期更新串起來看,DeepSeek 正在拼裝一套完整的 Agent 技術棧:模型負責推理和工具調用,Harness 負責持續執行任務,Vision 則讓 Agent 能直接讀取電腦裏的視覺信息,此次開源正是這塊拼圖的關鍵落子。