DeepSeek 首個開源多模態模型來了:這雙“眼睛”不給人類看圖,專供 Agent 幹活DeepSeek在Hugging Face上線V4家族首款實驗多模態模型DeepSeek-V4-Flash-Vision-Exp,採用MIT協議,參數305B。基於V4-Flash-0731底座,接入視覺編碼器與Aligner,經持續訓練獲得圖像理解能力。與傳統視覺問答不同,它重點聚焦多模態Agent能力,不做簡單“看圖說話”。5 小時前9.7K