DeepSeek 首个开源多模态模型来了:这双“眼睛”不给人类看图,专供 Agent 干活DeepSeek在Hugging Face上线V4家族首款实验多模态模型DeepSeek-V4-Flash-Vision-Exp,采用MIT协议,参数305B。基于V4-Flash-0731底座,接入视觉编码器与Aligner,经持续训练获得图像理解能力。与传统视觉问答不同,它重点聚焦多模态Agent能力,不做简单“看图说话”。5 小时前9.7K