DeepSeek's First Open-Source Multimodal Model Has Arrived: These Eyes Are Not for Humans to View, but Specifically for Agent Work
DeepSeek releases first experimental multimodal model in V4 family, DeepSeek-V4-Flash-Vision-Exp, on Hugging Face, MIT license, 305B params. Based on V4-Flash-0731, integrates vision encoder and Aligner, gains image understanding via continued training. Unlike traditional VQA, focuses on multimodal agent capabilities, not simple image captioning.....
9.8K