DeepSeek近日正式開源了其V4系列的首個實驗性多模態模型——DeepSeek-V4-Flash-Vision-Exp。該模型基於現有的V4-Flash底層架構深度融合了視覺模塊,使其在原有的強大文本處理能力之上,全面具備了深度的圖片理解與分析能力。
在覈心技術參數方面,該實驗模型總參數量達到了3050億規模。通過將視覺模塊與文本架構進行有機結合,它不僅能夠精準解讀各類圖像內容,還可以無縫結合外部工具獨立完成複雜的Agent(智能體)任務。官方評測數據顯示,該模型在純文本Agent任務上的表現與此前的V4-Flash保持相當水準,而在多模態綜合測試中則展現出強勁競爭力,其實際多模態Agent能力在多項行業測試中表現亮眼,接近行業頂尖水平。
爲了進一步推動開源生態的發展與技術的普惠應用,DeepSeek此次爲該實驗性多模態模型選擇了開放且友好的MIT許可證。這一舉措允許全球開發者、研究機構以及企業在合規的前提下更自由地進行二次開發、商業集成與技術創新,有望在開源社區中掀起新一輪的多模態應用落地熱潮。


