DeepSeek 开源首个多模态模型:不搞「看图说话」,为 Agent 装上视觉「利器」
2 小时前

DeepSeek在Hugging Face平台开源了其首款实验性多模态模型DeepSeek-V4-Flash-Vision-Exp。该模型遵循MIT协议,拥有3050亿参数,基于V4-Flash-0731底座架构,并集成了视觉编码器与Aligner模块,开发者可获取完整相关开发资源。与传统多模态模型不同,DeepSeek-V4-Flash-Vision-Exp重点强化了多模态Agent能力,能够解析网页截图等视觉信息,并联动工具完成复杂任务。开源仅十日,该模型便已推出7个量化版本,降低了本地部署的门槛。在商业化方面,DeepSeek采取了“服务先行、生态跟进”的模式,先上线API付费调用服务,十天后开源模型权重。值得注意的是,该模型的视觉模块并未削弱其文本处理能力,在多项测试指标上有所提升,部分甚至超越了Claude Opus 4.8,但在NL2Repo项目上仍有提升空间。官方表示,其多模态Agent能力已接近行业标杆。DeepSeek正在构建完整的Agent解决方案,而此次开源的模型是其中的关键一环。其设计强调组件间的深度协同与场景适配,与行业内的模块化拼接路径形成鲜明对比。