DeepSeek 于8月31日在Hugging Face发布其首个多模态模型DeepSeek-V4-Flash-Vision-Exp,采用MIT License,参数规模达305B,基于V4-Flash-0731底座,通过集成视觉编码器和Aligner实现图像理解能力。该模型的关键创新在于重新定义了“多模态”概念,并非传统意义上的简单“看图说话”,而是强调视觉与语言能力的深度融合与协同推理。文章指出,这一设计旨在提升模型对复杂视觉信息的语义解析和逻辑推理效率,而非仅停留在图像描述层面。此举标志着DeepSeek在扩展V4模型生态上的战略布局,为后续多模态应用开发提供了实验性基础,同时其开源许可也利于社区进一步探索和优化。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅