DeepSeek 正式发布 V4.1 Flash 模型,这是其全新模型结构系列中尺寸最小的版本,具备原生多模态视觉理解能力。该模型为 552B 参数的 MoE 架构,采用非对称模型结构设计,官方称其以较低成本实现了较高智能水平。新结构的设计目标包括更高的能力上限、更快的推理速度、更大的吞吐量以及可扩展至更大参数规模。此次发布的核心意义在于,DeepSeek 通过架构创新在性能与效率之间寻求平衡,试图以更小的模型尺寸和更低的部署成本提供接近大模型的智能表现,进一步推动高性能 AI 能力的普惠化。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅