DeepSeek AI 发布 DeepSeek-V4.1-Flash,一款面向长程智能体场景的多模态混合专家模型。该模型拥有 552B 骨干参数与 196B Engram 参数,支持 100 万 token 上下文,预填充阶段每 token 激活 8B 参数,解码阶段激活 16B。其核心突破在于将全局 KV 缓存压缩至每 token 890 字节,约为 DeepSeek-V4-Flash 的四分之一,比 DeepSeek-V1 缩小约 437 倍,显著缓解了 HBM 与带宽压力。架构上采用因果编码器-解码器设计,解码器复用编码器隐状态生成全局 KV,使预填充计算量近乎减半;同时以纯 CSA2 机制沿层轴压缩缓存,通过 Full、Reindex、Reuse 三种模式静态分配各层计算。模型以 MIT 协议开放权重,支持 vLLM、SGLang 与 Transformers,并提供分级推理 API。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅