🔥 今日值得一读 DeepSeek新模型炸场:1M上下文+FP4缓存,552B参数直击长文本瓶颈!
DeepSeek AI Released DeepSeek-V4.1-Flash with 1M Context, FP4 KV Cache, and Cross-Layer Attention Reuse
MarkTechPost 🔥 重点 大模型开源算力论文方法 🕐 09-10 15:31

📖 AI 总结

DeepSeek AI 发布 DeepSeek-V4.1-Flash,一款面向长程智能体场景的多模态混合专家模型。该模型拥有 552B 骨干参数与 196B Engram 参数,支持 100 万 token 上下文,预填充阶段每 token 激活 8B 参数,解码阶段激活 16B。其核心突破在于将全局 KV 缓存压缩至每 token 890 字节,约为 DeepSeek-V4-Flash 的四分之一,比 DeepSeek-V1 缩小约 437 倍,显著缓解了 HBM 与带宽压力。架构上采用因果编码器-解码器设计,解码器复用编码器隐状态生成全局 KV,使预填充计算量近乎减半;同时以纯 CSA2 机制沿层轴压缩缓存,通过 Full、Reindex、Reuse 三种模式静态分配各层计算。模型以 MIT 协议开放权重,支持 vLLM、SGLang 与 Transformers,并提供分级推理 API。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅