小米 MiMo 团队公开了 MiMo-V3 的核心推理架构 HySparse2,由团队负责人罗福莉预告、官方公众号发布完整介绍。该架构面向长程多轮 Agent 场景,设定三个目标:减少 Prefill 计算、压缩 KV Cache、提升长上下文检索精度。相比 MiMo-V2.6 的 Hybrid SWA,HySparse2 在百万 token 规模下实现了 KV 共享层级提升两级、Prefill 计算量减少约一半的效果。这一进展意味着长上下文推理的算力与显存开销有望显著下降,对多轮 Agent 等长程任务的实际部署具有直接价值,也显示出小米在大模型推理效率优化上的持续投入。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅