小米MiMo团队发布MiMo-V2.6技术报告,首次系统性地将Agentic RL在Rollout、环境与Grader三个维度同步规模化。模型包含Pro(总参数1.02T、激活42B)与Flash(总参数310B、激活15B)两个版本,均采用MoE架构并混合滑动窗口与全局注意力,支持百万级上下文训练。每个RL步生成约2.5万条轨迹,Token量达27亿至37亿,Pro单次后训练成本约260万美元,其中Grader占比达12.7%。针对传统二元奖励在长程任务中的不足,团队引入分组奖励合成与分组优势重分配机制,并部署Hack Agent主动搜寻作弊路径,配合轨迹审计清零Reward Hacking。该工作揭示了大模型通过规模化强化学习走向自我改进的可行路径,同时暴露了成本结构与奖励设计上的新挑战。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅