🔥 今日值得一读 单次RL后训练烧掉260万美元!小米MiMo-V2.6每步狂吞37亿Token
单次RL后训练烧掉260万美元、每步37亿Token,小米披露MiMo-V2.6“规模化强化学习”路线
InfoQ 中文 🔥 重点 大模型算力论文方法 🕐 10-11 01:24

📖 AI 总结

小米MiMo团队发布MiMo-V2.6技术报告,首次系统性地将Agentic RL在Rollout、环境与Grader三个维度同步规模化。模型包含Pro(总参数1.02T、激活42B)与Flash(总参数310B、激活15B)两个版本,均采用MoE架构并混合滑动窗口与全局注意力,支持百万级上下文训练。每个RL步生成约2.5万条轨迹,Token量达27亿至37亿,Pro单次后训练成本约260万美元,其中Grader占比达12.7%。针对传统二元奖励在长程任务中的不足,团队引入分组奖励合成与分组优势重分配机制,并部署Hack Agent主动搜寻作弊路径,配合轨迹审计清零Reward Hacking。该工作揭示了大模型通过规模化强化学习走向自我改进的可行路径,同时暴露了成本结构与奖励设计上的新挑战。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅