小米在沉寂近半年后,由负责人罗福莉官宣了其在强化学习方向的最新进展,并首次以直播形式公开MiMo-V2.6两款模型的训练过程,包括奖励曲线、训练成本与显卡故障等信息。训练36小时花费超108万美元,平均每小时约3万美元。小米提出从训练计算量、环境与执行框架、评分计算量三个维度扩展强化学习,采用完全异步流水线,每个训练步处理约20亿Token,并探索信用分配等关键问题。目前两款模型在RL训练初期已显现能力提升,Pro和Flash在离线评测中分别达到62.24和60.77。此举的意义在于,小米试图验证强化学习能否像预训练一样实现持续规模化,为Agent类模型的能力提升提供新路径。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅