小米将一场大模型强化学习训练全程搬进直播间,6天内完成MiMo-V2.6-Pro和Flash各30个训练Step,总花费约350万美元(约合人民币2344万元)。Pro为1.02万亿参数、420亿激活,在Artificial Analysis Intelligence Index上取得46分,位列开源第一,部分Agent评测中已逼近Claude Opus 5和GPT-5.6 Sol。训练后Flash平均通过率提升25%,Pro提升12%,在样本外测试DeepSWE v1.1上分别提升约17分和14分,显示能力可迁移至未见过的软件工程任务。小米同步开放模型权重、技术报告、7000多个RL任务环境及完整训练框架,并将API价格维持在V2.5水平,Pro完成任务成本仅为国际前沿模型的1/20至1/60。此举显著缩小了开源与闭源模型差距,被视为开源模型训练规模与开放程度的重要突破。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅