生数科技发布的Motus2世界模型,尝试解决机器人“自进化”难题。该模型将行动、预测与评估三种能力整合于同一系统,形成“生成动作—预测后果—评估结果—更新策略”的闭环,初步探索了递归自我改进(RSI)。其核心创新在于采用动作优先的信息流,避免模型在决策前“偷看”未来结果,并通过推理阶段的Best-of-N规划与训练阶段的基于模型强化学习,使失败数据也能转化为学习信号。真机测试显示,规划与强化学习结合后,任务成功率从基础策略的65%提升至75%。此外,模型新增触觉与记忆模块,触觉使灵巧操作成功率提升12.5个百分点,记忆则帮助机器人应对依赖历史信息判断的任务。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅