星尘智能基座模型团队发布了SmoothRL,一种适配异步推理的在线强化学习框架。真实机器人部署中,大模型推理耗时较长,机器人无法暂停等待,因此普遍采用异步执行——机器人执行当前动作时,模型在后台计算下一段动作序列。这导致模型计划生成的动作与机器人实际执行的动作不一致,传统RL若将整段动作统一优化,会错误归因。 SmoothRL将动作序列划分为已提交、执行和丢弃三个区域,只对真正执行的区域进行强化学习,并让训练过程直接运行异步推理,遵循“在部署中强化”原则。在星尘智能S1真机上测试三项任务,动态投掷成功率从39%提升至94%,给笔戴帽从8%提升至83%,快递开箱从30%提升至90%。实验表明,在线RL不仅能用于高精度修正,也能适配连续加速、不能停顿的高动态操作,有效修正基础策略的系统性偏差。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅