前字节跳动强化学习专家孙鹏博士于2026年9月正式加入星尘智能,负责机器人强化学习方向的技术研发与应用探索。孙鹏拥有十余年强化学习与智能体研究经验,曾在腾讯Robotics X担任智能体中心负责人,主导开发字节核心强化学习基础设施ByteRL,并参与大模型RLHF与强化微调方法ReFT的研发。星尘智能坚持“Design for AI”理念,已构建覆盖基座模型Lumo系列、前端Agent Philia及绳驱机器人本体的全栈技术体系。孙鹏的加入将强化机器人模型“训练之后”的关键环节,推动强化学习与真实机器人执行、数据闭环和长期部署的结合,使机器人能够在真实环境中持续学习和优化策略,加速Physical AI从Demo走向规模化商业部署。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅