🔥 今日值得一读 全球首个可仿真人-场景交互框架HSImul3R来了,人类视频直接变机器人技能库!
全球首个可仿真的人–场景交互重建框架 HSImul3R:让人类视频真正成为机器人技能来源
量子位 🔥 重点 机器人世界模型论文方法 🕐 09-10 15:57

📖 AI 总结

大晓机器人联合南洋理工大学S-Lab与上海人工智能实验室提出HSImul3R,这是全球首个面向非标定稀疏视角输入、实现稳定可仿真人–场景交互重建的框架,已被ECCV 2026接收。该研究直指三维视觉长期存在的“感知—仿真鸿沟”,将重力稳定性、真实接触与交互稳定性纳入核心评价标准,推动重建从“视觉正确”走向“物理可执行”。其核心是物理闭环双向优化机制:正向通过面向场景的强化学习优化人体运动,反向通过直接仿真奖励优化三维场景,使仿真器从最终检验工具变为重建过程的主动监督者。在HSIBench测试中,HSImul3R三档任务交互稳定率分别达53.68%、30.56%和13.92%,显著高于HSfM,并将穿模率从69.51%降至22.90%。团队还将优化动作迁移至Unitree G1人形机器人,打通从日常视频到真实机器人执行的完整链路,使人类视频中的交互经验转化为可仿真、可学习、可执行的机器人技能资产。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅