RoboTok提出了一种互联网规模的数据引擎,旨在解决机器人学习中人类演示数据收集成本高、难以覆盖真实世界长尾任务的问题。该引擎以人类操作视频为查询输入,从网络视频中检索与操作相关的演示,用于训练灵巧机器人策略。其核心创新在于从3D手部轨迹中学习潜在运动空间,并采用以演员为中心的参考坐标系,从而在视角、场景外观和遮挡变化下仍能有效比较操作行为,同时保持紧凑表示以支持大规模视频的高效检索和持续索引。实验评估显示,RoboTok在检索相关演示的准确性上优于现有方法,并显著提升了下游机器人策略的任务成功率。这项工作验证了基于手部姿态轨迹的检索思路,为将海量网络视频转化为可扩展且持续增长的机器人学习监督源提供了可行路径。
| RoboTok | 一个互联网规模的数据引擎,用于从网络视频中检索人类操作演示以训练机器人策略。 |
| dexterous manipulation | 灵巧操作,指机器人用多指手或手臂进行精细、灵活的操作任务。 |
| latent motion space | 潜在运动空间,一种从手部轨迹中学习到的低维表示,用于比较不同视频中的操作行为。 |
| actor-centered reference frames | 以演员为中心的参考坐标系,一种以操作者身体为基准的坐标系统,用于标准化手部轨迹,减少视角和外观变化的影响。 |
| retrieval benchmarks | 检索基准,用于评估检索系统性能的标准数据集和指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅