本文提出 UniMo,一个统一的点云动作生成框架,旨在解决文本驱动动作生成从人类扩展到动物领域的两大难题:动物骨骼拓扑高度多样,难以用统一模型跨物种建模;现有动物动作数据集规模小、标注质量低。UniMo 通过将参数化骨架转换为非参数化点云表示来规避拓扑差异,并引入动态采样机制,为活跃关节分配更多点。作者同时构建了大规模动作-语言数据集 UniML3D,涵盖人类与动物类别,包含 145,907 条动作序列和 433,388 条文本描述,规模超过现有动物数据集的 102 倍。该方法在 UniML3D 及 HumanML3D、KIT-ML、AnimalML3D 三个公开基准上均取得最优结果,验证了统一人兽动作生成的可行性与有效性。
| UniMo | 一种统一的基于点云的动作生成框架,通过非参数化表示解决跨物种骨骼拓扑差异问题。 |
| UniML3D | 一个大规模动作-语言数据集,涵盖人类和动物,包含 145,907 个动作序列和 433,388 条描述。 |
| 点云 | 一种非参数化的 3D 表示形式,由一组离散点组成,用于统一建模不同骨骼拓扑的动作。 |
| 骨骼拓扑 | 描述骨骼关节连接关系的结构,动物与人类之间差异显著,是统一建模的主要挑战。 |
| 动态采样 | 一种采样策略,为动作中活跃的关节分配更多点,以增强点云表示的动作细节。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅