该论文提出了一种名为Puppeteer的共语手势生成模型,旨在解决现有方法在时间连贯性、语义对齐和物体交互方面的不足。传统模型主要关注音频与手势的匹配,却忽略了身体姿态约束和周围物体的影响。Puppeteer采用因果变分自编码器将长手势分解为结构化原语,并在因果潜在空间中进行条件扩散,同时结合语音信号、运动历史、初始姿态参考和物体几何信息,从而生成物理一致且与物体交互的手势。该模型支持显式时间控制,可应用于手势插值和补全任务。此外,作者引入了针对该任务的新评估指标,并构建了首个包含3D物体和具身共语手势的合成数据集SceneGes。实验结果表明,Puppeteer生成的手势比现有方法更多样、时间同步性更强,并实现了物体锚定的手势合成。
| co-speech gesture | 伴随语音的手势,指与说话同步产生的身体动作,用于增强沟通表达。 |
| causal latent space | 因果潜在空间,一种编码表示,其中每个时间点的潜在变量仅依赖于过去的信息,便于时序建模。 |
| diffusion model | 扩散模型,一种生成模型,通过逐步去噪过程从噪声中恢复数据,常用于高质量生成任务。 |
| object-grounded | 物体接地,指生成过程考虑周围物体的几何和位置,使手势与物理环境相协调。 |
| gesture in-betweening | 手势插值,指在两个已知手势之间生成中间过渡手势,实现平滑动画。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅