手势生成新突破!Puppeteer让AI手势同步语音还能避开物体,时间对齐更精准
Puppeteer: Object-Grounded Posture-Aware Co-Speech Gesture Generation
arXiv CV (cs.CV) 重要 #扩散模型#手势生成#多模态 🕐 09-02 12:00

📖 AI 总结

该论文提出了一种名为Puppeteer的共语手势生成模型,旨在解决现有方法在时间连贯性、语义对齐和物体交互方面的不足。传统模型主要关注音频与手势的匹配,却忽略了身体姿态约束和周围物体的影响。Puppeteer采用因果变分自编码器将长手势分解为结构化原语,并在因果潜在空间中进行条件扩散,同时结合语音信号、运动历史、初始姿态参考和物体几何信息,从而生成物理一致且与物体交互的手势。该模型支持显式时间控制,可应用于手势插值和补全任务。此外,作者引入了针对该任务的新评估指标,并构建了首个包含3D物体和具身共语手势的合成数据集SceneGes。实验结果表明,Puppeteer生成的手势比现有方法更多样、时间同步性更强,并实现了物体锚定的手势合成。

🔑 关键词速览

co-speech gesture伴随语音的手势,指与说话同步产生的身体动作,用于增强沟通表达。
causal latent space因果潜在空间,一种编码表示,其中每个时间点的潜在变量仅依赖于过去的信息,便于时序建模。
diffusion model扩散模型,一种生成模型,通过逐步去噪过程从噪声中恢复数据,常用于高质量生成任务。
object-grounded物体接地,指生成过程考虑周围物体的几何和位置,使手势与物理环境相协调。
gesture in-betweening手势插值,指在两个已知手势之间生成中间过渡手势,实现平滑动画。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅