仅靠重建训练的运动码本,几何和左右手性轻松解码,手势语义却几乎读不出来!
Do Motion Tokenizers for Co-Speech Gesture Generation Encode Gesture Semantics?
arXiv CV (cs.CV) 重要 #运动生成#分词器#可解释性 🕐 今天 12:00

📖 AI 总结

该研究探讨了用于语音伴随手势生成的离散运动分词器是否真正编码了手势语义。作者以基于重建目标训练的运动码本为对象,使用涵盖从原始运动特征到抽象交际功能的19种手势描述符进行探测。结果显示,几何信息和左右手属性可以较容易地从词元嵌入中解码,而手势类别尽管在离散码的使用上存在系统性差异,却只能被微弱解码。这一重建质量与描述符可解码性之间的落差表明,仅靠重建目标并不能保证码本捕获手势语义,对此类属性的评估可为设计更具语义感知的运动分词器提供指导。

🔑 关键词速览

Motion Tokenizer将连续运动信号离散化为原子标记(token)的模型,常用于生成任务中作为中间表示。
Co-Speech Gesture Generation根据语音信号自动生成与之同步的手势动作,是虚拟人、人机交互等领域的关键技术。
Codebook在离散表示学习中,存储所有可能标记(码字)的集合,用于将连续输入映射为离散编码。
Gesture Semantics手势所传达的交际意义或功能,如指示、强调、示意等抽象信息。
Reconstruction Objective训练模型时以最小化输入与重建输出之间差异为目标的损失函数,常用于自编码器等结构。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅