本文提出EVFormer,一个面向第一视角双手姿态估计的多模态框架,将当前RGB帧与之前200毫秒的双侧手腕表面肌电信号(sEMG)相结合,用于估计44个手指和手腕关节角度。模型分别编码视觉空间特征与肌电时间特征,通过顺序双向交叉注意力实现跨模态信息交换,并采用特征级门控融合整合两种模态。研究基于一段公开的EgoEMG同步记录开展单参与者可行性实验,训练、验证与测试集按时间顺序划分。在296个测试样本上,EVFormer平均绝对误差为11.482度,优于纯视觉、纯肌电、晚期融合及训练均值等基线(13.228至13.610度),相对纯视觉模型误差降低13.20%,相对晚期融合降低14.23%,并在五类手势中的四类取得最低误差。该结果初步表明,第一视角视觉与肌电在特征层面的交互可提升双手姿态估计性能,但其泛化性仍需跨参与者、跨会话及真实交互条件下的进一步验证。
| EVFormer | 一种结合自我中心视觉和表面肌电信号的双向注意力模型,用于双手动姿估计。 |
| sEMG | 表面肌电信号,通过皮肤表面电极记录肌肉电活动,用于捕捉手部运动意图。 |
| 双向交叉注意力 | 一种注意力机制,允许两个模态(视觉和sEMG)相互交换信息,增强特征表示。 |
| 特征级门控融合 | 一种多模态融合方法,通过门控机制在特征层面动态加权组合不同模态的信息。 |
| 平均绝对误差 | 预测值与真实值之间绝对差异的平均值,用于评估模型估计关节角度的精度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅