本文提出一种以人为中心的双手机手物交互检测新范式,旨在解决现有多数方法以单手为独立实例、在多人物场景中易产生手部归属歧义的问题。作者设计单一查询机制,使一个查询即可预测同一人的完整结构化输出,涵盖人体框、身体姿态、双手框与状态以及交互目标,并引入部位感知可变形注意力,将注意力分配至人体、手部与姿态相关的参考区域。研究还通过手到查询关系矩阵统一检测与交互推理,让每只手从检测查询集及可学习的off token中选择交互目标,直接恢复目标框与类别,无需单独的目标回归。作者构建了基于COCO的以人为中心双手机交互标注数据集,并定义评估手部状态与完整手物元组的结构化指标。基于Transformer检测器的实验表明,该公式化方法提升了人物级双手交互解析效果,为联合检测、姿态估计与手部推理提供了有效统一框架。
| Person-Centric Bimanual Hand-Object Interaction Detection | 以人为中心的双手-物体交互检测,强调将同属一人的双手及其交互对象作为一个整体进行识别。 |
| Part-Aware Deformable Attention | 部件感知可变形注意力,一种在人体、手部和姿态等不同参考区域上分配注意力的机制,用于捕捉完整的人物结构。 |
| Hand-to-Query Relationship Matrix | 手到查询关系矩阵,用于统一检测和交互推理,使每只手能从检测到的查询集中选择交互目标。 |
| Off Token | 关闭标记,一个可学习的标记,用于表示手部没有交互目标的情况。 |
| Structured Metrics | 结构化指标,用于评估手部状态和完整手-物元组等结构化输出的评价标准。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅