该研究针对人-实体交互理解中事件参与者、角色及共享身份难以完整建模的问题,提出了HEIR图像基准与CoRISP方法。HEIR包含18730张图像、6种角色、105类动作和437个名词,其中51.6%的图像涉及多个行动者,62.1%包含多个动作,并引入完整集合AP与结构化评估,弥补了传统HOI指标仅评估单条关系、忽视事件整体构成的不足。CoRISP利用共享实体身份整合角色条件证据,通过基数与角色多重性势函数耦合事件规模与角色组成,实现精确的逐事件归一化。实验显示,在16个基线中,关系排序与完整事件排序存在明显分歧;CoRISP在重复角色事件和共享参与者图像上分别领先2.87和3.82个Set mAP点,并在V-COCO上取得73.72/76.23的角色AP与61.06/68.59的完整集合AP。该工作表明,将事件构成与个体关系结合学习与评估,对具身智能体的预期与协调具有重要意义。
| HEIR | 一个用于评估完整参与者-角色集合的图像基准,涵盖物体、人际和自我导向交互。 |
| CoRISP | 一种组合式角色感知交互集合预测方法,利用共享实体身份预测归一化的参与者-角色集合。 |
| HOI | 人-物交互,指人类与物体之间动作关系的识别任务。 |
| Set mAP | 集合平均精度均值,用于评估预测的参与者-角色集合与真实集合的匹配程度。 |
| V-COCO | 一个常用的人-物交互检测数据集和评估基准。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅