这篇论文提出 Segment-Snap 方法,用于理解三维场景中的交互关系,即联合描述可动部件、其运动方式以及可供操作的空间区域。方法的核心在于利用部件与把手之间的物理关联实现几何信息与语义信息的耦合:几何解码器借助平面与竖直先验约束运动,并依据预测的把手位置选取铰链线,无需训练专门的运动回归器;同时,部件与把手的联合预测器提供额外把手候选,并借助所属部件修正其运动类别。每类信息传递仅执行一次,不进行迭代反馈。在 Articulate3D 验证集上,把手引导使运动门控 AP 从 13.74% 提升至 40.98%,额外把手候选使把手 AP 从 24.63% 提升至 29.65%,基于部件的类别修正再增加 0.98 个百分点,完整上下文达到 30.99%。重复训练与对照实验验证了融合几何与语义证据的有效性及其局限。
| Segment-Snap | 一种用于3D场景交互理解的框架,通过部件与手柄的物理关系连接可动部件、运动及可操作区域的预测。 |
| Articulate3D | 一个用于评估3D场景中关节物体交互理解任务的验证数据集。 |
| 运动门控AP | 一种评估指标,在固定掩码和轴的情况下,衡量运动预测的平均精度,并受运动门控条件影响。 |
| 手柄AP | 评估手柄检测性能的平均精度指标,反映预测手柄位置与真实手柄的匹配程度。 |
| 几何解码器 | 利用平面和直立先验约束运动,并根据手柄位置选择铰链线的解码模块,无需训练运动回归器。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅