该研究系统分析了装配动作识别中动词—名词分解方法的泛化能力。作者在MECCANO、HAViD和IMPACT三个数据集上发现,尽管分解策略能够突破原子分类器对未见组合零概率的固有限制,但其泛化提升仅部分有效:未见组合的性能仍高度依赖训练数据的共现结构,说明大部分增益来自组合空间密集区域的插值,而非真正意义上的自由重组。失败案例集中出现在词汇量较大的成分上,且IMPACT的动词密集词汇使瓶颈从名词转向动词。研究还表明,共享编码器训练会引入成分纠缠,使模型依赖难以迁移的共现模式,其调和平均指标最多落后独立重组方法6.0倍。作者据此提出以基元支持度、词汇不对称和成分纠缠为核心的诊断框架,为组合式识别研究提供了超越总体精度的分析视角。
| 动词-名词分解 | 一种将动作识别任务分解为分别预测动词和名词组件,再重新组合以识别未见动作的方法。 |
| 组合偏移 | 指测试时遇到的组件组合与训练时不同,导致分布偏移的现象。 |
| 共现结构 | 训练数据中动词和名词同时出现的频率和模式,影响模型对未见组合的泛化能力。 |
| 组件纠缠 | 在共享编码器训练中,不同组件的表示相互影响,导致模型过度依赖训练数据中的共现模式,难以泛化到新组合。 |
| 调和平均 | 一种评估指标,用于综合衡量模型在多个组件上的性能,对极端值敏感,常用于平衡不同组件的表现。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅