动词-名词分解也救不了装配识别!共享编码器让泛化落后独立重组6倍
Reachability Is Not Generalization: Understanding Verb--Noun Decomposition in Assembly Action Recognition
arXiv CV (cs.CV) 重要 #动作识别#组合泛化#评测基准 🕐 今天 12:00

📖 AI 总结

该研究系统分析了装配动作识别中动词—名词分解方法的泛化能力。作者在MECCANO、HAViD和IMPACT三个数据集上发现,尽管分解策略能够突破原子分类器对未见组合零概率的固有限制,但其泛化提升仅部分有效:未见组合的性能仍高度依赖训练数据的共现结构,说明大部分增益来自组合空间密集区域的插值,而非真正意义上的自由重组。失败案例集中出现在词汇量较大的成分上,且IMPACT的动词密集词汇使瓶颈从名词转向动词。研究还表明,共享编码器训练会引入成分纠缠,使模型依赖难以迁移的共现模式,其调和平均指标最多落后独立重组方法6.0倍。作者据此提出以基元支持度、词汇不对称和成分纠缠为核心的诊断框架,为组合式识别研究提供了超越总体精度的分析视角。

🔑 关键词速览

动词-名词分解一种将动作识别任务分解为分别预测动词和名词组件,再重新组合以识别未见动作的方法。
组合偏移指测试时遇到的组件组合与训练时不同,导致分布偏移的现象。
共现结构训练数据中动词和名词同时出现的频率和模式,影响模型对未见组合的泛化能力。
组件纠缠在共享编码器训练中,不同组件的表示相互影响,导致模型过度依赖训练数据中的共现模式,难以泛化到新组合。
调和平均一种评估指标,用于综合衡量模型在多个组件上的性能,对极端值敏感,常用于平衡不同组件的表现。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅