本文介绍了一项名为VidParse的在线第一人称视频程序解析方法,旨在解决将连续、嘈杂的自我中心视频流转化为有序动作步骤的难题。研究指出,传统帧级在线时序模型常因剧烈自我运动、瞬时遮挡和动作高变异性而产生过度分割和结构崩溃。VidParse提出一种无需训练的图约束推理框架,利用冻结基础模型提取以手部交互为核心的特征,构建时序相似度矩阵动态识别语义转换,并通过束搜索解码器结合程序任务图约束有效动作转换,剔除不可能轨迹。实验表明,该方法在复杂多步解析任务上相较强在线基线准确率提升最高达10倍,且无需梯度更新。该研究为在线活动理解提供了新思路,兼顾了低层感知稳定性与高层程序逻辑一致性。
| VidParse | 本文提出的在线、无需训练的自我中心程序解析框架,利用图约束推理来提升动作步骤解析的准确性。 |
| egocentric video | 第一人称视角视频,通常由穿戴式摄像头拍摄,记录佩戴者的视觉体验和交互。 |
| temporal similarity matrix | 时间相似性矩阵,用于衡量视频帧或片段之间的语义相似度,以识别动作转换点。 |
| beam search decoder | 束搜索解码器,一种启发式搜索算法,在解码过程中保留多个候选路径,以找到最优序列。 |
| procedural task graph | 程序任务图,表示动作步骤之间合法转换关系的图结构,用于约束推理和剪枝。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅