该研究针对长时段第一人称与第三人称工作场景视频中程序性信息冗余、噪声大、处理与存储成本高的问题,提出了一套紧凑的程序理解框架。其核心思路受事件分割理论启发,不依赖固定时间窗口或单纯视觉新颖性,而是综合视觉语境、位置、运动、叙述、注视与物体交互以及可选的第三人称工作区证据来检测事件边界,并将每个片段抽象为包含执行者、时间区间、地点、动作、对象工具、前后状态、置信度与来源的可追溯事件卡片。这些卡片增量式更新工作环境模型,形成结构化的程序状态记忆,从而在本地隐私约束下实现紧凑、可审计的记录与检索。作者以冻结的DINOv2和VJEPA-2编码器及本地语言模型实例化该设计,并给出分割质量、记忆压缩、检索保真度与长时问答等评估方向。
| 程序状态记忆 (Procedural State Memory) | 一种将视频中的程序性知识结构化存储的记忆表示,用于支持检索和推理。 |
| 工作环境模型 (Work Environment Model, WEM) | 由事件卡增量更新而成的结构化模型,用于紧凑地表示工作场所的程序状态。 |
| 事件分割理论 (Event Segmentation Theory) | 认知心理学理论,认为人类通过检测变化边界将连续经验分割为事件。 |
| DINOv2 | 一种自监督视觉Transformer模型,用于提取图像特征,此处作为冻结编码器使用。 |
| VJEPA-2 | 一种视频联合嵌入预测架构模型,用于提取视频特征,此处作为冻结编码器使用。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅