🔥 今日值得一读 1.95亿帧视频训练,运动边界教会AI看懂物体!
Object Concepts Emerge from Motion
arXiv CV (cs.CV) 🔥 重点 #自监督学习#物体中心表征#视频理解 🕐 09-07 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用此方法从视频中自动提取物体级表征,提升单图像识别和跟踪任务的实例一致性。

📖 AI 总结

该研究提出了一种受生物学启发的视觉预训练框架,旨在从原始视频中学习面向单张图像的物体中心化表征。其核心方法在于利用运动边界作为物体分组的线索,通过现成的光流和聚类技术生成伪实例掩码,并以此监督单图像编码器进行像素级成对度量学习,全程无需人工标注或相机标定。研究团队先利用7163小时的驾驶及网络视频获取了1.95亿个伪标记帧,随后通过结合模型提议与运动证据的“运动验证自训练”策略,将监督数据扩展至4.21亿帧。实验表明,基于该方法训练的模型(最大至Swin-H)在单目深度估计、3D物体检测、3D占用预测及端到端规划等下游任务中,性能达到或超越了现有的监督与自监督预训练基线,尤其在几何与实例敏感任务上表现突出。该成果证明,运动衍生的监督信号能有效教会静态图像编码器表征视觉实例,为可扩展的视觉预训练提供了新方向。

🔑 关键词速览

object-centric representations以对象为中心的表示,强调将场景分解为独立对象实例的视觉特征,而非仅关注语义类别。
motion boundaries运动边界,指视频中由于物体运动产生的边缘或轮廓,用于区分不同对象。
pseudo-instance masks伪实例掩码,通过无监督方法(如光流和聚类)生成的近似对象分割掩码,用于训练。
Motion-Verified Self-Training运动验证自训练,一种结合模型预测和运动证据来扩展伪标签数据的方法。
Swin-HSwin Transformer的一种大型变体,用于视觉特征提取的骨干网络。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅