该研究提出了一种受生物学启发的视觉预训练框架,旨在从原始视频中学习面向单张图像的物体中心化表征。其核心方法在于利用运动边界作为物体分组的线索,通过现成的光流和聚类技术生成伪实例掩码,并以此监督单图像编码器进行像素级成对度量学习,全程无需人工标注或相机标定。研究团队先利用7163小时的驾驶及网络视频获取了1.95亿个伪标记帧,随后通过结合模型提议与运动证据的“运动验证自训练”策略,将监督数据扩展至4.21亿帧。实验表明,基于该方法训练的模型(最大至Swin-H)在单目深度估计、3D物体检测、3D占用预测及端到端规划等下游任务中,性能达到或超越了现有的监督与自监督预训练基线,尤其在几何与实例敏感任务上表现突出。该成果证明,运动衍生的监督信号能有效教会静态图像编码器表征视觉实例,为可扩展的视觉预训练提供了新方向。
| object-centric representations | 以对象为中心的表示,强调将场景分解为独立对象实例的视觉特征,而非仅关注语义类别。 |
| motion boundaries | 运动边界,指视频中由于物体运动产生的边缘或轮廓,用于区分不同对象。 |
| pseudo-instance masks | 伪实例掩码,通过无监督方法(如光流和聚类)生成的近似对象分割掩码,用于训练。 |
| Motion-Verified Self-Training | 运动验证自训练,一种结合模型预测和运动证据来扩展伪标签数据的方法。 |
| Swin-H | Swin Transformer的一种大型变体,用于视觉特征提取的骨干网络。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅