本文提出了一种名为Masked Swingers的自监督学习方法,旨在改进掩码自编码器(MAE)框架。该方法对同一图像施加两种不同的数据增强,分别进行掩码和编码,并在解码被遮蔽的图像块之前交换两个视图的全局表示(CLS token)。这一设计促使模型学习与视图无关的图像摘要,从而提升迁移效率。实验表明,Masked Swingers在ImageNet-1K的kNN评估中比MAE高出3%至5%,在细粒度任务上提升显著:实例检索相对提升45%,动物重识别提升22%,Omniglot字符识别提升76%。此外,在三个新的状态探测数据集上,该方法相对MAE将误差降低了64%,为世界建模开辟了新的可能。
| 自监督学习 (SSL) | 一种无需人工标注标签,通过设计辅助任务从数据本身生成监督信号来训练模型的方法。 |
| 掩码自编码器 (MAE) | 一种自监督学习框架,通过随机掩码输入图像的部分区域,并训练模型重建这些被掩码区域来学习表示。 |
| CLS令牌 | 在Transformer模型中,一个附加在输入序列开头的特殊可学习向量,其最终输出常被用作整个序列的全局表示。 |
| 视图无关的摘要 | 指模型学习到的图像表示不依赖于特定的数据增强视图,能够捕捉图像的本质内容,从而提升泛化能力。 |
| 状态探测数据集 | 用于评估模型是否理解环境状态(如物体位置、属性等)的数据集,通常用于世界建模任务的评测。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅