该研究分析了自监督预训练中依赖样本的使用问题。自监督学习依赖数据增强方法,如对图像随机遮罩像素,以学习低复杂度不变子空间用于下游任务。实践中,不同增强版本被合并使用,尽管它们之间存在相互依赖,但现有理论通常回避这种依赖,仅适用于独立数据子集。研究证明,合并增强样本优于将数据划分为独立子集的基线方法。在估计不变子空间时,合并方法的统计误差界从不差于划分方法,且在浅层神经网络上的遮罩或噪声注入增强场景中,合并能实现更快的收敛速度。当增强间的相关性对估计影响温和或有助于降低方差时,合并优势尤为明显。该研究为实践中偏好使用大量增强样本提供了理论依据,揭示了自监督预训练成功的新视角。
| Self-supervised learning | 一种无需人工标注标签,通过设计辅助任务从数据自身学习表示的学习范式。 |
| Data augmentation | 对原始数据施加变换(如随机遮蔽)以生成新样本,同时保持语义标签不变的技术。 |
| Invariant subspace | 在数据增强下保持不变的子空间,用于提取对任务不变的特征表示。 |
| Pooling | 将多个增强样本合并在一起用于训练,而非将其划分为独立子集。 |
| Estimation error bound | 衡量估计量与真实值之间差异的上界,用于评估统计方法的收敛性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅