本文对长尾图像分类中的小批量采样策略进行了系统的理论与实证研究,比较了均匀实例采样、类别平衡采样、平方根采样和渐进平衡采样四种方法。作者在统一的偏差—方差框架下分析了各策略对梯度估计的影响,揭示了经验损失的无偏优化与稀有类别公平表示之间的内在张力。实验采用ResNet-32在CIFAR-100-LT数据集上进行,设置10、50、100三种不平衡比例,并控制长尾子集与初始化条件。结果显示,在不平衡比例为100时,渐进采样将尾部类别准确率从均匀基线的10.8%提升至13.5%,提升约25%,且该效果在三个随机种子下保持一致;但整体准确率与均匀采样无显著差异。类别平衡采样则因对稀缺数据的过度采样导致过拟合,在所有类别组上均出现性能下降。研究表明,训练过程中何时施加再平衡与再平衡的程度同样重要。
| 长尾图像分类 | 处理类别分布高度不平衡的图像分类任务,其中少数头部类别样本多,多数尾部类别样本少。 |
| 小批量采样策略 | 决定每个训练批次中各类别样本组成的方法,影响梯度估计和模型泛化。 |
| 偏差-方差框架 | 分析估计量偏差和方差的理论框架,用于比较不同采样策略对梯度估计的影响。 |
| 渐进平衡采样 | 一种在训练过程中逐步调整类别采样权重的策略,以平衡头部和尾部类别。 |
| CIFAR-100-LT | CIFAR-100数据集的长尾版本,用于评估长尾分类算法,具有不同的不平衡比率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅