该研究针对生成式数据增强在类别不平衡场景下的理论可靠性问题,提出了基于Wasserstein距离的统计框架。作者将增强过程形式化为分布混合,证明分类风险失真受增强强度与类别条件Wasserstein差异共同控制,并推导出基于Rademacher复杂度的泛化界,揭示假设复杂度、增强强度与生成保真度间的权衡。实验采用CGAN与CWGAN-GP在二分类及多分类不平衡任务中验证,发现CWGAN-GP的Wasserstein差异更低、分布保真度更高,但保真度提升未必带来分类性能优势,传统过采样方法仍具竞争力。核心结论是:增强可靠性取决于分布逼近误差而非单纯预测精度,该框架为评估合成数据质量提供了超越分类准确率的理论基础与有限样本保证。
| Generative data augmentation | 使用生成模型(如GAN)合成新样本来扩充训练数据的技术。 |
| Wasserstein discrepancy | 衡量两个概率分布之间差异的度量,基于最优传输理论,对分布距离敏感。 |
| Rademacher complexity | 一种衡量假设类复杂度的统计量,用于推导泛化误差界。 |
| Conditional GAN (CGAN) | 一种条件生成对抗网络,通过输入条件信息(如类别标签)生成特定类别的样本。 |
| Conditional WGAN-GP (CWGAN-GP) | 基于Wasserstein距离和梯度惩罚的条件生成对抗网络,旨在提高训练稳定性和生成质量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅