本文研究合成数据对高维线性回归中单遍随机梯度下降泛化性能的影响,重点关注模型偏移情形。作者为混合训练与两阶段训练建立了有限样本风险界,将标准偏差与方差同源不匹配效应区分开来,包括混合训练下的波动与持续漂移,以及两阶段训练下的过滤初始化偏差。结果显示,混合训练会引发强烈的模型坍缩,而两阶段训练通过仅在首阶段使用合成数据即可避免这一风险下限,表明坍缩并非不可避免。在随机草图模型下,作者进一步给出两种协议的缩放规律,发现更大模型可能放大混合训练中合成数据带来的性能退化,并量化了高质量合成预训练对降低两阶段训练偏差的作用。研究还建立了两阶段训练在相同真实数据预算下严格优于纯真实数据训练的精确有限样本充要条件,表明合成数据本身无害也无益,其效果取决于数据质量与训练协议。
| 模型崩溃 | 指使用合成数据训练模型时,模型性能无法随数据量增加而提升,甚至退化的现象。 |
| 单遍 SGD | 一种随机梯度下降变体,每个数据点仅使用一次进行参数更新,常用于在线学习或大数据场景。 |
| 高维线性回归 | 指特征维度与样本量相当或更大的线性回归问题,常用于研究过参数化模型的泛化行为。 |
| 两阶段训练 | 一种训练协议,先使用合成数据进行预训练,再使用真实数据进行微调或继续训练。 |
| 缩放定律 | 描述模型性能(如风险)随模型规模、数据量等资源变化而变化的数学关系。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅