该研究探讨了弱到强泛化现象,即用弱教师模型生成的标签训练强学生模型时,学生模型能超越教师的表现。作者以两层随机特征网络为研究对象,以网络宽度衡量模型强度,运用随机矩阵理论推导了最优训练教师模型与梯度流训练学生模型的总体误差的确定性等价形式。针对ReLU激活函数和纯球谐目标,在高斯普适性假设下得到精确渐近结果,证明学生误差与教师误差呈平方关系,即实现二次改进,且该结果达到了Medvedev等人(2025)给出的通用下界。研究还分析了更一般的停止时间和多谐波度目标下的学生行为,刻画了弱到强泛化发生的条件区间,并识别出二次改进、非二次改进与无改进之间的相变边界。
| 弱到强泛化 | 用弱模型生成的标签训练强模型,强模型泛化能力超过弱模型的现象。 |
| 随机特征网络 | 两层神经网络,其中第一层权重随机固定,仅训练第二层权重。 |
| 随机矩阵理论 | 研究随机矩阵特征值分布的数学理论,用于分析高维统计模型。 |
| 确定性等价 | 大维极限下,随机矩阵的某些函数收敛到确定性矩阵的对应函数。 |
| 球谐函数 | 球面上的正交函数系,常用于表示球对称目标函数。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅