本文研究了数据受限条件下语言模型混合预训练的扩展规律。随着模型规模增大,所需数据量激增,但低资源语言或专业领域等目标数据源规模有限,常见做法是将稀缺目标数据与丰富通用数据混合使用,这带来根本性权衡:目标数据过少导致领域暴露不足,过多则造成重复采样、收益递减甚至过拟合。作者通过超过2000次语言模型训练实验,涵盖多种模型规模、目标数据规模及数据类型(多语言、领域特定、质量过滤),发现重复是影响目标领域性能的核心因素,且混合训练对重复的容忍度远高于单一数据源训练——稀缺语料可重复使用15至20次,最优重复次数取决于目标数据规模、计算预算和模型规模。研究进一步提出考虑重复目标token价值递减和通用数据正则化作用的重复感知混合扩展定律,通过优化该定律可计算有效混合配置,为数据约束下的预训练提供实用建议。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅