🔥 今日值得一读 2000次实验破解数据配比密码!稀缺数据混训模型,收益递减拐点找到了!
Scaling Laws for Mixture Pretraining Under Data Constraints
Apple ML Research 🔥 重点 大模型论文方法算力 🕐 08-20 08:00

📖 AI 总结

本文研究了数据受限条件下语言模型混合预训练的扩展规律。随着模型规模增大,所需数据量激增,但低资源语言或专业领域等目标数据源规模有限,常见做法是将稀缺目标数据与丰富通用数据混合使用,这带来根本性权衡:目标数据过少导致领域暴露不足,过多则造成重复采样、收益递减甚至过拟合。作者通过超过2000次语言模型训练实验,涵盖多种模型规模、目标数据规模及数据类型(多语言、领域特定、质量过滤),发现重复是影响目标领域性能的核心因素,且混合训练对重复的容忍度远高于单一数据源训练——稀缺语料可重复使用15至20次,最优重复次数取决于目标数据规模、计算预算和模型规模。研究进一步提出考虑重复目标token价值递减和通用数据正则化作用的重复感知混合扩展定律,通过优化该定律可计算有效混合配置,为数据约束下的预训练提供实用建议。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅