🔥 今日值得一读 数据混合也能“实验设计”?新方法砍掉25%代理训练,照样选出最优配比!
Data Mixing as Mixture Experiment: Response Surface Methodology and Optimal Design for Large Language Model Pretraining
arXiv ML (stat.ML) 🔥 重点 #预训练#数据混合#优化设计 🕐 08-26 12:00
👨‍💼 主理人解读 · 为什么值得关注
用响应面方法确定最优数据域比例,提升大模型预训练效率,节省计算资源。

📖 AI 总结

该研究将大语言模型预训练中的数据混合问题重新定义为经典的混合物实验,其中数据领域是混合组分,token分配比例是组分占比,代理训练运行构成实验设计点,验证损失则定义了概率单纯形上的响应面。作者采用稀疏二阶Scheffé响应面模型构建模型鲁棒的I-最优设计,并以RegMix为案例进行实证分析。研究发现领域价值具有强关系性,若干在加性效应下表现弱的领域通过成对交互变得有利,尤其是与网络文本的组合。稀疏Scheffé模型能跨模型规模保持混合排序,同时提供加性与交互效应的显式分解。在模拟研究中,模型鲁棒的I-最优设计在移除约25%原始代理运行后仍能恢复相关混合排序。这表明LLM数据混合不仅是预测问题,更是实验设计问题,可通过优化代理混合选择提升统计效率。

🔑 关键词速览

Data mixing数据混合,指在预训练中按比例分配不同领域数据的过程。
Mixture experiment混合实验,一种实验设计方法,研究各成分比例对响应的影响。
Response surface methodology响应曲面方法,用于建模和优化响应变量与输入因素关系的统计技术。
Scheffé modelScheffé模型,一种用于混合实验的规范多项式模型,用于描述成分比例与响应之间的关系。
I-optimal designI最优设计,一种实验设计准则,旨在最小化预测响应的平均方差。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅