该研究将大语言模型预训练中的数据混合问题重新定义为经典的混合物实验,其中数据领域是混合组分,token分配比例是组分占比,代理训练运行构成实验设计点,验证损失则定义了概率单纯形上的响应面。作者采用稀疏二阶Scheffé响应面模型构建模型鲁棒的I-最优设计,并以RegMix为案例进行实证分析。研究发现领域价值具有强关系性,若干在加性效应下表现弱的领域通过成对交互变得有利,尤其是与网络文本的组合。稀疏Scheffé模型能跨模型规模保持混合排序,同时提供加性与交互效应的显式分解。在模拟研究中,模型鲁棒的I-最优设计在移除约25%原始代理运行后仍能恢复相关混合排序。这表明LLM数据混合不仅是预测问题,更是实验设计问题,可通过优化代理混合选择提升统计效率。
| Data mixing | 数据混合,指在预训练中按比例分配不同领域数据的过程。 |
| Mixture experiment | 混合实验,一种实验设计方法,研究各成分比例对响应的影响。 |
| Response surface methodology | 响应曲面方法,用于建模和优化响应变量与输入因素关系的统计技术。 |
| Scheffé model | Scheffé模型,一种用于混合实验的规范多项式模型,用于描述成分比例与响应之间的关系。 |
| I-optimal design | I最优设计,一种实验设计准则,旨在最小化预测响应的平均方差。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅