🔥 今日值得一读 1914亿token开放STEM合成语料,17亿参数小模型跑赢Cosmopedia!
QVAC Genesis III: A Large-Scale, High-Quality Open Synthetic STEM Corpus for Efficient Language Model Pre-Training
arXiv AI (cs.AI) 🔥 重点 开源大模型论文方法 🕐 09-18 12:00

📖 AI 总结

该研究针对边缘AI和端侧部署场景中高质量STEM预训练数据稀缺的问题,发布了QVAC Genesis III——一个规模达1914.3亿token、覆盖19个STEM领域、多难度层级与多种教学风格的开放合成语料库。其核心方法采用双重生成策略:以边缘规模的小型学生模型为信号进行定向教师蒸馏,将学生的失败案例转化为纠错解释,将成功案例扩展为针对所有选项的对比式推理。研究还提出LLM-as-a-parser评估协议,从自由文本输出中提取最终答案并同时追踪准确率与答案有效率。通过1.7B参数模型的从头训练对照实验,使用该语料的模型在ARC、GPQA Diamond和MMLU STEM基准上均持续优于使用Cosmopedia-v2训练的模型及公开的Cosmo-1B模型,ARC-E最高提升28.57%,ARC-C提升21.35%,答案有效率最高达99.45%。该工作为小模型高效预训练提供了高学习价值的开放STEM数据资源。

🔑 关键词速览

QVAC Genesis III本文提出的1914.3亿token、面向STEM的多领域合成预训练语料库,覆盖19个领域和多种难度与教育风格。
双生成策略一种利用弱边缘规模学生模型的失败与成功信号进行定向教师蒸馏的数据生成方法,将失败转化为纠正解释,将成功扩展为对比式选项级推理。
LLM-as-a-parser一种评估协议,使用大语言模型从自由形式输出中解析最终答案,并同时评估准确率和答案有效性。
Cosmopedia-v2一个开源合成预训练语料库,在本文中作为对比基线,用于评估QVAC Genesis III的有效性。
有效答案率模型输出中能够被解析为有效最终答案的比例,用于衡量模型回答的格式合规性和可解析性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅