多维度教育数据评分器Edu-QuRater:平均准确率0.917复现GPT-4.1-mini判断,已评分3.2亿文档
Edu-QuRating: Multi-Dimensional Educational Data Curation with Distilled Pairwise Judgements
arXiv CL (cs.CL) 重要 数据筛选论文方法大模型 🕐 09-10 12:00

📖 AI 总结

该研究提出Edu-QuRating,一种面向教育数据的多维度评分与筛选流程。针对现有教育数据过滤器将教育价值简化为单一标量的局限,作者借鉴QuRating方法,定义了教育专属评分标准,利用大语言模型对文档对进行标注,并将成对偏好蒸馏为可复用的评分器,从准确性、吸引力、结构性和受众适配性等维度对文本块打分。实验显示,最佳评分器在六项教育标准上恢复GPT-4.1-mini成对判断的平均准确率达0.917。在应用层面,研究对3.22亿余篇FineWeb-Edu-Fortified文档评分并构建预训练混合数据,训练出的小模型在九项基准上的总体准确率优于基线;同时将评分作为GRPO后训练的奖励项,使模型在教学质量与指令遵循上均获得更优表现。

🔑 关键词速览

Edu-QuRating一种多维度教育数据评分与策管流程,通过定义教育特定评分标准并蒸馏成对偏好,实现对文本块的教育价值评分。
Edu-QuRater从 LLM 成对判断中蒸馏得到的可复用评分器,能够依据多项教育标准对单个文本块进行评分。
QuRating一种基于成对比较和蒸馏的文本质量评分方法,Edu-QuRating 在其基础上扩展了教育维度的评分标准。
GRPO一种强化学习后训练方法,通过组相对策略优化来微调语言模型,本文将其用于结合教育评分奖励进行训练。
FineWeb-Edu-Fortified一个大规模教育类网页文本数据集,本文使用 Edu-QuRater 对其中的文档进行评分以构建过滤后的预训练混合数据。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅