该研究提出Edu-QuRating,一种面向教育数据的多维度评分与筛选流程。针对现有教育数据过滤器将教育价值简化为单一标量的局限,作者借鉴QuRating方法,定义了教育专属评分标准,利用大语言模型对文档对进行标注,并将成对偏好蒸馏为可复用的评分器,从准确性、吸引力、结构性和受众适配性等维度对文本块打分。实验显示,最佳评分器在六项教育标准上恢复GPT-4.1-mini成对判断的平均准确率达0.917。在应用层面,研究对3.22亿余篇FineWeb-Edu-Fortified文档评分并构建预训练混合数据,训练出的小模型在九项基准上的总体准确率优于基线;同时将评分作为GRPO后训练的奖励项,使模型在教学质量与指令遵循上均获得更优表现。
| Edu-QuRating | 一种多维度教育数据评分与策管流程,通过定义教育特定评分标准并蒸馏成对偏好,实现对文本块的教育价值评分。 |
| Edu-QuRater | 从 LLM 成对判断中蒸馏得到的可复用评分器,能够依据多项教育标准对单个文本块进行评分。 |
| QuRating | 一种基于成对比较和蒸馏的文本质量评分方法,Edu-QuRating 在其基础上扩展了教育维度的评分标准。 |
| GRPO | 一种强化学习后训练方法,通过组相对策略优化来微调语言模型,本文将其用于结合教育评分奖励进行训练。 |
| FineWeb-Edu-Fortified | 一个大规模教育类网页文本数据集,本文使用 Edu-QuRater 对其中的文档进行评分以构建过滤后的预训练混合数据。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅