专家验证的STEM题库来了!241位专家打造,前沿AI正确率不到25%!
Expert-validated STEM QA
arXiv AI (cs.AI) 大模型数据集 🕐 09-01 12:00

📖 AI 总结

该研究针对现有STEM领域AI评估数据集的不足,构建了一个由241名领域专家参与创建的高质量问答数据集,涵盖物理、化学、生物和数学四个学科,共398个问题。研究团队通过精心设计均衡的类别分布、严格筛选问题贡献者、多轮专家共识评审等流程,确保数据质量,并采用可验证的问答格式。基准测试显示,前沿AI模型在该数据集上的准确率不足25%,表明其具有较高的区分度。此外,使用该数据集私有版本(2000个问题)对开源模型进行后训练,使其在HLE验证数据集的STEM子集上相对性能提升15%,证明了该数据集不仅可用于模型评估,对模型训练也有实际价值。研究已开源部分数据供学术界使用。

🔑 关键词速览

STEM QA科学、技术、工程和数学领域的问答数据集,用于评估AI模型的知识和推理能力。
frontier models指当前最先进、性能最强的AI模型,通常在大规模数据上训练。
taxonomy分类体系,用于对数据集中的问题或主题进行系统分类。
post-training在预训练模型基础上,使用特定数据集进行进一步训练,以提升模型在特定任务上的表现。
HLE-verified dataset一个经过验证的基准数据集,用于评估模型在STEM领域的表现。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅