该研究针对现有STEM领域AI评估数据集的不足,构建了一个由241名领域专家参与创建的高质量问答数据集,涵盖物理、化学、生物和数学四个学科,共398个问题。研究团队通过精心设计均衡的类别分布、严格筛选问题贡献者、多轮专家共识评审等流程,确保数据质量,并采用可验证的问答格式。基准测试显示,前沿AI模型在该数据集上的准确率不足25%,表明其具有较高的区分度。此外,使用该数据集私有版本(2000个问题)对开源模型进行后训练,使其在HLE验证数据集的STEM子集上相对性能提升15%,证明了该数据集不仅可用于模型评估,对模型训练也有实际价值。研究已开源部分数据供学术界使用。
| STEM QA | 科学、技术、工程和数学领域的问答数据集,用于评估AI模型的知识和推理能力。 |
| frontier models | 指当前最先进、性能最强的AI模型,通常在大规模数据上训练。 |
| taxonomy | 分类体系,用于对数据集中的问题或主题进行系统分类。 |
| post-training | 在预训练模型基础上,使用特定数据集进行进一步训练,以提升模型在特定任务上的表现。 |
| HLE-verified dataset | 一个经过验证的基准数据集,用于评估模型在STEM领域的表现。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅