最强统计AI翻车了?1013道教科书难题,最佳模型准确率仅72%!
Benchmarking Language Models for Statistical Problem Formulation
arXiv AI (cs.AI) 重要 #评测基准#数据科学 🕐 09-03 12:00

📖 AI 总结

该研究针对大语言模型在统计与数据科学辅助中的关键缺口,提出“统计问题公式化”这一上游环节,并将其拆解为统计问题分类与变量识别及角色分配两个子任务。作者构建了StatFormBench基准,基于五本跨领域统计教材及数据科学案例库,涵盖1013个样本、20个粗粒度和85个细粒度问题类别。对14种开源及闭源模型的评估显示,最优零样本模型的细粒度分类准确率仅为72.0%,变量集合重叠度为63.2%,且没有任何模型能在两个子任务上同时表现最佳。增强提示策略带来的提升有限且不稳定。该基准及评估代码已公开,为未来提升模型在真实场景中自主理解统计需求的能力提供了评测基础。

🔑 关键词速览

Statistical Problem Formulation统计问题表述,指将非正式的用户目标转化为明确的统计任务和变量角色的过程。
StatFormBench一个用于评估语言模型在统计问题表述上能力的基准测试,包含跨领域样本。
Statistical Problem Classification统计问题分类,即识别数据所隐含的统计任务类型(如假设检验、回归等)。
Variable Identification & Role Assignment变量识别与角色分配,即确定数据中哪些变量是响应变量、预测变量等。
Zero-shot models零样本模型,指未经特定任务微调、直接用于新任务的模型。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅