GPT都能解奥数几何,却画不出图?新基准曝光:编译成功率仅36%!
Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry
arXiv AI (cs.AI) 重要 #评测基准#几何推理#多模态 🕐 08-20 12:00
👨‍💼 主理人解读 · 为什么值得关注
提出奥赛几何图解推理基准,区分解题与绘图能力,用于评估模型图表理解与生成。

📖 AI 总结

这篇论文指出,尽管GPT和Claude等基础模型在奥林匹克级数学问题上表现出色,但“解题”与“作图”是两种不同的能力。现有基准如MathVista和MathVerse主要评估模型是否得出正确答案,却未单独测试其构建几何图形的能力。为此,作者推出了一个开源基准,包含954道自包含的奥林匹克几何题(其中297道为困难子集),每题配有解答、人工绘制的高保真Asymptote代码图,以及基于文本、代码、图像、视觉语言模型和约束条件的多种评估指标,用于衡量“图解推理”能力。实验结果显示,当前模型在作图上的表现明显弱于解题,平均编译成功率仅为36.14%,表明强大的数学推理能力并不等同于准确构造几何图形的能力。该数据集已公开在Hugging Face上,为未来研究提供了重要参考。

🔑 关键词速览

Diagrammatic Reasoning图解推理,指通过构建和解读几何图形来辅助问题解决的能力。
Olympiad Geometry奥林匹克几何,指国际数学奥林匹克竞赛中的几何问题,通常需要高级推理和构造技巧。
Foundation Models基础模型,如GPT和Claude,是大型预训练模型,能够执行多种任务,包括数学推理。
Asymptote一种用于生成精确矢量图形的编程语言,常用于绘制数学图表。
Benchmark基准测试,用于评估模型性能的标准数据集和度量方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅