ClosureBench 是一个用于组合图关系推理的建设性基准测试,通过程序化验证确保答案正确性。与易受数据污染影响的固定测试集不同,它按需生成实例,每个任务的参考答案由Ein张量逻辑语言程序执行得出,实现机器验证。基准涵盖26个任务类别,分三个组合层级(L1-L3),难度由图大小、边密度和查询深度三个独立轴控制。评估从1.5B开源模型到前沿系统(如o3、GPT-4.1等)后发现:其一,基准能直接测量记忆化,模型在固定测试集上微调后,见过与新鲜实例的准确率差距达19.3个百分点,静态测试集无法揭示此问题;其二,准确率随图规模和查询深度增加而下降,两者交互作用导致模型误读自然语言图描述后基于错误图推理,即使最强模型也从原子查询退化至组合查询,且该瓶颈与输入格式无关;其三,4B模型微调为输出可执行程序而非直接答案时,跨组合层级保持稳定,接近前沿准确率(94.3%),且token成本更低,此特性在Ein和Python+NetworkX两种程序目标中均成立,表明验证程序合成优于单一语言。
| ClosureBench | 一个建设性基准,用于组合图关系推理,按需生成实例并具有程序化验证的真实标签。 |
| Ein | 一种张量逻辑语言,用于定义和执行图推理任务,确保参考答案的机器验证正确性。 |
| 组合推理 | 将多个推理步骤或关系组合起来以解决复杂查询的推理过程。 |
| 数据污染 | 测试集数据被模型在训练或微调期间看到,导致评估结果不准确的现象。 |
| 程序合成 | 自动生成可执行程序以解决特定任务的方法,此处用于生成图推理的答案。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅