材料大模型晶体问答:有依据视图比公式输入高17.3分,却仍靠复制关系而非推理!
CARAT: Do Materials LLMs Reason or Recite?
arXiv AI (cs.AI) 重要 #评测基准#科学推理#材料科学 🕐 今天 12:00

📖 AI 总结

这篇论文提出CARAT基准,旨在检验材料科学大语言模型回答晶体结构问题时究竟是真正推理还是照搬输入。研究将问题与标准答案固定,在八种匹配视图下分别命名结构关系,并引入微调、答案掩码、证据注入等对照实验。关键发现有三:在最难的题目族上,有结构依据的视图比仅给化学式高出17.3分;GraphSpace比普通周期图高19.3分,但该差距实为两种效应叠加,普通渲染已含所需信息时仅差1.96分,完全缺失时则达46.7分,说明标题分数主要反映基线缺陷而非证据呈现方式;作者进一步攻击自身基准,发现跳过链接直接读列表的规则可答对七个加固族中的四个,重建后十一种捷径接近随机水平。冻结模型在95.6%的配对案例中引用链接却在重定向后给出相同答案,表明其重复关系而未真正使用;经匹配监督后达99.8%,删除链接则降至23.4%,低于最佳捷径的27.0%,说明引用与使用两个步骤均可学习。该工作为评估材料LLM的真实推理能力提供了方法论警示。

🔑 关键词速览

CARAT一种用于评估材料大语言模型是真正推理还是机械复述的基准测试框架。
GraphSpace一种将晶体结构关系分别命名的图表示方法,用于提供结构化证据。
materials LLM针对材料科学领域训练或微调的大语言模型,用于回答晶体结构等问题。
answer masking在输入中隐藏或遮蔽答案字段,以防止模型直接复制答案的技术。
paired inference对匹配的问题-答案对进行推理,以检验模型是否依赖特定证据。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅