该研究提出了SciReC,一个面向多模态大语言模型(MLLM)的模型自适应学术对话基准,用于系统评估其在类比、结构和因果等不同类别上的关系推理能力。同时,作者设计了基于缺陷的诊断框架DMRA,以量化视觉理解、知识调用和记忆回溯等成分对推理失败的贡献,从而定位错误的主要来源。实验结果显示,Claude 4.6在总体关系得分上最优(73%),GPT 5.4次之(68%)。性能趋势表明,开源模型在空间关系上表现最弱,而闭源模型则在层级和序列关系上困难更大;学科领域中,模型在天文学上得分最低,在心理学上最高。DMRA诊断进一步揭示,关系推理本身是所有模型最主要的错误来源,其次是记忆限制。该工作为细粒度评估和提升多模态模型的复杂推理能力提供了诊断性工具与改进方向。
| Relational reasoning | 关系推理,指理解、比较和整合概念间关系的能力。 |
| Multimodal large language models (MLLM) | 多模态大语言模型,能处理文本、图像等多种模态数据的语言模型。 |
| SciReC | 模型自适应的多模态学术对话基准,用于评估关系推理能力。 |
| DMRA | 基于缺陷的诊断框架,用于量化各组件对推理失败的贡献。 |
| Deficit-based diagnostic framework | 基于缺陷的诊断框架,通过分析错误来源来识别模型弱点。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅