LLM物理推理新基准:交互实验让多数模型准确率跌破30%!
PhysMent: An Interactive Approach For LLM Reasoning In Physics Problems
arXiv CL (cs.CL) 重要 大模型论文方法 🕐 09-15 12:00

📖 AI 总结

本文提出 PhysMent,一个用于评估大语言模型物理推理能力的交互式基准。与提供全部已知条件的静态基准不同,PhysMent 要求模型通过 MuJoCo 物理模拟器主动施加力、查询物体状态、推进时间并修改场景几何,从而自行发现信息后再作答。基准包含 105 个经典力学场景,覆盖四种难度组合、三种场景模态及场景操纵类别,并采用六维评分框架。结果显示,当前模型在定性单概念任务上表现尚可(准确率最高约 80%),但在需要精确多步实验的定量任务上大幅下降,最难的单一概念类别中多数模型低于 30%;七个模型的整体准确率介于 25% 至 67% 之间。失败原因主要在于过早提交答案、探索效率低以及对模拟器反馈的利用不一致,而非概念理解不足,表明瓶颈在于程序性的自适应多步工具使用能力。

🔑 关键词速览

PhysMent一个通过工具中介交互与MuJoCo物理模拟器评估LLM物理推理能力的基准测试。
MuJoCo一个用于物理模拟的软件环境,常用于机器人学和强化学习研究。
工具中介交互模型通过调用外部工具(如施加力、查询状态)与环境进行迭代交互来获取信息的方式。
六维评分框架用于评估模型在PhysMent基准上表现的六个维度的评分体系。
程序性瓶颈模型在需要自适应多步工具使用的任务中表现不佳,主要受限于程序性能力而非概念理解。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅