数值等价应用题换种写法,大模型正确率从0.996暴跌至0.848!
Same Quantity, Different Answer: Numerical Representation Invariance in Language Models
arXiv CL (cs.CL) 重要 论文方法大模型评测 🕐 今天 12:00

📖 AI 总结

本研究考察语言模型在数值表示发生等价变换时能否保持答案不变。作者构建了3600道精确有理数应用题和8600条提示,覆盖小数、分数、百分比、数词、科学计数法及精确单位换算五类保义变换,并评测五个开源权重模型。经固定语法审计后,规范答案准确率为0.969至0.996,但轨道正确率降至0.848至0.981,轨道不变性为0.851至0.981,其中不变却错误的轨道占比不超过0.003。研究发现,严格解析器的大部分崩溃源于乘法形式科学计数法超出所实现的数字语法,说明评测接口缺陷可能被误判为推理失败。此外还存在语义病理:Mistral Small 4在单位换算输入上得分仅0.699,产生265个与标签相差恰好10的幂次的错误。另一项9000次调用实验显示,表示共识并未优于复述共识,且误报明显更多。该工作揭示了数值不变性评测中接口与语义问题的交织。

🔑 关键词速览

轨道不变性模型对同一问题的不同数值表示(如小数、分数)应给出相同答案的性质。
保持恒等性的变换改变数值的表示形式但不改变其数值大小的操作,如将0.5写成1/2。
规范准确率经过语法审计后,模型输出与标准答案完全匹配的准确率。
表示共识通过聚合模型对同一问题不同表示形式的回答来提升一致性的方法。
复述共识通过聚合模型对同一问题不同复述(同义改写)的回答来提升一致性的方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅