🔥 今日值得一读 LLM因果判断严重过密:40%间接边被误判为直接边,84.6%假阳性还高置信度!
From Causal Plausibility to Causal Reliability: Evaluating LLMs as Calibrated Direct Causal-Edge Classifiers
arXiv LG (cs.LG) 🔥 重点 论文方法大模型因果推理 🕐 08-26 12:00

📖 AI 总结

该研究系统评估了12个指令微调的开源大语言模型在因果边直接分类任务中的可靠性,覆盖6个基准因果图、5种提示策略和4种置信度来源。研究发现三个关键问题:首先,模型判断呈强召回主导特征,倾向于预测过密的因果图,产生大量假阳性边,提示策略只能调整精确率与召回率的权衡,无法解决过度预测问题。其次,模型能捕捉因果关联性,但难以可靠区分直接因果关系与间接关系或方向,40%的间接边和36%的反向非边被误判为直接边,且80%以上的错误判断获得高置信度,显示显著过度自信。第三,传统置信度估计不可靠,逻辑值置信度常趋近于1,而跨提示和跨模型一致性提供了更有前景的校准信号。研究建议将大语言模型视为外部验证的软因果先验来源,而非因果结构的直接证据。

🔑 关键词速览

因果边分类器一种模型或方法,用于判断变量间是否存在直接的因果边,并可能给出方向。
校准指模型预测的置信度与实际正确率之间的一致性程度。
口头化置信度模型通过自然语言表达的对预测的自信程度,如“80%确定”。
基于逻辑的置信度从模型输出的逻辑值(如softmax概率)中提取的置信度估计。
跨提示一致性不同提示策略下模型预测的一致性,用作置信度信号。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅