该研究系统评估了12个指令微调的开源大语言模型在因果边直接分类任务中的可靠性,覆盖6个基准因果图、5种提示策略和4种置信度来源。研究发现三个关键问题:首先,模型判断呈强召回主导特征,倾向于预测过密的因果图,产生大量假阳性边,提示策略只能调整精确率与召回率的权衡,无法解决过度预测问题。其次,模型能捕捉因果关联性,但难以可靠区分直接因果关系与间接关系或方向,40%的间接边和36%的反向非边被误判为直接边,且80%以上的错误判断获得高置信度,显示显著过度自信。第三,传统置信度估计不可靠,逻辑值置信度常趋近于1,而跨提示和跨模型一致性提供了更有前景的校准信号。研究建议将大语言模型视为外部验证的软因果先验来源,而非因果结构的直接证据。
| 因果边分类器 | 一种模型或方法,用于判断变量间是否存在直接的因果边,并可能给出方向。 |
| 校准 | 指模型预测的置信度与实际正确率之间的一致性程度。 |
| 口头化置信度 | 模型通过自然语言表达的对预测的自信程度,如“80%确定”。 |
| 基于逻辑的置信度 | 从模型输出的逻辑值(如softmax概率)中提取的置信度估计。 |
| 跨提示一致性 | 不同提示策略下模型预测的一致性,用作置信度信号。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅