该研究提出了一种测试时干预方法,用于提升大语言模型解释的忠实度。作者将解释不忠实划分为两个维度:不完整性(遗漏影响答案的因素)和不健全性(引用未影响答案的因素)。现有方法多聚焦于训练阶段或仅处理不健全性,而该研究直接针对不完整性。其核心思路是:从输入中移除解释未提及的概念,再重新查询模型,从而消除未提及因素的影响,同时保留已提及概念的作用。实验覆盖两个数据集、多个模型家族及两种独立忠实度指标,结果表明该方法在提升解释忠实度方面优于标准提示和鼓励忠实的提示策略。该方法无需修改模型参数,可在推理时灵活应用,为减少隐藏影响、提升LLM辅助决策的可靠性与安全性提供了实用工具。
| faithfulness | 忠实度,指模型解释是否真实反映其决策依据的程度。 |
| incompleteness | 不完整性,指解释遗漏了影响模型答案的因素。 |
| unsoundness | 不健全性,指解释包含了未影响模型答案的因素。 |
| test-time approach | 测试时方法,指在模型推理阶段而非训练阶段进行干预以提高性能或忠实度的方法。 |
| model-agnostic | 模型无关的,指方法不依赖于特定模型结构,可适用于多种模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅