该研究探讨角色分工问答系统中,推理者向验证者传递的“理由”究竟传递了什么信息。作者设计了一种消息干预诊断方法,在固定证据与候选答案的前提下,仅改变跨角色边界传递的理由内容,并在MuSiQue、HotpotQA和2WikiMultiHopQA的400个样本上,以DeepSeek分别作为生成者与验证者进行实验。结果显示,忠实理由相比不提供理由几乎不提升答案准确率,但被篡改的理由会显著改变验证者的支持判断:在盲验证提示下,无害改写仅使支持判断变动0–2.5%,而篡改理由可造成10–22%的偏移;加入显式理由核查提示后,该偏移进一步放大至34–55%。最终答案的变化幅度较小(2–30%),且仅2.9–35.3%的支持翻转伴随答案改变。人工审计发现,42个有效篡改中有16个属于“过度信任篡改”情形,且人类对模型接受的10个篡改理由中有9个予以拒绝或标记为不明确。研究据此提出,理由共享应被视为一种验证消息机制来评估,而非单纯追求答案准确率的途径。
| 角色专门化问答 | 一种问答系统架构,其中不同组件(如推理器和验证器)承担专门角色,通过消息传递协作。 |
| 理由 | 推理器生成的解释性文本,用于说明其答案或推理过程,并传递给验证器。 |
| 消息干预诊断 | 一种实验方法,通过固定其他因素、仅改变传递的消息(如理由)来评估其影响。 |
| 支持判断 | 验证器对候选答案是否被证据支持所做的评估或判断。 |
| 损坏-过度信任 | 一种失败模式,验证器过度信任损坏的理由,导致错误地接受不正确的支持判断。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅