该研究针对基于检索的事实性评估在开放式医疗问答场景中的失效问题展开分析。这类评估方法通过将大模型生成的陈述与权威医学语料库中的证据进行比对来检测幻觉,已成为临床高风险场景下的主流范式,但现有系统多以F1等聚合指标衡量性能,无法揭示失败发生的具体环节与原因。作者基于MedExpert开放式数据集及三个封闭式数据集构建了两套分类体系,将失败分解为检索阶段五个质量维度的错误和验证器推理阶段六个连续步骤的错误,并采用LLM-as-Judge的自动模式归纳流程进行大规模标注,随后在四种检索方法和六种前沿验证模型上进行压力测试。结果显示,扩大模型规模、增加推理投入、引入权威网络来源以及医学微调均无法消除这些失败模式,表明它们是"先检索后验证"范式在开放式医疗场景中的根本性局限,而非旧系统的偶然缺陷。
| Retrieval-based factuality evaluation | 基于检索的事实性评估,即从权威语料库中检索证据来验证生成文本真实性的方法。 |
| Hallucination detection | 幻觉检测,识别大语言模型生成内容中与事实不符或无依据的虚假信息。 |
| RAG (Retrieval-Augmented Generation) | 检索增强生成,一种结合外部知识检索与文本生成的技术框架。 |
| LLM-as-Judge | 以大语言模型作为评判者,利用LLM自动评估文本质量或分类错误。 |
| Retrieve-then-verify paradigm | 先检索后验证范式,即先检索相关证据再验证生成论断真实性的两阶段流程。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅