LLM评判新协议GAVEL:合并时间线在77%比较中更受青睐,差异从每份报告7.63降至0.85!
Grounded Adjudication of Variations across Extracted TimeLines (GAVEL): Comparing Clinical Timelines Against Their Case Reports
arXiv AI (cs.AI) 大模型论文方法 🕐 09-15 12:00

📖 AI 总结

该研究提出GAVEL,一种基于大语言模型的评判协议,用于将临床时间线与病例报告进行对照,针对每处差异输出差异类型、判定结论及报告原文依据,从而摆脱对不完美参考标注和精确事件对齐的依赖。研究评估了事件匹配器,审查了来自GPT5.6sol和DeepSeek V3.2的2738条发现,对六种LLM提取器和两名人工标注者进行排序,并测试了GAVEL引导的合并方法。结果显示,0.10阈值上下方的真实匹配率分别为60%和48%,人工复核确认了89.4%和88.6%的发现。在126份报告中,合并后的时间线在77.0%的比较中被优先选择,并将归因于被评估时间线的差异从每份报告7.63处降至0.85处。该工作表明,无需将任一时间线视为金标准,即可实现基于报告的比较与修订,为临床时间线抽取的评估提供了更可靠的路径。

🔑 关键词速览

GAVEL一种基于LLM的评判协议,用于比较临床时间线与病例报告,识别差异并支持时间线修订。
临床时间线提取从病例报告中自动识别和提取医疗事件及其时间顺序的过程。
LLM评判协议利用大型语言模型作为评判者,对两个时间线进行对比评估并给出差异类型和判定的方法。
事件匹配器用于对齐两个时间线中事件并判断是否匹配的组件,其性能通过真实匹配率评估。
GAVEL引导的合并利用GAVEL的评判结果将多个时间线合并为一个更准确时间线的过程。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅