该研究提出GAVEL,一种基于大语言模型的评判协议,用于将临床时间线与病例报告进行对照,针对每处差异输出差异类型、判定结论及报告原文依据,从而摆脱对不完美参考标注和精确事件对齐的依赖。研究评估了事件匹配器,审查了来自GPT5.6sol和DeepSeek V3.2的2738条发现,对六种LLM提取器和两名人工标注者进行排序,并测试了GAVEL引导的合并方法。结果显示,0.10阈值上下方的真实匹配率分别为60%和48%,人工复核确认了89.4%和88.6%的发现。在126份报告中,合并后的时间线在77.0%的比较中被优先选择,并将归因于被评估时间线的差异从每份报告7.63处降至0.85处。该工作表明,无需将任一时间线视为金标准,即可实现基于报告的比较与修订,为临床时间线抽取的评估提供了更可靠的路径。
| GAVEL | 一种基于LLM的评判协议,用于比较临床时间线与病例报告,识别差异并支持时间线修订。 |
| 临床时间线提取 | 从病例报告中自动识别和提取医疗事件及其时间顺序的过程。 |
| LLM评判协议 | 利用大型语言模型作为评判者,对两个时间线进行对比评估并给出差异类型和判定的方法。 |
| 事件匹配器 | 用于对齐两个时间线中事件并判断是否匹配的组件,其性能通过真实匹配率评估。 |
| GAVEL引导的合并 | 利用GAVEL的评判结果将多个时间线合并为一个更准确时间线的过程。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅