该论文介绍了UIC-AIHealth4All系统在ArchEHR-QA 2026共享任务中的表现,该系统针对电子健康记录中的有依据问答任务,参与了证据识别、答案生成和答案-证据对齐三个子任务。研究提出了一种"答案优先"流水线,先让模型生成引用特定病历句子的候选答案,再对完整证据集进行分类,利用抽象相关性判断与基于生成答案判断之间的不对称性。在证据识别子任务中排名第三(Strict Micro F1 62.90),答案生成排名第九(Overall 31.90),答案-证据对齐排名第五(F1 79.81)。事后语言分析发现,尽管模型输出的词数和句数与临床医生撰写的参考文本相当,但其可读性难度高出3.2个Flesch-Kincaid年级水平,表明临床NLP系统需要明确优化可读性。
| ArchEHR-QA | 一个基于电子健康记录的问答共享任务,包含多个子任务,如证据识别、答案生成和答案-证据对齐。 |
| Answer-first pipeline | 一种流水线方法,先基于生成的答案来引用证据,再对完整证据集进行分类,利用抽象相关性与答案相对相关性之间的不对称性。 |
| Self-consistency voting | 一种通过多次模型调用并对结果进行投票以提高一致性和可靠性的技术,常用于增强生成任务的稳定性。 |
| Flesch-Kincaid grade level | 一种衡量文本可读性的指标,表示阅读文本所需的教育年级水平,数值越高表示文本越难读。 |
| Evidence grounding | 在问答系统中,将生成的答案与来自源文档(如电子健康记录)的具体证据片段相关联的过程。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅