🔥 今日值得一读 下一事件准确率几乎相同,三种模型展开生成却差出137倍!
What Next-Event Accuracy Cannot See: Closed-Loop Evaluation of Emergency Department Trajectory Simulators
arXiv LG (cs.LG) 🔥 重点 #医疗AI#仿真评测#闭环评估#轨迹模型 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
可用于评估临床轨迹模拟器在自生成事件上的误差累积,帮助开发者发现仅看下一步准确率掩盖的问题。

📖 AI 总结

该研究针对临床轨迹模拟器提出闭环评估框架EDSim-Bench,基于425,028条MIMIC-IV-ED就诊记录并在MC-MED上外部验证。模拟与常规预测不同,模型需以自身生成的事件为条件,误差会逐步累积。研究发现,尽管三种神经架构的下一事件准确率差异在0.001以内,但在自回归展开中表现迥异:某Transformer配置的终止评分在不同随机种子下从0.43波动至0.96,发散度达n-gram基线的4.2至137倍;没有任何前缀训练的神经模型在终止与事件构成上接近n-gram。推理期干预可改善终止,却无法同时恢复构成与时序。对每个可监督位置而非仅前缀末位进行训练,可使Transformer、GRU和LSTM的发散度降低一至两个数量级,且该规律在模型扩展、时间偏移和外部站点评估下依然成立。即便如此,最佳模型生成的就诊时长仍仅为实际的一半,且模型排名在占用预测这一下游任务上发生反转。结果表明,下一事件准确率不足以评估临床轨迹模拟器,需在多种子、多展开准则与下游任务上开展闭环评估。

🔑 关键词速览

EDSim-Bench一个用于评估急诊科临床轨迹模拟器的基准测试框架,基于MIMIC-IV-ED和MC-MED数据集。
Next-Event Accuracy下一事件准确率,指模型在给定历史序列下预测下一个事件的准确程度,是常见的序列模型评估指标。
Closed-Loop Evaluation闭环评估,指模型在生成过程中基于自身输出进行条件预测,从而模拟误差累积的评估方式。
MIMIC-IV-ED一个公开的急诊科电子健康记录数据集,包含大量就诊记录,常用于临床机器学习研究。
n-gramn元语言模型,基于前n-1个事件预测下一个事件的统计模型,此处作为参考基线。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅