诊断AI一次只查一项检查,准确率飙升还省钱!新方法CDPR让模型少做检查、多救对病
CDPR: Counterfactual Advantage-based Credit Assignment for Cost-Aware Sequential Medical Diagnosis
arXiv AI (cs.AI) 重要 医疗论文方法 🕐 09-01 12:00

📖 AI 总结

该论文提出了一种名为CDPR(反事实诊断过程奖励)的方法,用于解决成本敏感的序贯医疗诊断问题。传统医学语言模型通常将诊断视为一次性分类任务,忽略了检查价值与成本之间的权衡。研究者将诊断建模为成本敏感的序贯决策过程,并采用强化学习进行策略训练。核心挑战在于信用分配问题——仅在长轨迹末端获得单一可靠信号,导致低效检查与高效检查获得相同评分。CDPR无需专家标注或学习型评论器,通过识别策略犹豫状态,利用短回滚在平衡正确性、检查次数、成本和不可行请求的效用函数下,估计所选动作相对于替代方案的优势。该方法集成到GRPO中,在MIMIC-IV、ClinicalBench及私有医院数据集上验证,显著提高了诊断准确性,同时减少了检查数量和成本。

🔑 关键词速览

CDPR反事实诊断过程奖励,一种用于强化学习的奖励分配方法,通过比较实际动作与替代动作的优势来评估决策。
Credit Assignment信用分配,强化学习中确定哪个动作对最终结果负责的过程。
GRPO一种强化学习优化算法,用于训练策略模型,此处集成CDPR以改进诊断策略。
MIMIC-IV一个公开的医疗重症监护数据库,常用于医学机器学习研究。
Rollout回放,在强化学习中指从当前状态开始模拟策略执行一段轨迹以估计回报。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅