临床AI诊断碾压医生25个百分点!波兰150例实测准确率82%对57%
Performance of Clinical AI System and Physicians and Frontier Language Models in primary care diagnostics
arXiv CL (cs.CL) 重要 #医疗AI#评测基准#LLM 🕐 09-08 12:00

📖 摘要

比较临床AI系统、医生和前沿语言模型在初级保健诊断中的性能。

🔑 关键词速览

Doctorina一种临床AI系统,用于初级保健诊断和管理,本文中表现优于医生和其他模型。
frontier language models指处于技术前沿的大型语言模型,如Claude Opus和Kimi K3,用于通用任务。
Top-1 concordanceAI或医生的首选诊断与标准诊断一致的比例,衡量诊断准确性。
primary-or-reference-differential concordance诊断与主要或参考鉴别诊断一致的比例,反映诊断的全面性。
adaptive information gathering在咨询中根据患者反应动态收集额外信息的过程,模拟真实临床交互。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅