比较临床AI系统、医生和前沿语言模型在初级保健诊断中的性能。
| Doctorina | 一种临床AI系统,用于初级保健诊断和管理,本文中表现优于医生和其他模型。 |
| frontier language models | 指处于技术前沿的大型语言模型,如Claude Opus和Kimi K3,用于通用任务。 |
| Top-1 concordance | AI或医生的首选诊断与标准诊断一致的比例,衡量诊断准确性。 |
| primary-or-reference-differential concordance | 诊断与主要或参考鉴别诊断一致的比例,反映诊断的全面性。 |
| adaptive information gathering | 在咨询中根据患者反应动态收集额外信息的过程,模拟真实临床交互。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅