该研究关注医学视觉语言模型在临床转诊场景中的评估问题。由于模型仅提出建议,最终决策权归本地服务,因此“建议质量”与“实际执行质量”是两个不同的评估目标,基准证据只有在本地审核保留预期行动得分时才能相互迁移。作者提出AuthEval框架,同时记录建议行动与被选行动,在声明标准下分别评分,并在记录支持时报告“权威差距”。研究指出,该差距等于建议变更率与变更案例平均得分变化的乘积,因此变更率本身无法决定差距的大小或方向。在ISIC 2019数据集上,使用MedGemma与模拟本地审核,两种约束机制在变更率相近的情况下,容量约束下出现乐观差距(+0.744),而安全约束下未检测到显著差距;评估单元的选择同样关键,混合约束下权重从图像转向病灶感知聚类时,差距由+0.374反转为-0.206。该工作有助于厘清研究记录究竟支持关于模型、工作流还是两者的结论。
| AuthEval | 一种日志记录与评估框架,用于记录医学视觉语言模型提议的行动和本地审查后选择的行动,并评估两者之间的权威差距。 |
| Authority gap | 本地审查选择的行动与模型提议的行动在评分上的差异,反映本地权威对模型提议的修改程度。 |
| Proposal-change rate | 本地审查改变模型提议行动的案例比例,是计算权威差距的一个因子。 |
| MedGemma | 一种医学视觉语言模型,用于在实验中生成皮肤病变审查紧急程度的提议。 |
| ISIC 2019 | 一个皮肤病变图像数据集,常用于医学图像分类和评估研究。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅