首个兽医病理学基准VIPER:16模型实测,前沿AI竟误诊正常组织!
VIPER: An Expert-Curated Benchmark for Vision-Language Models in Veterinary Pathology
arXiv CV (cs.CV) 重要 #评测基准#医疗AI#多模态 🕐 08-28 12:00

📖 AI 总结

本文介绍了VIPER,这是首个由专家精心构建的、用于评估病理学视觉语言模型在毒理学病理学领域表现的基准数据集。该研究填补了现有基准主要聚焦于人类组织(尤其是肿瘤学)而忽视非人类病理学的空白。VIPER包含1,251个问题,对应419张H&E染色的大鼠组织学图像,覆盖七个器官系统,并采用选择题、KPrim和自由文本等多种格式。所有问题均由经认证的兽医病理学家策划和验证。研究团队对16个模型进行了基准测试,包括两个新引入的兽医病理学专用模型、七个人类病理学专用模型和七个通用前沿模型。结果显示,兽医病理学与人类病理学之间存在显著的领域差距,前沿模型存在对正常组织过度诊断的风险,且领域特定训练对于视觉基础预测至关重要。该基准的数据和评估代码已公开,为未来相关研究提供了重要资源。

🔑 关键词速览

VIPER一个由专家策划的基准测试,用于评估视觉语言模型在毒理学病理学中的表现。
Vision-Language Models能够同时处理图像和文本信息的模型,用于理解视觉内容与语言描述之间的关系。
Toxicologic Pathology研究药物或化学物质对实验动物组织影响的病理学分支,用于评估安全性。
H&E-stained苏木精-伊红染色,一种常用的组织学染色技术,用于显示细胞结构和形态。
KPrim一种问题格式,要求模型判断陈述是否正确,并给出理由。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅