本文通过医学图像对齐评估任务,检验前沿多模态大语言模型是否具备通用视觉推理能力。研究设置两项典型对齐任务,系统变化提示策略与图像呈现方式,并将前沿模型与本地微调模型及任务专用CNN进行对比。结果显示,该领域正迎来转折点:数月前发布的模型泛化能力差,部分场景仅略高于随机水平,而GPT-6在几乎所有测试场景中准确率超过85%。本地微调模型在其训练任务上可媲美甚至超越前沿模型,但迁移到未见场景时效果明显下降。研究表明,医学图像对齐可作为检验通用视觉推理的有效测试平台,前沿多模态模型正初步具备支撑异构医学影像流程统一质控的潜力。
| Multimodal Large Language Models (MLLMs) | 多模态大语言模型,能够同时处理文本和图像等多种模态输入的大型语言模型。 |
| Medical Image Alignment Assessment | 医学图像对齐评估,判断两幅医学图像之间是否存在解剖学对应关系的任务。 |
| Generalist Visual Reasoning | 通用视觉推理,指模型无需特定任务优化即可处理多种视觉判断任务的能力。 |
| Fine-tuned Local Models | 微调的本地模型,在特定任务数据上进一步训练并可在本地部署的模型。 |
| Task-specific CNN | 特定任务的卷积神经网络,针对某一具体任务设计和训练的卷积神经网络模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅