轻量探测框架MedProb让冻结VLM逆袭医学问答,性能超微调大模型!
MedProb: Probing Internal Representations of Vision-Language Models for Medical Question Answering
arXiv CL (cs.CL) 重要 多模态医疗VQA 🕐 09-07 12:00

📖 AI 总结

该研究提出MedProb,一种轻量级探测框架,用于从冻结的视觉-语言模型内部表征中直接预测医学视觉问答的答案,无需文本生成或医学微调。在PATH-VQA、SLAKE和VQA-RAD三个基准上,MedProb提取到的答案相关信息显著多于提示方法,且表现优于医学专用视觉语言模型和智能体系统。研究发现,探测方式缩小了小模型与大模型之间的性能差距,表明小型模型中包含的可恢复医学问答信号比基于生成的评估所显示的更多。此外,在14对通用与医学视觉语言模型的对比中,医学适应并未持续提升线性可解码性。研究还发现自由文本生成存在高达10个百分点的答案位置偏差,而MedProb虽也有位置偏差,但影响方式不同。该方法可扩展至开放式生成场景。

🔑 关键词速览

Med-VQA医学视觉问答,指根据医学图像回答相关问题的任务。
Probing探测,一种通过训练轻量级分类器来评估预训练模型内部表示中信息可获取性的方法。
Vision-Language Models (VLMs)视觉语言模型,能够同时处理图像和文本信息的模型。
Prompting提示,通过设计输入提示来引导模型生成特定输出的方法。
Rejection-sampling scoring拒绝采样评分,一种通过多次采样并筛选有效结果来评估生成答案的方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅