该研究提出Lumen,一种通过参数高效对齐构建病理视觉-语言模型的方案。其核心思路是不再预训练或微调大型编码器,而是冻结Virchow2与BioMedBERT两个单模态基础模型,仅用秩为4的适配器和投影头进行对齐,在QUILT-1M语料上仅训练总参数的0.40%。在九个公开零样本图像块基准上,Lumen取得最高的平均机会校正平衡准确率0.546,显著优于最强基线0.461。在淋巴结转移检测任务中,内部4214张切片AUROC达0.964,九个外部队列2368张切片达0.955,校准阈值下内外平衡准确率分别为0.909和0.915,超越所有视觉-语言基线,仅在跨模态检索上排名第三。研究还发现全量微调两个编码器相比低秩适配并无一致收益。这表明对齐冻结的单模态基础模型即可在图像块和切片层面获得强且可迁移的性能,同时大幅降低训练参数量。
| Lumen | 本文提出的参数高效对齐方法,通过适配器对齐冻结的病理视觉和语言基础模型。 |
| Virchow2 | 一种用于病理图像分析的预训练视觉编码器基础模型。 |
| BioMedBERT | 一种在生物医学文本上预训练的语言模型,用作文本编码器。 |
| 零样本学习 | 模型在未见过的任务或类别上直接进行预测,无需额外训练样本。 |
| 低秩适应 | 一种参数高效微调技术,通过注入低秩矩阵来适应下游任务,仅训练少量参数。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅