本文针对生成式视觉语言模型(如Qwen-VL、LLaVA)在远域分布外(distant OOD)场景下的适应问题展开研究。作者指出,这类模型虽在预训练分布内表现优异,但在缺乏判别性特征的专门领域(如医学影像)中会失效,而传统适应方法因受限于编码器既有特征空间而难以奏效。研究的关键发现是:即便判别能力崩溃,VLM仍保留稳健的描述能力,能够用语言刻画无法分类的视觉模式。基于这一不对称性,作者提出免训练的归纳视觉逻辑(IVL)框架,通过双模式提示从少量支持图像中提取语义描述与基础视觉观察,构建按类别组织的特征词典,并在推理阶段以分层过滤定位空间化的特征证据完成分类。在多个远域OOD基准上,IVL在两种VLM骨干下均取得最高综合准确率,且预测具备可解释、可追溯的特征依据。该工作为VLM在专业领域的少样本适应提供了新思路。
| 远距离分布外(Distant OOD) | 指测试数据与预训练数据分布差异极大,模型从未学习到所需判别特征的场景。 |
| 归纳视觉逻辑(IVL) | 一种无需训练的框架,利用视觉语言模型残存的描述能力构建分类知识。 |
| 双模式提示(Dual-mode Prompting) | 同时使用语义描述和原始视觉观察两种提示方式提取图像特征的方法。 |
| 特征词典(Trait Dictionary) | 按类别组织的特征集合,用于存储从支持图像中提取的视觉特征。 |
| 分层过滤(Hierarchical Filtering) | 推理阶段逐步筛选空间接地的特征证据以进行分类的机制。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅