该研究探讨了视觉语言模型提示学习中提示矩阵是否存在过参数化问题。作者将CoOp中稠密的提示矩阵分解为两个低秩因子,使可训练参数量从md大幅降至r(m+d),并在固定token侧因子后进一步降至rd。在七个少样本基准和两种CLIP骨干网络上,低秩提示以更少参数达到或超过稠密CoOp的性能,在低样本基类到新类泛化上提升尤为明显。研究进一步发现,token侧因子无需学习,将其固定为高斯、正交、SVD导出甚至随机基,仅训练嵌入侧因子即可与完全可训练分解持平,且源域训练的基并不优于随机基。作者通过提示因子不对称性和局部更新空间维度差异解释了固定token基限制更小的原因,并给出收敛性保证。这表明在CLIP提示学习中,适应能力主要由嵌入侧系数承载,token基可直接固定。
| Prompt Learning | 提示学习,通过可学习的连续向量替代人工模板来适配预训练模型到下游任务。 |
| CLIP | 对比语言-图像预训练模型,联合学习图像和文本表示,用于零样本和少样本识别。 |
| CoOp | 上下文优化,一种提示学习方法,用可学习的连续上下文向量替代手写模板。 |
| Low-Rank Factorization | 低秩分解,将矩阵分解为两个低秩矩阵的乘积,以减少可训练参数数量。 |
| Base-to-New Generalization | 基类到新类泛化,模型在基类上训练后泛化到新类别的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅