该论文提出了一种名为CM-GLasso(跨模态图形套索)的新框架,旨在从多模态视觉-语言特征中估计可解释的条件依赖结构,填补了该领域的研究空白。CM-GLasso包含三个核心组件:通过文本可视化策略将类别属性描述渲染为图像,并利用SigLIP-2视觉编码器生成共享特征空间中的注意力足迹;采用跨注意力蒸馏机制将高维补丁压缩为语义图节点,其注意力足迹相似度形成非均匀L1惩罚的结构先验;以及联合ADMM优化公式,在单一凸目标中同时估计共享和类别特定的精度矩阵。实验表明,该方法在八个基准数据集上表现优异,在受控协议下平均分类准确率达91.97%,并在VOC和ADE20K数据集上分别取得74.75%和64.01%的最高分割mIoU,同时生成具有共性-特性分解的稀疏条件依赖图,为可解释多模态学习提供了新思路。
| CM-GLasso | 跨模态图形套索,一种结合视觉-语言表示学习与稀疏高斯图模型的框架,用于估计多模态特征的条件依赖结构。 |
| Cross-Modal Attention Priors | 跨模态注意力先验,通过跨模态注意力机制从视觉和语言特征中提取的结构性先验信息,用于指导图学习中的惩罚项。 |
| SigLIP-2 | 一种视觉编码器,用于处理图像和文本渲染图像,生成共享特征坐标系中的补丁级注意力足迹。 |
| ADMM | 交替方向乘子法,一种优化算法,用于在凸目标中联合估计共享和类别特定的精度矩阵分量。 |
| Sparse Gaussian Graphical Models | 稀疏高斯图模型,用于估计变量间条件依赖关系的统计模型,通过稀疏化精度矩阵来揭示图结构。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅