该研究针对图像-元数据预测中多模态证据可靠性随样本和潜在因子变化的问题,提出RiVaT-Fuse框架。现有表示级融合方法通常直接选择拼接、门控、条件调制或注意力等聚合架构,却未明确定义模态不确定性下融合表示应具有的含义。RiVaT-Fuse将融合重新定义为逐样本的潜在状态估计,通过变分目标在图像证据、元数据证据、结构化跨模态交互与稳定性之间取得平衡,从而估计共识潜在状态。该框架以矩阵值信任几何替代标量模态置信度,将交互分解为加性、乘性和关系性成分,并将潜在状态与条件鲁棒性及结构化多任务预测相耦合。作者给出了潜在求解的适定性与稳定性解释,并采用高效的低秩加对角信任算子实现。在图像级图像-元数据预测基准上,RiVaT-Fuse在直接表示级基线中取得最佳整体预测排名,同时在扰动下提升了概率与标签稳定性。
| RiVaT-Fuse | 一种可靠性校准的变分张量融合框架,用于在模态不确定性下进行多模态预测。 |
| 变分张量融合 | 将融合视为样本级潜在状态估计,通过变分目标平衡多源证据和交互。 |
| 模态不确定性 | 指不同模态(如图像和元数据)的证据可靠性因样本和潜在因子而变化的情况。 |
| 信任几何 | 用矩阵值表示模态置信度,取代传统的标量置信度,以捕捉更复杂的可靠性结构。 |
| 低秩加对角信任算子 | 一种高效的计算方法,将信任矩阵分解为低秩部分和对角部分,用于实例化融合框架。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅