该研究针对现有多模态融合模型只能处理预设模态组合和单一任务的局限,提出构建通用多模态基础模型的设想。作者认为,统一的融合模型不应依赖特定模态,而应学习可迁移的多模态关联模式。为此,他们设计了一种基于大规模合成多模态数据集的学习范式,通过生成具有多样因果结构的数据来刻画真实世界多模态数据的生成过程,并据此训练出通用多模态基础模型。该模型在训练中编码可迁移的模态关联,在推理时借助上下文示例激活相应关联。在涵盖12种模态、11类预测任务的18个真实数据集上,模型无需任务特定适配即可达到与专用模型相当的性能,为通用多模态学习提供了可行路径。
| 多模态融合模型 | 将来自不同模态(如视觉、文本、音频)的数据整合在一起进行预测的模型。 |
| 广义多模态基础模型 | 一种统一的基础模型,旨在处理任意模态组合和任意预测任务,无需针对特定任务进行适配。 |
| 合成多模态数据集 | 通过人工生成的大规模多模态数据,具有多样化的因果结构,用于模拟现实世界的数据生成过程。 |
| 可迁移的多模态关联 | 在不同模态之间普遍存在的、可跨任务和模态组合迁移的关联模式。 |
| 上下文示例 | 在推理阶段提供的少量示例,用于激活模型内部与当前任务相关的关联模式。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅