该论文提出了一种面向扩散多模态大语言模型(dMLLMs)的视觉信息引导并行解码方法。dMLLMs通过逐步解掩码生成输出,解码顺序直接影响生成质量,而现有策略或偏向高频词,或忽略输入图像信息。研究者设计了视觉信息引导采样器(VIG-Sampler),根据候选token对图像token的注意力程度进行优先级排序,并加入约束,惩罚与已选token图像注意力分布相似的候选,以提升解码子集的信息增益。实验覆盖7个图像描述和视觉问答基准,使用3个开源dMLLM模型,结果显示VIG-Sampler在描述任务上平均超越Info-Gain Sampler 19.3个CIDEr点,并在COCO Caption上以仅一半的解码步骤取得更优表现,验证了视觉信息对解码顺序优化的有效性。
| Diffusion Multimodal Large Language Models (dMLLMs) | 一种结合扩散过程的多模态大语言模型,用于逐步生成多模态内容。 |
| Visual Information-Guided Sampler (VIG-Sampler) | 一种采样器,根据标记对图像标记的注意力来优先选择解码标记,以增强信息增益。 |
| Info-Gain Sampler | 一种基于信息增益的采样方法,用于选择对后续预测影响最大的标记。 |
| CIDEr | 一种用于评估图像描述生成质量的指标,衡量生成描述与参考描述的一致性。 |
| VQA | 视觉问答,一种多模态任务,要求模型根据图像回答自然语言问题。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅