🔥 今日值得一读 视觉信息引导采样器VIG-Sampler:图像描述基准平均提升19.3 CIDEr,解码步骤减半!
Visual Information-Guided Parallel Decoding for Diffusion Multimodal Large Language Models
arXiv CV (cs.CV) 🔥 重点 #多模态#推理优化#扩散模型 🕐 08-28 12:00
👨‍💼 主理人解读 · 为什么值得关注
利用视觉信息选择解码顺序,提升扩散多模态模型生成速度与质量。

📖 AI 总结

该论文提出了一种面向扩散多模态大语言模型(dMLLMs)的视觉信息引导并行解码方法。dMLLMs通过逐步解掩码生成输出,解码顺序直接影响生成质量,而现有策略或偏向高频词,或忽略输入图像信息。研究者设计了视觉信息引导采样器(VIG-Sampler),根据候选token对图像token的注意力程度进行优先级排序,并加入约束,惩罚与已选token图像注意力分布相似的候选,以提升解码子集的信息增益。实验覆盖7个图像描述和视觉问答基准,使用3个开源dMLLM模型,结果显示VIG-Sampler在描述任务上平均超越Info-Gain Sampler 19.3个CIDEr点,并在COCO Caption上以仅一半的解码步骤取得更优表现,验证了视觉信息对解码顺序优化的有效性。

🔑 关键词速览

Diffusion Multimodal Large Language Models (dMLLMs)一种结合扩散过程的多模态大语言模型,用于逐步生成多模态内容。
Visual Information-Guided Sampler (VIG-Sampler)一种采样器,根据标记对图像标记的注意力来优先选择解码标记,以增强信息增益。
Info-Gain Sampler一种基于信息增益的采样方法,用于选择对后续预测影响最大的标记。
CIDEr一种用于评估图像描述生成质量的指标,衡量生成描述与参考描述的一致性。
VQA视觉问答,一种多模态任务,要求模型根据图像回答自然语言问题。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅