该论文提出ReImaGin方法,将图像生成模型作为多模态大语言模型的灵活视觉推理机制。研究指出,思维链推理虽在自然语言处理中成效显著,但纯文本推理难以胜任需要直接操作视觉表征的任务;现有借助深度估计、目标检测等外部视觉专家工具的方案,受限于操作狭窄僵化,无法灵活生成或变换视觉内容。ReImaGin则利用图像生成模型接受自然语言指令、执行开放式视觉操作的能力,例如去除遮挡或根据房间的多个不连贯视角生成平面图。在涵盖多视角空间推理与碰撞预测等六项视觉推理任务中,该方法持续优于纯文本推理和专用视觉工具基线,性能提升最高达25%,验证了灵活生成式视觉推理的优势。
| Chain-of-thought reasoning | 思维链推理,一种让模型在给出最终答案前逐步生成中间推理步骤的技术。 |
| Multimodal LLMs | 多模态大语言模型,能够同时处理文本、图像等多种模态输入的大型语言模型。 |
| ReImaGin | 本文提出的方法,利用图像生成模型作为多模态LLM的灵活视觉推理机制。 |
| Visual reasoning | 视觉推理,指对视觉信息进行理解、分析和操作以解决任务的能力。 |
| Multi-view spatial reasoning | 多视图空间推理,基于多个视角的图像理解物体间空间关系的任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅