本文提出SLVR(结构化潜在视觉推理)训练框架,旨在解决多模态大语言模型在视觉推理中过度依赖语言先验、忽视图像证据的问题。现有文本思维链方法虽能引导模型分解问题,但自回归生成推理步骤会显著增加推理成本;而潜在推理虽避免了显式生成,却难以对中间状态施加规划、定位、证据选择等分阶段监督。SLVR通过将推理过程组织为规划、定位、证据选择和推理整合等类型化潜在阶段,并分别以计划、边界框、视觉证据和最终理由进行监督,从而在推理时无需生成文本链即可获得结构化推理能力。基于Qwen2.5-VL-7B构建的模型在多个多模态推理基准上取得一致提升,其中MMVP绝对提升9.4,BLINK Relation提升14.2,并在V*、MathVista和ChartQA上均有改善。该工作表明,结构化潜在监督可在不增加文本思维链解码开销的前提下提升细粒度视觉推理能力。
| Structured Latent Visual Reasoning (SLVR) | 一种训练框架,将多模态推理组织为类型化的潜在阶段,以结构化监督提升视觉推理能力。 |
| Multimodal Large Language Models (MLLMs) | 能够处理文本和图像等多种模态输入的大型语言模型,用于跨模态理解和推理。 |
| Chain-of-Thought (CoT) | 一种提示或训练方法,让模型逐步生成中间推理步骤,以提高复杂问题的解决能力。 |
| Latent Reasoning | 在模型的潜在空间中进行推理,不生成显式的文本推理步骤,从而降低推理成本。 |
| Visual Grounding | 将语言表达与图像中的具体区域或对象关联起来的过程,是视觉推理的关键步骤。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅