视觉语言模型在多模态推理中表现优异,却常生成看似合理实则错误的答案。自我验证是提升答案可靠性、无需依赖外部评判者的实用手段,但现有方法多依赖单一验证标准或固定提示,导致可靠性评估不完整且不稳定。该研究系统分析了验证器能力与提示设计对验证性能的影响,发现更强的验证器能给出更可靠的判断,而验证性能对提示选择高度敏感,没有任何单一提示能在所有任务中持续占优。基于此,作者提出MOTIVE框架,从互补的验证视角评估候选答案,并通过基于正确性的多视角验证学习得到与正确性对齐的可靠性分数。推理时该分数驱动“接受或重思”决策:可靠答案直接返回,不确定的则触发历史引导的重思。在多种多模态基准和VLM骨干上的实验表明,MOTIVE持续优于强自我验证与自我纠错基线,并能减少不必要的推理轮次,实现更可靠高效的自我验证。
| MOTIVE | 本文提出的多视角自验证与可靠性引导选择性重思框架,用于提升视觉语言模型多模态推理的可靠性。 |
| Self-Verification | 模型对自身生成的答案进行验证,以判断其正确性,无需依赖外部评判者。 |
| Vision-Language Models (VLMs) | 能够同时处理视觉和语言信息的多模态模型,常用于图像描述、视觉问答等任务。 |
| Reliability Score | 通过多视角验证学习得到的、与答案正确性对齐的分数,用于决定接受答案还是触发重思。 |
| Accept-or-Rethink | 推理阶段的决策机制:若答案可靠性高则直接接受,否则触发历史引导的重思过程。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅