多模态大语言模型在长序列视觉-语言推理任务中常因丢失早期视觉证据和中间约束而导致性能下降。针对这一问题,该研究提出了一种参数高效的机制DLMR,受人类分别回忆所见与所推过程的启发,为模型配备双潜记忆:视觉记忆用于压缩图像证据,推理记忆用于追踪中间结论与约束。路由模块在推理时动态决定调用何种记忆及其程度,从而在保持视觉锚定的同时实现连贯的长程推理。DLMR采用三阶段训练,从潜记忆构建到选择性路由学习,全程冻结基础模型,仅引入少量可训练参数,即在通用与推理基准上取得显著提升。分析显示,该机制具备可解释的状态依赖路由行为,记忆角色分工明确,并减少了长序列生成中的解码令牌数量。该成果已被ICML 2026接收为Spotlight论文。
| DLMR | 双潜在记忆路由,一种为多模态大语言模型设计的参数高效机制,通过视觉记忆和推理记忆增强长程推理能力。 |
| Multimodal large language models (MLLMs) | 多模态大语言模型,能够处理和推理文本与图像等多种模态信息的模型。 |
| Dual Latent Memories | 双潜在记忆,包括压缩图像证据的视觉记忆和跟踪中间结论与约束的推理记忆。 |
| Router | 路由器,一种动态决策机制,在推理时决定使用哪种记忆及其复用程度。 |
| Parameter-efficient | 参数高效,指仅增加少量可训练参数就能实现性能提升的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅