LoopVL 是一项探索循环 Transformer 能否有效扩展到视觉语言模型的研究。该模型结合模块循环与模型循环两种计算方式,通过共享模块迭代更新统一的视觉语言状态,并从头经历语言预训练、多模态训练和后训练三个阶段。在多项多模态理解与视觉推理基准上,LoopVL 的表现优于同等规模乃至更大规模的非循环模型。研究还观察到所谓“视觉顿悟时刻”现象,即模型在循环过程中视觉注意力出现显著转移。这项工作为循环式视觉语言建模提供了实证支持,也展示了共享参数如何在持续演化的视觉语言状态上支撑更深层的多模态计算。
| LoopVL | 本文提出的循环视觉-语言模型,通过共享模块迭代更新统一的多模态状态。 |
| Loop Transformers | 循环 Transformer,一种通过重复使用相同层或模块来增加计算深度的架构。 |
| Module-Loop | 模块循环,指在模型内部重复执行同一组模块的计算方式。 |
| Model-Loop | 模型循环,指将整个模型或其主要部分进行多次迭代的计算方式。 |
| Visual Aha Moments | 视觉顿悟时刻,指模型在循环过程中视觉注意力发生显著转变的现象。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅