🔥 今日值得一读 MLLM新突破:逐token动态递归,训练内存和计算量大幅降低!
MoR-MLLM: Mixture of Recursions for Efficient Multimodal Large Language Models
arXiv CV (cs.CV) 🔥 重点 #多模态#推理优化#模型压缩 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
让多模态大模型按需计算,简单token少算、复杂token多算,降低部署成本。

📖 AI 总结

本文提出MoR-MLLM,一种面向多模态大语言模型的高效计算稀疏框架。针对现有轻量化模型因静态稀疏与固定深度分配而难以适应不同token语义复杂度的问题,该方法引入自适应逐token递归机制,使模型能够动态调整递归深度,将更多计算资源分配给视觉或语言上更具挑战性的token,同时跳过简单token的冗余运算。为稳定多模态场景下的递归稀疏训练,作者设计了三阶段MoR-Tuning策略及熵正则化损失,以促进路由分布的多样性。实验表明,与近期先进的轻量级多模态大模型相比,MoR-MLLM在保持多种视觉语言任务高性能的同时,显著降低了训练内存与计算复杂度,为多模态大模型的实际部署提供了更高效的路径。

🔑 关键词速览

MoR-MLLM一种基于递归混合框架的多模态大语言模型,通过自适应逐token递归实现计算稀疏,提升效率。
Mixture-of-Recursions (MoR)递归混合框架,允许模型根据输入动态调整递归深度,以分配计算资源。
per-token recursion逐token递归,指模型对每个token独立决定递归深度,从而自适应分配计算量。
MoR-Tuning一种三阶段训练策略,用于稳定多模态场景下递归稀疏性的训练。
entropy-regularized loss熵正则化损失,用于鼓励路由分布多样化,防止路由坍塌。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅