本文介绍了第八届LSVOS挑战赛MUMU赛道的获胜方案EUMU(高效统一多模态理解)。该赛道要求单一高效模型同时完成多概念图像标注、开放词汇目标检测和图像描述三项任务。EUMU基于共享的预训练多模态模型,利用其提示能力处理检测与描述任务,并在共享视觉特征上训练轻量级头部预测质量、场景和事件标签。其核心创新在于任务感知的推理优化:将各任务输出作为跨任务线索相互复用,例如用描述线索找回检测遗漏的目标,用检测线索优化描述内容,用图像统计和描述、检测线索分别改进质量与场景、事件预测。该模型仅含2.39亿参数,推理仅需23.947 GFLOPs和4.5 GB峰值内存,最终以17.3409分夺冠,验证了在资源受限条件下统一多任务建模的可行性。
| MUMU | 移动统一多模态理解挑战赛,要求单一模型同时完成图像标注、目标检测和图像描述三项任务。 |
| EUMU | 本文提出的高效统一多模态理解模型,是MUMU赛道的获胜方案,通过跨任务线索复用实现三任务统一。 |
| 开放词汇目标检测 | 一种目标检测设定,模型能够检测训练时未出现过的类别,依赖文本提示或语义嵌入进行识别。 |
| 任务感知推理精炼 | EUMU的核心策略,将一项任务的输出作为另一项任务的线索,在推理阶段迭代优化各任务结果。 |
| GFLOPs | 十亿次浮点运算,衡量模型计算复杂度的指标,数值越低表示推理效率越高。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅