该研究提出了一种无需监督微调即可训练多模态大语言模型(MLLM)高效使用缩放工具的新方法。传统方法依赖大量标注数据进行预热监督微调,而该研究引入基于InfoNCE风格的对比课程奖励,通过逐步增加难度的负样本工具调用作为对比信号,实现内在奖励驱动的学习。在V*、HRBench和MME-RealWorld基准上的实验表明,该方法在性能上与现有方法相当且效率更高,作为监督微调的替代方案时甚至超越所有基线。为直接评估缩放能力,作者构建了可扩展的合成数据集Muffin&Chihuahua(M&C),其中图像由网格组成,每格显示松饼或吉娃娃图像。利用该数据集独特的感兴趣区域标签,研究发现召回率是衡量缩放区域与最终任务性能相关性的最强指标。模型和代码已公开。
| MLLMs | 多模态大语言模型,能够处理文本和图像等多种模态信息。 |
| InfoNCE-style reward | 一种基于InfoNCE损失函数的奖励机制,用于对比学习中的正负样本区分。 |
| Curriculum learning | 课程学习,一种训练策略,从简单样本逐步过渡到困难样本。 |
| SFT | 监督微调,使用标注数据对预训练模型进行进一步训练。 |
| Zoom-in tool | 缩放工具,允许模型聚焦于图像的高分辨率区域以提升任务性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅