该论文提出Video-FLAIR训练框架,旨在解决多模态推理中“一刀切”策略导致的效率与效果失衡问题。核心观点是不同查询需要匹配不同推理模式:简单任务依赖感知推理直接提取信息,复杂任务则需组合推理或深思熟虑的评估推理。该框架利用强化学习,让模型在同一提示下生成三种模式的回答,并通过综合奖励(正确性、依据性和成本)选出最优响应,从而无需逐条标注即可学习自适应推理策略。实验显示,Video-FLAIR在MathVista、Video-Holmes和Video-MMMU基准上分别比Qwen2.5-VL基础模型提升+5.4、+4.8和+4.8的准确率,同时将平均token使用量从417降至95,显著降低计算开销。该研究为多模态推理的按需分配提供了可行方案,兼顾了性能与效率。
| Video-FLAIR | 一种训练框架,通过强化学习为每个查询选择适当的推理模式。 |
| perceptual reasoning | 感知推理,直接从视觉信号中提取信息来回答问题。 |
| compositional reasoning | 组合推理,结合多个观察结果来推导答案。 |
| deliberative reasoning | 深思熟虑的推理,评估相互竞争的假设以得出结论。 |
| reinforcement learning | 强化学习,一种通过奖励信号训练模型做出决策的机器学习方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅