🔥 今日值得一读 视频推理新突破:自适应选择推理模式,准确率最高提升5.4%,算力消耗暴降77%!
Video-FLAIR: Not Whether to Reason, But How
arXiv CV (cs.CV) 🔥 重点 #视频理解#推理优化#训练方法 🕐 08-28 12:00
👨‍💼 主理人解读 · 为什么值得关注
根据查询复杂度动态选择推理方式,减少简单任务计算,提升复杂任务准确性。

📖 AI 总结

该论文提出Video-FLAIR训练框架,旨在解决多模态推理中“一刀切”策略导致的效率与效果失衡问题。核心观点是不同查询需要匹配不同推理模式:简单任务依赖感知推理直接提取信息,复杂任务则需组合推理或深思熟虑的评估推理。该框架利用强化学习,让模型在同一提示下生成三种模式的回答,并通过综合奖励(正确性、依据性和成本)选出最优响应,从而无需逐条标注即可学习自适应推理策略。实验显示,Video-FLAIR在MathVista、Video-Holmes和Video-MMMU基准上分别比Qwen2.5-VL基础模型提升+5.4、+4.8和+4.8的准确率,同时将平均token使用量从417降至95,显著降低计算开销。该研究为多模态推理的按需分配提供了可行方案,兼顾了性能与效率。

🔑 关键词速览

Video-FLAIR一种训练框架,通过强化学习为每个查询选择适当的推理模式。
perceptual reasoning感知推理,直接从视觉信号中提取信息来回答问题。
compositional reasoning组合推理,结合多个观察结果来推导答案。
deliberative reasoning深思熟虑的推理,评估相互竞争的假设以得出结论。
reinforcement learning强化学习,一种通过奖励信号训练模型做出决策的机器学习方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅