StreamScout提出了一种面向流式视频理解的自适应推理框架,核心观点是:对于每个查询,决定“多深入地访问记忆”与“记忆存什么”同样重要。该框架在流式处理中仅维护轻量级文本时间线,查询时通过最多三级视觉增强逐步补充信息:近期帧快速浏览、历史均匀回看、以及查询相关的精准检索。模型在每级判断证据是否充分,不足则升级。研究通过辅助集蒸馏和强化学习两种方式优化“停止或升级”策略,分别得到StreamScout-S和StreamScout-R。在三个基准和三种骨干网络上,该方法均优于现有流式方法,同时显著降低推理成本和token消耗。例如在OVO-Bench上,StreamScout-S使Qwen3-VL-8B提升14.65分,token使用比均匀采样少59%,平均响应时间仅1.04秒。
| StreamScout | 一种自适应推理框架,用于流式视频理解,通过逐步增加视觉信息深度来平衡准确性和效率。 |
| LoRA | 低秩适应,一种轻量级模型微调技术,通过低秩矩阵更新参数以减少计算成本。 |
| Reinforcement Learning | 强化学习,一种通过与环境交互和奖励信号来优化决策策略的机器学习方法。 |
| Cascade | 级联,指多阶段处理流程,每个阶段根据证据充分性决定是否继续深入。 |
| Token Consumption | 令牌消耗,指模型处理文本时使用的令牌数量,是衡量推理成本的重要指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅