Google为Gemini Flash系列模型推出了基于智能代理的视频分析功能,取代了原先固定帧率的逐帧扫描方式。该模型能自主决定分析视频的哪些片段、以何种速度和模态(帧、音频或转录文本)进行处理,仅提取任务所需的时刻和信号。在1H-VideoQA和LVBench基准测试中,这一方法将token使用量降低了88%,成本减少66%,同时准确率略有提升。新模型还能捕捉短于一秒的瞬间变化,如状态切换或剪辑点,并能在数小时视频中定位特定场景、识别异常和统计重复动作。该功能现已通过Gemini API提供,用于长视频中的场景检索,未来计划集成到Gemini应用和YouTube中。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅