🔥 今日值得一读 谷歌Gemini视频分析革命性升级:省88%令牌,专治数小时长视频!
Google Gemini's new agent-based video analysis cuts token usage by up to 88 percent
The Decoder 🔥 重点 多模态Agent算力 🕐 09-02 16:21

📖 AI 总结

Google为Gemini Flash系列模型推出了基于智能代理的视频分析功能,取代了原先固定帧率的逐帧扫描方式。该模型能自主决定分析视频的哪些片段、以何种速度和模态(帧、音频或转录文本)进行处理,仅提取任务所需的时刻和信号。在1H-VideoQA和LVBench基准测试中,这一方法将token使用量降低了88%,成本减少66%,同时准确率略有提升。新模型还能捕捉短于一秒的瞬间变化,如状态切换或剪辑点,并能在数小时视频中定位特定场景、识别异常和统计重复动作。该功能现已通过Gemini API提供,用于长视频中的场景检索,未来计划集成到Gemini应用和YouTube中。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅