谷歌近期为Gemini Flash系列模型推出了智能体视频理解功能,旨在解决视频作为高成本模态的推理难题。传统静态处理以固定每秒一帧的方式摄取整个视频,导致在上下文长度与细节保留间难以平衡。新功能让模型自主导航视频,按需决定观看内容、帧率及模态,仅加载提示所需片段。谷歌数据显示,该方案可减少高达88%的视频令牌消耗,成本降低66%,并在标准视频基准上准确率提升7%。该功能通过Gemini API托管提供,支持文件上传与YouTube链接,按标准令牌计费,无额外费用。其核心改进在于模型内部运行推理与工具调用循环,而非开发者手动组装,尤其对长视频分析效果显著,使Gemini 3.7 Flash在成本与精度上达到更优平衡。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅