🔥 今日值得一读 视频理解革命!Gemini视频令牌狂砍88%,只加载需要的片段!
Google Launches Agentic Video Understanding for Gemini Flash Models, Cutting Video Tokens by Up to 88%
MarkTechPost 🔥 重点 多模态视频理解Gemini 🕐 09-05 12:37

📖 AI 总结

谷歌近期为Gemini Flash系列模型推出了智能体视频理解功能,旨在解决视频作为高成本模态的推理难题。传统静态处理以固定每秒一帧的方式摄取整个视频,导致在上下文长度与细节保留间难以平衡。新功能让模型自主导航视频,按需决定观看内容、帧率及模态,仅加载提示所需片段。谷歌数据显示,该方案可减少高达88%的视频令牌消耗,成本降低66%,并在标准视频基准上准确率提升7%。该功能通过Gemini API托管提供,支持文件上传与YouTube链接,按标准令牌计费,无额外费用。其核心改进在于模型内部运行推理与工具调用循环,而非开发者手动组装,尤其对长视频分析效果显著,使Gemini 3.7 Flash在成本与精度上达到更优平衡。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅