Google发布了Gemini Omni 1.1 Flash,这是其原生多模态视频生成与编辑模型的生产级更新。该版本的核心改进在于场景扩展能力:模型可读取长达10秒的先前视频上下文(此前仅参考最后一秒),支持以10秒为增量将片段扩展至累计40秒,并自动编辑输入片段的末尾帧以实现无缝衔接。此外,新版本支持首帧和末帧固定以控制镜头运动,草稿渲染为360p(成本仅为720p的三分之一),最终输出可升级至4K分辨率,并允许传入视频片段作为参考以保持角色一致性。Gemini Omni Flash具备原生多模态处理能力,可通过Interactions API进行有状态的对话式编辑,用户无需重新上传先前视频即可修改指定内容。该模型已通过Gemini API在Google AI Studio和Gemini Enterprise Agent Platform上线,Adobe、Figma Weave、GMI Cloud和Runway已宣布为生产用户。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅