谷歌发布Gemini 2.0 Flash,成为首个实现原生多模态输入与输出的模型。该模型性能超越1.5 Pro,速度提升至两倍,支持直接生成图像、多语言文本转语音音频,并可原生调用Google搜索、代码执行等工具,通过单一API调用即可生成文本、音频和图像的集成响应。同步推出四款产品:通用助手Project Astra实现更低延迟、更强记忆力和多语言对话能力;浏览器Agent Project Mariner在WebVoyager基准测试中达83.5%完成率;AI代码助手Jules在SWE-bench Verified测试中通过率51.8%,超过Claude 3.5。谷歌CEO皮查伊将Agent定义为能提前多步思考并代表用户行动的模型,Gemini 2.0的工具调用能力为Agent发展奠定基础,标志着原生多模态输入输出的大模型时代正式到来。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅