🔥 今日值得一读 谷歌Gemini 2.0炸场!性能超1.5 Pro,原生生成音频图像,Agent时代来了!
Gemini 2.0发布!主打Agent+多模态,性能超1.5 Pro、可直接生成音频、图片
极客公园 🔥 重点 多模态Agent谷歌 🕐 今天 21:15

📖 AI 总结

谷歌发布Gemini 2.0 Flash,成为首个实现原生多模态输入与输出的模型。该模型性能超越1.5 Pro,速度提升至两倍,支持直接生成图像、多语言文本转语音音频,并可原生调用Google搜索、代码执行等工具,通过单一API调用即可生成文本、音频和图像的集成响应。同步推出四款产品:通用助手Project Astra实现更低延迟、更强记忆力和多语言对话能力;浏览器Agent Project Mariner在WebVoyager基准测试中达83.5%完成率;AI代码助手Jules在SWE-bench Verified测试中通过率51.8%,超过Claude 3.5。谷歌CEO皮查伊将Agent定义为能提前多步思考并代表用户行动的模型,Gemini 2.0的工具调用能力为Agent发展奠定基础,标志着原生多模态输入输出的大模型时代正式到来。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅