谷歌发布新一代语音模型Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking,旨在解决语音AI代理的延迟问题。两款模型支持近实时推理与边说边思考,并能在后台执行第三方工具调用,使用户在对话过程中无需等待代理完成任务。据谷歌公布的数据,Gemini 3.8 Live Extended Thinking在Artificial Analysis语音质量指数上取得82.6分的新高,超过GPT-Live-1-Astra和Grok Voice Think Fast 2.0;Gemini 3.8 Live则在ServiceNow的EVA-Bench上排名第一。新模型支持97种语言的自动检测与中途切换,具备近实时视觉定位能力,并能用“让我查一下”等自然语言提示回应用户。目前两款模型已通过Gemini API和Google AI Studio开放,企业版同步进入私有预览。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅