谷歌发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,旨在解决语音 Agent 在调用工具时出现的“沉默等待”问题。Extended Thinking 支持后台异步推理与并行工具调用,可在执行任务的同时以语音反馈进度,避免对话中断;Gemini 3.8 Live 则侧重低延迟与规模化部署。两款模型均支持文字、图像、音频和视频输入,可识别 97 种语言,并具备实时视觉理解能力。在 Artificial Analysis 语音榜单中,Extended Thinking 的 High 配置综合指数达 82.6 分,Big Bench Audio 语音推理测试得分 97.7%。此次发布表明,语音 Agent 的竞争焦点正从“说得自然”转向在对话不中断的前提下理解现场、调用系统并完成任务。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅