Google DeepMind 发布了两款面向开发者的音频模型 Gemini 3.8 Live 与 3.8 Live Extended Thinking,可通过 Gemini API 和 Google AI Studio 使用。前者支持语音代理在通话同时进行后台 API 调用和视觉输入处理,覆盖超过 97 种语言;后者在 Artificial Analysis 语音到语音排行榜上以 82.6% 的成绩位列第一,领先 OpenAI 最新的 GPT-Live-1。价格方面,Google 音频输入每分钟 0.005 美元、输出 0.018 美元,一小时语音对话约 1.38 美元,而 OpenAI 为每分钟 0.05 美元、至少 3.00 美元。不过,OpenAI 模型凭借全双工能力可实现更自然的对话,演示音质也更佳,显示 Google 此次仍以价格优势而非质量领先为策略重点。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅