谷歌发布两款屠榜语音模型,开发者可无缝并用!
Google launches two benchmark-topping speech generation models
SiliconANGLE 重要 多模态大模型商业化 🕐 今天 08:22

📖 AI 总结

Google通过云平台发布了两款新的文本转语音模型Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。两款模型API高度相似,便于开发者并行使用。Flash-Lite TTS侧重成本效率和推理速度,Flash TTS则以更高价格提供更优音质,适用于有声书等场景。两者分别支持130种和101种语言,均提供超过2000种预设语音,并支持通过自然语言提示定制音色、口音和语速,还可基于30秒音频样本生成合成语音。Google采用SynthID音频水印和C2PA记录确保内容可追溯。在Hume AI的音频质量基准测试中,两款模型分列第一和第二,并在Voice Arena多语言版本中超越多个竞品。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅