Google通过云平台发布了两款新的文本转语音模型Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。两款模型API高度相似,便于开发者并行使用。Flash-Lite TTS侧重成本效率和推理速度,Flash TTS则以更高价格提供更优音质,适用于有声书等场景。两者分别支持130种和101种语言,均提供超过2000种预设语音,并支持通过自然语言提示定制音色、口音和语速,还可基于30秒音频样本生成合成语音。Google采用SynthID音频水印和C2PA记录确保内容可追溯。在Hume AI的音频质量基准测试中,两款模型分列第一和第二,并在Voice Arena多语言版本中超越多个竞品。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅