Google发布两款新型文本转语音模型Gemini 3.8 Flash TTS和Flash-Lite TTS,支持超过100种语言。Flash TTS可通过文本描述从零设计语音,定义角色、口音和声音特征,并提供2000多种预设语音;其语音克隆功能仅需30秒音频样本即可构建语音档案,但需录制同意声明,且所有生成音频均嵌入SynthID水印以标识AI生成内容。Flash-Lite TTS则面向配音、音频内容和语音代理等大规模低成本场景。两款模型均支持逐行舞台指示、双人对话及笑声、叹息等非语言声音,并能长时间生成音频而保持音色稳定。模型正通过Gemini API和Google AI Studio推出,企业版API随后跟进。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅