🔥 今日值得一读 谷歌新AI语音模型来了!100+语言,打字就能从零造声音!
Google's new Flash TTS models let you design AI voices from scratch using text descriptions
The Decoder 🔥 重点 多模态大模型 🕐 今天 01:39

📖 AI 总结

Google发布两款新型文本转语音模型Gemini 3.8 Flash TTS和Flash-Lite TTS,支持超过100种语言。Flash TTS可通过文本描述从零设计语音,定义角色、口音和声音特征,并提供2000多种预设语音;其语音克隆功能仅需30秒音频样本即可构建语音档案,但需录制同意声明,且所有生成音频均嵌入SynthID水印以标识AI生成内容。Flash-Lite TTS则面向配音、音频内容和语音代理等大规模低成本场景。两款模型均支持逐行舞台指示、双人对话及笑声、叹息等非语言声音,并能长时间生成音频而保持音色稳定。模型正通过Gemini API和Google AI Studio推出,企业版API随后跟进。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅