Gradium AI发布了新的默认文本转语音(TTS)模型,并已在其API和Studio中全面启用。该模型在500句高难度测试集上取得了81.0%的人工评分通过率,涵盖五种语言,显著领先于Cartesia Sonic 3.6(75.1%)和ElevenLabs v3 Conversational(65.4%)。测试集已开源,包含10项标准,重点考察拼写、数字、日期、邮箱等关键信息的准确发音,评分标准极为严格,任何遗漏即判失败。在延迟方面,该模型的首音频时间中位数为216毫秒,较旧模型快170毫秒,且性能波动极小,稳定性优于竞品。该模型已于2026年8月31日默认上线,现有声音和自定义克隆无需迁移即可继续使用,实现了即时部署。这一发布提升了语音代理在订单号、回拨号码等关键信息传递上的可靠性,对语音AI的实际应用具有重要意义。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅