语音界新王!Sonic-3.6双榜登顶,90毫秒极速响应,性能直接拉满!
Cartesia Ships Sonic-3.6: A Streaming TTS Model That Now Leads Both Artificial Analysis Speech Arenas
MarkTechPost 重要 语音合成多模态商业化 🕐 08-18 18:37

📖 AI 总结

Cartesia发布了流式文本转语音模型Sonic-3.6,该模型基于状态空间模型而非Transformer架构,在Artificial Analysis语音排行榜上双双登顶,分别以1,283 Elo和1,123 Elo的成绩位居Provider Voice和Controlled Voice榜首。后者通过将各模型统一到相同参考音色上,以隔离评测合成引擎性能。Sonic-3.6实现了低于90毫秒的首音频延迟,目前已在Cartesia自有API上提供测试版本。这一进展表明,状态空间模型在语音合成领域具备超越传统Transformer架构的潜力,尤其在实时交互场景中具有显著优势。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅