Cartesia发布了流式文本转语音模型Sonic-3.6,该模型基于状态空间模型而非Transformer架构,在Artificial Analysis语音排行榜上双双登顶,分别以1,283 Elo和1,123 Elo的成绩位居Provider Voice和Controlled Voice榜首。后者通过将各模型统一到相同参考音色上,以隔离评测合成引擎性能。Sonic-3.6实现了低于90毫秒的首音频延迟,目前已在Cartesia自有API上提供测试版本。这一进展表明,状态空间模型在语音合成领域具备超越传统Transformer架构的潜力,尤其在实时交互场景中具有显著优势。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅