🔥 今日值得一读 150毫秒开口!ElevenLabs v4语音模型碾压谷歌Gemini
ElevenLabs' new v4 speech model makes AI voices more expressive and consistent
The Decoder 🔥 重点 语音Agent商业化 🕐 09-29 22:45

📖 AI 总结

ElevenLabs 发布新一代语音模型 Eleven v4,核心改进在于更精准地执行脚本中的情感、停顿与音效指令,并在长篇内容中保持音色一致。该模型支持超过 90 种语言,单次请求可处理约一万字符(约十分钟音频),语音克隆能力增强,专业克隆功能在 v3 停用后重新上线,即时克隆仅需十秒音频。v4 采用新架构分析脚本的语气、节奏与上下文,对话场景中 AI 能依据整段情境而非孤立台词作出回应。同步推出的 Turbo 版本面向实时语音代理,约 150 毫秒即可开始发声,据称快于 Cartesia 和 OpenAI 的同类方案。此次更新意味着 AI 语音在表现力、跨语言自然度与实时响应上进一步逼近实用化门槛。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅