ElevenLabs 发布新一代语音模型 Eleven v4,核心改进在于更精准地执行脚本中的情感、停顿与音效指令,并在长篇内容中保持音色一致。该模型支持超过 90 种语言,单次请求可处理约一万字符(约十分钟音频),语音克隆能力增强,专业克隆功能在 v3 停用后重新上线,即时克隆仅需十秒音频。v4 采用新架构分析脚本的语气、节奏与上下文,对话场景中 AI 能依据整段情境而非孤立台词作出回应。同步推出的 Turbo 版本面向实时语音代理,约 150 毫秒即可开始发声,据称快于 Cartesia 和 OpenAI 的同类方案。此次更新意味着 AI 语音在表现力、跨语言自然度与实时响应上进一步逼近实用化门槛。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅