🔥 今日值得一读 阶跃星辰发布StepAudio 3系列,一个模型搞定语音识别生成交互和音乐创作!
阶跃发布全新语音大模型 StepAudio 3系列:覆盖语音识别、生成、实时交互与音乐创作
InfoQ 中文 🔥 重点 大模型多模态语音 🕐 09-17 23:50

📖 AI 总结

阶跃于9月15日发布StepAudio 3系列语音大模型,一次性推出Realtime、ASR、TTS、Gen和Music五款模型,覆盖实时交互、语音识别、语音生成与音乐创作。其核心突破在于将语音理解、实时推理、任务执行与音频创作整合为全栈能力,而非局限于单项识别或生成。Realtime模型支持原生全双工对话,可判断回应与等待时机、处理打断,并实现推理与生成并行及异步Tool Call,在Artificial Analysis Conversational Dynamics和Speech Reasoning两项榜单均位列全球第一,综合得分98.9%。ASR模型词错误率为1.7%,并列全球第一。TTS支持副语言表现与流式生成,Gen可一次生成包含人声、音效与环境声的完整音频,Music则支持多轮交互创作。五款模型均已上线开放平台,标志着语音大模型竞争从单项能力转向全栈融合。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅