阶跃于9月15日发布StepAudio 3系列语音大模型,一次性推出Realtime、ASR、TTS、Gen和Music五款模型,覆盖实时交互、语音识别、语音生成与音乐创作。其核心突破在于将语音理解、实时推理、任务执行与音频创作整合为全栈能力,而非局限于单项识别或生成。Realtime模型支持原生全双工对话,可判断回应与等待时机、处理打断,并实现推理与生成并行及异步Tool Call,在Artificial Analysis Conversational Dynamics和Speech Reasoning两项榜单均位列全球第一,综合得分98.9%。ASR模型词错误率为1.7%,并列全球第一。TTS支持副语言表现与流式生成,Gen可一次生成包含人声、音效与环境声的完整音频,Music则支持多轮交互创作。五款模型均已上线开放平台,标志着语音大模型竞争从单项能力转向全栈融合。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅