阿里巴巴通义千问团队发布Qwen-Audio-3.1,推出五款覆盖语音识别、文本转语音和实时交互的模型。其中ASR模型提升了多语言与方言识别能力,可自动清理冗余词句;ASR-Next新增多说话人识别、时间戳标注,并能检测情绪、环境音和机器噪声。TTS支持多语言合成与自然的跨语言音色迁移,用户可通过文本提示控制情感、语速和风格;TTS-Next结合语言模型与扩散方法,一次生成语音、音效和背景音频。实时模型支持边说边听与即时打断,并能根据用户情绪调整回应方式。与此同时,阿里大幅下调价格,TTS降价约70%,实时模型约85%,ASR最高达95%。此次发布在提升音频AI功能的同时显著降低了使用门槛。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅