🔥 今日值得一读 阿里通义千问甩出5款音频模型,AI语音价格最高暴降95%!
Alibaba launches Qwen Audio 3.1 with new models and slashes AI audio prices by up to 95 percent
The Decoder 🔥 重点 多模态大模型商业化 🕐 今天 20:31

📖 AI 总结

阿里巴巴通义千问团队发布Qwen-Audio-3.1,推出五款覆盖语音识别、文本转语音和实时交互的模型。其中ASR模型提升了多语言与方言识别能力,可自动清理冗余词句;ASR-Next新增多说话人识别、时间戳标注,并能检测情绪、环境音和机器噪声。TTS支持多语言合成与自然的跨语言音色迁移,用户可通过文本提示控制情感、语速和风格;TTS-Next结合语言模型与扩散方法,一次生成语音、音效和背景音频。实时模型支持边说边听与即时打断,并能根据用户情绪调整回应方式。与此同时,阿里大幅下调价格,TTS降价约70%,实时模型约85%,ASR最高达95%。此次发布在提升音频AI功能的同时显著降低了使用门槛。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅