阿里巴巴通义千问团队发布了Qwen-Audio-3.1音频模型系列,包含5个模型,覆盖语音识别、语音合成和实时交互。核心模型Qwen-Audio-3.1-Realtime是一款全双工语音模型,专为可调用工具的语音智能体设计,能够自主判断何时倾听、说话、停止或恢复。该模型通过托管API在QwenCloud上线,支持262K上下文窗口,具备函数调用、网络搜索和结构化输出等功能。与此同时,Qwen大幅下调价格,实时模型降价约85%,语音合成降价约70%,语音识别最高降价95%。架构上,系统由全双工决策模型和语音转文本模型协同工作,再通过上下文感知的语音渲染器生成流式语音。训练分为思考、行动、说话与协调三个层次,采用在线策略蒸馏而非模仿预设答案。此举标志着实时语音交互模型在功能完整性和成本可及性上的重要推进。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅