🔥 今日值得一读 阿里通义千问发布全双工语音模型,背景语音误回率从73%暴降至13%!
Alibaba Qwen Releases Qwen-Audio-3.1-Realtime: A Full-Duplex Voice Model Trained to Think, Act, and Decide When to Speak
MarkTechPost 🔥 重点 多模态大模型Agent 🕐 今天 12:58

📖 AI 总结

阿里巴巴通义千问团队发布了Qwen-Audio-3.1音频模型系列,包含5个模型,覆盖语音识别、语音合成和实时交互。核心模型Qwen-Audio-3.1-Realtime是一款全双工语音模型,专为可调用工具的语音智能体设计,能够自主判断何时倾听、说话、停止或恢复。该模型通过托管API在QwenCloud上线,支持262K上下文窗口,具备函数调用、网络搜索和结构化输出等功能。与此同时,Qwen大幅下调价格,实时模型降价约85%,语音合成降价约70%,语音识别最高降价95%。架构上,系统由全双工决策模型和语音转文本模型协同工作,再通过上下文感知的语音渲染器生成流式语音。训练分为思考、行动、说话与协调三个层次,采用在线策略蒸馏而非模仿预设答案。此举标志着实时语音交互模型在功能完整性和成本可及性上的重要推进。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅