阿里巴巴Qwen团队发布新一代实时同声传译模型Qwen3.8-LiveTranslate,可在说话人仍在讲话时同步输出翻译文本与语音,并支持可选的视频帧输入。该模型采用全新的Interleave架构,在忠实度、流畅度和简洁性上均有提升,平均滞后指标LAAL从2.8秒降至2.3秒,降幅约18%。新版本还引入实时说话人分离、双语同步显示和长上下文消歧三项能力,其中说话人分离可保留各方音色并支持多种声音克隆模式。模型基于Qwen-Omni技术栈构建,融合大规模多模态数据与跨语言、跨模态对齐。目前已通过阿里云Model Studio和QwenCloud以WebSocket接口形式提供托管API服务,标志着实时同传在延迟与多说话人场景处理上的进一步成熟。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅