传音多语言ASR系统挑战赛拿下第二,tcpMER仅15.41%!
Transsion's Speaker-Attributed Multilingual ASR System for the MLC-SLM 2026 Challenge
arXiv CL (cs.CL) 重要 #语音识别#多语言#说话人分离 🕐 今天 12:00

📖 AI 总结

传音语音团队针对MLC-SLM 2026挑战赛任务一(多语种对话语音的说话人归属转写)提交了一套级联式系统,由说话人日志、长音频多语种ASR和说话人-转写融合三个模块组成。其中日志模块基于DiariZen,通过局部说话人活动估计与全局聚类生成说话人同质分段;ASR模块基于Qwen3-Omni生成多语种转写,并借助外部CTC对齐模型提供精确的词级与字符级时间戳;融合模块将日志输出与带时间戳的转写结合,生成说话人归属的STM结果。在官方评测集上,该系统取得15.41%的tcpMER,在全部参赛队伍中排名第二,验证了该级联框架在多语种对话场景下的有效性。

🔑 关键词速览

说话人日志(Speaker Diarization)识别音频中“谁在什么时候说话”的技术,将语音按说话人分割并聚类。
多语言 ASR(Multilingual ASR)能够识别并转写多种语言的自动语音识别系统。
Qwen3-Omni一种支持文本、音频等多模态输入输出的大规模语言模型,此处用作多语言语音识别骨干。
CTC 对齐(CTC-based Alignment)基于连接时序分类(CTC)的方法,用于将语音帧与文本 token 对齐,从而获得精确时间戳。
tcpMERMLC-SLM 挑战赛中用于评估说话人归属转写质量的综合错误率指标,数值越低表示性能越好。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅