传音语音团队针对MLC-SLM 2026挑战赛任务一(多语种对话语音的说话人归属转写)提交了一套级联式系统,由说话人日志、长音频多语种ASR和说话人-转写融合三个模块组成。其中日志模块基于DiariZen,通过局部说话人活动估计与全局聚类生成说话人同质分段;ASR模块基于Qwen3-Omni生成多语种转写,并借助外部CTC对齐模型提供精确的词级与字符级时间戳;融合模块将日志输出与带时间戳的转写结合,生成说话人归属的STM结果。在官方评测集上,该系统取得15.41%的tcpMER,在全部参赛队伍中排名第二,验证了该级联框架在多语种对话场景下的有效性。
| 说话人日志(Speaker Diarization) | 识别音频中“谁在什么时候说话”的技术,将语音按说话人分割并聚类。 |
| 多语言 ASR(Multilingual ASR) | 能够识别并转写多种语言的自动语音识别系统。 |
| Qwen3-Omni | 一种支持文本、音频等多模态输入输出的大规模语言模型,此处用作多语言语音识别骨干。 |
| CTC 对齐(CTC-based Alignment) | 基于连接时序分类(CTC)的方法,用于将语音帧与文本 token 对齐,从而获得精确时间戳。 |
| tcpMER | MLC-SLM 挑战赛中用于评估说话人归属转写质量的综合错误率指标,数值越低表示性能越好。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅