该研究针对当前语音理解评测框架以英语为中心、东南亚语言严重缺失的问题,提出了SEA-SpeechBench——首个覆盖11种东南亚语言的大规模多任务语音理解基准。该基准包含97,194个样本、99个评测集和597小时音频数据,涵盖语音处理、副语言分析(情感、性别、年龄、说话人识别)以及时间理解三大类共9项任务,其中时间理解是新增维度,支持长达3分钟的音频序列中的时间戳查询与定位。研究采用东南亚母语和英语双语提示进行评测,结果显示主流开源与闭源模型在时间理解、情感识别和语音翻译上表现普遍不佳,缅甸语、泰米尔语等低资源语言的提示效果较英语最多落后41个百分点。该工作揭示了现有模型的关键局限,为构建更具包容性的语音模型提供了重要参考。
| SEA-SpeechBench | 首个面向东南亚 11 种语言的大规模多任务语音理解评估基准。 |
| Temporal Understanding | 在长音频中定位时间戳内容并回答时序相关查询的新任务维度。 |
| Paralinguistic Analysis | 分析语音中情感、性别、年龄、说话人等非语言信息的任务类别。 |
| Multilingual Prompting | 分别用东南亚母语和英语构造提示,以评估模型跨语言交互能力。 |
| Low-Resource Languages | 训练数据稀缺、模型支持较弱的语言,如缅甸语和泰米尔语。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅