🔥 今日值得一读 首个东南亚语音基准来了!11种语言、近10万样本,低资源语言性能竟落后英语41个百分点!
SEA-SpeechBench: A Large-Scale Multitask Benchmark for Speech Understanding Across Southeast Asia
arXiv CL (cs.CL) 🔥 重点 #语音理解#评测基准#多语言#东南亚 🕐 09-10 12:00
👨‍💼 主理人解读 · 为什么值得关注
做东南亚语音产品时,可用它评测模型在11种语言、9类任务上的真实表现。

📖 AI 总结

该研究针对当前语音理解评测框架以英语为中心、东南亚语言严重缺失的问题,提出了SEA-SpeechBench——首个覆盖11种东南亚语言的大规模多任务语音理解基准。该基准包含97,194个样本、99个评测集和597小时音频数据,涵盖语音处理、副语言分析(情感、性别、年龄、说话人识别)以及时间理解三大类共9项任务,其中时间理解是新增维度,支持长达3分钟的音频序列中的时间戳查询与定位。研究采用东南亚母语和英语双语提示进行评测,结果显示主流开源与闭源模型在时间理解、情感识别和语音翻译上表现普遍不佳,缅甸语、泰米尔语等低资源语言的提示效果较英语最多落后41个百分点。该工作揭示了现有模型的关键局限,为构建更具包容性的语音模型提供了重要参考。

🔑 关键词速览

SEA-SpeechBench首个面向东南亚 11 种语言的大规模多任务语音理解评估基准。
Temporal Understanding在长音频中定位时间戳内容并回答时序相关查询的新任务维度。
Paralinguistic Analysis分析语音中情感、性别、年龄、说话人等非语言信息的任务类别。
Multilingual Prompting分别用东南亚母语和英语构造提示,以评估模型跨语言交互能力。
Low-Resource Languages训练数据稀缺、模型支持较弱的语言,如缅甸语和泰米尔语。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅