不用重训,Whisper推理提速还能几乎不掉准确率,覆盖16种语言和3种模型规模!
Token Merging for Multilingual Speech Recognition: A Systematic Study Across Model Scale and Fine-Tuning
arXiv CL (cs.CL) 重要 多模态论文方法算力 🕐 09-15 12:00

📖 AI 总结

本文系统评估了Token合并技术在多语言语音识别中的应用效果。研究以Whisper系列模型为对象,覆盖16种语言和3种不同参数规模,并进一步考察了该技术与低资源语言微调方法DoRA的交互影响。核心发现是:合并Token能够显著提升推理效率、缩短序列长度,且在大多数低资源语言和模型规模下几乎不损失转录准确率;即便模型经过微调,该方法依然有效。这一结果表明,Token合并无需重新训练即可降低多语言语音识别的部署成本,为资源受限场景下部署大型语音模型提供了切实可行的加速方案。

🔑 关键词速览

Token Merging令牌合并,一种通过动态组合冗余特征来缩短序列长度、提升推理效率的技术。
WhisperOpenAI开发的多语言语音识别模型家族,无需特定语言训练即可转录多种语言。
DoRA一种参数高效微调方法,通过低秩适应和权重分解来减少微调参数量。
Low-Resource Languages低资源语言,指训练数据稀缺、在语音识别等任务中性能较难提升的语言。
Fine-Tuning微调,在预训练模型基础上使用特定数据进一步训练,以适应下游任务。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅