本文系统评估了Token合并技术在多语言语音识别中的应用效果。研究以Whisper系列模型为对象,覆盖16种语言和3种不同参数规模,并进一步考察了该技术与低资源语言微调方法DoRA的交互影响。核心发现是:合并Token能够显著提升推理效率、缩短序列长度,且在大多数低资源语言和模型规模下几乎不损失转录准确率;即便模型经过微调,该方法依然有效。这一结果表明,Token合并无需重新训练即可降低多语言语音识别的部署成本,为资源受限场景下部署大型语音模型提供了切实可行的加速方案。
| Token Merging | 令牌合并,一种通过动态组合冗余特征来缩短序列长度、提升推理效率的技术。 |
| Whisper | OpenAI开发的多语言语音识别模型家族,无需特定语言训练即可转录多种语言。 |
| DoRA | 一种参数高效微调方法,通过低秩适应和权重分解来减少微调参数量。 |
| Low-Resource Languages | 低资源语言,指训练数据稀缺、在语音识别等任务中性能较难提升的语言。 |
| Fine-Tuning | 微调,在预训练模型基础上使用特定数据进一步训练,以适应下游任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅