尼泊尔语音支付来了!LoRA微调让交易成功率暴涨20倍,数字识别从0飙到73.9%!
SpeakPay: Domain-Adaptive LoRA Fine-Tuning of Whisper for Low-Resource Nepali Financial Speech Recognition
arXiv CL (cs.CL) 重要 #语音识别#低资源#微调 🕐 09-03 12:00

📖 AI 总结

本文介绍 SpeakPay,一个面向尼泊尔语低资源金融场景的语音优先数字钱包系统。其核心技术贡献在于对 Whisper large-v2 模型进行 LoRA 领域自适应微调,并构建了包含 403 条语音指令的尼泊尔语金融数据集 NepFinSpeech-403。实验结果显示,领域自适应将词错误率从零样本基线的 129.95% 降至 42.58%,相对降低 67.2%;天城文数字识别准确率从 0% 提升至 73.9%。更重要的是,任务层面的交易成功率从 1.67% 提升至 33.33%,提升约 20 倍,表明词级指标会低估实际应用收益。数据效率分析发现,仅需约 100 条领域样本即可将零样本词错误率减半,性能在约 300 条样本后趋于平稳。错误分析揭示了系统性数字混淆模式,是剩余交易失败的主因。该系统已部署为公开的语音优先网页应用,代码、数据集和模型权重均已开源。

🔑 关键词速览

LoRA低秩适应,一种参数高效的微调技术,通过低秩矩阵更新模型权重,减少训练成本。
WhisperOpenAI开发的通用语音识别模型,支持多语言和多种任务。
Word Error Rate (WER)词错误率,衡量语音识别系统性能的指标,越低越好。
Domain Adaptation领域自适应,将模型从通用领域调整到特定领域(如金融)以提高性能。
Devanagari天城文,用于书写尼泊尔语等南亚语言的文字系统。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅