本文介绍 SpeakPay,一个面向尼泊尔语低资源金融场景的语音优先数字钱包系统。其核心技术贡献在于对 Whisper large-v2 模型进行 LoRA 领域自适应微调,并构建了包含 403 条语音指令的尼泊尔语金融数据集 NepFinSpeech-403。实验结果显示,领域自适应将词错误率从零样本基线的 129.95% 降至 42.58%,相对降低 67.2%;天城文数字识别准确率从 0% 提升至 73.9%。更重要的是,任务层面的交易成功率从 1.67% 提升至 33.33%,提升约 20 倍,表明词级指标会低估实际应用收益。数据效率分析发现,仅需约 100 条领域样本即可将零样本词错误率减半,性能在约 300 条样本后趋于平稳。错误分析揭示了系统性数字混淆模式,是剩余交易失败的主因。该系统已部署为公开的语音优先网页应用,代码、数据集和模型权重均已开源。
| LoRA | 低秩适应,一种参数高效的微调技术,通过低秩矩阵更新模型权重,减少训练成本。 |
| Whisper | OpenAI开发的通用语音识别模型,支持多语言和多种任务。 |
| Word Error Rate (WER) | 词错误率,衡量语音识别系统性能的指标,越低越好。 |
| Domain Adaptation | 领域自适应,将模型从通用领域调整到特定领域(如金融)以提高性能。 |
| Devanagari | 天城文,用于书写尼泊尔语等南亚语言的文字系统。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅