该研究构建了一个面向电信客服场景的合成孟加拉语语音数据集,包含10,000条音频-文本对,总时长约26.82小时,采样率为24kHz,并划分了训练、验证和测试集。数据集以CC-BY-4.0许可在Hugging Face上公开。语音通过OmniVoice的语音克隆模式生成,基于真实女性参考录音和文本,采用bfloat16精度和16步扩散采样。除原始孟加拉语文本外,数据集还提供标准化转录字段,便于ASR/STT训练。评估方面,研究者使用领域适配的Whisper模型进行自动可懂度检查,平均词错误率为2.54%,字符错误率为0.59%,中位数均为0.00%,表明文本-音频一致性良好。该资源填补了孟加拉语电信领域语音数据的空白,但论文也讨论了合成语音和基于STT评估的局限性。
| OmniVoice | 一种语音合成模型,支持语音克隆模式,用于生成特定说话人的合成语音。 |
| Whisper ASR | OpenAI开发的自动语音识别模型,此处经过领域微调用于评估合成语音的可懂度。 |
| WER (Word Error Rate) | 词错误率,衡量语音识别输出与参考文本之间词级别差异的指标。 |
| CER (Character Error Rate) | 字符错误率,衡量语音识别输出与参考文本之间字符级别差异的指标。 |
| Voice Cloning | 语音克隆技术,通过参考录音复制特定说话人的声音特征来生成语音。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅