本文提出PTC-Bias,一个面向语音大语言模型(SpeechLLM)的两阶段上下文偏置框架,旨在解决大规模偏置词表难以高效利用的问题。该方法基于音素级时间竞争:在预填充阶段,PTC Retrieval执行帧同步音素解码,并在候选发音间进行时间竞争,生成精简的偏置词候选列表及对应语音区间;在SpeechLLM解码后,PTC Correction在这些区间内对候选词与不匹配的转写片段进行二次局部竞争,通过选择性纠正减少近音词和分词错误,同时保留正确转写。两个阶段共享同一音素后验,无需额外的SpeechLLM前向计算。在LibriSpeech上的实验表明,该方法在两种SpeechLLM及多达2000词的偏置词表下均取得稳定增益:使用Prompt-SLAM-ASR-7B和2000个偏置词时,相比CTC-Filter在test-clean/test-other上将B-WER相对降低23.4%/23.9%,而U-WER基本保持不变。
| PTC-Bias | 一种基于音素级时间竞争的两阶段上下文偏置框架,用于提升语音大语言模型对罕见词的识别能力。 |
| SpeechLLM | 语音大语言模型,将语音输入与大语言模型结合以进行语音识别和理解的模型。 |
| PTC Retrieval | 预填充阶段的帧同步音素解码与时间竞争模块,用于从大规模偏置词表中检索出紧凑的候选词列表及对应语音区间。 |
| PTC Correction | 解码后阶段的局部竞争纠正模块,在检索到的语音区间内对候选词与不匹配转写片段进行二次竞争,以减少近音词和分词错误。 |
| B-WER / U-WER | 偏置词错误率(B-WER)衡量偏置词表内词的识别错误率,非偏置词错误率(U-WER)衡量词表外词的识别错误率,用于评估上下文偏置方法的性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅