语音大模型偏置检索新突破:PTC-Bias让2000词偏置表下B-WER狂降23.9%!
PTC-Bias: Phoneme-Level Temporal Competition for Bias Retrieval and Post-Decoding Correction in Speech LLMs
arXiv CL (cs.CL) 重要 #语音识别#上下文偏置#解码优化 🕐 今天 12:00

📖 AI 总结

本文提出PTC-Bias,一个面向语音大语言模型(SpeechLLM)的两阶段上下文偏置框架,旨在解决大规模偏置词表难以高效利用的问题。该方法基于音素级时间竞争:在预填充阶段,PTC Retrieval执行帧同步音素解码,并在候选发音间进行时间竞争,生成精简的偏置词候选列表及对应语音区间;在SpeechLLM解码后,PTC Correction在这些区间内对候选词与不匹配的转写片段进行二次局部竞争,通过选择性纠正减少近音词和分词错误,同时保留正确转写。两个阶段共享同一音素后验,无需额外的SpeechLLM前向计算。在LibriSpeech上的实验表明,该方法在两种SpeechLLM及多达2000词的偏置词表下均取得稳定增益:使用Prompt-SLAM-ASR-7B和2000个偏置词时,相比CTC-Filter在test-clean/test-other上将B-WER相对降低23.4%/23.9%,而U-WER基本保持不变。

🔑 关键词速览

PTC-Bias一种基于音素级时间竞争的两阶段上下文偏置框架,用于提升语音大语言模型对罕见词的识别能力。
SpeechLLM语音大语言模型,将语音输入与大语言模型结合以进行语音识别和理解的模型。
PTC Retrieval预填充阶段的帧同步音素解码与时间竞争模块,用于从大规模偏置词表中检索出紧凑的候选词列表及对应语音区间。
PTC Correction解码后阶段的局部竞争纠正模块,在检索到的语音区间内对候选词与不匹配转写片段进行二次竞争,以减少近音词和分词错误。
B-WER / U-WER偏置词错误率(B-WER)衡量偏置词表内词的识别错误率,非偏置词错误率(U-WER)衡量词表外词的识别错误率,用于评估上下文偏置方法的性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅