ASR新突破!用基础LLM隐藏状态自纠错,性能碾压传统重打分和晚期融合
Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions
arXiv CL (cs.CL) 重要 #语音识别#ASR#推理优化 🕐 09-04 12:00

📖 AI 总结

该研究针对大型音频语言模型(LALM)在自动语音识别(ASR)中的应用,提出了一种基于隐藏状态交互的自校正方法。作者发现,将ASR模型与基础大语言模型(LLM)的隐藏状态进行对比,可有效识别哪些token在语义上更依赖LLM的知识。基于此,他们提出“混合搜索”策略,仅对高语义依赖的token进行定向校正,而非对所有输出进行全局重打分或融合。实验表明,这种选择性校正方法显著优于传统的全局LLM校正手段,如重打分和晚期融合。该发现揭示,即便经过热启动初始化完成语义知识迁移,ASR模型仍可借助其底层LLM在推理阶段进一步优化识别性能。论文已被EMNLP 2026 Findings接收。

🔑 关键词速览

Automatic Speech Recognition (ASR)自动语音识别,将语音信号转换为文本的技术。
Large Language Models (LLMs)大型语言模型,基于海量文本训练的深度学习模型,具备强大的语义理解和生成能力。
Warm Initialization热初始化,使用预训练模型参数作为初始权重,以加速训练并提升性能。
LoRA (Low-Rank Adaptation)低秩适应,一种参数高效的微调方法,通过添加低秩矩阵来适应新任务,同时保留原始模型权重。
Hybrid Search混合搜索,本文提出的针对高语义依赖标记的纠正策略,结合交互特征进行选择性优化。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅