该研究针对大型音频语言模型(LALM)在自动语音识别(ASR)中的应用,提出了一种基于隐藏状态交互的自校正方法。作者发现,将ASR模型与基础大语言模型(LLM)的隐藏状态进行对比,可有效识别哪些token在语义上更依赖LLM的知识。基于此,他们提出“混合搜索”策略,仅对高语义依赖的token进行定向校正,而非对所有输出进行全局重打分或融合。实验表明,这种选择性校正方法显著优于传统的全局LLM校正手段,如重打分和晚期融合。该发现揭示,即便经过热启动初始化完成语义知识迁移,ASR模型仍可借助其底层LLM在推理阶段进一步优化识别性能。论文已被EMNLP 2026 Findings接收。
| Automatic Speech Recognition (ASR) | 自动语音识别,将语音信号转换为文本的技术。 |
| Large Language Models (LLMs) | 大型语言模型,基于海量文本训练的深度学习模型,具备强大的语义理解和生成能力。 |
| Warm Initialization | 热初始化,使用预训练模型参数作为初始权重,以加速训练并提升性能。 |
| LoRA (Low-Rank Adaptation) | 低秩适应,一种参数高效的微调方法,通过添加低秩矩阵来适应新任务,同时保留原始模型权重。 |
| Hybrid Search | 混合搜索,本文提出的针对高语义依赖标记的纠正策略,结合交互特征进行选择性优化。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅