该研究针对大型音频语言模型(audio-LLM)在韵律信息处理上的不足,提出了一种分阶段探针阶梯方法,以定位模型失败的具体环节。研究在四个仅需理解的音频语言模型上发现,韵律信息在音频处理路径中通常被保留,并能在模型后期状态中被解码,但最终输出中仅部分体现。通过隐藏状态干预实验,研究者验证了这些潜在表征的因果作用:单次编辑相关层即可推动模型朝被抑制的韵律决策方向转变,但恢复具有方向性而非选择性。特征层面分析表明,可恢复信号存在于低维子空间中,部分高归因特征与已知承载韵律信息的声学线索一致。研究结论指出,模型的主要瓶颈不在于感知韵律,而在于使用韵律——即使模型正确表征了韵律线索,仍可能在回答中忽略它。
| audio-LLM | 大型音频语言模型,结合音频编码器与大型语言模型,处理语音等音频输入并生成文本或语义理解输出。 |
| prosody | 韵律,指语音中的音高、时长、强度等超音段特征,承载情感和语用信息。 |
| probe ladder | 探针阶梯,一种分阶段诊断方法,通过在模型不同层设置探针来定位信息处理失败的具体环节。 |
| hidden-state intervention | 隐藏状态干预,通过修改模型内部激活值来测试特定表征对输出的因果影响。 |
| causal status | 因果地位,指某个内部表征是否真正驱动模型输出,而非仅相关或冗余。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅