大型语音语言模型在跨模态理解与生成上表现强劲,却难以保留副语言线索,尤其是情感信息。现有系统多依赖纠缠的声学表征,使语言模型过度依赖恢复出的词汇内容,而非以声学韵律证据为依据。为此,作者提出EMODE,一种以动态副语义专家(DPSE)为核心的情感感知语音语言模型。DPSE将连续语音特征分解为语义与副语言两条路径,动态路由并在融入语言模型前进行融合。为将结构分解转化为功能专精,EMODE采用三阶段课程训练:语义预热、副语言激活与联合精调,并辅以正交专家引导、语义到声学对齐和门控多样性正则化。在语音情感识别、共情回应评估及新建双语MEPA基准上的实验表明,EMODE改善了词汇保真度与情感敏感性之间的平衡,增强了基于情感的回应生成,并揭示了显式副语义分解对稳健跨语料情感理解的价值。
| EMODE | 一种情感感知语音语言模型,通过动态副语义专家实现语音中语义与副语言信息的解耦与融合。 |
| Dynamic Para-Semantic Experts (DPSE) | 动态副语义专家,将连续语音特征分解为语义和副语言两条路径,并进行动态路由与融合的模块。 |
| Orthogonal Expert Guidance (OEG) | 正交专家引导,一种训练指导机制,旨在促使不同专家路径学习相互正交的特征表示。 |
| Semantic-to-Acoustic Alignment (SAA) | 语义到声学对齐,一种将语义表示与声学特征对齐的训练策略,以增强声学韵律证据的利用。 |
| MEPA benchmark | 新构建的双语情感感知语音语言模型评测基准,用于评估模型在情感理解与生成方面的表现。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅