🔥 今日值得一读 语音大模型情感识别新突破!EMODE让AI真正听懂情绪,双语基准全面领先
EMODE: Dynamic Para-Semantic Experts for Emotion-Aware Speech Language Modeling
arXiv CL (cs.CL) 🔥 重点 #语音语言模型#情感识别#多模态 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
做情感语音助手或语音理解时,可借鉴其专家结构更好保留韵律情感线索。

📖 AI 总结

大型语音语言模型在跨模态理解与生成上表现强劲,却难以保留副语言线索,尤其是情感信息。现有系统多依赖纠缠的声学表征,使语言模型过度依赖恢复出的词汇内容,而非以声学韵律证据为依据。为此,作者提出EMODE,一种以动态副语义专家(DPSE)为核心的情感感知语音语言模型。DPSE将连续语音特征分解为语义与副语言两条路径,动态路由并在融入语言模型前进行融合。为将结构分解转化为功能专精,EMODE采用三阶段课程训练:语义预热、副语言激活与联合精调,并辅以正交专家引导、语义到声学对齐和门控多样性正则化。在语音情感识别、共情回应评估及新建双语MEPA基准上的实验表明,EMODE改善了词汇保真度与情感敏感性之间的平衡,增强了基于情感的回应生成,并揭示了显式副语义分解对稳健跨语料情感理解的价值。

🔑 关键词速览

EMODE一种情感感知语音语言模型,通过动态副语义专家实现语音中语义与副语言信息的解耦与融合。
Dynamic Para-Semantic Experts (DPSE)动态副语义专家,将连续语音特征分解为语义和副语言两条路径,并进行动态路由与融合的模块。
Orthogonal Expert Guidance (OEG)正交专家引导,一种训练指导机制,旨在促使不同专家路径学习相互正交的特征表示。
Semantic-to-Acoustic Alignment (SAA)语义到声学对齐,一种将语义表示与声学特征对齐的训练策略,以增强声学韵律证据的利用。
MEPA benchmark新构建的双语情感感知语音语言模型评测基准,用于评估模型在情感理解与生成方面的表现。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅