该研究探讨了在全双工语音模型Moshi中通过激活引导控制情绪表达的可行性。作者采用均值差激活引导方法,无需重新训练即可在每帧仅增加少量向量运算的条件下,对四种情绪进行调控。研究发现,情绪信息在Moshi的残差流中可线性解码,但激活引导仅能部分实现且效果不均衡:高兴、愤怒和惊讶三种情绪趋向于共享同一引导方向,而悲伤则具有独立的可引导方向。此外,研究还表明,三种情绪间的共享成分无法通过简单投影从所有情绪中同等移除。这一发现揭示了情绪引导受模型内部几何结构而非情绪标签本身支配的规律,为全双工语音代理在实时对话中调节情绪和表达方式提供了重要参考,也指出了激活引导在多情绪控制中的局限性与复杂性。
| 全双工语音模型 | 能够同时进行语音输入和输出的模型,支持实时双向对话。 |
| 激活引导 | 通过向模型内部激活添加特定向量来调控模型行为的技术。 |
| 均值差激活引导 | 一种激活引导方法,通过计算正负样本激活的均值差来构造引导向量。 |
| 残差流 | Transformer模型中各层残差连接累积的隐藏状态表示。 |
| Moshi | 一个完全开源的全双工语音语言模型,用于实时语音对话。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅