全双工语音大模型竟在用户沉默时“自言自语”?新方法实时抑制13/13虚假起始,真实响应一个不丢!
Causal Analysis and Mitigation of Spurious Onsets in Full-Duplex Speech LLMs
arXiv CL (cs.CL) 重要 多模态论文方法 🕐 09-15 12:00

📖 AI 总结

本文研究全双工语音大模型在用户长时间静默时出现的"虚假起说"现象。作者以Moshi和PersonaPlex为对象,发现在数字零输入下,两者分别在40次五分钟续写中有12次和11次不当起说。通过对比两种假设,研究确认起说并非源于重复采样,而是模型对自身非语音输出的条件依赖,导致起说概率在单个80毫秒帧内骤增超过九个数量级。为此,作者提出一种因果反事实抑制方法:若屏蔽前序用户输入后模型的下一词分布变化甚微,则判定该起说为虚假并加以抑制。在含真实麦克风噪声的留出测试中,该方法完全抑制了Moshi的13次和PersonaPlex的9次虚假起说,同时保留全部真实响应,且无需重训练,95百分位决策时间低于61毫秒,满足实时帧预算要求。

🔑 关键词速览

全双工生成模型能够同时进行听和说的生成模式,实现实时交互。
虚假起始模型在用户沉默时错误地开始说话的现象。
因果反事实通过干预(如静音用户输入)来推断因果关系的方法。
起始概率模型在下一个时间步开始生成语音的概率。
推理时方法在模型推理阶段应用的技术,无需重新训练模型。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅