该论文提出了一种广义的、风格感知的全双工对话框架,旨在解决自然对话中智能体主动发言的时机控制问题。研究构建了三个核心组件:轻量级主动语音轮次控制器LPS-TC,可即插即用地为半双工模型赋予全双工能力;包含约2981小时真实对话的WildTurn数据集,并标注了五种轮次转换和五种回馈风格;以及双层评估方案,同时衡量块级时机精度和轮次级交互质量。实验将LPS-TC集成到Qwen2.5-Omni和Freeze-Omni等模型中,验证了其在时机恰当性和响应质量上的优越表现,并展示了细粒度的风格可控性和强泛化能力。该框架为构建更自然、类人的实时语音交互系统提供了有效方案。
| Full-Duplex Dialogue System | 全双工对话系统,允许用户和智能体同时说话,支持实时打断和反馈。 |
| LPS-TC | 轻量级主动语音轮次控制器,用于控制对话中的轮换时机,支持即插即用。 |
| WildTurn | 大规模真实世界英语对话数据集,包含多轮立体声对话,用于训练和评估轮换行为。 |
| Turn-Taking | 轮换,指对话中参与者轮流发言的机制,包括时机和风格。 |
| Backchanneling | 反馈,指听者发出的简短回应(如“嗯”“啊”)以表示关注或理解。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅