🔥 今日值得一读 无需ASR,FD-VAD直接从流式音频判断话轮结束,EOT召回率0.853创新高!
FD-VAD: Semantic Endpoint Detection for Streaming Full-Duplex Speech
arXiv CL (cs.CL) 🔥 重点 #语音交互#全双工#端点检测#多模态 🕐 09-30 12:00
👨‍💼 主理人解读 · 为什么值得关注
做实时语音助手时,用它替代ASR级联判断用户是否说完,降低延迟并支持自然打断。

📖 AI 总结

本文提出FD-VAD,一种面向流式全双工语音交互的语义端点检测方法。研究指出,传统声学语音活动检测无法判断停顿是犹豫还是话轮结束,而基于级联ASR的端点检测又依赖转录结果并增加处理环节。为此,作者将语义端点检测建模为因果音频语言推理任务,通过冻结语音编码器、轻量模态适配器和参数高效微调的语言模型,将有限因果音频窗口直接映射为继续或停止决策,并引入置信度门控端点提交与边界聚焦难负样本采样。实验表明,FD-VAD在域内及对话评测中优于强流式与非流式语义话轮分类器,在TurnBench开发集零样本设置下以假阳性不超过0.10取得最高结束话轮召回率0.853,证明无需中间ASR或对话状态跟踪即可直接从流式音频完成语义端点检测。

🔑 关键词速览

FD-VAD一种无需ASR的流式语义端点检测模型,直接从音频窗口输出继续/停止决策。
语义端点检测从部分语音中判断停顿是犹豫还是对话意图完成的任务,比声学VAD更具语义理解。
全双工语音交互允许双方同时说话和聆听的语音交互模式,需要自然轮流发言机制。
EOT召回率话轮结束(End-of-Turn)召回率,衡量系统正确检测对话结束点的能力。
零样本设置模型在未针对特定数据集进行微调的情况下直接进行评估的设定。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅