本文提出FD-VAD,一种面向流式全双工语音交互的语义端点检测方法。研究指出,传统声学语音活动检测无法判断停顿是犹豫还是话轮结束,而基于级联ASR的端点检测又依赖转录结果并增加处理环节。为此,作者将语义端点检测建模为因果音频语言推理任务,通过冻结语音编码器、轻量模态适配器和参数高效微调的语言模型,将有限因果音频窗口直接映射为继续或停止决策,并引入置信度门控端点提交与边界聚焦难负样本采样。实验表明,FD-VAD在域内及对话评测中优于强流式与非流式语义话轮分类器,在TurnBench开发集零样本设置下以假阳性不超过0.10取得最高结束话轮召回率0.853,证明无需中间ASR或对话状态跟踪即可直接从流式音频完成语义端点检测。
| FD-VAD | 一种无需ASR的流式语义端点检测模型,直接从音频窗口输出继续/停止决策。 |
| 语义端点检测 | 从部分语音中判断停顿是犹豫还是对话意图完成的任务,比声学VAD更具语义理解。 |
| 全双工语音交互 | 允许双方同时说话和聆听的语音交互模式,需要自然轮流发言机制。 |
| EOT召回率 | 话轮结束(End-of-Turn)召回率,衡量系统正确检测对话结束点的能力。 |
| 零样本设置 | 模型在未针对特定数据集进行微调的情况下直接进行评估的设定。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅