这篇论文提出了DuplexSpeechBench-Document Grounding(DSB-DG),一个用于评估语音智能体文档接地能力的基准测试,覆盖五个专业领域。该基准聚焦三类失效模式:上下文饱和(文档长度增加时的接地表现)、接地衰减(多轮对话中文档事实的保持能力)以及主动接地(上下文重新注入能否缓解对话漂移)。测试集包含来自50份文档的1636个经对抗性验证的问答对,支持对 grounding 准确率、幻觉和响应延迟的自动评估。研究对比了级联式、专有全双工与实时系统以及开放权重语音到语音架构,发现不同系统的有效接地能力差异显著:级联流水线(ASR-LLM-TTS)接地准确率最高,Gemini-Live和GPT-Realtime紧随其后;开放权重系统则表现出上下文容量骤降和多轮接地衰减等独特失效模式。总体而言,接地保真度随上下文和对话负载增加而下降,且失败往往表现为无依据的生成而非拒答,表明上下文接地仍是可靠全双工语音智能体的关键未解难题。
| Document Grounding | 文档依据,指语音智能体的回答忠实基于外部文档内容而非凭空生成。 |
| Context Saturation | 上下文饱和,衡量文档长度增加时智能体依据能力下降的失败模式。 |
| Grounding Decay | 依据衰减,指多轮对话中智能体逐渐丢失文档事实的失败模式。 |
| Proactive Grounding | 主动依据,评估通过重新注入上下文来缓解对话漂移的效果。 |
| Full-Duplex Voice Agents | 全双工语音智能体,支持同时听与说、实现低延迟自然交互的语音系统。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅