全双工语音模型隐式指令大考:1038个测试暴露架构短板,人设推断下遵守度暴跌9.7%!
DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents
arXiv AI (cs.AI) 重要 多模态Agent评测 🕐 09-04 12:00

📖 AI 总结

该研究提出DuplexSpeechBench-IFEval(DSB-IFEval)基准,用于评估全双工语音代理在实时对话中遵循隐式指令的能力。基准包含1038个测试用例,覆盖八种助手角色,并设计五种指令条件,包括默认行为、显式指令、角色隐含行为、角色与规则组合及指令冲突。研究采用确定性指令遵循得分和LLM评判的角色一致性得分,对六个实时语音系统进行测试。结果显示,不同架构存在显著权衡:全双工模型在仅依赖角色推断行为时表现下降,而其他模型虽能保持角色内容一致性,但无法灵活调整对话行为。此外,系统在安全冲突下难以覆盖预设角色指令。研究表明,推断角色行为、在适当时机执行及解决冲突指令仍是全双工语音代理面临的独立挑战。

🔑 关键词速览

Full-duplex voice agents能够同时进行听和说的语音代理,支持实时双向对话。
Implicit instruction following从角色或人设中推断行为指令,而非依赖显式规则。
Instruction Adherence Score (IAS)用于衡量代理在实时对话中遵循话语管理指令的确定性指标。
Persona Adherence Score (PAS)通过LLM评判代理生成内容与人设一致性的指标。
Conditioning protocols用于测试代理指令跟随的不同调节方式,如默认行为、显式指令或人设隐含行为。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅