车载对话助手正日益集成到车辆中,用于路线规划、车辆控制和信息获取,但其多轮交互特性、缺乏明确标准答案以及严格的安全约束,使可靠性评估面临挑战。现有评估方法多针对单轮场景,无法捕捉跨轮次的约束处理、上下文保持和安全关键行为。为此,作者提出了一套自动化测试框架,将系统视为黑盒,通过闭环仿真进行评估,包含策略引导的用户模拟器、对抗性策略管理器和两层大语言模型评判器,分别评估单轮失败和整体对话质量。研究在一款工业级车载助手、六种大语言模型后端和十二名人工标注者上进行了验证。结果显示,自动评判与人工判断具有较高一致性;与无引导仿真相比,策略引导每段对话发现的独特失败类型多出2.96倍,发现的独特失败对话数量也增加了一倍以上。该工作为车载对话助手的安全性和多轮能力测试提供了可扩展的自动化方案。
| In-car Conversational Assistants (ICAs) | 车载对话助手,集成在车辆中用于支持路线规划、车辆控制和信息获取等任务的对话系统。 |
| Multi-turn Dialogues | 多轮对话,指用户与系统之间进行多次交互的对话形式,需要处理上下文和约束。 |
| Closed-loop Simulation | 闭环仿真,一种测试方法,其中系统输出影响后续输入,模拟真实交互循环。 |
| LLM Judge | 大语言模型评判器,使用大语言模型自动评估对话质量或故障的组件。 |
| Adversarial Strategy Manager | 对抗策略管理器,负责生成对抗性策略以引导用户模拟器发现系统故障的模块。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅