该研究指出现有多轮交互基准中使用的用户模拟器虽在风格上接近真人,却缺乏结果校准,即模拟用户与真实用户在同一智能体上的成功率和失败模式并不一致。为此作者提出校准用户嵌入(CUE)框架,通过编码真实会话、采样连续表示并解码为角色指令来引导大模型扮演用户,无需训练。在τ²-Bench上,经CUE校准的模拟器产生的模拟器归因错误更少,能更忠实复现真实用户的智能体失败模式、总体成功率及特定任务-用户组合的结果,同时保持与既有指标相当的用户保真度。该框架在主要拟合客服对话后,可泛化至文档创作、数学辅导和日常对话,并跨不同模拟器模型有效,无需重新训练。
| 用户模拟器 | 在多轮交互基准测试中模拟真实用户行为以评估AI智能体的系统。 |
| 结果校准 | 模拟器与真实用户在与智能体交互时,在成功率和失败模式上保持一致的程度。 |
| 校准用户嵌入(CUE) | 一种无需训练即可编码会话并采样连续表示,进而解码为角色指令以引导LLM模拟用户的框架。 |
| 生态效度 | 基准测试在模拟环境与真实用户群体中,智能体失败时间和方式的一致性程度。 |
| 角色指令 | 用于引导LLM模拟特定用户角色的文本提示或命令。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅