本文提出TRACER,一种多轮用户模拟器,旨在解决现有模拟方法仅关注单轮回复合理性、却无法复现真实交互中意图演变与结果的问题。TRACER显式建模用户不断演变的意图,并通过两阶段训练实现行为对齐:先在真实用户对话上进行监督微调,再进行多轮强化学习,后者结合结果级与轨迹级的层次化奖励及偏差感知优势调节,缓解长对话中的奖励稀疏与信用分配难题。在真实客服会话构建的参考队列上,TRACER-7B的转化F1较最强基线提升11.4,同时取得最低的组级转化率误差与语义轨迹距离,并能泛化至分布外场景;人类图灵测试的识别准确率接近随机水平,表明生成对话具有自然性。基于该模拟器,作者进一步提出动态营销基准,联合评估大模型的劝说效果与回复质量,发现更高的回复质量并不必然带来更高的转化率。
| TRACER | 一种多轮用户模拟器,显式建模用户意图演变并对齐真实交互轨迹。 |
| 多轮强化学习 | 在多个对话轮次中应用强化学习,以优化长期交互目标。 |
| 分层奖励 | 结合结果级和轨迹级奖励的奖励结构,用于指导模型学习。 |
| 偏差感知优势调制 | 一种根据偏差调整优势函数的方法,以改善信用分配。 |
| 动态营销基准 | 一个通过模拟交互评估LLM说服效果和响应质量的基准测试。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅