该论文提出了一种名为RL-ADA的协同进化训练框架,旨在解决企业客服对话系统面临的标注瓶颈问题。该框架的核心创新在于用“世界反馈”替代人工标注,即基于可测量的交互结果作为奖励信号。具体而言,一个30亿参数的客服代理与一个70亿参数的对抗性客户代理在固定自动评判器的引导下进行对抗性博弈:客服代理因成功解决多轮对话而获得奖励,对抗代理则因生成能导致错误路由的逼真话语而获得奖励,从而形成非对称的对抗压力。隔离训练环境会基于失败记录对较弱代理进行迭代重训,全程无需人工标注。在银行客服场景的概念验证中,该框架在五个协同进化周期内消除了工具路由错误,端到端通过率翻倍。研究还观察到“情境伪装”这一对抗策略的涌现,即对抗代理仅凭奖励压力就学会将真实意图嵌入密集的客户细节中,这对企业红队测试和鲁棒性评估具有直接意义。
| RL-ADA | 一种基于强化学习的对抗性对话代理训练框架,通过世界反馈替代人工标注。 |
| World Feedback | 基于可测量交互结果的奖励信号,用于指导代理学习,无需人工标注。 |
| Adversarial Arena | 对抗竞技场,其中两个代理(DA和CA)在竞争环境中协同进化。 |
| Contextual Camouflage | 对抗策略,代理学会将真实意图隐藏在密集的上下文细节中,以误导对手。 |
| Co-evolutionary Training | 协同进化训练,两个代理通过相互对抗迭代提升性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅