本文提出AdvRole,一种面向大语言模型角色扮演智能体的对抗式上下文重写框架,旨在解决现有强化学习方法依赖固定场景池所导致的分布瓶颈问题:随着智能体能力提升,其薄弱场景不断变化,而训练分布却始终静止。AdvRole将角色扮演强化学习转化为闭环课程,让学习扮演角色的Actor与重写角色档案和对话上下文的Rewriter交替训练,Rewriter以性能差距为奖励信号,优先生成能降低当前Actor得分的困难场景,从而使场景池随Actor共同演化,持续针对角色—上下文空间中尚未掌握的区域。研究在涵盖中英文的三个角色扮演基准及新发布的多语言基准上进行实验,结果表明AdvRole持续优于基线方法。该工作为角色扮演智能体的训练提供了一种动态自适应的课程生成思路。
| 角色扮演智能体 | 基于大语言模型,能够模拟特定角色进行对话和互动的AI系统。 |
| 强化学习 | 一种通过与环境交互并根据奖励信号优化策略的机器学习方法。 |
| 闭环课程 | 训练场景根据智能体表现动态调整,形成持续演化的学习课程。 |
| 对抗性上下文重写 | 通过对抗性编辑角色档案和对话上下文,生成针对当前智能体的困难场景。 |
| 性能差距奖励 | 一种奖励函数,鼓励重写后的场景使当前智能体的得分低于原始场景。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅