该研究提出了一种针对小型对话游戏智能体的分阶段交互学习方法,并发布了Qwen-GuidePlay-2B模型。该方法通过三步微调策略:先仅使用成功游戏轨迹进行监督微调,再进行加权轮次级微调,最后引入教师模型辅助修正格式与评估示例。在Playpen验证集上,该模型取得57.12的clemscore和42.68的statscore,并在官方挑战中获得第二高的clemscore增量,较基础模型提升约36分。研究发现,完整轨迹模仿有助于提升可玩性,而轮次级和教师引导训练则改善决策能力与整体得分。相比之下,重放修复和难例挖掘等复杂方法效果不佳,表明小型模型通过精心设计的数据筛选策略即可获得良好性能,无需激进改动。模型与代码均已开源,便于复现。
| Qwen-GuidePlay-2B | 一个2B参数的语言模型,专门用于对话游戏交互任务。 |
| SFT (Supervised Fine-Tuning) | 监督微调,使用标注数据对预训练模型进行进一步训练以适应特定任务。 |
| Playpen | 一个对话游戏环境或数据集,用于训练和评估对话游戏代理。 |
| clemscore | 一种评估指标,用于衡量对话游戏代理在完成任务方面的表现。 |
| statscore | 另一种评估指标,可能衡量代理在游戏中的统计或状态相关性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅