2B小模型干翻大模型?三步微调让对话游戏得分暴涨36分!
First Make It Playable, Then Make It Good: Staged Interaction Learning for Small Dialogue-Game Agents
arXiv CL (cs.CL) 重要 #Agent#训练方法#对话系统 🕐 08-31 12:00

📖 AI 总结

该研究提出了一种针对小型对话游戏智能体的分阶段交互学习方法,并发布了Qwen-GuidePlay-2B模型。该方法通过三步微调策略:先仅使用成功游戏轨迹进行监督微调,再进行加权轮次级微调,最后引入教师模型辅助修正格式与评估示例。在Playpen验证集上,该模型取得57.12的clemscore和42.68的statscore,并在官方挑战中获得第二高的clemscore增量,较基础模型提升约36分。研究发现,完整轨迹模仿有助于提升可玩性,而轮次级和教师引导训练则改善决策能力与整体得分。相比之下,重放修复和难例挖掘等复杂方法效果不佳,表明小型模型通过精心设计的数据筛选策略即可获得良好性能,无需激进改动。模型与代码均已开源,便于复现。

🔑 关键词速览

Qwen-GuidePlay-2B一个2B参数的语言模型,专门用于对话游戏交互任务。
SFT (Supervised Fine-Tuning)监督微调,使用标注数据对预训练模型进行进一步训练以适应特定任务。
Playpen一个对话游戏环境或数据集,用于训练和评估对话游戏代理。
clemscore一种评估指标,用于衡量对话游戏代理在完成任务方面的表现。
statscore另一种评估指标,可能衡量代理在游戏中的统计或状态相关性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅