Spotify 的研究团队针对对话式推荐代理在冷启动场景下缺乏真实用户交互数据、难以优化代理规划与工具调用的问题,提出了一套多轮合成数据生成流程与自我改进循环机制。合成数据流程可将单轮提示转化为逼真的多轮对话,支持上线前的系统性评估;自我改进循环则结合基于方差的对比优化与编码代理的迭代精炼,自动识别并修复规划及工具使用中的错误。该方法在已高度优化的人工提示基础上进一步带来8%的质量提升,并已投入生产,显著加快了 Spotify 对话式推荐代理的上线迭代速度。在线 A/B 测试显示,相比仅支持会话精炼的旧体验,新系统使用户收听量提升14%、周活跃用户增加5%、跳过率降低5%。该工作为工业界加速开发对话式推荐代理提供了可复用的实践框架。
| Conversational Recommendation Agent | 通过自然语言对话理解用户意图并推荐内容的智能代理系统。 |
| Agent Planning | 代理决定如何选择、排序和调用外部工具以完成用户请求的决策过程。 |
| Cold-start Setting | 系统上线初期缺乏真实用户交互数据、难以进行有效优化的场景。 |
| Synthetic Data Generation | 通过算法自动生成模拟真实交互的数据,用于训练和评估模型。 |
| Self-Improvement Loop | 系统自动识别自身错误并迭代优化提示或策略的闭环机制。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅