大型语言模型虽在多项基准测试中表现优异,但其对齐规范价值的倾向导致回复趋于同质化,难以满足用户多样化的偏好。现有免训练方法依赖提示工程占用宝贵上下文窗口,而基于训练的方法在训练完成后通常保持静态,无法支持真实场景所需的持续优化。为此,作者提出COPE框架,面向用户反馈稀疏的真实交互场景,为每位用户分配可学习的个性化嵌入,并在单次更新步骤中协同完成偏好捕捉、自评估校准与个性化回复优化。其核心创新在于利用自评估生成代理奖励,使得在缺乏显式用户反馈时仍能持续更新模型。实验表明,COPE在稀疏反馈条件下持续优于强免训练与基于训练的基线方法,且与检索增强提示互补;进一步分析验证了其自评估的可靠性、偏好模式的有效性、通用能力的稳定性,以及在偏好变化和更换评估器情形下的鲁棒性。
| COPE | 一种针对稀疏用户反馈场景的持续优化框架,通过个性化嵌入和自评估实现LLM的持续个性化。 |
| 用户嵌入 | 为每个用户分配的可学习向量表示,用于捕获和存储用户的个性化偏好。 |
| 自评估 | 模型对自身生成响应进行质量评估的机制,用于在缺乏显式用户反馈时生成代理奖励。 |
| 稀疏用户反馈 | 用户仅提供少量或间歇性反馈的交互场景,是现实世界中常见的反馈模式。 |
| 检索增强提示(RAP) | 一种通过检索外部信息来增强提示的方法,与COPE互补,共同提升模型性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅