🔥 今日值得一读 LLM个性化新突破:稀疏反馈下持续优化,性能碾压基线!
COPE: Continual Personalization of LLMs under Sparse User Feedback via User Embeddings and Self-Evaluation
arXiv LG (cs.LG) 🔥 重点 大模型个性化论文方法 🕐 今天 12:00

📖 AI 总结

大型语言模型虽在多项基准测试中表现优异,但其对齐规范价值的倾向导致回复趋于同质化,难以满足用户多样化的偏好。现有免训练方法依赖提示工程占用宝贵上下文窗口,而基于训练的方法在训练完成后通常保持静态,无法支持真实场景所需的持续优化。为此,作者提出COPE框架,面向用户反馈稀疏的真实交互场景,为每位用户分配可学习的个性化嵌入,并在单次更新步骤中协同完成偏好捕捉、自评估校准与个性化回复优化。其核心创新在于利用自评估生成代理奖励,使得在缺乏显式用户反馈时仍能持续更新模型。实验表明,COPE在稀疏反馈条件下持续优于强免训练与基于训练的基线方法,且与检索增强提示互补;进一步分析验证了其自评估的可靠性、偏好模式的有效性、通用能力的稳定性,以及在偏好变化和更换评估器情形下的鲁棒性。

🔑 关键词速览

COPE一种针对稀疏用户反馈场景的持续优化框架,通过个性化嵌入和自评估实现LLM的持续个性化。
用户嵌入为每个用户分配的可学习向量表示,用于捕获和存储用户的个性化偏好。
自评估模型对自身生成响应进行质量评估的机制,用于在缺乏显式用户反馈时生成代理奖励。
稀疏用户反馈用户仅提供少量或间歇性反馈的交互场景,是现实世界中常见的反馈模式。
检索增强提示(RAP)一种通过检索外部信息来增强提示的方法,与COPE互补,共同提升模型性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅