生成式推荐器不用A/B测试也能选优?SID树粗化法让离线评估误差大降!
Off-Policy Evaluation for Semantic ID Recommenders: Does the Model's Own Code Hierarchy Help?
arXiv LG (cs.LG) 重要 #推荐系统#离线评估#语义ID 🕐 09-01 12:00

📖 AI 总结

该研究探讨了生成式推荐系统中,利用语义ID(SID)树作为离线策略评估(OPE)动作抽象的可能性。研究发现,在生产日志中,逐项OPE因有效样本量过小而效果不佳,但将项目边缘化至代码前缀簇可恢复可估计支持并降低误差。这种改进主要源于粗粒度化本身,而非层级结构特有优势,但SID树使粗粒度化在生成系统中变得可行,因为解码器能精确且低成本地返回各簇的质量。研究还指出,分辨率深度是关键调节参数,在支持不足时应采用更粗的粒度,并提出了条件偏差界,将粗粒度化偏差与量化器最坏情况重构残差及目标日志散度联系起来。该工作为生成式推荐系统的离线评估提供了实用指导,明确了SID层级在OPE中的价值边界与适用条件。

🔑 关键词速览

Off-Policy Evaluation (OPE)离线策略评估,利用已有日志数据评估新策略性能,无需在线实验。
Semantic IDs (SIDs)语义ID,将物品表示为层次化离散代码序列,用于生成式推荐。
Residual Quantizer残差量化器,通过逐级量化残差生成层次化代码的模型组件。
Coarsening粗化,将细粒度单元(如物品)合并为更粗的聚类以减少估计方差。
Effective Sample Size有效样本量,考虑权重后实际贡献的样本数量,反映估计可靠性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅