该研究探讨了生成式推荐系统中,利用语义ID(SID)树作为离线策略评估(OPE)动作抽象的可能性。研究发现,在生产日志中,逐项OPE因有效样本量过小而效果不佳,但将项目边缘化至代码前缀簇可恢复可估计支持并降低误差。这种改进主要源于粗粒度化本身,而非层级结构特有优势,但SID树使粗粒度化在生成系统中变得可行,因为解码器能精确且低成本地返回各簇的质量。研究还指出,分辨率深度是关键调节参数,在支持不足时应采用更粗的粒度,并提出了条件偏差界,将粗粒度化偏差与量化器最坏情况重构残差及目标日志散度联系起来。该工作为生成式推荐系统的离线评估提供了实用指导,明确了SID层级在OPE中的价值边界与适用条件。
| Off-Policy Evaluation (OPE) | 离线策略评估,利用已有日志数据评估新策略性能,无需在线实验。 |
| Semantic IDs (SIDs) | 语义ID,将物品表示为层次化离散代码序列,用于生成式推荐。 |
| Residual Quantizer | 残差量化器,通过逐级量化残差生成层次化代码的模型组件。 |
| Coarsening | 粗化,将细粒度单元(如物品)合并为更粗的聚类以减少估计方差。 |
| Effective Sample Size | 有效样本量,考虑权重后实际贡献的样本数量,反映估计可靠性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅