本文研究如何利用固定随机实验(A/B测试)的历史数据,为基于上下文赌博机的自适应实验部署提供决策支持。作者提出将离线策略评估(OPE)与受控热启动模拟相结合的方法:先从存在异质性处理效应的A/B测试日志数据中估计干扰成分,再用双重稳健估计器对一组预设的自适应与非自适应策略进行排序;在真实基准可得时,将离线训练的策略部署到复用原始奖励生成概率的模拟器中,构建安全且锚定真值的环境,以研究热启动下的离线到在线迁移。基于已知异质性结构的合成随机对照试验及预言机策略,结果显示:当存在有意义的异质性时,自适应、上下文感知策略优于固定分配;异质性缺失时收益甚微。研究还在Hillstrom、Criteo Uplift和LaLonde等公开基准上以策略价值与遗憾视角验证了上述结论。该工作为判断何时值得部署自适应实验、以及如何利用现有A/B测试数据在竞争性自适应策略间进行选择,提供了实用方法论。
| Off-Policy Evaluation (OPE) | 离策略评估,利用历史日志数据评估新策略性能的方法,无需在线部署。 |
| Contextual Bandits | 上下文赌博机,一种在线学习框架,根据上下文信息在探索与利用之间权衡以选择动作。 |
| Doubly Robust Estimators | 双重稳健估计器,结合倾向得分和结果模型,在任一模型正确时都能得到无偏估计。 |
| Warm-Start Simulation | 热启动模拟,利用离线数据预训练策略后再在模拟环境中继续学习,以研究离线到在线的过渡。 |
| Heterogeneous Treatment Effects | 异质性处理效应,指不同个体或子群体对同一干预的反应存在差异。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅