用A/B测试老数据预测自适应实验能否逆袭,三大开放基准验证:有异质性时稳赢,没有则白搭!
Offline Policy Evaluation as a decision support tool for designing Adaptive Experiments
arXiv LG (cs.LG) 重要 #离线策略评估#因果推断#A/B测试 🕐 今天 12:00

📖 AI 总结

本文研究如何利用固定随机实验(A/B测试)的历史数据,为基于上下文赌博机的自适应实验部署提供决策支持。作者提出将离线策略评估(OPE)与受控热启动模拟相结合的方法:先从存在异质性处理效应的A/B测试日志数据中估计干扰成分,再用双重稳健估计器对一组预设的自适应与非自适应策略进行排序;在真实基准可得时,将离线训练的策略部署到复用原始奖励生成概率的模拟器中,构建安全且锚定真值的环境,以研究热启动下的离线到在线迁移。基于已知异质性结构的合成随机对照试验及预言机策略,结果显示:当存在有意义的异质性时,自适应、上下文感知策略优于固定分配;异质性缺失时收益甚微。研究还在Hillstrom、Criteo Uplift和LaLonde等公开基准上以策略价值与遗憾视角验证了上述结论。该工作为判断何时值得部署自适应实验、以及如何利用现有A/B测试数据在竞争性自适应策略间进行选择,提供了实用方法论。

🔑 关键词速览

Off-Policy Evaluation (OPE)离策略评估,利用历史日志数据评估新策略性能的方法,无需在线部署。
Contextual Bandits上下文赌博机,一种在线学习框架,根据上下文信息在探索与利用之间权衡以选择动作。
Doubly Robust Estimators双重稳健估计器,结合倾向得分和结果模型,在任一模型正确时都能得到无偏估计。
Warm-Start Simulation热启动模拟,利用离线数据预训练策略后再在模拟环境中继续学习,以研究离线到在线的过渡。
Heterogeneous Treatment Effects异质性处理效应,指不同个体或子群体对同一干预的反应存在差异。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅