政策学习新突破:跨子样本平均投票,提升福利还降低抽样风险!
Stable Policy Learning
arXiv ML (stat.ML) 重要 #政策学习#因果推断#算法稳定性 🕐 09-18 12:00

📖 AI 总结

本文研究循证政策制定中的政策学习问题:通常先观察一个实验样本,再将学习到的政策建议大规模实施,但实验中的随机抽样可能导致推荐政策产生较差的福利结果。作者提出核心问题:政策学习算法应如何在期望福利与抽样风险之间取得平衡?研究发现,算法稳定性在刻画和权衡这一关系中起核心作用——若算法在替换一个实验单元后推荐结果保持稳定,则其抽样风险有限。为此,作者提出"政策投票装袋"方法,在多个子样本上学习处理决策,再将其投票平均为处理概率。相对于使用单一子样本,跨子样本平均可保持期望福利,并提升风险规避研究者的期望效用。作者进一步推导出估计精度、子样本规模与福利变异之间的紧致界,并在CARA效用下给出精确保证。

🔑 关键词速览

算法稳定性指算法输出对输入数据微小变化(如替换一个样本)的不敏感程度,稳定性越高则抽样风险越小。
政策投票装袋一种集成学习方法,通过在多个子样本上学习处理决策并平均其投票来生成处理概率。
抽样风险由于实验数据随机抽样导致学习到的政策建议在实际实施时福利结果不确定的风险。
CARA效用常数绝对风险厌恶效用函数,常用于经济学中刻画风险规避偏好。
期望福利政策在总体中实施后所获得的平均福利水平,是政策学习的主要优化目标之一。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅