每步CVaR直接管住信念内风险,现有POMDP规划器改个代价就能用,还带端到端性能保证!
Risk-Averse Online POMDP Planning via CVaR of the Immediate Cost with Performance Guarantees
arXiv AI (cs.AI) 论文方法安全对齐 🕐 今天 12:00

📖 AI 总结

本文针对在线POMDP规划中传统方法仅优化期望累积代价、容易忽视信念内高代价状态风险的问题,提出一种新的风险规避规划方法。与既有做法对值函数施加静态或动态CVaR不同,作者将CVaR直接作用于每一步的即时代价在信念上的分布,从而刻画当前状态的不确定性风险,同时保留标准的期望累积回报作为优化目标。这一处理使问题保持标准MDP结构,任何基于期望的POMDP规划器只需修改代价计算即可获得风险敏感性,无需设计专门算法。理论方面,作者继承了策略评估与稀疏采样的有限时间保证,且估计误差与风险水平无关,并证明了粒子信念MDP近似与原始POMDP之间差距的有限时间界,进而给出从真实POMDP值到算法估计的端到端保证;在风险中性极限下,该方法退化为标准期望规划。

🔑 关键词速览

POMDP部分可观测马尔可夫决策过程,一种在状态不完全可观测环境下进行序列决策的数学模型。
CVaR条件风险价值,一种衡量尾部风险的指标,表示在最坏情况下(如损失超过某阈值时)的条件期望。
信念在POMDP中,对当前状态的概率分布估计,反映了基于历史观测的不确定性。
粒子信念MDP一种用粒子集近似信念的MDP代理模型,常用于POMDP的近似求解。
有限时间保证算法在有限样本或有限步数下性能误差的理论上界,确保收敛性和可靠性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅