本文提出一种面向未知环境的端到端基于模型的强化学习算法,用于在线性时序逻辑(LTL)规范下高效合成策略。核心方法是将LTL任务的极限确定性Büchi自动机(LDBA)与环境贝叶斯自适应马尔可夫决策过程(BAMDP)同步,借助贝叶斯强化学习实现更优的探索-利用权衡,并进一步提出新的贝叶斯自适应蒙特卡洛规划(BAMCP)算法,在同步后的BAMDP结构上近似求解贝叶斯最优策略。在有限与无限时域任务实验中,该方法在属性满足率和样本效率上均优于传统无模型方法;消融研究验证了新BAMCP算法相较经典BAMCP在LTL任务满足方面的价值。研究还展示了其在“谨慎”强化学习中的应用,可有效减少策略训练过程中的任务违规次数。
| 线性时序逻辑 (LTL) | 一种用于描述系统随时间变化的行为规范的形式化语言,常用于表达安全性、可达性等任务属性。 |
| 极限确定性Büchi自动机 (LDBA) | 一种用于表示LTL规范的自动机,具有极限确定性,便于与决策过程同步。 |
| 贝叶斯自适应马尔可夫决策过程 (BAMDP) | 一种在未知环境中进行决策的框架,通过贝叶斯方法对模型不确定性进行推理,实现自适应学习。 |
| 贝叶斯自适应蒙特卡洛规划 (BAMCP) | 一种基于蒙特卡洛树搜索的规划算法,用于在贝叶斯自适应MDP中近似求解最优策略。 |
| 谨慎强化学习 (cautious RL) | 一种强化学习设置,旨在训练过程中尽量减少对任务规范的违反,强调安全性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅