神经符号RL三招注入先验知识,MiniGrid任务解决率全线飙升!
Managing Action Preconditions in Neuro-Symbolic RL: Three Placement Strategies for Embodied Agents
arXiv LG (cs.LG) 重要 Agent论文方法 🕐 09-16 12:00

📖 AI 总结

本文探讨神经符号强化学习中先验行为知识的注入位置问题。作者将行为知识形式化为作用于“结构性动作”(如拾取钥匙、抓取方块、开关门等合法性依赖前置条件的动作)的前置条件贝叶斯网络,并比较三种注入策略:仅在推理阶段生效的符号验证器、在训练与推理全程生效的符号执行器,以及将知识内化到网络并自行学习动作限制与使用的符号学习器。实验在两种特性相反的基准上进行,分别侧重长序列有序规划与连续操作任务。结果显示,在MiniGrid上三种策略均优于PPO+RND基线,其中符号执行器以98.2%的解质量领先基线的88.8%。该研究为具身智能体在动态环境中兼顾安全性、可靠性与可追溯性提供了可操作的知识集成方案。

🔑 关键词速览

神经符号强化学习结合符号推理与神经网络策略的强化学习方法,利用先验知识提升学习效率和安全性。
前置条件贝叶斯网络一种概率图模型,用于表示动作执行所需的前置条件及其依赖关系。
结构动作其合法性取决于特定前置条件的动作,如拾取钥匙、抓取方块等。
符号验证器仅在推理阶段使用的符号组件,检查前置条件是否满足以触发结构动作。
符号执行器在训练和推理阶段均活跃的符号组件,全程管理结构动作的使用。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅