强化学习新招!好奇心驱动探索,稀疏奖励下性能碾压PPO和ICM
Endogenous Exploration in Reinforcement Learning with Intrinsic Curiosity
arXiv LG (cs.LG) 重要 #强化学习#探索#好奇心驱动 🕐 09-09 12:00

📖 AI 总结

该论文提出了一种基于内在好奇心的强化学习探索框架,旨在应对环境非平稳、奖励稀疏或缺失的复杂场景。其核心假设是,有效的探索行为出现在中等程度的“非一致性”水平,过于僵化或过于混乱的动态都会导致性能下降。作者在液态状态机(LSM)基底上实现了该框架,并在LunarLander-v2和BipedalWalker-v3两个标准基准任务中进行了验证。结果显示,该方法在离散和连续控制任务上均取得了与PPO、ICM等主流深度强化学习算法相当的竞争力。此外,研究还发现,在相同的分析条件下,Active Inference智能体未能复现这种“好奇心窗口”,表明该框架捕捉到了一种独特的探索机制。这一发现为设计更鲁棒的自主探索策略提供了新视角,尤其在奖励信号不可靠的现实应用中具有潜在价值。

🔑 关键词速览

Intrinsic Curiosity内在好奇心,一种驱动智能体探索环境的内在奖励机制,不依赖外部奖励。
Liquid State Machine (LSM)液态状态机,一种基于脉冲神经网络的储备池计算模型,用于处理时序数据。
Proximal Policy Optimization (PPO)近端策略优化,一种常用的深度强化学习算法,通过裁剪目标函数稳定策略更新。
Intrinsic Curiosity Module (ICM)内在好奇心模块,一种通过预测状态变化来生成内在奖励的探索方法。
Active Inference主动推断,一种基于自由能原理的认知框架,强调智能体通过行动最小化预测误差。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅