该研究重新审视了选项-批评(Option-Critic)框架中“选项越多性能越好”的既有结论,通过理论与实验揭示了其背后的真实机制。研究发现,该框架学习到的终止规则对性能提升并无实质贡献,在特定条件下甚至会导致探索受阻,产生Ω(T)的遗憾值,而始终终止策略仅需O(log T)。此外,选项内部策略几乎不进行探索,导致状态锁定于最初看似合理的动作而不再更新,作者将这一现象命名为“策略坏死”,并发现典型选项中约五分之三的状态存在此问题。研究还表明,额外选项并未改善单个选项的性能,而是降低了所有选项在同一状态同时失败的概率(从59%降至4%),从而提升整体表现。该工作为选项学习机制提供了更清晰的理论解释,对分层强化学习的设计具有指导意义。
| Option-Critic | 一种强化学习框架,学习子策略(选项)及其终止条件,以在时间抽象层面进行决策。 |
| Policy Necrosis | 本文提出的术语,指选项内部策略因缺乏探索而锁定在初始动作上,不再更新,导致状态无法改进。 |
| Termination Rule | 决定选项何时结束并将控制权交回高层策略的规则,在选项批评中通过最大化回报学习。 |
| Redundant Coverage | 指多个选项在相同状态下可能重复失败,增加选项数量降低所有选项同时失败的概率,从而提升性能。 |
| Regret | 在线学习或强化学习中,衡量算法累积回报与最优策略回报差距的指标,此处用于比较不同终止规则的表现。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅