该研究探讨强化学习策略能否通过可审计的离散行为规则来表示与组合,并将可审计性拆解为六个可独立检验的谓词:轨迹完整性、无损编码、规则覆盖、行为一致性、组合质量与价值模型可靠性。实验在CartPole-v1和Acrobot-v1上进行,覆盖八个随机种子。核心发现是规则集重叠并不等于行为一致:策略可能共享符号规则,却在新状态上做出接近随机的动作选择,因此融合策略只是在既有规则间选择,而非生成新技能。研究还发现,在冲突主导任务中,表面上的融合失败源于归纳与部署不匹配——从采样动作归纳的规则在argmax动作下评估时,重新归纳会逆转仲裁顺序。拟合Q广义策略改进诊断在两个环境中均告失败,削弱了规则融合优于基于价值组合的主张。作者贡献的是一套有证据边界的审计与组合协议,而非通用可解释性或自主技能生成的宣称。
| Auditability | 可审计性,指策略的行为能够被独立验证和解释的程度,本文将其分解为六个可测试的谓词。 |
| Rule Overlap | 规则重叠,指不同策略共享相同的离散行为规则,但可能在新状态下选择不同的动作。 |
| Behavioral Agreement | 行为一致性,衡量策略在相同状态下选择相同动作的程度,是审计性的关键谓词之一。 |
| Composition | 组合,指将多个策略或规则集融合成一个新策略的过程,本文关注其质量和局限性。 |
| Fitted-Q Generalized Policy Improvement | 拟合Q广义策略改进,一种基于价值函数的策略组合诊断方法,本文发现其在测试环境中失败。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅