该研究针对并行状态熵最大化(PGPSE)方法中团队熵评分无法区分个体策略贡献的问题,提出边际覆盖信用机制(MCC-PGPSE)。该方法通过留一策略覆盖评估与状态所有者专业化相结合,为每个策略分配非负辅助内在奖励,在不改变总奖励量的前提下重新分配,以抑制冗余探索并促进互补覆盖。实验覆盖受控环境、七个公开离散状态基准及原始PGPSE协议的Room和Maze场景,结果显示MCC-PGPSE在归一化团队状态熵和支持度上均优于基线,受控任务与固定基准的改进显著,五种子原始协议比较方向一致。消融实验表明,主要收益来自留一策略覆盖机制,而非非均匀加权或神经新颖性。该研究为并行策略在离散状态空间中的互补探索提供了可解释的贡献条件化奖励分配方案。
| PGPSE | 并行状态熵最大化的策略梯度方法,通过多个独立策略在相同环境副本中训练以扩大状态空间覆盖。 |
| MCC-PGPSE | 边际覆盖信用增强的PGPSE,通过留一策略覆盖和状态所有者专业化估计每个策略的贡献,并据此分配奖励。 |
| Marginal Coverage Credit | 边际覆盖信用,衡量单个策略对整体覆盖的非冗余贡献,用于指导奖励分配。 |
| Leave-one-policy-out coverage | 留一策略覆盖,通过移除一个策略后评估覆盖变化来估计该策略的独特贡献。 |
| State-owner specialization | 状态所有者专业化,将状态归属到特定策略,以明确各策略的覆盖责任。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅