本文研究偏好条件多目标强化学习(MORL)中事后重标记(hindsight relabeling)的扩展应用,即以智能体实际达成的偏好方向替代原本请求的偏好方向来重标记转移。作者在连续控制MO-Gymnasium套件上,对四种偏好条件离策略算法(涵盖两种评论家骨干和两种偏好采样方案)进行测试,发现该扩展在36个算法-环境组合中有19个出现性能退化,退化幅度最高达四个标准差,仅1个得到改善。研究进一步表明,这种损害并非源于重标记噪声,去噪几乎无法恢复性能,优先采样和缓冲区结构选择也无法复现该现象。真正原因是重复重标记使评论家的覆盖范围坍缩到智能体偶然访问的狭窄偏好区域,作者将其命名为"偏好覆盖坍缩",并提出"被弃偏好质量"(APM)这一价值感知统计量来量化该损害。为此,作者提出her_mix方法,通过单参数凸组合将达成方向拉回请求偏好,在统一参数值下使19个受损设置中的16个恢复基线,并将被弃偏好质量从69%降至6%。该工作表明,保护偏好单纯形上的覆盖范围而非过滤噪声重标记,才是使事后重标记在MORL中安全可用的关键。
| Hindsight Relabeling | 后见之明重标记,一种利用智能体实际达成结果回溯性替换原目标以提升样本效率的技术。 |
| Preference-Conditioned MORL | 偏好条件化多目标强化学习,智能体根据给定的偏好方向(如权重向量)优化多个目标。 |
| Preference Coverage Collapse | 偏好覆盖坍缩,本文提出的失效模式,指重复重标记导致评论家仅覆盖偏好空间中极窄区域。 |
| Abandoned Preference Mass (APM) | 弃置偏好质量,一种价值感知统计量,用于量化偏好覆盖坍缩造成的危害。 |
| her_mix | 本文提出的单参数凸组合方法,将实际达成的偏好方向拉回所请求的偏好以缓解覆盖坍缩。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅