本文提出了一种名为扩散技能发现(DSD)的技能学习方法,旨在让模拟角色像人类一样,通过复用丰富的运动技能库来高效完成新任务。研究指出,要让技能库支持广泛的下游任务,其行为需兼具多样性,并包含每个行为在空间与时间上的变化。常用的做法是最大化技能隐变量与策略生成状态之间的互信息,其中边缘状态熵促进行为覆盖,条件熵鼓励同一隐变量对应一致行为。然而在高维控制问题中直接估计边缘状态熵不可行,已有方法只能依赖隐空间的间接近似或粗糙的状态分布估计,导致状态空间覆盖不足,技能多样性受限。DSD 的创新在于利用扩散模型通过分数匹配来近似策略诱导状态分布的熵梯度,从而更有效地鼓励发现覆盖更广行为的技能。实验表明,在高维人形控制任务中,DSD 发现的技能库比先前方法更丰富,能够涌现出复杂且敏捷的行为,并可在分层控制和基于离线轨迹隐变量选择的零样本控制两种下游场景中复用。
| Diffusion Skill Discovery (DSD) | 本文提出的技能发现方法,利用扩散模型通过分数匹配近似策略诱导状态分布的熵梯度,以学习多样化且可复用的运动技能。 |
| Mutual Information | 互信息,衡量技能隐变量与策略产生状态之间的相关性,最大化它可促进技能多样性。 |
| Marginal State Entropy | 边缘状态熵,衡量策略访问状态分布的广泛程度,值越高表示行为覆盖越广。 |
| Score Matching | 分数匹配,一种训练扩散模型以估计数据分布梯度(分数函数)的方法,此处用于近似熵梯度。 |
| Hierarchical Control | 分层控制,一种下游控制设置,使用任务特定的高层策略来选择和组合低层可复用技能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅