本文研究如何通过强化学习使晶体生成模型对齐特定设计目标。作者采用组相对策略优化(GRPO),将基于随机插值和离散流匹配的生成模型与黑箱奖励函数对接,其策略梯度直接作用于原子类型转移的似然,区别于以往针对扩散和流模型的强化学习方法。所提出的奖励函数将亚稳、独特且新颖结构(mSUN)的产率从预训练模型的13.4%提升至强化后的45.5%,并同样改善了基于潜在去噪扩散模型的强化学习框架。但研究也发现,直接强化原子类型转移似然会引发奖励利用问题,需设置显式防护机制。此外,分析暴露了社区指标的缺陷:不同堆积方式的单元素结构被误计为mSUN,虚增指标却未产生新化合物。作者据此主张基准测试应按参考相数量分类报告结果。
| 组相对策略优化 (GRPO) | 一种强化学习算法,通过比较一组样本的相对表现来优化策略,无需价值函数。 |
| 离散流匹配 | 一种生成建模方法,通过匹配离散状态之间的概率流来学习生成过程。 |
| mSUN | 亚稳态、独特和新颖结构的缩写,用于评估生成晶体材料的新颖性和稳定性。 |
| 奖励利用 (Reward Hacking) | 强化学习中智能体利用奖励函数的漏洞获得高奖励,而非真正完成预期任务的现象。 |
| 参考凸包 | 在材料热力学中,用于判断化合物稳定性的凸包构造,基于已知参考相的能量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅