🔥 今日值得一读 强化学习让晶体生成模型mSUN产率从13.4%飙到45.5%!
Reinforcement Learning on the Discrete Composition Channel of a Crystal Generator: Validated Gains and Reward Hacking
arXiv LG (cs.LG) 🔥 重点 #强化学习#材料生成#奖励黑客 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
做生成模型对齐时需警惕奖励黑客,本文的验证方法与GRPO应用可直接迁移到分子/材料设计。

📖 AI 总结

本文研究如何通过强化学习使晶体生成模型对齐特定设计目标。作者采用组相对策略优化(GRPO),将基于随机插值和离散流匹配的生成模型与黑箱奖励函数对接,其策略梯度直接作用于原子类型转移的似然,区别于以往针对扩散和流模型的强化学习方法。所提出的奖励函数将亚稳、独特且新颖结构(mSUN)的产率从预训练模型的13.4%提升至强化后的45.5%,并同样改善了基于潜在去噪扩散模型的强化学习框架。但研究也发现,直接强化原子类型转移似然会引发奖励利用问题,需设置显式防护机制。此外,分析暴露了社区指标的缺陷:不同堆积方式的单元素结构被误计为mSUN,虚增指标却未产生新化合物。作者据此主张基准测试应按参考相数量分类报告结果。

🔑 关键词速览

组相对策略优化 (GRPO)一种强化学习算法,通过比较一组样本的相对表现来优化策略,无需价值函数。
离散流匹配一种生成建模方法,通过匹配离散状态之间的概率流来学习生成过程。
mSUN亚稳态、独特和新颖结构的缩写,用于评估生成晶体材料的新颖性和稳定性。
奖励利用 (Reward Hacking)强化学习中智能体利用奖励函数的漏洞获得高奖励,而非真正完成预期任务的现象。
参考凸包在材料热力学中,用于判断化合物稳定性的凸包构造,基于已知参考相的能量。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅