本文提出 Spectral Feedback,一种用于离散扩散模型测试时对齐的新算法。现有奖励最大化方法多将推理视为单向过程,仅通过影响 token logits 或在中间步骤筛选序列来引导反向过程,缺乏对不理想 token 选择的回溯机制。该研究转而将“哪些 token 需要重新审视”作为对齐的核心问题,通过重新掩码并重采样 token 形成反馈循环,使模型迭代修正自身生成结果。由于编辑效果相互依赖,编辑位置的选择具有挑战性;作者受生物系统中稀疏交互研究的启发,发现蛋白质逆折叠的编辑集价值函数具有稀疏傅里叶表示,从而可高效学习并优化编辑位置选择。该方法与模型无关,适用于预训练、测试时对齐及微调后的扩散模型,且无需修改底层生成过程。在蛋白质稳定性奖励预言机上,该方法使预训练模型的稳定蛋白质比例提升 32.3%,Best-of-10 提升 24.8%,最先进的强化学习微调扩散模型提升 5.8%。
| 离散扩散模型 | 一种生成模型,通过在离散状态空间(如 token 序列)上逐步添加和去除噪声来生成数据。 |
| 谱反馈 | 本文提出的算法,利用价值函数的稀疏傅里叶表示,在反馈循环中选择编辑位置以迭代修正生成结果。 |
| 编辑集 | 需要重新掩码和重新采样的 token 位置集合,用于在扩散模型推理中修正不理想的生成。 |
| 蛋白质逆折叠 | 给定蛋白质三维结构,预测其氨基酸序列的任务,是蛋白质设计中的核心问题。 |
| 稀疏傅里叶表示 | 函数在傅里叶域中仅由少数频率分量主导的表示形式,可用于高效学习和优化价值函数。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅