🔥 今日值得一读 扩散语言模型RL训练新突破:DACA-GRPO即插即用,去噪信用分配让GRPO性能飙升!
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
Apple ML Research 🔥 重点 大模型论文方法强化学习 🕐 09-16 08:00

📖 AI 总结

苹果研究团队提出DACA-GRPO,一种针对扩散语言模型强化学习的轻量级改进方法。研究指出,现有扩散模型RL方法存在两大缺陷:一是将去噪轨迹中各步骤视为同等重要,缺乏时间维度的信用分配;二是策略优化所依赖的均值场似然估计存在系统性偏差。为此,DACA-GRPO引入两个互补机制:去噪进度分数,在不增加前向计算成本的前提下从中间预测中提取逐词重要性权重;分层掩码似然,将词元位置分层,使每个词元在预测时能以序列的大部分内容作为上下文,从而降低均值场偏差。该方法可即插即用地叠加于任意GRPO风格训练器。在三种GRPO基线方法上应用后,DACA-GRPO在数学推理、代码生成、约束满足和受限生成等七个基准上均取得一致提升,其中数学推理最高提升5.6个百分点,代码生成7.4个百分点,约束满足36.3个百分点,JSON模式遵循5.9个百分点。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅