🔥 今日值得一读 双熵加持!DEEPO让多模态大模型幻觉直降,VideoMMMU暴涨4分!
DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs
arXiv AI (cs.AI) 🔥 重点 #多模态#强化学习#幻觉缓解#策略优化 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
多模态模型幻觉严重?DEEPO通过双熵机制修正RL奖励与梯度盲区,可直接用于提升MLLM可靠性。

📖 AI 总结

本文针对多模态大语言模型在强化学习推理过程中幻觉改善效果不稳定的问题,指出奖励到参数更新的“纠正链”存在两个薄弱环节:在采样层面,高语义熵的困难查询常产生全错的样本组,使组相对优势归零,而这恰恰是幻觉风险最高的区域;在优化层面,自信但错误的token因类别策略分布趋于尖锐而梯度不可见,导致最需纠正的预测获得最弱更新。为此作者提出双熵增强策略优化方法DEEPO,通过语义熵触发的专家前缀为高不确定性查询注入有依据的续写以恢复优势方差,并采用优势符号感知的Renyi预处理对抗logit饱和,使纠正信号能作用于高置信度错误。实验表明两个分支均优于GRPO,二者交互在VideoMMMU任务上提升显著(+4.0,95%置信区间[1.1, 6.9]),其他任务上呈叠加效应,方法在降低幻觉的同时保持了准确率与训练稳定性。

🔑 关键词速览

MLLMs多模态大语言模型,能够同时处理文本、图像、视频等多种模态输入的大型语言模型。
语义熵衡量模型对同一查询生成答案的语义不确定性的指标,熵越高表示模型越不确定。
组相对优势在强化学习中,通过比较同一查询下多个采样响应的奖励来计算的相对优势值,用于策略更新。
Renyi预条件一种基于Renyi熵的梯度预条件方法,用于调整不同token的梯度尺度,缓解logit饱和问题。
GRPO组相对策略优化,一种强化学习算法,通过组内相对奖励来优化策略,常用于大语言模型微调。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅