该研究针对视觉语言模型在OCR任务中可能将图像中的异常文本改写为通顺表达、从而损害转录忠实度的问题,提出了一种名为GAD-RL的门控与衰减在线策略蒸馏方法。作者发现,固定的教师监督会随着学生模型能力提升而逐渐失效,无论跨训练检查点还是跨不同任务奖励的响应组均如此。为此,GAD-RL根据学生当前任务表现和局部分布自适应调节教师监督:当某响应组存在任务奖励不低于0.95的输出时关闭蒸馏,并随组平均奖励升高持续衰减蒸馏强度,同时按学生对教师Top-1词元的概率对前向KL加权。在Qwen3.5-2B上,该方法在CHAOS-Bench取得59.92%的Micro Recall,分别超过GRPO和固定权重GRPO+OPD达8.45和4.43个百分点,并在OmniDocBench v1.6上取得91.18的Overall分数,表明自适应蒸馏能有效提升OCR转录的忠实度。
| OCR忠实性 | 指OCR系统转录图像中文本时保持与原始内容一致、不进行改写或合理化的能力。 |
| 在策略蒸馏 | 一种知识蒸馏方法,其中学生模型基于自身生成的输出(而非固定数据集)接受教师模型的指导。 |
| GAD-RL | 本文提出的方法,通过门控和衰减机制自适应调节教师监督的强化学习后训练框架。 |
| GRPO | Group Relative Policy Optimization,一种基于组相对比较的强化学习策略优化方法。 |
| 前向KL | Kullback-Leibler散度的一种方向,衡量学生分布与教师分布之间的差异,常用于知识蒸馏。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅