🔥 今日值得一读 OCR忠实性提升8.45个百分点!新方法让视觉语言模型不再乱改图中文字
Improving OCR Faithfulness via Gated and Attenuated On-Policy Distillation
arXiv AI (cs.AI) 🔥 重点 #多模态#知识蒸馏#OCR 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
解决VLM识别图片文字时擅自改写异常文本的问题,开发者可用于提升OCR类应用转录准确性。

📖 AI 总结

该研究针对视觉语言模型在OCR任务中可能将图像中的异常文本改写为通顺表达、从而损害转录忠实度的问题,提出了一种名为GAD-RL的门控与衰减在线策略蒸馏方法。作者发现,固定的教师监督会随着学生模型能力提升而逐渐失效,无论跨训练检查点还是跨不同任务奖励的响应组均如此。为此,GAD-RL根据学生当前任务表现和局部分布自适应调节教师监督:当某响应组存在任务奖励不低于0.95的输出时关闭蒸馏,并随组平均奖励升高持续衰减蒸馏强度,同时按学生对教师Top-1词元的概率对前向KL加权。在Qwen3.5-2B上,该方法在CHAOS-Bench取得59.92%的Micro Recall,分别超过GRPO和固定权重GRPO+OPD达8.45和4.43个百分点,并在OmniDocBench v1.6上取得91.18的Overall分数,表明自适应蒸馏能有效提升OCR转录的忠实度。

🔑 关键词速览

OCR忠实性指OCR系统转录图像中文本时保持与原始内容一致、不进行改写或合理化的能力。
在策略蒸馏一种知识蒸馏方法,其中学生模型基于自身生成的输出(而非固定数据集)接受教师模型的指导。
GAD-RL本文提出的方法,通过门控和衰减机制自适应调节教师监督的强化学习后训练框架。
GRPOGroup Relative Policy Optimization,一种基于组相对比较的强化学习策略优化方法。
前向KLKullback-Leibler散度的一种方向,衡量学生分布与教师分布之间的差异,常用于知识蒸馏。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅