小米发布技术报告,提出统一文档解析与OCR理解模型Xiaomi-OCR-0,参数规模仅0.8B。该模型基于Qwen3.5-0.8B,采用自动化数据引擎构建约1.7亿样本的OCR语料库,融合专家共识、渲染验证与定向合成,并通过Q-Mask文本锚定、持续预训练和混合任务强化学习(Mix-RL)的渐进式训练流程完成优化。在多项基准测试中,模型于Real5-OmniDocBench取得95.24分、OmniDocBench v1.6取得96.83分、Wild-OmniDocBench取得87.94分,并在五个OCR导向的VQA基准上平均得分83.2。消融实验表明,在充分解析训练基础上引入OCR理解监督可进一步提升文档解析性能,为紧凑型OCR模型兼顾解析与理解提供了可行路径。
| Xiaomi-OCR-0 | 小米提出的统一0.8B参数OCR专用视觉语言模型,用于文档解析和OCR中心理解。 |
| Q-Mask | 一种基于掩码的文本锚定技术,用于在训练中引导模型关注文本区域。 |
| Mix-RL | 混合任务强化学习,一种结合多种任务的强化学习训练策略,用于提升模型综合能力。 |
| Real5-OmniDocBench | 一个评估文档解析性能的基准测试集,包含真实场景的文档图像。 |
| OCR-centric VQA | 以OCR为中心的视觉问答任务,要求模型基于文档图像中的文本信息回答问题。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅