🔥 今日值得一读 0.8B小模型OCR解析刷到96.83分,小米用1.7亿样本硬刚文档理解!
Xiaomi-OCR-0 Technical Report
arXiv CV (cs.CV) 🔥 重点 #OCR#视觉语言模型#文档解析 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
可用来做文档解析和OCR理解,0.8B小模型适合部署,开发者能直接用于票据、表单等场景。

📖 AI 总结

小米发布技术报告,提出统一文档解析与OCR理解模型Xiaomi-OCR-0,参数规模仅0.8B。该模型基于Qwen3.5-0.8B,采用自动化数据引擎构建约1.7亿样本的OCR语料库,融合专家共识、渲染验证与定向合成,并通过Q-Mask文本锚定、持续预训练和混合任务强化学习(Mix-RL)的渐进式训练流程完成优化。在多项基准测试中,模型于Real5-OmniDocBench取得95.24分、OmniDocBench v1.6取得96.83分、Wild-OmniDocBench取得87.94分,并在五个OCR导向的VQA基准上平均得分83.2。消融实验表明,在充分解析训练基础上引入OCR理解监督可进一步提升文档解析性能,为紧凑型OCR模型兼顾解析与理解提供了可行路径。

🔑 关键词速览

Xiaomi-OCR-0小米提出的统一0.8B参数OCR专用视觉语言模型,用于文档解析和OCR中心理解。
Q-Mask一种基于掩码的文本锚定技术,用于在训练中引导模型关注文本区域。
Mix-RL混合任务强化学习,一种结合多种任务的强化学习训练策略,用于提升模型综合能力。
Real5-OmniDocBench一个评估文档解析性能的基准测试集,包含真实场景的文档图像。
OCR-centric VQA以OCR为中心的视觉问答任务,要求模型基于文档图像中的文本信息回答问题。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅