Jina AI(Elastic旗下)发布了jina-ocr-v1,一款端到端视觉文档解析模型,可将PDF、扫描件、表格、图表和发票一次性转换为干净的Markdown格式。模型总参数3.4B,采用MoE架构,每token激活约570M解码参数,并内置投机解码头,面向NVIDIA L4等低预算GPU部署。技术报告显示其在OmniDocBench v1.6上得分91.14,olmOCR-Bench上得分83.4。模型基于DeepSeek-OCR后训练,保留DeepEncoder和DeepSeek-3B-MoE解码器两大高效组件,通过FastMTP投机解码实现无损加速,平均每步提交2.73个token。权重以BF16格式开放约6.8GB,支持Transformers和vLLM运行,采用CC BY-NC 4.0许可,仅限研究和非商业用途,商用需联系Jina AI。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅