该研究系统评估了开源指令微调大语言模型在干净文本与含噪OCR条件下进行键值对抽取的表现,选取Gemma、Mistral、Qwen2.5、LLaMA 3和DeepSeek等模型,在FUNSD、CORD和SROIE三个基准上,分别使用人工标注文本及PaddleOCR、EasyOCR、Tesseract的OCR输出进行测试,并采用统一评估协议隔离输入质量、模型设计与提示策略的影响。结果显示,高质量文本下现代LLM具备较强的语义抽取能力,部分接近有监督的版面感知系统;但在OCR噪声下性能显著下降,模型间差距随输入损坏程度增加而缩小。抽取效果主要取决于文本语义推理与OCR噪声下的文本保真度两个因素,模型规模带来的优势在噪声输入下明显减弱,OCR质量成为主导因素。研究还识别出键值错位、幻觉和数字损坏等典型失败模式,揭示了干净文本评测与实际部署之间的差距,强调需协同提升OCR质量、结构推理与语义建模能力。
| 键值对提取 (KVP Extraction) | 从文档中识别并抽取键(如字段名)和对应值(如具体内容)的结构化信息提取任务。 |
| OCR噪声 | 光学字符识别过程中产生的文本错误或失真,如字符误识别、格式混乱等,影响下游任务性能。 |
| 仅解码器模型 (Decoder-only Models) | 仅使用Transformer解码器架构的自回归语言模型,如GPT系列,擅长生成和指令跟随。 |
| 布局感知系统 (Layout-aware Systems) | 结合文档视觉布局信息(如位置、排版)进行信息提取的监督学习系统,通常需要标注数据。 |
| 幻觉 (Hallucination) | 模型生成输入中不存在或与事实不符的内容,在信息提取中表现为虚构键值对。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅