LLM提取键值对遇OCR噪声性能暴跌,大模型优势全没了!
From Pixels to Pairs: A Comprehensive Benchmark of LLM-Based Key-Value Extraction in Noisy Document Settings
arXiv CL (cs.CL) 重要 大模型论文方法 🕐 09-17 12:00

📖 AI 总结

该研究系统评估了开源指令微调大语言模型在干净文本与含噪OCR条件下进行键值对抽取的表现,选取Gemma、Mistral、Qwen2.5、LLaMA 3和DeepSeek等模型,在FUNSD、CORD和SROIE三个基准上,分别使用人工标注文本及PaddleOCR、EasyOCR、Tesseract的OCR输出进行测试,并采用统一评估协议隔离输入质量、模型设计与提示策略的影响。结果显示,高质量文本下现代LLM具备较强的语义抽取能力,部分接近有监督的版面感知系统;但在OCR噪声下性能显著下降,模型间差距随输入损坏程度增加而缩小。抽取效果主要取决于文本语义推理与OCR噪声下的文本保真度两个因素,模型规模带来的优势在噪声输入下明显减弱,OCR质量成为主导因素。研究还识别出键值错位、幻觉和数字损坏等典型失败模式,揭示了干净文本评测与实际部署之间的差距,强调需协同提升OCR质量、结构推理与语义建模能力。

🔑 关键词速览

键值对提取 (KVP Extraction)从文档中识别并抽取键(如字段名)和对应值(如具体内容)的结构化信息提取任务。
OCR噪声光学字符识别过程中产生的文本错误或失真,如字符误识别、格式混乱等,影响下游任务性能。
仅解码器模型 (Decoder-only Models)仅使用Transformer解码器架构的自回归语言模型,如GPT系列,擅长生成和指令跟随。
布局感知系统 (Layout-aware Systems)结合文档视觉布局信息(如位置、排版)进行信息提取的监督学习系统,通常需要标注数据。
幻觉 (Hallucination)模型生成输入中不存在或与事实不符的内容,在信息提取中表现为虚构键值对。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅