🔥 今日值得一读 15个顶级多模态模型集体翻车!OCR任务陷阱识别率惨不忍睹
Beyond Blind Compliance: Benchmarking Task Verification in OCR Reasoning
arXiv CV (cs.CV) 🔥 重点 #多模态#评测基准#OCR 🕐 09-02 12:00
👨‍💼 主理人解读 · 为什么值得关注
用于测试模型在OCR场景下能否拒绝无效问题,开发者可借此改进文档理解系统的鲁棒性。

📖 AI 总结

这篇论文针对多模态大语言模型(MLLMs)在OCR文档理解任务中普遍存在的“盲目服从”问题,提出了任务验证(Task Verification)的新评估框架。作者指出,现有评测默认所有任务均有效可答,但真实场景中常出现文本模糊、证据被遮挡、前提矛盾或变量缺失等情况。为此,他们构建了VeriOCRBench基准,包含1800个人工验证样本,其中1600个为注入陷阱的无效任务,覆盖视觉、上下文、事实和逻辑四个验证维度及八种陷阱类型,另设200个无陷阱样本用于衡量过度拒绝。通过对15个主流MLLM的评估,研究发现模型在任务验证、根因诊断和过度拒绝方面均存在显著缺陷,揭示了当前OCR推理系统在可靠性上的关键短板。该基准为解耦评估任务验证能力提供了新工具。

🔑 关键词速览

Multimodal Large Language Models (MLLMs)多模态大语言模型,能够同时处理文本和图像等多种模态信息的AI模型。
OCR-grounded Task Verification基于OCR的任务验证,指在回答前判断图像、文本和问题是否构成可执行任务的过程。
VeriOCRBench一个用于评估OCR推理中任务验证能力的基准测试,包含大量注入陷阱的无效任务。
Visual Atomic Fact (VAF)视觉原子事实,指图像中不可再分的基本事实单元,用于锚定验证流程。
Over-refusal过度拒绝,指模型在任务有效时仍错误地拒绝回答的现象。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅