这篇论文针对多模态大语言模型(MLLMs)在OCR文档理解任务中普遍存在的“盲目服从”问题,提出了任务验证(Task Verification)的新评估框架。作者指出,现有评测默认所有任务均有效可答,但真实场景中常出现文本模糊、证据被遮挡、前提矛盾或变量缺失等情况。为此,他们构建了VeriOCRBench基准,包含1800个人工验证样本,其中1600个为注入陷阱的无效任务,覆盖视觉、上下文、事实和逻辑四个验证维度及八种陷阱类型,另设200个无陷阱样本用于衡量过度拒绝。通过对15个主流MLLM的评估,研究发现模型在任务验证、根因诊断和过度拒绝方面均存在显著缺陷,揭示了当前OCR推理系统在可靠性上的关键短板。该基准为解耦评估任务验证能力提供了新工具。
| Multimodal Large Language Models (MLLMs) | 多模态大语言模型,能够同时处理文本和图像等多种模态信息的AI模型。 |
| OCR-grounded Task Verification | 基于OCR的任务验证,指在回答前判断图像、文本和问题是否构成可执行任务的过程。 |
| VeriOCRBench | 一个用于评估OCR推理中任务验证能力的基准测试,包含大量注入陷阱的无效任务。 |
| Visual Atomic Fact (VAF) | 视觉原子事实,指图像中不可再分的基本事实单元,用于锚定验证流程。 |
| Over-refusal | 过度拒绝,指模型在任务有效时仍错误地拒绝回答的现象。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅