Datalab 发布了开源结构化文档提取基准 OmniExtractBench,旨在解决现有提取基准中存在的偏见、评测框架不透明、评分依据不清以及文档类型单一等问题。该基准汇集了来自四个现有基准的 620 份文档,覆盖监管申报表、密集表格、大型表格及合成数据等多种类型,其中 128 份为单页文档,33 份超过 100 页且占总页数约 40%。所有文档由统一的确定性评分器进行逐值打分,并可解释每项评分决策。该工具以 Apache 2.0 协议开源,评分器可通过 PyPI 安装,代码托管于 GitHub,数据发布于 Hugging Face。其意义在于为文档提取系统提供一个可复现、可审计的共享评测标准,改变当前各厂商自建排行榜难以横向比较的局面。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅