本文提出 CroissantMiner,首个面向 Croissant 元数据标准的端到端抽取评测基准,旨在解决机器学习数据集元数据人工填写成本高、需通读文档的难题。该基准包含 602 篇论文,其中 102 篇为人工验证的金标注,500 篇为 LLM 生成的银标注,覆盖 Croissant 完整模式及负责任 AI(RAI)字段。研究评估了前沿模型、开放权重模型和多种智能体架构,采用规则评分与经人工审核选定的 LLM 评判相结合的两层框架。关键发现是:单次全上下文抽取的准确率稳定优于所评测的四种智能体分解架构;差距最大的是长篇 RAI 字段,这类字段需综合散落全文的信息而非简单复制,现有系统仍远不可靠。作者公开了基准、评测代码、评判审核、在线演示及排行榜。
| Croissant | 一种用于机器学习数据集的机器可读元数据标准,旨在统一描述数据集的结构、来源和负责任 AI 属性。 |
| Responsible AI (RAI) 字段 | Croissant 模式中用于描述数据集伦理、公平性、隐私等负责任 AI 相关属性的元数据字段。 |
| 智能体架构(Agentic Architectures) | 指将复杂任务分解为多个步骤并由多个智能体协作完成的抽取系统架构,本文中与单次抽取进行对比。 |
| LLM 评判器(LLM Judge) | 使用大型语言模型作为自动评估工具,对抽取结果进行质量打分,本文中通过人工审计选择。 |
| 金标准/银标准标注 | 金标准指经人工验证的高质量标注,银标准指由 LLM 生成但未经人工验证的标注,用于扩大基准规模。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅