最佳模型工具调用成功率99.7%,却只搞定33.5%的邮件任务!
EmailBench: A Benchmark for Evaluating LLM Agents on Enterprise Email and Productivity Tasks
arXiv AI (cs.AI) 重要 Agent大模型论文方法 🕐 今天 12:00

📖 AI 总结

本文提出 EmailBench,一个面向企业邮件与生产力任务的智能体评测基准,包含覆盖16个任务类别的206个场景。该基准结合类型化邮件API规范、确定性的合成Enron语料库,以及基于交互原型任务意图遥测设计的场景集,并采用混合评测协议,将258条可执行静态断言与211条大模型评分标准相结合。研究在固定单用户语料上评测了八种语言模型配置,表现最佳的配置仅通过33.5%的场景,尽管其99.7%的工具调用未出现API失败,且各任务类别通过率差异显著。这一结果表明工具调用成功并不等同于任务完成,凸显了当前模型在企业邮件工作流中的能力缺口。EmailBench为端到端邮件智能体评测提供了自包含环境,未来将扩展工具覆盖、多角色测试与重复运行评估。

🔑 关键词速览

EmailBench一个用于评估大语言模型智能体在企业邮件与生产力任务上表现的基准测试套件。
typed email API一种具有明确类型定义的邮件应用程序接口,用于规范智能体与邮件系统的交互操作。
LLM rubrics由大语言模型根据预设评分标准对智能体输出进行主观质量评估的评分方法。
static assertions在评估中预先定义的可执行检查条件,用于验证智能体行为是否符合预期结果。
task-intent telemetry从交互式原型中收集的关于用户任务意图的聚合使用数据,用于指导基准场景设计。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅