🔥 今日值得一读 首个混合深度研究基准发布:最强模型Pass@8仅50%!
Benchmarking Hybrid Deep Research Across Database Querying and Web Search
arXiv CL (cs.CL) 🔥 重点 Agent评测基准RAG 🕐 09-10 12:00

📖 AI 总结

本文提出 HybridDeepResearch,据作者所述是首个要求智能体同时使用网络搜索与 SQL 查询才能得出完整可验证答案的深度研究基准。现有基准通常将非结构化文本与结构化数据分开评估,忽略了跨系统迁移证据时保持约束条件这一关键“交接”能力。该基准包含 380 个依赖工具的任务,基于 LiveSQLBench-Base-Lite 数据库与公开网络语料构建,经自动检查与人工审核验证,覆盖 SQL2S、S2SQL 和 Parallel 三种推理模式。对多种专有与开源模型在不同智能体框架下的评估显示,即便 GLM-5.2、Claude-Sonnet-4.6 和 GPT-5 等先进模型在困难子集上的 Pass@8 也仅约 50% 至 54%。结果还表明,方向性推理明显难于并行交集,说明在不丢失约束的前提下打通结构化与非结构化信息空间,仍是智能体系统面临的重要开放挑战。

🔑 关键词速览

HybridDeepResearch本文提出的首个混合深度研究基准,要求智能体同时使用网络搜索和 SQL 查询来形成完整可验证的答案。
SQL2S一种推理模式,指智能体先从结构化数据库(SQL)中获取信息,再转移到非结构化网络搜索(S)中继续推理。
S2SQL一种推理模式,指智能体先从非结构化网络搜索(S)中获取信息,再转移到结构化数据库(SQL)中继续推理。
Pass@8评估指标,表示模型在 8 次尝试中至少有一次成功通过任务的比例,用于衡量智能体在困难任务上的能力。
Agentic Scaffolds智能体脚手架,指为自主智能体提供工具调用、规划、记忆等支持的外层框架或控制结构。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅