本文提出 HybridDeepResearch,据作者所述是首个要求智能体同时使用网络搜索与 SQL 查询才能得出完整可验证答案的深度研究基准。现有基准通常将非结构化文本与结构化数据分开评估,忽略了跨系统迁移证据时保持约束条件这一关键“交接”能力。该基准包含 380 个依赖工具的任务,基于 LiveSQLBench-Base-Lite 数据库与公开网络语料构建,经自动检查与人工审核验证,覆盖 SQL2S、S2SQL 和 Parallel 三种推理模式。对多种专有与开源模型在不同智能体框架下的评估显示,即便 GLM-5.2、Claude-Sonnet-4.6 和 GPT-5 等先进模型在困难子集上的 Pass@8 也仅约 50% 至 54%。结果还表明,方向性推理明显难于并行交集,说明在不丢失约束的前提下打通结构化与非结构化信息空间,仍是智能体系统面临的重要开放挑战。
| HybridDeepResearch | 本文提出的首个混合深度研究基准,要求智能体同时使用网络搜索和 SQL 查询来形成完整可验证的答案。 |
| SQL2S | 一种推理模式,指智能体先从结构化数据库(SQL)中获取信息,再转移到非结构化网络搜索(S)中继续推理。 |
| S2SQL | 一种推理模式,指智能体先从非结构化网络搜索(S)中获取信息,再转移到结构化数据库(SQL)中继续推理。 |
| Pass@8 | 评估指标,表示模型在 8 次尝试中至少有一次成功通过任务的比例,用于衡量智能体在困难任务上的能力。 |
| Agentic Scaffolds | 智能体脚手架,指为自主智能体提供工具调用、规划、记忆等支持的外层框架或控制结构。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅