搜索轨迹变图谱,边F1达86%,SearchAtlas揪出搜索代理三大失败!
SearchAtlas: Analyzing Agentic Search Strategies via Evidential Query Graphs
arXiv CL (cs.CL) 重要 Agent论文方法 🕐 09-11 12:00

📖 AI 总结

SearchAtlas 是一个用于分析 LLM 搜索智能体策略的框架,它将冗长难解的原始搜索轨迹转化为结构化图,图中的边表示证据如何从检索它的查询传播至最终答案。该框架的自动解析流程与人工标注图相比,平均边 F1 达到 86.0%,且多次运行结果保持一致。研究者利用该框架在三个基准上分析了五种搜索智能体,揭示了它们在搜索规模和证据聚合方式上的系统性差异,并发现答案支撑碎片化、问题约束未能传递至答案、未经验证的参数化知识混入回答等过程性失败与错误答案高度相关,其关联强度甚至超过给定原始轨迹或有序查询列表的 LLM 评判器。此外,对过程诊断得分与最终答案正确性不一致案例的审查表明,这些得分捕捉到了无法还原为答案准确率的信息。该工作为搜索智能体的过程可解释性评估提供了新工具与实证依据。

🔑 关键词速览

SearchAtlas一个将LLM搜索代理的搜索轨迹转换为结构化证据查询图的框架,用于分析搜索策略。
LLM search agents基于大语言模型的搜索代理,能够自主执行搜索和推理以回答问题。
Evidential Query Graphs证据查询图,一种表示证据在推理轨迹中如何从查询传播到最终答案的结构化图。
Edge F1边F1值,衡量自动解析图与人工标注图在边级别上一致性的指标。
Parametric knowledge参数化知识,指LLM在训练过程中内化到模型参数中的知识,而非通过检索获得。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅