该研究首次系统考察了ChatGPT、Claude、Grok和DeepSeek四大对话式平台上LLM智能体的网络搜索全流程,结合真实用户交互与基于同一平台API的受控实验,分析了智能体发起搜索的决策质量、查询构建策略、搜索结果中的领域偏好,以及将结果转化为有据回答时的选择。研究发现,各平台和模型的搜索决策差异显著,更频繁地调用搜索并不必然带来更高质量的回复;不同智能体采用各异的复杂查询策略,且平台专属搜索引擎倾向于返回其偏好域名的结果。此外,尽管回答大体基于搜索结果,部分论断仍依赖未被引用的搜索结果,引发对归因与可靠性的担忧。该研究为面向对话式检索优化的未来AI智能体与搜索工具设计提供了重要启示。
| Conversational LLM Agents | 基于大语言模型、能够通过多轮对话与用户交互并调用外部工具(如网络搜索)来完成任务的智能体。 |
| Agentic Search | 由AI智能体自主决定是否搜索、如何构建查询并整合搜索结果以生成回复的搜索范式。 |
| Invivo / Invitro | 分别指真实用户与平台交互的“体内”研究和通过API控制模型进行的“体外”实验,二者结合以全面评估搜索行为。 |
| Querying Strategies | 智能体为获取所需信息而构建和优化搜索查询所采用的方法,如关键词提取、问题重写或多步查询。 |
| Grounded Responses | 基于检索到的搜索结果生成的回复,旨在确保信息有据可依,但可能仍存在未引用来源的问题。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅