GraphEcho 是一项针对大语言模型图智能体的基准研究,探讨智能体是否会因反复经过相同路径而误将其当作额外的独立证据。该基准在固定证据内容的前提下,改变路径数量与证据来源,同时评估智能体的判断与主动探索行为。受控合成实验显示,判断偏移因模型而异,但冗余支持路径会普遍提高所有被测冻结智能体的重复游走比例。研究提出的来源感知后训练(PAPT)能减少重复访问并提升合成任务准确率,但覆盖的独立来源反而更少;在科学论断任务上,它虽持续降低重复率,准确率却随之下降。这一结果揭示了高效探索与有效利用证据之间的落差:智能体可能学会停止重复,却同时忽略其真正需要的信息。该工作为评估图智能体的结论质量及其探索是否触及独立证据来源提供了可控方法。
| GraphEcho | 一个用于评估图智能体是否将重复路径误认为额外证据的基准测试。 |
| LLM agent | 基于大型语言模型的智能体,能够进行推理、决策和探索。 |
| Provenance-aware post-training (PAPT) | 一种考虑证据来源的后训练方法,旨在减少重复探索并提高准确性。 |
| Structural redundancy | 图中重复的路径或结构,可能被智能体误认为是独立证据。 |
| Evidence provenance | 证据的来源或出处,用于区分独立证据和重复证据。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅