本文针对长周期AI智能体执行日志中的故障诊断问题,提出将根因归因视为一个大规模搜索问题。现有基于大语言模型的一次性判断方法在轨迹较长时诊断准确率明显下降,原因在于关键证据稀疏、分散且与可见故障相距甚远,模型往往过早锁定看似合理的结论而遗漏重要线索。为此,作者提出迭代式框架Continual Search,通过多轮引导促使判断器持续搜寻尚未解决的诊断证据。研究在四个现有RCA基准上验证了该方法,并构建了包含50个人工标注长周期故障案例的MegaRCA-Mix测试集以评估大规模场景下的表现。结果显示,Continual Search在多个基准和模型家族中均稳定提升归因性能,在MegaRCA-Mix上将GPT-5.5的F1分数从0.349提升至0.498,提升超过40%;更值得注意的是,同家族中较低层级模型甚至可超越更高层级模型,表明有效的搜索策略比单纯的模型规模更为关键。
| Root-Cause Attribution (RCA) | 根因归因,指从执行日志或轨迹中定位导致任务失败的根本原因,而非仅描述表面故障现象。 |
| Long-Horizon Agent | 长时程智能体,指需要执行数十甚至数百步动作、跨越较长交互过程才能完成任务的 AI 智能体。 |
| Continual Search | 本文提出的迭代式框架,通过多轮引导判断器持续搜寻未解决的诊断证据,避免一次性判断过早收敛。 |
| MegaRCA-Mix | 本文构建的大规模 RCA 评测基准,包含 50 个人工标注的失败试验,专门用于评估长时程、执行密集型任务下的归因能力。 |
| F1 Score | F1 分数,精确率与召回率的调和平均,常用于衡量根因归因等诊断任务的综合准确度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅