NVIDIA联合普林斯顿大学和马里兰大学提出PivotOPD,一种面向多轮LLM智能体的在线策略蒸馏方法,旨在训练智能体规避最具破坏性的早期错误,并在错误发生后实现恢复。研究在ALFWorld、WebShop和搜索问答等任务上,以Qwen3-1.7B和Qwen3-8B为学生模型,对比13个基线方法,在全部8项分基准平均成绩上均排名第一。关键发现是:在失败轨迹中,59%包含至少一个“关键错误”,且首次关键错误多出现在第8至12轮,之后智能体平均浪费18至21轮仍无法恢复;回放实验显示,修正关键错误可将成功率从8%提升至59%。PivotOPD能从72.7%的回放关键错误中恢复,而标准在线策略蒸馏仅为20.3%。这表明恢复能力可被学习,而标准方法几乎无法教会智能体这一点。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅