该研究系统考察了多轮对话中大型语言模型(LLM)自身生成的历史内容对后续行为的影响。作者在六个任务族和五个模型上展开实验,发现从完整单轮输入到渐进式多轮交互的性能退化具有明显的任务和模型依赖性,且单轮表现更强的模型未必在多轮交互中更稳健。通过“中性化”处理——将先前助手回复替换为中性内容——在2973条轨迹上使下游性能平均提升0.027,且长度匹配实验表明该效应不能简单归因于上下文缩短。逐轮干预实验显示,在237条退化轨迹中,63.7%至少存在一个有益干预点,48.4%的二元任务可实现从失败到成功的逆转。案例研究进一步发现,行为层面的历史影响对应可测量的内部状态差异,但缺乏通用特征。研究结论认为,助手生成历史对多轮性能具有主动但选择性的影响,提示应实施选择性而非统一的历史管理策略。
| Multi-turn interaction | 多轮交互,指用户与LLM之间进行多轮对话,其中每轮的回答影响后续轮次的行为。 |
| SHARDED | 一种实验设置,将完整输入逐步揭示为多轮交互,以模拟真实对话中的渐进信息暴露。 |
| Neutralization | 一种干预方法,将先前的助手回答替换为中性内容,以评估历史编辑对后续性能的影响。 |
| Turn Surgery | 一种干预技术,一次修改一个助手轮次,以识别对下游性能有影响的特定历史位置。 |
| Min-max normalized performance | 最小-最大归一化性能,一种将原始性能指标缩放到[0,1]区间的方法,用于比较不同任务或条件下的相对变化。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅