这篇论文指出,大语言模型在对话中的失败常被归因于记忆问题,但真正的问题在于模型过早锁定对用户意图的解读。作者提出“早期后验坍缩”概念:当早期对话存在歧义时,模型会将其固化为单一隐藏解释,后续的澄清信息只能被当作补充上下文,而无法推翻既有任务状态。研究通过写作、规划和编程三类受控对话任务,使用Gemini-2.5-Pro和Gemini-2.5-Flash进行数千次试验,发现相同信息以不同顺序呈现会导致不同结果,编程任务尤为脆弱,因为早期假设会嵌入接口和控制流等结构化产物中。常规提示和记忆策略难以奏效,摘要可能加剧歧义坍缩,思维链虽能减少推理轨迹中的显式错误承诺,却不提升最终任务成功率。作者据此主张转向保留不确定性的状态管理,让模型在歧义未解时维持暂定假设,在高影响歧义下先询问再执行,并在新证据推翻旧解读时重建状态。
| early posterior collapse | 模型在用户意图尚未明确时就过早锁定单一解释,导致后续澄清无法纠正该承诺的现象。 |
| order effect | 相同任务相关信息以不同顺序呈现时,模型输出结果出现差异的现象。 |
| uncertainty-preserving state management | 一种对话状态管理策略,在歧义未解决时保留多种可能解释而非过早固化为单一状态。 |
| chain-of-thought | 让模型在给出最终答案前显式生成中间推理步骤的提示技术。 |
| Gemini-2.5-Pro / Gemini-2.5-Flash | 谷歌发布的两个大语言模型版本,分别面向高性能和低延迟场景,本文用作实验对象。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅